- El modelo chino de pesos abiertos Kimi K3 se ha acercado a los modelos de vanguardia, pero la competitividad del negocio de IA no se decide por el costo de desarrollo del modelo sino por el costo de bienes vendidos (COGS) para ofrecer inteligencia al nivel de una respuesta correcta
- Como la cantidad de tokens necesaria para llegar a una respuesta correcta varía según el modelo, los tokens en sí no son un producto intercambiable; lo que realmente se comoditiza es la inteligencia producida con esos tokens
- Los altos precios de Anthropic y OpenAI se deben en gran parte a la escasez de oferta de cómputo, y aunque los modelos chinos sean más baratos por token, si usan más tokens de inferencia su ventaja de costo puede desaparecer
- China busca comoditizar la IA con modelos de pesos abiertos para fortalecer su industria nacional de robótica y del mundo físico, y también disfruta de una ventaja estructural al usar modelos estadounidenses de vanguardia como maestros de bajo costo mediante destilación (distillation)
- Si EE. UU. no flexibiliza las restricciones sobre modelos de vanguardia para ciberseguridad ni permite la destilación a sus desarrolladores nacionales de pesos abiertos, las empresas estadounidenses terminarán dependiendo de modelos chinos para defenderse
La estructura de costos de la IA, distinta al software
- En software, el costo marginal y el costo de transacción eran prácticamente cercanos a 0, lo que daba centralización y ventajas de escala a las empresas que capturaban la demanda; en IA, el costo marginal vuelve a determinar la estructura industrial
- Los modelos de pesos abiertos ahorran el costo de I+D de crear los pesos, pero no vuelven gratuito el costo de ofrecer el servicio
- El costo de I+D es un costo fijo independiente de los ingresos
- El costo de inferencia es un costo de bienes vendidos que aumenta conforme crecen el uso y los ingresos
- Si el costo de generar tokens es de 0.50 dólares por cada 1 dólar de ingresos, entonces con 100 millones de dólares de ingresos se generan 50 millones de dólares de costo de bienes vendidos, y con 100 mil dólares de ingresos se generan 50 mil dólares
- Kimi K3 cuesta 3 dólares por 1 millón de tokens de entrada y 15 dólares por 1 millón de tokens de salida; Sol cuesta 5 y 30 dólares respectivamente
- Aun así, el precio por token por sí solo no basta para captar por completo el costo real de ofrecer inteligencia
Lo que se comoditiza no son los tokens, sino la inteligencia
- Si Nvidia define las GPU como “fábricas de tokens” independientes del modelo, entonces los indicadores clave pasan a ser tokens por segundo, tiempo hasta el primer token, tokens por watt y costo por token
- En la era de ChatGPT, cuando los tokens se entregaban directamente al usuario, esta forma de medir encajaba bien; pero en la era de la inferencia, los tokens de cadena de pensamiento se disparan y la cantidad de tokens necesaria para llegar a la respuesta correcta cambia según el modelo
- Se sabe que Kimi usa muchos más tokens que Sol, por lo que la ventaja de su precio publicado puede desaparecer
- En los flujos de trabajo con agentes también cambia entre modelos la cantidad de tokens necesaria para completar una tarea
- Los tokens no son intercambiables entre sí, así que no son como el petróleo, el cobre o el trigo
- Si varios modelos pueden producir la misma respuesta correcta, lo que tiene carácter de commodity no son los tokens sino la inteligencia al nivel de una respuesta correcta, y la cantidad de tokens consumidos hasta llegar a esa respuesta es lo que crea la diferencia en costo de bienes vendidos
- El costo de bienes vendidos de la inteligencia se determina por cinco factores
- Tamaño del modelo: los pesos y el estado en tiempo de ejecución determinan cuánta memoria costosa y cuántos aceleradores necesita cada réplica de serving
- Eficiencia de inferencia: arquitecturas como Mixture-of-Experts reducen el cómputo por token generado
- Eficiencia de memoria: reducir los requisitos de caché KV permite aumentar las solicitudes concurrentes y la utilización de GPU
- Eficiencia de serving: batch processing, scheduling y prefix caching comparten trabajo entre solicitudes y elevan la utilización
- Eficiencia de tokens: cuantos menos tokens se necesiten para la respuesta correcta, menor será el costo de inferencia
- Las apps CRUD básicas ya pueden construirse con modelos de múltiples proveedores, así que en este tipo de trabajo la rentabilidad la define una mejor estructura de costos más que un precio alto
Precio y estructura de ganancias en un mercado de commodities
- En un mercado de commodities, todos los proveedores venden lo mismo, por lo que el precio se determina por la oferta y la demanda
- A medida que baja el precio, aumenta la demanda por efecto de la elasticidad precio
- La oferta depende del costo marginal de producir el commodity
- Como el costo marginal difiere entre proveedores, el costo del proveedor marginal más caro determina el precio de mercado, y la ganancia del resto depende de qué tanto más barato producen frente a ese nivel
- Si los proveedores A, B y C producen 10 unidades cada uno a 10, 15 y 20 dólares por unidad, y la demanda a 20 dólares es de 25 unidades, entonces sucede lo siguiente
- A vende 10 unidades y gana 10 dólares por unidad
- B vende 10 unidades y obtiene 5 dólares por unidad
- C vende 5 unidades, pero no tiene ganancia por unidad
- En la práctica, A y B podrían bajar un poco el precio frente a C, y los cambios de precio también afectarían la demanda, pero la estructura en la que el proveedor de mayor costo carga con el riesgo de quiebra sigue siendo la misma
- El precio de equilibrio del mercado no puede reflejar costos fijos como I+D o deuda por adquisición de infraestructura, pero esos costos sí pueden expulsar del mercado a los proveedores menos rentables
- Cuando un proveedor sale del mercado, el precio sube hasta que entre otro proveedor o uno existente amplíe capacidad
La posición actual de los modelos chinos en el mercado de inteligencia
- Hoy el mercado de modelos de vanguardia no cumple las condiciones de un mercado de commodities perfecto porque la demanda supera a la oferta debido a la escasez de cómputo
- Nvidia suministra cómputo con márgenes altos, clientes como SpaceXAI también lo revenden a Anthropic con márgenes altos, y Anthropic puede poner un precio aún mayor a los tokens
- Es probable que Anthropic y OpenAI sean el grupo de empresas con el costo unitario más bajo para inteligencia de calidad de vanguardia gracias al rendimiento del modelo, la escala de serving y la eficiencia de tokens
- Ofrecen cierto nivel de desempeño varios meses antes que sus competidores
- Reutilizan sus mejores modelos para optimizar costos
- La demanda del mercado todavía se dirige directamente a Anthropic y OpenAI, más que a una inteligencia abstracta, y actores de menor rendimiento relativo como SpaceXAI y Meta venden capacidad a Anthropic
- Si se define una tarea por el nivel de inteligencia requerido, puede formarse un mercado de commodities en el que el comprador cambie de proveedor
- A largo plazo, los modelos de vanguardia bajan meses después al mercado no de vanguardia, y mientras tanto los desarrolladores pueden optimizar el costo de serving, por lo que las empresas de punta también tienen ventaja en mercados inferiores
- El bajo precio publicado de los modelos chinos puede ser simplemente el resultado de compararlos con precios altos fijados por Anthropic y OpenAI debido a la escasez de oferta
- Hay poca evidencia de que Kimi sea más barato en términos de costo marginal, y si se incorpora también la eficiencia de tokens, la reacción económica frente a los modelos chinos podría estar exagerada
Por qué los laboratorios de vanguardia ven con recelo a los modelos chinos
- Los laboratorios de vanguardia siguen atados a una estructura financiera de la época en que el entrenamiento consumía más GPU que la inferencia
- Para financiar el siguiente entrenamiento necesitaban maximizar los ingresos por inferencia, y eso requería precios altos de inferencia
- Aunque se espera que el costo de entrenamiento siga subiendo con fuerza, también se espera que el mercado de inferencia crezca todavía más rápido
- Como el paradigma de agentes abrió una demanda a gran escala, si se asegura suficiente cómputo será posible crecer con precios bajos y mucho volumen
- La inteligencia no es un commodity perfecto, y los datos recolectados durante el uso real hacen más inteligente al siguiente modelo
- Si aumenta la oferta de cómputo, aparece el incentivo de bajar precios para aumentar uso y datos
- La estrategia de Microsoft de enfocarse en apoyar la ejecución de modelos propios por parte de empresas también se vuelve más viable cuanto más funcionen los modelos chinos como alternativa
- Los laboratorios de vanguardia pueden diferenciarse frente a modelos chinos y otros laboratorios expandiéndose hacia la experiencia del cliente
- Claude Code y Codex muestran una fuerte persistencia: los usuarios tienden a quedarse con el harness que eligieron al inicio
- Esa persistencia puede ser aún mayor entre usuarios no técnicos
- El avance de los laboratorios hacia capas superiores amenaza a proveedores de software, incluido Microsoft
- Las empresas de software que ya controlan la experiencia del cliente pueden resistir mejor la penetración de los laboratorios cuanto más acceso tengan a modelos competitivos
- Anthropic sostiene que solo ella es digna de confianza para encargarse de IA poderosa, y una alternativa de pesos abiertos derrumba esa premisa
La estrategia china de pesos abiertos
- Qwen3.8 Max de Alibaba tiene 2.4 billones de parámetros, y la empresa lo evalúa como un modelo de segundo nivel detrás de Fable 5 de Anthropic
- Kimi K3 de Moonshot AI tiene 2.8 billones de parámetros
- Qwen3.8 Max puede usarse en la plataforma de código de Alibaba, incluido Qoder
- Alibaba planea publicar los pesos después de la vista previa
- Ante la avalancha de demanda por modelos chinos, Moonshot suspendió temporalmente la aceptación de nuevas suscripciones
- Alibaba ya había dejado de publicar pesos de modelos de vanguardia, pero volvió a girar hacia pesos abiertos
- El discurso de Xi Jinping sobre IA promueve el open source, la apertura, la cooperación y el intercambio, y subraya que la IA se está moviendo del mundo digital al mundo físico
- Pide usar la IA en la transformación de industrias tradicionales, el crecimiento de industrias emergentes y la planificación de industrias del futuro para que todas las industrias y empresas se beneficien
- La estrategia de China es comoditizar una IA que complemente a su industria nacional
- El mundo físico y la robótica, donde China es fuerte, pueden beneficiarse de modelos de IA ampliamente disponibles
- Esto puede impedir que EE. UU. obtenga una ventaja asimétrica en IA y debilitar el poder de los laboratorios estadounidenses de vanguardia
- También puede absorber la innovación generada en un ecosistema abierto
La brecha estructural que crea la destilación
- Es poco probable que China bloquee un ataque de destilación contra los laboratorios de vanguardia
- Es incorrecto atribuir todo el éxito de los laboratorios chinos a la destilación, pero también lo es negar la gran ventaja que aporta
- En el último año, el aprendizaje por refuerzo en post-entrenamiento se volvió más importante para el desempeño del modelo, lo que ha aumentado el efecto de la destilación
- Los laboratorios chinos pueden usar modelos de vanguardia como maestros sin construir desde cero un entorno de aprendizaje por refuerzo
- Eso les permite mejorar mucho más rápido y a mucho menor costo
- La destilación no es el único factor que explica el bajo costo de desarrollo de los modelos chinos, pero sí es un factor importante
- En Occidente también se usan los propios modelos chinos para destilación
- Thinking Machines, que lanzó un modelo de pesos abiertos, depende de modelos chinos para resolver el problema de arranque en frío del aprendizaje por refuerzo
- Según el análisis de Dean Meyer y Konstantine Buhler, los laboratorios chinos cuentan con investigadores sobresalientes, cómputo a gran escala, modelos fuertes de preentrenamiento, co-diseño de software y hardware, y mejores capacidades de post-entrenamiento
- La destilación comprime la costosa brecha final entre un modelo base fuerte y un sistema cercano a la frontera
- Las medidas de control pueden volver la destilación a gran escala más difícil y cara, pero no eliminarán la destilación por parte de actores respaldados por el Estado
- Cada vez que avanzan los modelos occidentales de vanguardia, aparece un nuevo maestro para los laboratorios chinos
- Los desarrolladores estadounidenses de pesos abiertos deben acatar los términos de servicio de los laboratorios de vanguardia, por lo que quedan en desventaja frente a los modelos chinos y terminan redestilando resultados ya destilados a través de modelos chinos
- Los grandes modelos de lenguaje también son el resultado de recopilar conocimiento del internet abierto y comprimirlo en un modelo, así que surge una contradicción al tratar como ilícita solo la destilación de respuestas de API de otros modelos
- EE. UU. necesita dos medidas legales
- Debe dejar claro que recopilar datos para entrenar modelos constituye uso justo
- Al menos para empresas estadounidenses, no debería permitirse que los términos de servicio prohíban la destilación
- En lugar de intentar bloquear una destilación difícil de distinguir de consultas normales a una API, debería protegerse legalmente el aprendizaje de los laboratorios y permitir que sus resultados alimenten la innovación posterior
El área que realmente debería preocupar es la ciberseguridad
- La infraestructura de producción de Hugging Face fue comprometida por un sistema autónomo de agentes de IA, y los guardrails de los modelos estadounidenses de vanguardia no pudieron distinguir entre respondedores del incidente y atacantes, bloqueando así la respuesta
- El equipo defensor ejecutó en su propia infraestructura GLM 5.2, de código abierto y de la china Z.ai, para analizar más de 17,000 registros y rastros dejados por los atacantes
- Hugging Face recomienda validar de antemano modelos con buen desempeño que puedan ejecutarse en la propia infraestructura antes de que ocurra un incidente
- Eso permite evitar bloqueos de acceso causados por guardrails
- También evita que datos del ataque y credenciales salgan a un entorno externo
- En un contexto donde los modelos con capacidad ofensiva ya están ampliamente disponibles, los defensores también deben tener acceso a los mejores modelos de alto desempeño
- Debido a directrices de la administración Trump, los defensores en la práctica no pueden usar Fable ni Sol para ciberseguridad, por lo que los modelos chinos se convierten en la mejor alternativa
- EE. UU. debe aplicar dos políticas
- Debe flexibilizar las restricciones de ciberseguridad sobre Fable y Sol
- Debe garantizar que los desarrolladores estadounidenses de modelos de pesos abiertos compitan en igualdad de condiciones con China
- Si se permite que los laboratorios de vanguardia monopolicen el estándar de seguridad y protección o bloqueen el acceso posterior al conocimiento colectivo, la defensa de las empresas estadounidenses dependerá de modelos chinos
- Los laboratorios estadounidenses deben competir con mejores modelos y mejor estructura de costos, no frenando la competencia con restricciones, y no deben cederle a China el liderazgo en apertura e innovación
2 comentarios
Perdón, Tierra
Opiniones de Hacker News
Quienes más temen a los modelos chinos son los fondos de capital de riesgo que invirtieron en las valoraciones astronómicas de Anthropic y OpenAI. Anthropic apunta a 1.2 billones de dólares y OpenAI a 850 mil millones de dólares, valoraciones que parten del supuesto de que podrán obtener enormes ganancias con APIs caras
Los laboratorios chinos están desbaratando esa estrategia al distribuir gratis buenos modelos abiertos, y si hasta los laboratorios líderes entran en una guerra de reducción de precios por token, será difícil justificar las valoraciones actuales y los inversionistas verán pérdidas contables enormes
Descargar un modelo puede ser gratis, pero ejecutarlo no lo es, así que se parece más a la economía manufacturera que al software. Al hacer trabajo real con GLM 5.2, resultó más caro que GPT 5.6, y los laboratorios estadounidenses van adelante en costo de inferencia por tarea
Si el trabajo con agentes hace que la inferencia pese más, la proporción del costo de entrenamiento disminuye; además, la eficiencia por token parece difícil de destilar, por lo que los LLM chinos parecen ineficientes. Los modelos optimizados para una demanda masiva de inferencia pueden lograr un bajo costo por tarea, y OpenAI, gracias a una tokenización eficiente y respuestas más cortas, tiene un costo por tarea de menos de la mitad que Anthropic y, en tareas de frontera, es mejor y más barato que los modelos chinos
Las empresas tampoco van a gastar grandes sumas en tokens. Cuando los laboratorios ya no necesiten subsidiar el costo de entrenamiento, el costo por token bajará a una décima parte, y cuando llegue la etapa en que el modelo quede grabado en el chip, volverá a bajar a una décima parte, hasta el punto de que quizá sea difícil consumir una cantidad significativa de tokens salvo que se haga a propósito
A diferencia de la afirmación de que Claude Code y Codex generan mucha adhesión, en invierno y primavera usé Claude Code casi de forma exclusiva, y a inicios del verano me cambié a Codex sin ninguna dificultad. Antes de eso usaba Cursor y el proceso de cambio fue igual; también probé Conductor por un tiempo, pero básicamente parecía ofrecer un entorno de ejecución para Claude/Codex
Unos años después, cuando un ejecutivo de ventas convence a la directiva con ahorros de costos, vuelven a cambiar, no por un mejor producto sino por el precio. En la empresa de mi esposa también cambian cada 1 o 2 años a la suite de otra compañía justo cuando todos ya se estaban acostumbrando a la nueva herramienta
Opero un gran sitio B2B de analítica que recibe datos de backend de clientes, y observo una gran cantidad de tráfico originado en Shenzhen Tencent Computer Systems Company Limited desde la región de Xinjiang, en el noroeste de China. Otras cinco o seis empresas chinas también están golpeando continuamente los sitios web de los clientes
En imágenes satelitales se confirma la construcción de grandes centros de datos que aprovechan energía solar barata. Desde hace unos meses, la geolocalización de esas IP empezó a mostrarlas como Shanghai o Shenzhen, pero por mediciones de latencia todavía parece que operan en Xinjiang
El material de referencia es “You Can't Cheat Time: Finding foes and yourself with latency trilateration” https://youtu.be/_iAffzWxexA, compartido por el usuario de HN lopoc. Distinguir entre Shenzhen y Xinjiang es difícil, pero entre Shanghai y Xinjiang sí se nota la diferencia
Asumir que China solo hace destilación sería un gran error. Como se ve con ByteDance y Xiaomi, China ya no es un rezagado que solo copia productos de bajo valor agregado
Las empresas chinas, igual que las estadounidenses, también pagan a personas y rastrean la web para obtener datos. Entiendo que el gobierno impulsa a algunas grandes empresas a recolectar rápidamente la web para construir corpus y luego entregarlos a empresas estratégicas dentro de China
También hay agregadores que compran datos de apps, sitios web y servicios, y mediante sistemas como OpenRouter o Cursor podrían entrenar con las huellas de ejecución de conversaciones con agentes de programación. Gracias a eso, una empresa pequeña como DeepSeek no necesita obtener por sí misma datos de cientos de sitios y agentes de programación, lo que reduce mucho sus costos
También hay empresas que compran APIs de LLM estadounidenses y las revenden a compañías chinas. Aunque haya más de 10 mil empresas usando productos de IA de EE. UU., es posible que China registre cómo se usan y las huellas de ejecución para aprovecharlas en entrenamiento
La premisa central de que “Anthropic y OpenAI probablemente tengan el menor costo por unidad de inteligencia de frontera” no está suficientemente demostrada. No hay benchmarks que comparen cuántos tokens se necesitan para obtener una respuesta bajo las mismas condiciones, y solo hay una insinuación vaga de que los modelos estadounidenses serían más eficientes en tokens.
Tampoco se comparan los precios promedio de la electricidad entre China y EE. UU., y en ese punto China parece llevar ventaja. Estoy de acuerdo en que los benchmarks de programación y similares pasan por alto el costo de ventas, pero la conclusión de que “los laboratorios de frontera estarán bien” depende de una gran suposición
Si se permite raspar conocimiento público de internet para convertirlo en un LLM, entonces también parece razonable permitir destilar de nuevo ese modelo. La propuesta de declarar la recolección de datos de entrenamiento como uso justo y bloquear términos de servicio que prohíban la destilación se parece bastante a cosechar lo que uno sembró
Se puede ver internet como un bien público y cobrar impuestos a los laboratorios, pero eso es un tema distinto de la destilación
Por experiencia construyendo directamente entornos de ejecución para agentes, el desempeño de la IA proviene casi por completo del modelo en sí, y el entorno de ejecución importó poco. Incluso con una configuración mínima como mini-swe-agent para benchmarks, el modelo realiza bien las tareas.
Por eso soy escéptico ante la idea de que el entorno de ejecución sea un foso defensivo, especialmente porque Claude Code ha tenido muchísimos errores desde hace tiempo
El texto relacionado está en https://stratechery.com/2026/anthropics-safety-superpower/. Si controlas el punto de contacto con el usuario y te conviertes en el lienzo de todo el trabajo, surge un fuerte efecto de bloqueo, así que los laboratorios de frontera que no quieren quedarse como un insumo genérico del software terminarán chocando con las empresas de software ya establecidas
Se suele equiparar “hecho en China” con “no confiable”, pero la distinción más importante es abierto vs. cerrado. Los modelos abiertos pueden auditarse y ajustarse finamente, e incluso ejecutarse por completo en hardware propio, mientras que los modelos cerrados básicamente funcionan como un “confíen en nosotros”
Empezando por EE. UU., todo el mundo debe vigilar a los laboratorios de frontera de China. No se puede asumir que China siempre irá unos meses detrás; podría estar al mismo nivel o incluso por delante.
Los responsables de políticas públicas deben aprender las lecciones del acero, la energía solar y los vehículos eléctricos. La forma en que el gobierno chino construye sistemas para dominar industrias enteras merece respeto y estudio, y los países democráticos, si no cambian sus sistemas, inevitablemente adoptarán la IA más lentamente.
Gobiernos democráticos como los de EE. UU., Europa e India deben establecer una estrategia de IA de largo plazo que pueda ejecutarse sin importar los cambios de gobierno y proteger a fondo a sus laboratorios nacionales. Pero eso solo es posible si el precio de la inteligencia por tarea productiva en sus laboratorios se acerca al de los modelos de pesos abiertos, y hoy no es así.
Proteger no significa rescates financieros, sino ofrecer energía barata y aprobar rápidamente centros de datos. También hay que establecer salvaguardas mínimas para que los clientes usen modelos de pesos abiertos solo cuando empresas nacionales los alojen dentro del país; de lo contrario, podrían perder competitividad poco a poco
Parece que ni siquiera @deanwball de OpenAI acepta la lógica de la destilación: https://xcancel.com/deanwball/status/2078133895766114412#m
Tampoco se entiende por qué los pesos abiertos frenarían el progreso por naturaleza, ni por qué un mundo centrado en modelos abiertos terminaría en un comunismo total de IA donde el Estado ofrece la IA como infraestructura pública digital, junto con una distopía
Si Anthropic tuviera un modelo como Mythos, es muy probable que potencias rivales como Rusia y China ya hayan desarrollado algo similar o mejor, o al menos que no estén muy atrás