- Los modelos de pesos abiertos con suficiente rendimiento y portabilidad pueden convertirse en una base que desarrolladores, nubes y empresas expandan juntos, creando un ecosistema de innovación difícil de igualar para un solo proveedor
- Así como Kubernetes reunió herramientas de redes, almacenamiento y observabilidad sobre una interfaz común, en IA también está creciendo un stack de producción que abarca serving de modelos, ajuste fino, runtime de agentes y evaluación
- Los modelos públicos de Hugging Face ya superan los 2 millones, y GLM-5.2 obtuvo 62.1% en su evaluación interna de SWE-bench Pro, por encima del 58.6% de GPT-5.5, mientras que Kimi K3 también logró puntuaciones similares a Opus 4.8 y GPT-5.5 en evaluaciones independientes
- Si se prohíben ampliamente los modelos chinos de pesos abiertos, el desarrollo global seguirá avanzando mientras solo investigadores y empresas de EE. UU. quedan excluidos del ecosistema, y la innovación podría acumularse alrededor de los modelos chinos, que representaron 41% de las descargas en Hugging Face durante el último año
- En lugar de prohibir, EE. UU. debería competir con la publicación de modelos de frontera utilizables comercialmente, compras gubernamentales centradas en portabilidad e interoperabilidad, construcción de toda la capa de herramientas y operaciones, y pruebas y estándares de seguridad independientes
El poder de una plataforma abierta que mostró Kubernetes
- Mesosphere desarrolló software cloud native de código abierto basado en Apache Mesos y construyó alrededor de él DC/OS, que comercializó como una distribución empresarial con soporte y funciones propietarias
- Después, Kubernetes, un proyecto de código abierto más nuevo y más completo, reunió a la comunidad cloud native y sacudió a Mesosphere
- Ingenieros de infraestructura y sistemas distribuidos de clase mundial apostaron sus carreras por Kubernetes, y también se movió parte de la comunidad leal de Mesosphere
- A medida que el centro de innovación se desplazó hacia Kubernetes, los componentes que faltaban, como redes, almacenamiento, observabilidad, herramientas de despliegue y motores de políticas, se desarrollaron rápidamente
- Con la participación de muchas startups y proveedores establecidos, casi todos los componentes necesarios para operar Kubernetes en producción se ofrecieron como código abierto
- Proveedores cloud y empresas como Mesosphere/D2iQ, Rancher, Red Hat y Nutanix construyeron negocios centrados en integración, funciones empresariales, soporte y operaciones
- El éxito de Kubernetes no fue simplemente resultado de publicar un repositorio
- Se estableció como una base neutral que ingenieros, proveedores cloud y vendors empresariales podían expandir según las necesidades de los clientes
- Las interfaces comunes y una gobernanza neutral respecto a los proveedores dieron confianza a los participantes para construir productos a largo plazo
- Cuando una plataforma abierta y personalizable se vuelve el centro de una industria, a un proveedor único le resulta difícil seguir el ritmo combinado de innovación de todo el ecosistema
La diferencia entre pesos abiertos y código abierto en IA
- La mayoría de los modelos que suelen llamarse open source son, más exactamente, modelos de pesos abiertos
- Sus parámetros entrenados se pueden descargar y modificar, pero los datos de entrenamiento y el proceso completo de entrenamiento normalmente no se publican
- Por eso no alcanzan la definición de IA de código abierto de la Open Source Initiative
- Aunque no sea código abierto completo, puede formarse un ecosistema alrededor de un producto que los usuarios pueden ejecutar y modificar
- También hay diferencias importantes entre la estructura de Kubernetes y la de la IA
- Los contribuidores de Kubernetes podían inspeccionar y cambiar el código fuente real, y reflejar sus mejoras en un proyecto upstream compartido
- Los resultados del ajuste fino de modelos normalmente no se comparten de la misma manera
- Incluso si se pueden descargar los pesos de modelos de frontera, ejecutarlos puede requerir hardware costoso
- En IA no existe una organización como la CNCF que ofrezca gobernanza neutral e interfaces comunes
- Lo común entre ambos ecosistemas es que una base con suficiente rendimiento y portabilidad atrae innovación complementaria más allá de lo que el creador original puede construir por sí solo
Del self-hosting a las plataformas de modelos
- La primera razón para adoptar modelos de pesos abiertos fue el self-hosting
- Las empresas querían ejecutar modelos en su propia nube o centro de datos manteniendo control directo sobre sus datos
- A medida que crecían el uso y los costos de inferencia, también aumentó la demanda de controlar esos costos directamente
- A partir de esa demanda se formó un stack open source de serving de modelos como vLLM, SGLang, llama.cpp, Ollama y MLX
- Los pesos abiertos van más allá del self-hosting y permiten a los desarrolladores modificar y redistribuir el propio modelo
- En Hugging Face hay registrados más de 2 millones de modelos públicos
- Alrededor de familias de modelos populares como Qwen y Gemma se están creando muchos derivados
- Pesos cuantizados y convertidos para distintas arquitecturas de chips y distintas escalas
- Modelos ajustados finamente y adaptadores LoRA para programación, medicina, derecho, matemáticas y flujos de trabajo con agentes
- Fusiones de modelos que combinan distintos resultados de ajuste fino
- Variantes de modelos adaptadas a runtimes como TensorRT-LLM, vLLM y MLX
La frontera y la brecha de rendimiento que se reduce
- Antes era fácil descartar a los modelos abiertos en la competencia de frontera porque su rendimiento base no alcanzaba para las tareas más difíciles de programación y agentes, pero esa brecha se está reduciendo rápidamente
- Z.ai lanzó GLM-5.2 con pesos públicos bajo licencia MIT
- Su puntuación interna en SWE-bench Pro fue de 62.1%, superior al 58.6% de GPT-5.5
- Aun así, los resultados pueden variar según el benchmark y el harness de agentes
- Moonshot dijo que Kimi K3 se acerca a los modelos cerrados de frontera en tareas largas de programación y prometió publicar sus pesos el 27 de julio
- En una evaluación independiente de Artificial Analysis, Kimi K3 también obtuvo puntuaciones similares a Opus 4.8 y GPT-5.5
- Cuando el rendimiento del modelo base llega a ser suficiente, pueden crecer en cadena los runtimes de agentes, harnesses de programación, sandboxes, evaluación, observabilidad y proyectos de ajuste fino especializado
- Estos componentes forman un stack abierto de nivel de producción que puede ajustarse a la carga de trabajo, hardware y estructura de costos de cada equipo
- Es una estructura donde los modelos de pesos abiertos corren sobre software de código abierto
- Eso no garantiza que superen a todos los modelos cerrados en todos los benchmarks
- La IA de frontera es una competencia por talento, y un ecosistema abierto da a personas talentosas de todo el mundo una razón para desarrollar sobre la misma base
El impacto de prohibir modelos chinos en EE. UU.
- Tras la aparición de modelos chinos potentes como Kimi K3, se informó que la administración Trump está considerando restricciones sobre los modelos chinos de pesos abiertos
- Aún no está claro qué forma tendría una posible prohibición
- Si se prohíbe ampliamente el uso de modelos chinos de pesos abiertos, investigadores y empresas de EE. UU. podrían aislarse por sí mismos del ecosistema donde se reúnen investigadores e ingenieros de IA de clase mundial
- En ese ecosistema también participan muchos investigadores chinos
- La actividad de desarrollo global seguiría, pero el resultado sería que solo los desarrolladores de EE. UU. no tendrían acceso
- Alrededor de Qwen ya se observa una dinámica similar
- Según Hugging Face, durante el último año los modelos chinos representaron 41% de todas las descargas de modelos
- Si los mejores modelos abiertos basados en pesos siguen saliendo de China, como pasó con Kubernetes, las herramientas y la innovación podrían acumularse alrededor de esos modelos
Cuatro formas en que EE. UU. puede competir
-
Publicar modelos estadounidenses de nivel de frontera
- Los laboratorios de EE. UU. deberían publicar modelos de pesos abiertos de nivel de frontera con licencias que permitan a las startups construir productos reales
- Ya hay algunos avances
- NVIDIA Nemotron puede usarse comercialmente bajo la licencia permisiva de NVIDIA
- Inkling de Thinking Machines, gpt-oss de OpenAI y Gemma 4 de Google se publicaron bajo Apache 2.0
- Pero la mayoría de los modelos más potentes de los principales laboratorios de frontera de EE. UU., incluidos los mejores de OpenAI y Google, siguen siendo cerrados
-
Crear un mercado abierto mediante compras gubernamentales
- Las compras gubernamentales deberían generar demanda para sistemas con portabilidad e interoperabilidad, en vez de sistemas dependientes permanentemente de un solo proveedor de API
- El Departamento de Defensa de EE. UU. ya usa un enfoque similar
- Platform One ofrece herramientas open source y productos empresariales que varios programas militares pueden usar como base
- El mismo tipo de compra pública podría acelerar la innovación alrededor de los modelos de pesos abiertos
-
Construir todo el stack más allá del modelo
- Las empresas de EE. UU. también deben construir el resto de las capas alrededor del modelo
- Las startups pueden personalizar y extender modelos, e integrarlos en productos
- Las capas de serving, herramientas, soporte y operaciones también representan oportunidades de negocio
- Las principales empresas estadounidenses de chips pueden seguir mejorando el hardware, y los hyperscalers y neoclouds pueden ofrecer modelos y ecosistemas como servicio
-
Introducir pruebas y estándares en lugar de prohibiciones
- La seguridad es el argumento más fuerte a favor de las restricciones, pero una prohibición total es demasiado amplia y sacrifica incluso el acceso a todo el ecosistema
- Una mejor respuesta sería establecer pruebas y estándares independientes para modelos de frontera
- La prueba de conformidad de Kubernetes verifica compatibilidad, no seguridad, así que no es un ejemplo que aplique exactamente a la IA
- Aun así, sus criterios independientes y su modelo de gobernanza pueden servir de referencia
- Demis Hassabis propuso una entidad independiente de estándares liderada por EE. UU. de carácter similar
Estrategia para competir en un ecosistema abierto de IA
- En lugar de levantar barreras alrededor de sus propios desarrolladores, EE. UU. debería ejecutar directamente los modelos chinos, analizar su interior, hacer benchmarks y mejorarlos
- Al mismo tiempo, debería construir alternativas estadounidenses mejores para convertir su stack de IA en la opción más fácil de adoptar en el mundo
- Durante décadas, EE. UU. ha ofrecido un espacio para atraer y desarrollar al mejor talento tecnológico del mundo
- Si convierte esa ventaja en un ecosistema cerrado mientras otros países adoptan stacks más abiertos como estándar, EE. UU. terminará renunciando por sí mismo a su posición de líder en IA
1 comentarios
Comentarios de Hacker News
Prohibir los modelos chinos parece técnicamente imposible. Los pesos son solo números, así que no se puede distinguir entre unos de EE. UU. y unos de China, y una prohibición basada en el origen sería fácil de evadir
Al final habría que regular todos los modelos de pesos abiertos, y Axios incluso reportó que importantes laboratorios de IA o personas vinculadas al sector propusieron al poder ejecutivo prohibir los modelos open source cada 3 a 5 meses
Se podría imponer un esquema de licencias parecido al DRM para que solo modelos estadounidenses certificados se ejecuten en servidores propios, pero eso daría monopolio a los grandes laboratorios y también impediría distribuir modelos derivados. Como sería difícil aplicarlo en el extranjero, es muy probable que al final solo limite a los estadounidenses
En cambio, sí podría prohibirse pagar por inferencia o servicios de IA a empresas chinas o a operadores propiedad de empresas chinas
Una de las partes más raras de la industria de la IA es el esquema de precios por tokens. No está claro por qué GPT-4 era tan caro a inicios de 2023 y seis meses después ya se podía usar bastante inferencia por 20 dólares; además, los precios de varios laboratorios y proveedores han subido y bajado durante años sin una base evidente
Los modelos de pesos abiertos al menos ofrecen una línea base del costo de inferencia, hacen más razonables los precios y también aumentan la previsibilidad. Aunque salga Kimi K3, si quieres puedes seguir usando K2, así que la presión competitiva y la continuidad de los modelos abiertos son útiles para los usuarios
Si uno está acostumbrado a mercados maduros y estables puede parecer caótico, pero la volatilidad de precios de un mercado naciente es algo común
Aunque todos lleven
gpt-4en el nombre, eso no significa que el modelo interno sea el mismo, y quizá cambiaron bastante para reducir el costo del servicioPara llegar a una posición como la de Kubernetes, varias empresas tendrían que desarrollar en conjunto modelos de IA con datos de entrenamiento abiertos. Así como distintas compañías contribuyen a Linux, puede tener sentido usar un modelo abierto y aportar las funciones necesarias, porque los modelos de IA son necesarios para el negocio pero desarrollarlos por cuenta propia es demasiado caro
OpenAI también publicó dos modelos open source muy buenos para su momento. El modelo de 20B es excelente para revisar texto o hacer borradores de scripts de Bash en casa, pero el de 120B es difícil de ejecutar en hardware de consumo a una velocidad de tokens por segundo realista
Aun así, estaría bien que OpenAI actualizara estos modelos más seguido
gpt-oss-120bcorre a más de 30 tokens por segundo en Strix Halo y a más de 75 tokens por segundo en una MacBook Pro M5 Max de 128GBSu sucesor espiritual parece ser la línea Nemotron 3, aunque también ya tiene algo de tiempo: https://research.nvidia.com/labs/nemotron/Nemotron-3/
También está la más reciente Gemma 4: https://huggingface.co/collections/google/gemma-4
O se puede elegir Qwen3.6: https://huggingface.co/collections/Qwen/qwen36
China publica modelos abiertos para elevar su nivel tecnológico, pero OpenAI y Sam los publican con el objetivo de frenar a los competidores
Para las startups que quieren modelos de frontera de laboratorios estadounidenses, el ritmo de lanzamientos actual no es sostenible. Si EE. UU. no quiere ceder por completo este mercado, OpenAI y otros tendrán que acelerar rápido
Hasta que China amplíe la producción de hardware, ejecutar por cuenta propia no será económico, pero es positivo que los modelos abiertos presionen a los laboratorios. Al final, cuando los teléfonos puedan ejecutar modelos suficientes para la mayoría de las tareas, es muy probable que Apple gane
Ni siquiera requiere procesos de fabricación de semiconductores de punta, así que puede reducir mucho los costos
Calculado como 7 meses de suscripción a Claude Code por nodo, la inversión se recupera en 28 meses, y con una depreciación a 5 años casi se pueden montar dos clústeres al costo de equilibrio para atender dos flujos de solicitudes simultáneos
El hardware de próxima generación ya fue anunciado y se espera que salga tras unas dos iteraciones de la ley de Moore, y es probable que su precio estable quede por debajo de 1,400 dólares en valor de 2024 y que además sea más rápido
Cuando se desinfle la burbuja financiera y los laboratorios dejen de comprar hardware para centros de datos, la inferencia local pasará a ser más barata que una suscripción y muy práctica. Entonces me pregunto si UNIX Surplus venderá servidores de inferencia a precio de remate, como después del colapso puntocom, o si los requisitos eléctricos serán demasiado especializados para uso doméstico
Tiene valor la idea de generar demanda comprando sistemas portables e interoperables, en lugar de que el gobierno quede permanentemente atado a un proveedor específico de API. No solo podría hacerlo el gobierno federal, sino también estados como California, Colorado, Illinois y New York
Me da curiosidad una configuración real para hacer programación agentiva con modelos de pesos abiertos. Quisiera saber qué herramientas de ejecución y qué modelos usan, cuánto cuesta al mes y cómo se compara con planes subsidiados como Claude Code y Pro
Quiero comprobar si eso de que los modelos abiertos son baratos y eficientes también se cumple en la práctica
En Zed uso tres modelos locales: Qwen 3.6 27B con contexto de 128K en
llama.cppsobre una sola RTX 3090 a unos 50 tokens por segundo; Qwen 3.6 35B-A3B con contexto completo enllama.cppsobre una Titan V y dos GTX 1080 Ti a unos 30 tokens; GPT-OSS 120B corre lentamente en CPUUso los agentes paralelos de Zed para ir cambiando de tarea, y cuando el modelo se atasca lo detengo y corrijo el código. Con este método mantengo la concentración y produzco código mantenible, alcanzando alrededor de 80% del objetivo
Tengo 30 años de experiencia y necesito entender siempre cómo funciona el código, así que obtengo la mayor parte de las ventajas de corto plazo sin depender de un tercero para avanzar el código. Con dos GTX 5060 Ti de 16 GB, usando tarjetas ampliamente disponibles, probablemente se lograrían unos 100 tokens por segundo con Qwen 3.6 35B-A3B
Los modelos cloud más recientes son excelentes para programación general usando draft tokens y similares, pero en tareas especializadas por dominio su rendimiento cae. Como el modelo draft tiene apenas entre 10% y 20% del tamaño del modelo base, e incluso las GPU Blackwell de gama más alta están limitadas a unos 250 tokens por segundo, para escalar el rendimiento al nivel base hacen falta MoE o modelos draft
Pero mi caso de uso son problemas fuera de distribución (OOD) o problemas con pocos ejemplos en el corpus de entrenamiento, así que esas optimizaciones juegan en contra. Es una situación más de necesitar una minivan que un Lamborghini
qwen 3.6 35B unsloth 4 biten un Ryzen 5950X, 128 GB de memoria y una RTX 3060 de 12 GBCon 10K de contexto obtengo unos 40 tokens por segundo de generación y unos 500 tokens de prefill, y con 100K de contexto unos 25 tokens de generación y unos 400 tokens de prefill
Muchas veces primero hago un plan detallado paso a paso con GPT o Claude y luego hago que Qwen lo siga. No estoy seguro de que sea económico, pero ya tengo el hardware y gracias a los paneles solares en el techo la electricidad no es un gran problema
La mayor ventaja es poder tener la certeza de que todo se procesa completamente en local y de que la herramienta de ejecución no hace cargas ni telemetría remota
No lo he comparado con suscripciones porque no me gustan las limitaciones ni la forma de operar de esos planes. Es notablemente más lento que Fable, Opus y Gemini, pero mucho más barato que las tarifas API de estos
En el trabajo nos dan Claude, y recibí un reporte de que usar Opus cuesta 75 dólares por hora laboral
GLM 5.2 awq4en OpenCode; fue mejor que Sonnet 4.8, que es el preferido de la empresa, y un poco inferior a Opus 4.8, pero fue suficiente para la mayoría de las tareas que necesita el equipo de desarrollo. No supera a Sonnet 5, pero tampoco se queda sin tokensEn cambio, requiere cuatro H200 para correr, y con esa configuración solo unas tres personas pueden usar caché de contexto
Espero que llegue el equipo Blackwell y que los pesos de Kimi 3 realmente se publiquen. En el punto en que los desarrolladores gastan una parte importante de su salario en tokens, termina siendo más barato comprar directamente un servidor DGX absurdamente caro, montarlo en un rack y operarlo
Cuesta creer la interpretación de que el gobierno chino apoya el entrenamiento y la publicación de los mejores modelos para presionar a OpenAI y Anthropic con una competencia abierta. Más bien parece una forma de reforzar con aprendizaje por refuerzo modelos de punta para que se ajusten a la forma de distribución de información aprobada por el gobierno chino
Si tengo que confiar en un sistema opaco que responde preguntas, elegiría un modelo de una empresa estadounidense con fines de lucro y que cotiza en bolsa, sujeta a presión de mercado, antes que uno aprobado por el gobierno chino y fuertemente subsidiado
El dumping físico tiene una demanda finita y un costo ambiental alto, pero la demanda de software es prácticamente infinita y el costo ambiental frente al costo de producción también es menor, así que podría ser posible aprovecharse del dumping de IA
Se está asumiendo como si fuera una ley natural que China seguirá subiendo pesos de modelos de frontera a Hugging Face. Pero el momento Mythos de China está a solo unos meses, y varios reportes sugieren que China también podría responder de forma similar
Cuesta creer que China subiría una secuela de Mythos a Hugging Face y permitiría que todos le quitaran las salvaguardas. Las cosas no avanzaron como esperaban OpenAI y Anthropic, ni tampoco como esperaba China