Si eres una gran empresa que gasta varios millones de dólares al mes en inferencia, puede valer la pena comprar directamente un rack GB300 de unos 6 millones de dólares
De los 20.7 TB de memoria, ni siquiera se necesita el 10% para cargar completo el modelo MXFP4, y con un ancho de banda HBM total de 576 TB/s se pueden ejecutar en paralelo más de 6,000 tareas de agentes con contexto promedio de 100 mil tokens a unos 30 tokens/s
Si se calculan 1.5 millones de dólares anuales entre depreciación y electricidad, y una utilización promedio del 50%, el costo queda por debajo de 0.6 dólares por cada millón de tokens de salida; además, los datos permanecen dentro de la empresa y sale más de 10 veces más barato que un servicio hospedado
Para las empresas que creen que los modelos de pesos abiertos seguirán mejorando y que la IA llegó para quedarse, parece ser la primera justificación clara para decidir comprar el rack directamente
Están ejecutando Kimi 2.8 en un servidor de 107 mil dólares y procesando más de unos 50 mil tokens por segundo en la mayoría de las tareas
Ya han ahorrado más de lo que gastaron el año pasado en tokens de Claude y Gemini
Si contratas de 2 a 3 personas de DevOps para operarlo, eso suma otros 400 mil a 700 mil dólares, y las fallas y el mantenimiento también pasan a ser responsabilidad de la empresa
Aun así, no confiarían datos que deban permanecer privados a un LLM hospedado
También se necesita un espacio con refrigeración líquida e infraestructura eléctrica de ultra alta densidad, así que una instalación típica de colocación o un cuarto de servidores interno difícilmente lo soportaría
Si una empresa puede comprar un rack y la infraestructura por 6 millones de dólares, también tiene que considerar las condiciones de licencia comercial aplicables, así que la cuenta no es tan simple
De hecho, alguien opinaba que sí retrasa el avance
Porque otros laboratorios pueden ponerse al día destilando los modelos de los laboratorios punteros, quitándoles parte de los ingresos que podrían reinvertir en la siguiente generación
Si de verdad se quisiera acelerar al máximo, pensaba que habría que nacionalizar a los dos grandes laboratorios y cerrarlos como el Manhattan Project hasta llegar a la mejora recursiva autónoma (RSI), pero dijo que cambió mucho de perspectiva tras ver las objeciones en las respuestas
La licencia de Kimi-K3 puede revisarse en https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE
Los proveedores de Model as a Service cuyos ingresos combinados con sus afiliadas superen 20 millones de dólares durante 12 meses consecutivos deben firmar un acuerdo aparte con Moonshot AI antes de cualquier uso comercial
Las condiciones existentes también incluyen una cláusula que exige mostrar el nombre Kimi si se tienen más de 100 millones de usuarios activos mensuales o si los ingresos de un producto comercial superan los 20 millones de dólares
Desde el principio queda la duda de a qué se aplica exactamente esta licencia
Tampoco está claro si existe copyright sobre los pesos del modelo
En Estados Unidos puede interpretarse que los pesos de un modelo de aprendizaje automático no son objeto de copyright porque son el resultado de procesos automáticos de optimización como descenso de gradiente estocástico, maximización de la esperanza o algoritmos genéticos
Esto aún no se ha validado por completo en tribunales y litigar es caro, así que los empleadores normalmente preferirán irse por lo seguro y cumplir la licencia
Thaler v. Perlmutter confirmó que el copyright requiere un autor humano, y la guía de la Oficina de Copyright de EE. UU. también establece que no se puede registrar una obra generada automáticamente por una máquina sin intervención creativa humana
La cláusula siguiente además excluye del copyright principios matemáticos, fórmulas, algoritmos y ecuaciones, así que si se considera al modelo como un algoritmo, la conclusión parece relativamente clara
[1] https://media.cadc.uscourts.gov/opinions/docs/2025/03/23-523...
[2] https://www.copyright.gov/comp3/chap300/ch300-copyrightable-...
Está bien que al menos se pueda descargar, pero con estas condiciones da pena que sea difícil llamarlo realmente pesos abiertos u open source
También queda la duda de cómo detectarían a quienes violen la licencia para convertirlos en objetivo de demanda
Resulta interesante el enfoque de un grafo de conocimiento jerárquico autoevolutivo que se expande de forma continua mientras los agentes exploran a escala web áreas intensivas en conocimiento y de programación
Ver que la función de activación volvió a tanh hace pensar que las modas tecnológicas son cíclicas
Según la página 6 del paper, no usan tanh tal cual, sino f_gate(b,x) = b * tanh(x / b) * sigmoid(x) y f_up(b,x) = b * tanh(x / b)
Por la gráfica, parece un diseño que intenta combinar las ventajas de GLU en expresividad cuando x es mayor que aproximadamente 5 con las ventajas de SwiGLU cerca de 0, donde los valores se disparan
La síntesis de tareas basada en grafos de conocimiento parece un enfoque muy adecuado para el viejo problema de cómo abarcar sin omisiones una gran variedad de tareas
También da la impresión de que podría llevar a investigación teórica sobre la velocidad a la que se genera nuevo conocimiento y sobre formas humanas y mecánicas de generarlo
Se pregunta cuál es actualmente la mejor opción entre LoRA+DPO, GRPO para ajustar finamente un trabajo propio de agente
Por ahora LoRA+SFT parece adecuado, pero como el modelo es grande, la carga de costos sería considerable
Parece mejor esperar la API de ajuste fino del proveedor, y no da la impresión de que haga falta ir desde el inicio hacia aprendizaje por refuerzo o seudorefuerzo off-policy como DPO
Se pregunta cuál es el modelo profesor en la destilación on-policy con múltiples profesores
En áreas verificables como matemáticas o programación se entiende, pero al ver que incluso incluye biología surge la duda de si es una estructura que destila desde un modelo más grande
Está citando https://thinkingmachines.ai/blog/on-policy-distillation/
Se entiende como un método de destilación donde el modelo profesor califica cada token del modelo estudiante que resuelve el problema con la probabilidad de generación en cada paso, y aplica eso como recompensa o pérdida para hacer aprendizaje por refuerzo
Parece que múltiples profesores significa destilar desde varios modelos, y podrían incluirse incluso modelos privados de última generación
Sin embargo, se necesitan log probabilities; la API de OpenAI sí las permite, mientras que Anthropic no las ofrece, así que quizá también exista algún método para estimarlas externamente
Este enfoque puede aplicarse a cualquier campo que el profesor conozca, incluida la biología
El profesor se refiere a otros modelos
Se pregunta si la razón por la que los precios de inferencia de varios proveedores son todos iguales se debe a un acuerdo de licencia con Moonshot
Se pregunta qué haría falta para crear un modelo abierto hecho en EE. UU. que compita con Kimi
Parece que el último modelo abierto grande publicado recientemente por un gran laboratorio de investigación de EE. UU. fue GPT-OSS-120b en el verano de 2025, hace alrededor de un año
Se ve difícil que salga de forma voluntaria, así que parece que habría que presionar por su publicación de alguna manera
Últimamente se esperaba que Gemma saliera al menos en la clase de 100B, pero parece que Google mantiene un modelo de ese tamaño solo para uso interno
Parece bastante probable que MSL o SpaceXAI publiquen como open source uno de los próximos modelos grandes
Ambos son favorables al open source y competirán por el lugar de Kimi en EE. UU.
Si es cierto el lugar común de que China simplemente destila modelos y los replica en dos semanas, entonces EE. UU. también debería poder sacar un modelo replicado en dos semanas
Inkling también está aproximadamente dentro de un rango competitivo
1 comentarios
Opiniones de Hacker News
Si eres una gran empresa que gasta varios millones de dólares al mes en inferencia, puede valer la pena comprar directamente un rack GB300 de unos 6 millones de dólares
De los 20.7 TB de memoria, ni siquiera se necesita el 10% para cargar completo el modelo MXFP4, y con un ancho de banda HBM total de 576 TB/s se pueden ejecutar en paralelo más de 6,000 tareas de agentes con contexto promedio de 100 mil tokens a unos 30 tokens/s
Si se calculan 1.5 millones de dólares anuales entre depreciación y electricidad, y una utilización promedio del 50%, el costo queda por debajo de 0.6 dólares por cada millón de tokens de salida; además, los datos permanecen dentro de la empresa y sale más de 10 veces más barato que un servicio hospedado
Para las empresas que creen que los modelos de pesos abiertos seguirán mejorando y que la IA llegó para quedarse, parece ser la primera justificación clara para decidir comprar el rack directamente
Ya han ahorrado más de lo que gastaron el año pasado en tokens de Claude y Gemini
Aun así, no confiarían datos que deban permanecer privados a un LLM hospedado
Junto con el modelo también publicaron varias piezas de infraestructura open source
https://github.com/MoonshotAI/MoonEP
https://github.com/kvcache-ai/AgentEnv
https://github.com/MoonshotAI/FlashKDA
Cuesta aceptar la idea de que el código abierto y los modelos de pesos abiertos sean algo que retrasa el avance de la IA
Porque otros laboratorios pueden ponerse al día destilando los modelos de los laboratorios punteros, quitándoles parte de los ingresos que podrían reinvertir en la siguiente generación
Si de verdad se quisiera acelerar al máximo, pensaba que habría que nacionalizar a los dos grandes laboratorios y cerrarlos como el Manhattan Project hasta llegar a la mejora recursiva autónoma (RSI), pero dijo que cambió mucho de perspectiva tras ver las objeciones en las respuestas
La licencia de Kimi-K3 puede revisarse en https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE
Los proveedores de Model as a Service cuyos ingresos combinados con sus afiliadas superen 20 millones de dólares durante 12 meses consecutivos deben firmar un acuerdo aparte con Moonshot AI antes de cualquier uso comercial
Las condiciones existentes también incluyen una cláusula que exige mostrar el nombre Kimi si se tienen más de 100 millones de usuarios activos mensuales o si los ingresos de un producto comercial superan los 20 millones de dólares
Los modelos públicos de 2025 tenían una licencia MIT limpia, pero desde moonshotai/Kimi-K2-Thinking en enero de 2026 empezaron a usar una licencia MIT modificada
Tampoco está claro si existe copyright sobre los pesos del modelo
Esto aún no se ha validado por completo en tribunales y litigar es caro, así que los empleadores normalmente preferirán irse por lo seguro y cumplir la licencia
Thaler v. Perlmutter confirmó que el copyright requiere un autor humano, y la guía de la Oficina de Copyright de EE. UU. también establece que no se puede registrar una obra generada automáticamente por una máquina sin intervención creativa humana
La cláusula siguiente además excluye del copyright principios matemáticos, fórmulas, algoritmos y ecuaciones, así que si se considera al modelo como un algoritmo, la conclusión parece relativamente clara
[1] https://media.cadc.uscourts.gov/opinions/docs/2025/03/23-523...
[2] https://www.copyright.gov/comp3/chap300/ch300-copyrightable-...
Resulta interesante el enfoque de un grafo de conocimiento jerárquico autoevolutivo que se expande de forma continua mientras los agentes exploran a escala web áreas intensivas en conocimiento y de programación
Ver que la función de activación volvió a tanh hace pensar que las modas tecnológicas son cíclicas
f_gate(b,x) = b * tanh(x / b) * sigmoid(x)yf_up(b,x) = b * tanh(x / b)Por la gráfica, parece un diseño que intenta combinar las ventajas de GLU en expresividad cuando x es mayor que aproximadamente 5 con las ventajas de SwiGLU cerca de 0, donde los valores se disparan
La síntesis de tareas basada en grafos de conocimiento parece un enfoque muy adecuado para el viejo problema de cómo abarcar sin omisiones una gran variedad de tareas
También da la impresión de que podría llevar a investigación teórica sobre la velocidad a la que se genera nuevo conocimiento y sobre formas humanas y mecánicas de generarlo
Se pregunta cuál es actualmente la mejor opción entre LoRA+DPO, GRPO para ajustar finamente un trabajo propio de agente
Parece mejor esperar la API de ajuste fino del proveedor, y no da la impresión de que haga falta ir desde el inicio hacia aprendizaje por refuerzo o seudorefuerzo off-policy como DPO
Se pregunta cuál es el modelo profesor en la destilación on-policy con múltiples profesores
En áreas verificables como matemáticas o programación se entiende, pero al ver que incluso incluye biología surge la duda de si es una estructura que destila desde un modelo más grande
Se entiende como un método de destilación donde el modelo profesor califica cada token del modelo estudiante que resuelve el problema con la probabilidad de generación en cada paso, y aplica eso como recompensa o pérdida para hacer aprendizaje por refuerzo
Parece que múltiples profesores significa destilar desde varios modelos, y podrían incluirse incluso modelos privados de última generación
Sin embargo, se necesitan log probabilities; la API de OpenAI sí las permite, mientras que Anthropic no las ofrece, así que quizá también exista algún método para estimarlas externamente
Este enfoque puede aplicarse a cualquier campo que el profesor conozca, incluida la biología
Se pregunta si la razón por la que los precios de inferencia de varios proveedores son todos iguales se debe a un acuerdo de licencia con Moonshot
Se pregunta qué haría falta para crear un modelo abierto hecho en EE. UU. que compita con Kimi
Se ve difícil que salga de forma voluntaria, así que parece que habría que presionar por su publicación de alguna manera
Últimamente se esperaba que Gemma saliera al menos en la clase de 100B, pero parece que Google mantiene un modelo de ese tamaño solo para uso interno
Ambos son favorables al open source y competirán por el lugar de Kimi en EE. UU.