1 puntos por GN⁺ 3 시간 전 | 1 comentarios | Compartir por WhatsApp

1 comentarios

 
GN⁺ 3 시간 전
Opiniones de Hacker News
  • Si eres una gran empresa que gasta varios millones de dólares al mes en inferencia, puede valer la pena comprar directamente un rack GB300 de unos 6 millones de dólares
    De los 20.7 TB de memoria, ni siquiera se necesita el 10% para cargar completo el modelo MXFP4, y con un ancho de banda HBM total de 576 TB/s se pueden ejecutar en paralelo más de 6,000 tareas de agentes con contexto promedio de 100 mil tokens a unos 30 tokens/s
    Si se calculan 1.5 millones de dólares anuales entre depreciación y electricidad, y una utilización promedio del 50%, el costo queda por debajo de 0.6 dólares por cada millón de tokens de salida; además, los datos permanecen dentro de la empresa y sale más de 10 veces más barato que un servicio hospedado
    Para las empresas que creen que los modelos de pesos abiertos seguirán mejorando y que la IA llegó para quedarse, parece ser la primera justificación clara para decidir comprar el rack directamente

    • Están ejecutando Kimi 2.8 en un servidor de 107 mil dólares y procesando más de unos 50 mil tokens por segundo en la mayoría de las tareas
      Ya han ahorrado más de lo que gastaron el año pasado en tokens de Claude y Gemini
    • Si contratas de 2 a 3 personas de DevOps para operarlo, eso suma otros 400 mil a 700 mil dólares, y las fallas y el mantenimiento también pasan a ser responsabilidad de la empresa
      Aun así, no confiarían datos que deban permanecer privados a un LLM hospedado
    • También se necesita un espacio con refrigeración líquida e infraestructura eléctrica de ultra alta densidad, así que una instalación típica de colocación o un cuarto de servidores interno difícilmente lo soportaría
    • Si una empresa puede comprar un rack y la infraestructura por 6 millones de dólares, también tiene que considerar las condiciones de licencia comercial aplicables, así que la cuenta no es tan simple
  • Junto con el modelo también publicaron varias piezas de infraestructura open source
    https://github.com/MoonshotAI/MoonEP
    https://github.com/kvcache-ai/AgentEnv
    https://github.com/MoonshotAI/FlashKDA
    Cuesta aceptar la idea de que el código abierto y los modelos de pesos abiertos sean algo que retrasa el avance de la IA

    • De hecho, alguien opinaba que sí retrasa el avance
      Porque otros laboratorios pueden ponerse al día destilando los modelos de los laboratorios punteros, quitándoles parte de los ingresos que podrían reinvertir en la siguiente generación
      Si de verdad se quisiera acelerar al máximo, pensaba que habría que nacionalizar a los dos grandes laboratorios y cerrarlos como el Manhattan Project hasta llegar a la mejora recursiva autónoma (RSI), pero dijo que cambió mucho de perspectiva tras ver las objeciones en las respuestas
  • La licencia de Kimi-K3 puede revisarse en https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE
    Los proveedores de Model as a Service cuyos ingresos combinados con sus afiliadas superen 20 millones de dólares durante 12 meses consecutivos deben firmar un acuerdo aparte con Moonshot AI antes de cualquier uso comercial
    Las condiciones existentes también incluyen una cláusula que exige mostrar el nombre Kimi si se tienen más de 100 millones de usuarios activos mensuales o si los ingresos de un producto comercial superan los 20 millones de dólares

    • Kimi 2.6 usaba una licencia del mismo estilo, https://huggingface.co/moonshotai/Kimi-K2.6/blob/main/LICENS..., y parece remontarse hasta K2
      Los modelos públicos de 2025 tenían una licencia MIT limpia, pero desde moonshotai/Kimi-K2-Thinking en enero de 2026 empezaron a usar una licencia MIT modificada
    • Desde el principio queda la duda de a qué se aplica exactamente esta licencia
      Tampoco está claro si existe copyright sobre los pesos del modelo
    • En Estados Unidos puede interpretarse que los pesos de un modelo de aprendizaje automático no son objeto de copyright porque son el resultado de procesos automáticos de optimización como descenso de gradiente estocástico, maximización de la esperanza o algoritmos genéticos
      Esto aún no se ha validado por completo en tribunales y litigar es caro, así que los empleadores normalmente preferirán irse por lo seguro y cumplir la licencia
      Thaler v. Perlmutter confirmó que el copyright requiere un autor humano, y la guía de la Oficina de Copyright de EE. UU. también establece que no se puede registrar una obra generada automáticamente por una máquina sin intervención creativa humana
      La cláusula siguiente además excluye del copyright principios matemáticos, fórmulas, algoritmos y ecuaciones, así que si se considera al modelo como un algoritmo, la conclusión parece relativamente clara
      [1] https://media.cadc.uscourts.gov/opinions/docs/2025/03/23-523...
      [2] https://www.copyright.gov/comp3/chap300/ch300-copyrightable-...
    • Está bien que al menos se pueda descargar, pero con estas condiciones da pena que sea difícil llamarlo realmente pesos abiertos u open source
    • También queda la duda de cómo detectarían a quienes violen la licencia para convertirlos en objetivo de demanda
  • Resulta interesante el enfoque de un grafo de conocimiento jerárquico autoevolutivo que se expande de forma continua mientras los agentes exploran a escala web áreas intensivas en conocimiento y de programación

  • Ver que la función de activación volvió a tanh hace pensar que las modas tecnológicas son cíclicas

    • Según la página 6 del paper, no usan tanh tal cual, sino f_gate(b,x) = b * tanh(x / b) * sigmoid(x) y f_up(b,x) = b * tanh(x / b)
      Por la gráfica, parece un diseño que intenta combinar las ventajas de GLU en expresividad cuando x es mayor que aproximadamente 5 con las ventajas de SwiGLU cerca de 0, donde los valores se disparan
  • La síntesis de tareas basada en grafos de conocimiento parece un enfoque muy adecuado para el viejo problema de cómo abarcar sin omisiones una gran variedad de tareas
    También da la impresión de que podría llevar a investigación teórica sobre la velocidad a la que se genera nuevo conocimiento y sobre formas humanas y mecánicas de generarlo

  • Se pregunta cuál es actualmente la mejor opción entre LoRA+DPO, GRPO para ajustar finamente un trabajo propio de agente

    • Por ahora LoRA+SFT parece adecuado, pero como el modelo es grande, la carga de costos sería considerable
      Parece mejor esperar la API de ajuste fino del proveedor, y no da la impresión de que haga falta ir desde el inicio hacia aprendizaje por refuerzo o seudorefuerzo off-policy como DPO
  • Se pregunta cuál es el modelo profesor en la destilación on-policy con múltiples profesores
    En áreas verificables como matemáticas o programación se entiende, pero al ver que incluso incluye biología surge la duda de si es una estructura que destila desde un modelo más grande

    • Está citando https://thinkingmachines.ai/blog/on-policy-distillation/
      Se entiende como un método de destilación donde el modelo profesor califica cada token del modelo estudiante que resuelve el problema con la probabilidad de generación en cada paso, y aplica eso como recompensa o pérdida para hacer aprendizaje por refuerzo
      Parece que múltiples profesores significa destilar desde varios modelos, y podrían incluirse incluso modelos privados de última generación
      Sin embargo, se necesitan log probabilities; la API de OpenAI sí las permite, mientras que Anthropic no las ofrece, así que quizá también exista algún método para estimarlas externamente
      Este enfoque puede aplicarse a cualquier campo que el profesor conozca, incluida la biología
    • El profesor se refiere a otros modelos
  • Se pregunta si la razón por la que los precios de inferencia de varios proveedores son todos iguales se debe a un acuerdo de licencia con Moonshot

  • Se pregunta qué haría falta para crear un modelo abierto hecho en EE. UU. que compita con Kimi

    • Parece que el último modelo abierto grande publicado recientemente por un gran laboratorio de investigación de EE. UU. fue GPT-OSS-120b en el verano de 2025, hace alrededor de un año
      Se ve difícil que salga de forma voluntaria, así que parece que habría que presionar por su publicación de alguna manera
      Últimamente se esperaba que Gemma saliera al menos en la clase de 100B, pero parece que Google mantiene un modelo de ese tamaño solo para uso interno
    • Parece bastante probable que MSL o SpaceXAI publiquen como open source uno de los próximos modelos grandes
      Ambos son favorables al open source y competirán por el lugar de Kimi en EE. UU.
    • Si es cierto el lugar común de que China simplemente destila modelos y los replica en dos semanas, entonces EE. UU. también debería poder sacar un modelo replicado en dos semanas
    • Inkling también está aproximadamente dentro de un rango competitivo