1 puntos por GN⁺ 3 시간 전 | 2 comentarios | Compartir por WhatsApp
  • Kimi K3 es un modelo agente multimodal nativo de pesos abiertos, con 2.8 billones de parámetros y un contexto de 1,048,576 tokens, que da soporte a sesiones largas de programación, tareas de conocimiento y razonamiento
  • Combina Kimi Delta Attention(KDA), Attention Residuals y Stable LatentMoE para activar 16 de 896 expertos por cada token, con una eficiencia de escalado general aproximadamente 2.5 veces mayor que Kimi K2
  • En evaluaciones públicas registró GPQA Diamond 93.5, Terminal-Bench 2.1 88.3, BrowseComp 91.2 y OmniDocBench 91.1, aunque deben considerarse también las diferencias de harness, configuración de inferencia y hardware entre modelos
  • Fue entrenado con aprendizaje consciente de cuantización usando pesos MXFP4 y activaciones MXFP8, y puede ejecutarse con Transformers, vLLM, SGLang, Docker y APIs compatibles con OpenAI y Anthropic
  • En conversaciones multi-turno y llamadas a herramientas, se debe reenviar tal cual el mensaje completo del assistant devuelto por la API, incluyendo reasoning_content y tool_calls; el código y los pesos se publican bajo la Kimi K3 License

Estructura y escala del modelo

  • Kimi K3 es un modelo agente multimodal nativo de pesos abiertos, diseñado para programación de larga duración, tareas de conocimiento y razonamiento
  • Tiene 2.8T parámetros totales, 104B parámetros activos y está compuesto por 93 capas
    • Usa 1 capa dense, 69 capas KDA y 24 capas Gated MLA
    • La dimensión oculta de attention es 7,168 y tiene 96 attention heads
  • Stable LatentMoE selecciona 16 de 896 expertos por token y usa 2 expertos compartidos
    • La dimensión Latent MoE es 3,584, y la dimensión oculta MoE por experto es 3,072
    • En comparación con Kimi K2, la eficiencia de escalado general mejora aproximadamente 2.5 veces
  • El tamaño del vocabulario es 160K, la longitud de contexto es de 1,048,576 tokens y la función de activación es SiTU-GLU
  • Usa MoonViT-V2, con 401M parámetros, como encoder de visión
  • Entre sus capacidades principales se incluyen la comprensión de texto, imágenes y video, aunque en el campo modality de la tabla resumen del modelo solo figuran Text e Image

Programación de larga duración y tareas de conocimiento

  • Mantiene sesiones extensas de ingeniería con mínima supervisión humana, explora repositorios grandes y coordina herramientas de terminal
    • Da soporte a la optimización de kernels de GPU y al desarrollo de compiladores
    • También incluye como objetivos el desarrollo de videojuegos que usan visión, CAD y diseño de chips
  • En tareas de conocimiento de tipo agente, genera visualizaciones interactivas, widgets y dashboards junto con investigación profunda
    • El diseño de movimiento y la edición de video también entran en su alcance de soporte
  • Como framework de agente de programación se recomienda Kimi Code CLI, y se puede seleccionar Kimi K3 desde la terminal con el comando /model

Resultados de evaluación

  • Todos los resultados de Kimi K3 se midieron con reasoning_effort="max" y temperature 1.0
    • Para tareas de un solo paso, como GPQA Diamond, HLE-Full y evaluaciones de visión sin herramientas, se usó top-p 0.95
    • Para tareas de agente se aplicó top-p 1.0
  • En evaluaciones de razonamiento y conocimiento registró GPQA Diamond 93.5, CritPt 23.4 y AA-LCR 74.7
    • HLE-Full fue 43.5 sin herramientas y 56.0 con uso de herramientas
  • En evaluaciones de programación registró ProgramBench 77.8, Terminal-Bench 2.1 88.3 y FrontierSWE 81.2
    • DeepSWE fue 67.5 en el harness Kimi Code y 67.3 en el harness mini-SWE-agent
    • Registró SWE-Marathon 42.0, PostTrainBench 36.6, MLS-Bench-Lite 48.3, SciCode 58.7 y Kimi Code Bench 2.0 72.9
  • En evaluaciones de agente registró BrowseComp 91.2, DeepSearchQA F1 95.0 y ResearchRubrics 76.2
    • MCPMark-Verified 94.5, AutomationBench 30.8, SpreadsheetBench 2 34.8 y OSWorld-Verified 84.8
    • También se midió Harvey Lab-AA 94.6, CorpFin v2 71.6, Finance Agent v2 54.4 y Legal Research Bench 44.2
  • En evaluaciones de visión registró OmniDocBench 91.1, Video-MME 90.0 y MMVU 82.1
    • MMMU-Pro fue 81.6 sin herramientas y 83.4 con herramientas
    • MathVision sube de 94.3 a 97.8 al usar Python
    • ZeroBench pass@5 sube de 23.0 a 41.0 con uso de herramientas

Condiciones de evaluación y límites de comparación

  • Entre los modelos comparados se incluyen Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8, GPT-5.5 y GLM-5.2, pero el harness de evaluación puede variar según el modelo
    • Kimi K3 usa principalmente Kimi Code o Claude Code
    • La familia GPT usa principalmente Codex, y otros modelos Claude y GLM usan Claude Code o Terminus 2, entre otros
  • SWE-Marathon se evaluó en una rama que ajusta para H20 las tareas al 9 de julio de 2026, antes de la versión final v1.1
    • Las imágenes Docker, los criterios de rendimiento de GPU y el oráculo de referencia se recalibraron para H20, pero no se cambiaron los verificadores de exactitud ni de prevención de trampas
    • Claude Fable 5 tuvo fallback en el 35% de las tareas, lo que podría haber afectado negativamente el rendimiento medido
  • PostTrainBench es el promedio de 3 ejecuciones con máximo esfuerzo de inferencia en GPU H20, en lugar de H100 del entorno oficial
  • Kimi Code Bench 2.0 incluye tareas de ciberseguridad y seguridad
    • Claude Fable 5 tuvo 13 fallbacks y 1 rechazo entre 80 tareas
    • GPT-5.6 Sol rechazó 10 tareas y GPT-5.5 rechazó 3
  • BrowseComp 91.2 es el resultado usando una estrategia de compresión de contexto que opera con 300K tokens
    • Al usar la ventana completa de 1M tokens sin gestión de contexto adicional, registra 90.4
  • Las evaluaciones multimodales usan el promedio de 3 ejecuciones, salvo ZeroBench
    • ZeroBench se ejecuta 5 veces según la configuración oficial
    • PerceptionBench es un benchmark propio que mide capacidades atómicas de percepción visual

Cuantización nativa

  • Desde la etapa SFT se aplica aprendizaje consciente de cuantización
  • Los pesos usan MXFP4 y las activaciones MXFP8, con el objetivo de ofrecer amplia compatibilidad de hardware

Distribución y formas de ejecución

  • Se puede acceder a Kimi API seleccionando kimi-k3, y ofrece APIs compatibles con OpenAI y Anthropic
  • En Hugging Face Transformers se puede cargar con pipeline("image-text-to-text", ...) o AutoModel.from_pretrained(...)
    • Para usar código de modelo personalizado se requiere trust_remote_code=True
  • El serving local admite vLLM y SGLang
    • Ambos motores pueden manejar solicitudes de texto e imagen en el endpoint compatible con OpenAI /v1/chat/completions
  • En Docker Model Runner se ejecuta con docker model run hf.co/moonshotai/Kimi-K3
  • El modelo también puede usarse en HuggingChat, Google Colab y Kaggle

Uso de la API conservando el estado de razonamiento

  • Kimi K3 tiene el modo de pensamiento siempre activado y devuelve reasoning_content
  • El campo de solicitud de nivel superior reasoning_effort admite "low", "high" y "max"; el valor predeterminado es "max"
  • Las conversaciones multi-turno y las llamadas a herramientas deben ajustarse al método de historial de pensamiento preservado
    • Se debe reenviar en messages el mensaje del assistant devuelto por la API, tal cual
    • Debe incluir no solo content, sino también reasoning_content y tool_calls
  • La entrada de visión, la salida estructurada, partial mode, la selección de herramientas, la carga dinámica de herramientas y el caché de contexto pueden consultarse en Kimi K3 Quickstart y Thinking Effort

Licencia

  • Tanto el repositorio de código como los pesos del modelo se publican bajo la Kimi K3 License

2 comentarios

 
treestae 1 시간 전

Ojalá aparezca algún proveedor local que lo ofrezca.

 
GN⁺ 3 시간 전
Opiniones de Hacker News
  • Cuando se fije el precio intermedio de terceros para un modelo de 3 billones de parámetros, se podrá estimar el costo real de servirlo y si el laboratorio subsidia los tokens de la API.
    Al ser nativo en MXFP4, requiere alrededor de 1.5 TB de VRAM, lo que lo deja justo en el límite de 8×B200; si además se consideran la longitud de contexto y la optimización del throughput, en la práctica parecen necesarias 16 tarjetas.
    En el benchmark AISI de ciberseguridad supera a GLM 5.2, pero hay una gran brecha frente a los modelos cerrados de punta, por lo que podría requerir fine-tuning. También me pregunto si Cursor lo volverá a entrenar para compararlo directamente con la familia Composer, que son versiones fine-tuned de Kimi 2.6/2.7, y con Grok 4.5.
    También es prometedora la posibilidad de crear modelos más pequeños mediante destilación de conocimiento bien hecha, aprendiendo toda la distribución de probabilidades. En particular, DSV4-Kimi, con bajo costo de serving, parece prometedor.

    • Me da curiosidad el rendimiento de inferencia lenta que podría obtenerse en servidores Xeon de doble o cuádruple socket con solo RAM, sin GPU, de 1.5 a 3 TB. Para trabajos largos de 4 a 6 horas, incluso 5 o 6 tokens por segundo podrían ser útiles según el caso de uso.
      Con un servidor 4U usado y 32 DIMM ECC de 64 GB se pueden armar 3 TB de RAM por menos de 30 mil dólares, una diferencia grande frente al precio de un equipo real con GPU. Todavía no hay pesos de precisión completa ni versiones cuantizadas Q8/Q8-XL de Unsloth, pero para usar además un contexto amplio parece que harían falta más de 1,536 GB: 2 TB, e idealmente 2.5 a 3 TB.
      Q4 y Q6 probablemente sean el peor compromiso: lentos y poco confiables, mientras pierden conocimiento y precisión. Si uno va a correr en hardware de bajo presupuesto un modelo inteligente pero lento, creo que Q8 es necesario.
    • Hoy el fine-tuning suele aplicar LoRA sobre modelos base en 4 bits con bnb, pero creo que ya es hora de cambiar el formato base a GGUF. GGUF está incorporando activamente soporte para nuevas arquitecturas de modelos y cuantizaciones más agresivas.
      En https://github.com/woct0rdho/transformers5-qwen3.5-recipe hice una prueba de concepto: Qwen3.5-35B-A3B puede ajustarse con 16 GiB de VRAM, y DeepSeek-V4-Flash 284B-A13B con 90 GiB de VRAM, sin offloading a CPU. También funciona bien en sistemas de memoria unificada como Strix Halo.
      Aun así, un modelo de la escala de Kimi-K3 necesita varias GPU y varios nodos, por lo que hay muchos más problemas que resolver que en el entrenamiento con una sola GPU.
    • Anthropic y OpenAI tienen innovaciones de optimización que los laboratorios chinos no tienen, así que este precio puede mostrar el límite superior de los costos, pero no el inferior.
    • Como es un modelo nativo en MXFP4, el aspecto de hardware también es interesante. Entra holgadamente en un nodo 8×AMD MI355X, por lo que podría bajar aún más el precio por token.
    • Sin conocer el costo de entrenamiento, solo se puede inferir el costo marginal de servir un modelo así, pero no saber si el laboratorio subsidia los tokens de la API. Tampoco sabemos el tamaño real de los modelos cerrados, ni siquiera si Fable tiene 10 billones o 1 billón de parámetros.
  • Lo mucho más interesante que el precio en este lanzamiento es la personalización. Incluso una startup puede descargar los pesos, modificarlos y hacer fine-tuning; la verdadera ventaja está menos en el costo que en el rendimiento sobre sus propios datos y en la soberanía de la propiedad intelectual. Un gran logro del equipo de Kimi.

  • Siento que el hardware para que una persona ejecute LLM está configurado de una forma que no encaja con el uso. O sobrevives con memoria unificada a 5–10 tokens por segundo, o tienes que irte a tarjetas de datacenter que consumen cientos de GB de VRAM y más de 1 kW.
    No existen GPU semiprofesionales con TDP de 180–250 W y 128 GB o 256 GB de VRAM; con solo dos tarjetas así y una interconexión común de nivel NVLink ya serían bastante útiles. Ejecutar Kimi K3 localmente requeriría un homelab enorme y mucho dinero, pero sería bueno poder correr GLM 5.2 a unos 100 tokens por segundo en una sola sesión, o unos 60 tokens por segundo al usar varios subagentes.

    • El modelo grande Q8 que uno quisiera no cabe en un sistema de 3,995 dólares limitado a 128 GB de RAM, y tampoco deja espacio de contexto práctico. Qwen 3.5 122B Q8, DeepSeek V4 Flash Q8 y Laguna S 2.1 Q8 necesitan entre 170 y 190 GB de RAM incluyendo todo el contexto, así que sí caben en una workstation o servidor de doble socket con 256 GB y sin GPU.
      Las mediciones estimadas ejecutando el llama-server más reciente con --no-mmap son: DeepSeek-V4-Flash Q4_K_XL 178,175 MiB, Q8_K_XL 184,636 MiB, Laguna-S-2.1 Q8_K_X 172,860 MiB y Qwen3.5-122B-A10B Q8_K_XL 170,038 MiB.
    • La inferencia de LLM para un solo usuario encaja especialmente mal con el hardware de consumo general. La carga es intermitente, pero los pesos tienen que estar siempre en memoria, así que es mucho más eficiente un servidor multiusuario con los pesos residentes, al que solo se le agregue la caché KV por usuario; así los costosos núcleos de GPU tampoco quedan ociosos la mayor parte del tiempo.
      Esto contrasta con el trabajo de escritorio, que también es intermitente, pero donde la potencia de cómputo necesaria se volvió lo bastante barata como para que podamos tener sobre el escritorio una máquina exagerada para los momentos de inactividad.
    • Después del boom de las criptomonedas, los fabricantes de GPU empezaron a segmentar el mercado mediante la VRAM para discriminar precios. Nvidia limitó la memoria de las tarjetas de consumo para impedir que los proveedores cloud las acapararan, y pudo vender hardware esencialmente igual a precios muy distintos en los mercados de PC y datacenter, capturando ganancias de ambos lados.
    • Siento que, a medida que los modelos siguen creciendo, vamos en la dirección opuesta a la revolución de la PC. Los laboratorios de frontera publican solo modelos cerrados y, dejando como excepción algo como gpt-oss, hacen difícil ejecutar modelos abiertos mientras hablan de democratización, lo que parece especialmente injusto.
    • Ejecutar este tipo de LLM en casa difícilmente será práctico sin algún avance de diseño. La forma razonable de ejecutarlos es procesar lotes grandes en hardware compartido.
      Si pudiera comprar una GPU de varios miles de dólares, lo haría como tecnófilo con dinero, pero habría que reconocer que es un lujo extremadamente ineficiente, como un auto deportivo. La verdadera desgracia es que no tenemos ni la tecnología computacional ni las instituciones políticas y sociales para operar hardware compartido de manera confiable.
  • Según la licencia, si el titular de la licencia o sus afiliadas operan un negocio de modelos como servicio y sus ingresos acumulados durante 12 meses consecutivos superan los 20 millones de dólares, deben firmar un contrato aparte con Moonshot AI antes de usar comercialmente el software o sus derivados.

    • Parece similar al enfoque que Meta aplicó en los primeros modelos Llama. Además, también es una jugada de marketing inteligente la cláusula que exige mostrar Kimi K3 de forma destacada en la interfaz de usuario si el software o sus derivados se usan en productos o servicios comerciales con más de 100 millones de usuarios activos mensuales o más de 20 millones de dólares de ingresos mensuales.
  • Está disponible en https://app.fireworks.ai/models/fireworks/kimi-k3, con un precio de 3 dólares por millón de tokens de entrada sin caché, 0.30 dólares por entrada en caché y 15 dólares por salida.

    • El plan prioritario de Kimi de Fireworks también está disponible en OpenRouter a 3.75 dólares por millón de tokens: https://openrouter.ai/moonshotai/kimi-k3#providers
      Actualmente tiene una latencia mucho menor que Moonshot, aunque también mucho menos uso, así que habrá que ver si se mantiene. Aun así, el despliegue el mismo día es impresionante.
    • Claude Opus 5 cuesta 5 dólares por entrada sin caché, 0.50 dólares por entrada en caché y 25 dólares por salida; además, la escritura en caché tiene un costo adicional del 25% para 5 minutos y del 100% para 1 hora.
    • Pudimos ofrecerlo a los usuarios de nuestra plataforma apenas unas horas después de que Fireworks lo lanzara. Eso sí, como discontinuaron los modelos Flux bajo demanda, ahora queda la duda de dónde generar imágenes.
    • También está disponible en Together.ai al mismo precio de venta; Fireworks y Together fueron los primeros que revisamos.
  • Debido a la competencia, el precio de GLM 5.2 bajó alrededor de 45% en aproximadamente 1.5 meses desde su lanzamiento el 16 de junio, y todavía hay nuevos proveedores compitiendo en precio: https://openrouter.ai/z-ai/glm-5.2#providers
    En términos económicos, el precio no tiene por qué estar por encima del costo total, sino por encima del costo marginal; para un centro de datos con baja utilización de GPU, eso equivale aproximadamente al costo de electricidad. Sospecho que, por el exceso de capacidad en centros de datos pequeños y la competencia, pronto podría haber quienes vendan tokens por debajo de la suma de electricidad y depreciación de GPU.

    • También podría ser un modelo en el que venden tokens baratos y luego revenden los datos de tokens de los usuarios en otro lado.
    • La cifra de caída del 45% es sospechosa. Los proveedores baratos de OpenRouter usan FP4, a diferencia del FP8 oficial de Z.ai. También hay proveedores FP8 baratos como Novita, pero en la UI parece un descuento temporal y el precio normal es casi igual al de Z.ai oficial.
    • SemiAnalysis estima que el costo de un modelo de unos 2 billones de parámetros es de menos de 1 dólar por millón de tokens. Depende del throughput y la cuantización, pero si el costo de los grandes proveedores es lo suficientemente bajo, incluso el precio mínimo actual de GLM 5.2, 2.42 dólares, podría dejar una gran ganancia.
  • Al preguntarle “Tell me about yourself” en Hugging Face, fue interesante que Kimi K3 respondió que era Claude, creado por Anthropic.

    • A la misma pregunta, respondió correctamente que era “Kimi, desarrollado por Moonshot AI”.
    • Ese tipo de respuestas no significa mucho. Si se le hace la misma pregunta en chino a Opus, a veces responde que es DeepSeek, porque los datos de entrenamiento están mezclados y el modelo alucina.
    • No es sorprendente. La destilación de conocimiento es común y todos los laboratorios la usan, de forma intencional o no. Desde ChatGPT, los corpus de entrenamiento siempre incluyen contenido generado por IA.
  • Recomiendo descargar los modelos de frontera para preservación. Aunque ocupen 1.5 TB, guardarlos en un disco barato y seedearlos por torrent es aún más útil.
    Así como en el pasado se intentó controlar los algoritmos criptográficos, los modelos también podrían quedar bloqueados por regulación; el software abierto necesita distribuirse ampliamente para sobrevivir. Con el tiempo, gracias a enormes inversiones en técnicas y fabricación de hardware, será factible ejecutarlos en la práctica, y sería lamentable que para entonces su distribución sea ilegal y haya que pagar el costo de la captura regulatoria.

    • El archivo torrent está en https://terminalbytes.com/kimi-k3-torrent/Kimi-K3.torrent
      La dirección magnet es magnet:?xt=urn:btih:1e63a865fbf9b58decc8b71091db54d673c5da6f&dn=Kimi-K3&tr=udp%3A%2F%2Ftracker.opentrackr.org%3A1337%2Fannounce&tr=udp%3A%2F%2Ftracker.openbittorrent.com%3A6969%2Fannounce&tr=udp%3A%2F%2Fopen.stealth.si%3A80%2Fannounce&tr=udp%3A%2F%2Fexplodie.org%3A6969%2Fannounce&tr=udp%3A%2F%2Ftracker.torrent.eu.org%3A451%2Fannounce&tr=udp%3A%2F%2Fexodus.desync.com%3A6969%2Fannounce.
    • Las autoridades terminarán restringiendo primero la compra de hardware para ejecutar estos modelos.
    • Ya ni siquiera hay discos baratos, y no quiero gastar cientos de dólares por una preocupación regulatoria vaga.
  • Tras revisar la licencia y probarlo en hardware real, parece difícil que los proveedores puedan ofrecerlo 60–70% más barato que el precio de Moonshot. Quizá puedan bajarlo un poco, pero salvo que sacrifiquen mucho la velocidad de procesamiento, descuentos al nivel de GLM parecen difíciles.
    Estimo que el margen de Kimi es de alrededor de 40–50% incluso suponiendo que consiga GPU a precios altos de alquiler, y podría ser mayor si usa equipo propio. Pero no llega al margen de más del 90% que algunos atribuyen a Anthropic, e incluso el 80% de margen de la API de Anthropic me parece dudoso.
    Si el único costo fuera la electricidad, 80–90% sería posible, pero viendo los tokens por segundo que se ofrecen actualmente, no parece fácil. Solo lo probé en B200 y no pude conseguir B300; además, ya es un modelo cuantizado y no usa contexto de 1 millón de tokens, así que tampoco parece haber mucho margen inmediato para optimización de memoria. Sería bueno que alguien con acceso a R100 verificara los costos.
    Como los grandes proveedores tienen que contratar con Kimi, mientras Kimi sea el modelo abierto de primer nivel, no conviene esperar descuentos fuertes.

  • El enlace original devuelve 404, y me pregunto si fue bloqueado o autocensurado.

    • Hasta hace unos minutos había una página con cuenta regresiva para la publicación de los pesos, faltaban 19 minutos para que terminara, y de pronto apareció el 404.
    • Lo más probable es que sea un problema técnico durante la transición. Aunque casi nadie pueda ejecutarlo, también es interesante pensar qué pasaría con Hugging Face si muchísimos usuarios descargan un modelo de varios TB.
      Parece que habrá demanda para archivarlo ante la posibilidad de que desaparezca de repente por controles gubernamentales. China también empezó a discutir recientemente controles a la exportación de modelos, y la situación cambia ahora que empieza a lanzar modelos de vanguardia, no modelos rezagados.
    • Puede sonar a teoría conspirativa, pero sería una buena oportunidad para que EE. UU. o China muestren su influencia, y parece más probable que sea EE. UU.