- Kimi K3 es un modelo agente multimodal nativo de pesos abiertos, con 2.8 billones de parámetros y un contexto de 1,048,576 tokens, que da soporte a sesiones largas de programación, tareas de conocimiento y razonamiento
- Combina Kimi Delta Attention(KDA), Attention Residuals y Stable LatentMoE para activar 16 de 896 expertos por cada token, con una eficiencia de escalado general aproximadamente 2.5 veces mayor que Kimi K2
- En evaluaciones públicas registró GPQA Diamond 93.5, Terminal-Bench 2.1 88.3, BrowseComp 91.2 y OmniDocBench 91.1, aunque deben considerarse también las diferencias de harness, configuración de inferencia y hardware entre modelos
- Fue entrenado con aprendizaje consciente de cuantización usando pesos MXFP4 y activaciones MXFP8, y puede ejecutarse con Transformers, vLLM, SGLang, Docker y APIs compatibles con OpenAI y Anthropic
- En conversaciones multi-turno y llamadas a herramientas, se debe reenviar tal cual el mensaje completo del assistant devuelto por la API, incluyendo
reasoning_contentytool_calls; el código y los pesos se publican bajo la Kimi K3 License
Estructura y escala del modelo
- Kimi K3 es un modelo agente multimodal nativo de pesos abiertos, diseñado para programación de larga duración, tareas de conocimiento y razonamiento
- Tiene 2.8T parámetros totales, 104B parámetros activos y está compuesto por 93 capas
- Usa 1 capa dense, 69 capas KDA y 24 capas Gated MLA
- La dimensión oculta de attention es 7,168 y tiene 96 attention heads
- Stable LatentMoE selecciona 16 de 896 expertos por token y usa 2 expertos compartidos
- La dimensión Latent MoE es 3,584, y la dimensión oculta MoE por experto es 3,072
- En comparación con Kimi K2, la eficiencia de escalado general mejora aproximadamente 2.5 veces
- El tamaño del vocabulario es 160K, la longitud de contexto es de 1,048,576 tokens y la función de activación es SiTU-GLU
- Usa MoonViT-V2, con 401M parámetros, como encoder de visión
- Entre sus capacidades principales se incluyen la comprensión de texto, imágenes y video, aunque en el campo modality de la tabla resumen del modelo solo figuran Text e Image
Programación de larga duración y tareas de conocimiento
- Mantiene sesiones extensas de ingeniería con mínima supervisión humana, explora repositorios grandes y coordina herramientas de terminal
- Da soporte a la optimización de kernels de GPU y al desarrollo de compiladores
- También incluye como objetivos el desarrollo de videojuegos que usan visión, CAD y diseño de chips
- En tareas de conocimiento de tipo agente, genera visualizaciones interactivas, widgets y dashboards junto con investigación profunda
- El diseño de movimiento y la edición de video también entran en su alcance de soporte
- Como framework de agente de programación se recomienda Kimi Code CLI, y se puede seleccionar Kimi K3 desde la terminal con el comando
/model
Resultados de evaluación
- Todos los resultados de Kimi K3 se midieron con
reasoning_effort="max"y temperature 1.0- Para tareas de un solo paso, como GPQA Diamond, HLE-Full y evaluaciones de visión sin herramientas, se usó top-p 0.95
- Para tareas de agente se aplicó top-p 1.0
- En evaluaciones de razonamiento y conocimiento registró GPQA Diamond 93.5, CritPt 23.4 y AA-LCR 74.7
- HLE-Full fue 43.5 sin herramientas y 56.0 con uso de herramientas
- En evaluaciones de programación registró ProgramBench 77.8, Terminal-Bench 2.1 88.3 y FrontierSWE 81.2
- DeepSWE fue 67.5 en el harness Kimi Code y 67.3 en el harness mini-SWE-agent
- Registró SWE-Marathon 42.0, PostTrainBench 36.6, MLS-Bench-Lite 48.3, SciCode 58.7 y Kimi Code Bench 2.0 72.9
- En evaluaciones de agente registró BrowseComp 91.2, DeepSearchQA F1 95.0 y ResearchRubrics 76.2
- MCPMark-Verified 94.5, AutomationBench 30.8, SpreadsheetBench 2 34.8 y OSWorld-Verified 84.8
- También se midió Harvey Lab-AA 94.6, CorpFin v2 71.6, Finance Agent v2 54.4 y Legal Research Bench 44.2
- En evaluaciones de visión registró OmniDocBench 91.1, Video-MME 90.0 y MMVU 82.1
- MMMU-Pro fue 81.6 sin herramientas y 83.4 con herramientas
- MathVision sube de 94.3 a 97.8 al usar Python
- ZeroBench pass@5 sube de 23.0 a 41.0 con uso de herramientas
Condiciones de evaluación y límites de comparación
- Entre los modelos comparados se incluyen Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8, GPT-5.5 y GLM-5.2, pero el harness de evaluación puede variar según el modelo
- Kimi K3 usa principalmente Kimi Code o Claude Code
- La familia GPT usa principalmente Codex, y otros modelos Claude y GLM usan Claude Code o Terminus 2, entre otros
- SWE-Marathon se evaluó en una rama que ajusta para H20 las tareas al 9 de julio de 2026, antes de la versión final v1.1
- Las imágenes Docker, los criterios de rendimiento de GPU y el oráculo de referencia se recalibraron para H20, pero no se cambiaron los verificadores de exactitud ni de prevención de trampas
- Claude Fable 5 tuvo fallback en el 35% de las tareas, lo que podría haber afectado negativamente el rendimiento medido
- PostTrainBench es el promedio de 3 ejecuciones con máximo esfuerzo de inferencia en GPU H20, en lugar de H100 del entorno oficial
- Kimi Code Bench 2.0 incluye tareas de ciberseguridad y seguridad
- Claude Fable 5 tuvo 13 fallbacks y 1 rechazo entre 80 tareas
- GPT-5.6 Sol rechazó 10 tareas y GPT-5.5 rechazó 3
- BrowseComp 91.2 es el resultado usando una estrategia de compresión de contexto que opera con 300K tokens
- Al usar la ventana completa de 1M tokens sin gestión de contexto adicional, registra 90.4
- Las evaluaciones multimodales usan el promedio de 3 ejecuciones, salvo ZeroBench
- ZeroBench se ejecuta 5 veces según la configuración oficial
- PerceptionBench es un benchmark propio que mide capacidades atómicas de percepción visual
Cuantización nativa
- Desde la etapa SFT se aplica aprendizaje consciente de cuantización
- Los pesos usan MXFP4 y las activaciones MXFP8, con el objetivo de ofrecer amplia compatibilidad de hardware
Distribución y formas de ejecución
- Se puede acceder a Kimi API seleccionando
kimi-k3, y ofrece APIs compatibles con OpenAI y Anthropic - En Hugging Face Transformers se puede cargar con
pipeline("image-text-to-text", ...)oAutoModel.from_pretrained(...)- Para usar código de modelo personalizado se requiere
trust_remote_code=True
- Para usar código de modelo personalizado se requiere
- El serving local admite vLLM y SGLang
- Ambos motores pueden manejar solicitudes de texto e imagen en el endpoint compatible con OpenAI
/v1/chat/completions
- Ambos motores pueden manejar solicitudes de texto e imagen en el endpoint compatible con OpenAI
- En Docker Model Runner se ejecuta con
docker model run hf.co/moonshotai/Kimi-K3 - El modelo también puede usarse en HuggingChat, Google Colab y Kaggle
Uso de la API conservando el estado de razonamiento
- Kimi K3 tiene el modo de pensamiento siempre activado y devuelve
reasoning_content - El campo de solicitud de nivel superior
reasoning_effortadmite"low","high"y"max"; el valor predeterminado es"max" - Las conversaciones multi-turno y las llamadas a herramientas deben ajustarse al método de historial de pensamiento preservado
- Se debe reenviar en
messagesel mensaje del assistant devuelto por la API, tal cual - Debe incluir no solo
content, sino tambiénreasoning_contentytool_calls
- Se debe reenviar en
- La entrada de visión, la salida estructurada, partial mode, la selección de herramientas, la carga dinámica de herramientas y el caché de contexto pueden consultarse en Kimi K3 Quickstart y Thinking Effort
Licencia
- Tanto el repositorio de código como los pesos del modelo se publican bajo la Kimi K3 License
2 comentarios
Ojalá aparezca algún proveedor local que lo ofrezca.
Opiniones de Hacker News
Cuando se fije el precio intermedio de terceros para un modelo de 3 billones de parámetros, se podrá estimar el costo real de servirlo y si el laboratorio subsidia los tokens de la API.
Al ser nativo en MXFP4, requiere alrededor de 1.5 TB de VRAM, lo que lo deja justo en el límite de 8×B200; si además se consideran la longitud de contexto y la optimización del throughput, en la práctica parecen necesarias 16 tarjetas.
En el benchmark AISI de ciberseguridad supera a GLM 5.2, pero hay una gran brecha frente a los modelos cerrados de punta, por lo que podría requerir fine-tuning. También me pregunto si Cursor lo volverá a entrenar para compararlo directamente con la familia Composer, que son versiones fine-tuned de Kimi 2.6/2.7, y con Grok 4.5.
También es prometedora la posibilidad de crear modelos más pequeños mediante destilación de conocimiento bien hecha, aprendiendo toda la distribución de probabilidades. En particular, DSV4-Kimi, con bajo costo de serving, parece prometedor.
Con un servidor 4U usado y 32 DIMM ECC de 64 GB se pueden armar 3 TB de RAM por menos de 30 mil dólares, una diferencia grande frente al precio de un equipo real con GPU. Todavía no hay pesos de precisión completa ni versiones cuantizadas Q8/Q8-XL de Unsloth, pero para usar además un contexto amplio parece que harían falta más de 1,536 GB: 2 TB, e idealmente 2.5 a 3 TB.
Q4 y Q6 probablemente sean el peor compromiso: lentos y poco confiables, mientras pierden conocimiento y precisión. Si uno va a correr en hardware de bajo presupuesto un modelo inteligente pero lento, creo que Q8 es necesario.
En https://github.com/woct0rdho/transformers5-qwen3.5-recipe hice una prueba de concepto: Qwen3.5-35B-A3B puede ajustarse con 16 GiB de VRAM, y DeepSeek-V4-Flash 284B-A13B con 90 GiB de VRAM, sin offloading a CPU. También funciona bien en sistemas de memoria unificada como Strix Halo.
Aun así, un modelo de la escala de Kimi-K3 necesita varias GPU y varios nodos, por lo que hay muchos más problemas que resolver que en el entrenamiento con una sola GPU.
Lo mucho más interesante que el precio en este lanzamiento es la personalización. Incluso una startup puede descargar los pesos, modificarlos y hacer fine-tuning; la verdadera ventaja está menos en el costo que en el rendimiento sobre sus propios datos y en la soberanía de la propiedad intelectual. Un gran logro del equipo de Kimi.
Siento que el hardware para que una persona ejecute LLM está configurado de una forma que no encaja con el uso. O sobrevives con memoria unificada a 5–10 tokens por segundo, o tienes que irte a tarjetas de datacenter que consumen cientos de GB de VRAM y más de 1 kW.
No existen GPU semiprofesionales con TDP de 180–250 W y 128 GB o 256 GB de VRAM; con solo dos tarjetas así y una interconexión común de nivel NVLink ya serían bastante útiles. Ejecutar Kimi K3 localmente requeriría un homelab enorme y mucho dinero, pero sería bueno poder correr GLM 5.2 a unos 100 tokens por segundo en una sola sesión, o unos 60 tokens por segundo al usar varios subagentes.
Las mediciones estimadas ejecutando el
llama-servermás reciente con--no-mmapson: DeepSeek-V4-Flash Q4_K_XL 178,175 MiB, Q8_K_XL 184,636 MiB, Laguna-S-2.1 Q8_K_X 172,860 MiB y Qwen3.5-122B-A10B Q8_K_XL 170,038 MiB.Esto contrasta con el trabajo de escritorio, que también es intermitente, pero donde la potencia de cómputo necesaria se volvió lo bastante barata como para que podamos tener sobre el escritorio una máquina exagerada para los momentos de inactividad.
gpt-oss, hacen difícil ejecutar modelos abiertos mientras hablan de democratización, lo que parece especialmente injusto.Si pudiera comprar una GPU de varios miles de dólares, lo haría como tecnófilo con dinero, pero habría que reconocer que es un lujo extremadamente ineficiente, como un auto deportivo. La verdadera desgracia es que no tenemos ni la tecnología computacional ni las instituciones políticas y sociales para operar hardware compartido de manera confiable.
Según la licencia, si el titular de la licencia o sus afiliadas operan un negocio de modelos como servicio y sus ingresos acumulados durante 12 meses consecutivos superan los 20 millones de dólares, deben firmar un contrato aparte con Moonshot AI antes de usar comercialmente el software o sus derivados.
Está disponible en https://app.fireworks.ai/models/fireworks/kimi-k3, con un precio de 3 dólares por millón de tokens de entrada sin caché, 0.30 dólares por entrada en caché y 15 dólares por salida.
Actualmente tiene una latencia mucho menor que Moonshot, aunque también mucho menos uso, así que habrá que ver si se mantiene. Aun así, el despliegue el mismo día es impresionante.
Debido a la competencia, el precio de GLM 5.2 bajó alrededor de 45% en aproximadamente 1.5 meses desde su lanzamiento el 16 de junio, y todavía hay nuevos proveedores compitiendo en precio: https://openrouter.ai/z-ai/glm-5.2#providers
En términos económicos, el precio no tiene por qué estar por encima del costo total, sino por encima del costo marginal; para un centro de datos con baja utilización de GPU, eso equivale aproximadamente al costo de electricidad. Sospecho que, por el exceso de capacidad en centros de datos pequeños y la competencia, pronto podría haber quienes vendan tokens por debajo de la suma de electricidad y depreciación de GPU.
Al preguntarle “Tell me about yourself” en Hugging Face, fue interesante que Kimi K3 respondió que era Claude, creado por Anthropic.
Recomiendo descargar los modelos de frontera para preservación. Aunque ocupen 1.5 TB, guardarlos en un disco barato y seedearlos por torrent es aún más útil.
Así como en el pasado se intentó controlar los algoritmos criptográficos, los modelos también podrían quedar bloqueados por regulación; el software abierto necesita distribuirse ampliamente para sobrevivir. Con el tiempo, gracias a enormes inversiones en técnicas y fabricación de hardware, será factible ejecutarlos en la práctica, y sería lamentable que para entonces su distribución sea ilegal y haya que pagar el costo de la captura regulatoria.
La dirección magnet es
magnet:?xt=urn:btih:1e63a865fbf9b58decc8b71091db54d673c5da6f&dn=Kimi-K3&tr=udp%3A%2F%2Ftracker.opentrackr.org%3A1337%2Fannounce&tr=udp%3A%2F%2Ftracker.openbittorrent.com%3A6969%2Fannounce&tr=udp%3A%2F%2Fopen.stealth.si%3A80%2Fannounce&tr=udp%3A%2F%2Fexplodie.org%3A6969%2Fannounce&tr=udp%3A%2F%2Ftracker.torrent.eu.org%3A451%2Fannounce&tr=udp%3A%2F%2Fexodus.desync.com%3A6969%2Fannounce.Tras revisar la licencia y probarlo en hardware real, parece difícil que los proveedores puedan ofrecerlo 60–70% más barato que el precio de Moonshot. Quizá puedan bajarlo un poco, pero salvo que sacrifiquen mucho la velocidad de procesamiento, descuentos al nivel de GLM parecen difíciles.
Estimo que el margen de Kimi es de alrededor de 40–50% incluso suponiendo que consiga GPU a precios altos de alquiler, y podría ser mayor si usa equipo propio. Pero no llega al margen de más del 90% que algunos atribuyen a Anthropic, e incluso el 80% de margen de la API de Anthropic me parece dudoso.
Si el único costo fuera la electricidad, 80–90% sería posible, pero viendo los tokens por segundo que se ofrecen actualmente, no parece fácil. Solo lo probé en B200 y no pude conseguir B300; además, ya es un modelo cuantizado y no usa contexto de 1 millón de tokens, así que tampoco parece haber mucho margen inmediato para optimización de memoria. Sería bueno que alguien con acceso a R100 verificara los costos.
Como los grandes proveedores tienen que contratar con Kimi, mientras Kimi sea el modelo abierto de primer nivel, no conviene esperar descuentos fuertes.
El enlace original devuelve 404, y me pregunto si fue bloqueado o autocensurado.
Parece que habrá demanda para archivarlo ante la posibilidad de que desaparezca de repente por controles gubernamentales. China también empezó a discutir recientemente controles a la exportación de modelos, y la situación cambia ahora que empieza a lanzar modelos de vanguardia, no modelos rezagados.