- Un modelo de producción que amplía Kimi Linear, presentado el año pasado, de 48B a 2.8T; actualmente es el modelo de mayor escala entre los de pesos abiertos
- El nuevo LatentMoE comprime grandes capas lineales mediante down projection, y la arquitectura general reemplaza el MoE convencional y la atención por componentes centrados en la eficiencia de inferencia
- Los residuales de atención (attention residuals) conectan residuales entre capas con pesos basados en puntajes de atención, mejorando de forma pequeña pero consistente la pérdida de validación y el rendimiento downstream
- Con los residuales de atención, el costo de entrenamiento aumenta alrededor de 4% y el de inferencia cerca de 2%; además, se eliminan todas las capas RoPE y se aplica NoPE en toda la arquitectura
- También se añade soporte multimodal nativo, buscando a la vez la gran expansión de Kimi Linear y mejoras en eficiencia de inferencia y rutas residuales
Escalado desde Kimi Linear hasta 2.8T
- Kimi K3 es la versión de producción que escala Kimi Linear de 48B a 2.8T, y es actualmente el modelo de mayor tamaño entre los de pesos abiertos
- El LatentMoE añadido frente a Kimi Linear es esencialmente el mismo enfoque que Nemotron 3 Ultra
- Al igual que la atención latente multi-head, comprime grandes capas lineales mediante down projection
- Como en la tendencia vista en Nemotron 3 y DeepSeek V4, el foco está en mejorar la eficiencia de inferencia
- Reemplaza el MoE convencional por LatentMoE
- Usa atención latente multi-head y Kimi Delta Attention en lugar de atención convencional
Rutas residuales e información posicional
- Los residuales de atención son un componente para mejorar la ruta residual, no para optimización de eficiencia, y ya se habían aplicado en Kimi Linear
- A diferencia de mHC (manifold-constrained Hyper-Connections) de DeepSeek V4, que amplía la ruta residual, los residuales de atención conectan los residuales entre capas
- Usan como pesos de conexión los puntajes de atención que representan la importancia o contribución de cada residual
- Según el informe técnico, mejoran de forma pequeña pero consistente la pérdida de validación y el rendimiento downstream, pero aumentan el costo de entrenamiento cerca de 4% y el de inferencia cerca de 2%
- Se eliminan todas las capas RoPE y se aplica NoPE, es decir, sin embeddings posicionales, en todas las capas
- En otras arquitecturas recientes había una tendencia a usar RoPE en atenciones locales como sliding window attention y NoPE en capas globales
- Ya existían arquitecturas que usaban solo NoPE, pero dentro de lo confirmado Kimi K3 es el primer modelo frontier que lo aplica de forma total
Soporte multimodal nativo
- Kimi K3 también añade soporte multimodal nativo
1 comentarios
Opiniones en Hacker News
A diferencia de los directores de laboratorios occidentales que presentan a Kimi como un simple producto de un ataque de destilación, en realidad está introduciendo enfoques nuevos y originales.
Sebastian Raschka es un excelente investigador y autor de modelos de lenguaje a gran escala, y recomiendo mucho su Substack.
“Curiosamente, Kimi K3 elimina todas las capas RoPE y, en su lugar, usa NoPE (No Positional Embeddings) en todas partes”.
El solo hecho de que esto funcione es sorprendente. Si no hay información posicional, ¿no se convierte todo en una sopa de tokens? Me pregunto si la atención es lo suficientemente precisa como para que, solo aprendiendo que el segundo token acumula algo en el espacio de embeddings, pueda inferir que es el segundo.
La intuición de la acumulación también es adecuada. Si algunas cabezas de atención siguen escribiendo valores en la misma zona del flujo residual, a medida que aumentan los tokens de entrada esos valores se acumulan mediante la suma de la atención y pueden funcionar como una especie de índice sin codificación posicional separada.
Es interesante que use NoPE en todas partes. Otros modelos suelen conservar RoPE en las capas locales, pero aquí parece que capas de atención lineal como Kimi Delta se encargaron discretamente del manejo posicional, lo que permitió omitirlo. Me pregunto si esto se mantendrá también a escala de frontera.
Como se parece a una RNN, reconoce de forma inherente el orden de X, Y y Z en XYZ. Un Transformer básico procesa un conjunto sin orden, por lo que hay que indicarle por separado la posición entre los elementos.
Como hay 3 capas KDA por cada capa de atención, y además 3 antes de la primera capa de atención, todos los tokens pueden aprender su información posicional antes de llegar a la primera capa de atención real.
RoPE degrada parte de la información, así que si se puede omitir de esta forma, es una ventaja. Gemma-4 también tiene una estructura similar de 5:1, con cinco capas de sliding window attention (SWA) por cada capa de atención global. SWA es barata y de menor rendimiento, pero procesa información local y rellena los espacios entre capas globales potentes; en este modelo, KDA cumple el mismo rol.
En Gemma, RoPE solo es necesario en SWA, que sí es atención real, y se omite en la atención global. Como KDA no es atención, no necesita embeddings posicionales.
No sé cuánto más de frontera tendría que ser la escala, pero no hay razón para que no funcione también a mayor escala. Cuantos más parámetros haya, más fácil debería ser para las capas KDA transmitir información posicional.