2 puntos por GN⁺ 2 시간 전 | 1 comentarios | Compartir por WhatsApp
  • Un modelo de producción que amplía Kimi Linear, presentado el año pasado, de 48B a 2.8T; actualmente es el modelo de mayor escala entre los de pesos abiertos
  • El nuevo LatentMoE comprime grandes capas lineales mediante down projection, y la arquitectura general reemplaza el MoE convencional y la atención por componentes centrados en la eficiencia de inferencia
  • Los residuales de atención (attention residuals) conectan residuales entre capas con pesos basados en puntajes de atención, mejorando de forma pequeña pero consistente la pérdida de validación y el rendimiento downstream
  • Con los residuales de atención, el costo de entrenamiento aumenta alrededor de 4% y el de inferencia cerca de 2%; además, se eliminan todas las capas RoPE y se aplica NoPE en toda la arquitectura
  • También se añade soporte multimodal nativo, buscando a la vez la gran expansión de Kimi Linear y mejoras en eficiencia de inferencia y rutas residuales

Escalado desde Kimi Linear hasta 2.8T

  • Kimi K3 es la versión de producción que escala Kimi Linear de 48B a 2.8T, y es actualmente el modelo de mayor tamaño entre los de pesos abiertos
  • El LatentMoE añadido frente a Kimi Linear es esencialmente el mismo enfoque que Nemotron 3 Ultra
  • Como en la tendencia vista en Nemotron 3 y DeepSeek V4, el foco está en mejorar la eficiencia de inferencia
    • Reemplaza el MoE convencional por LatentMoE
    • Usa atención latente multi-head y Kimi Delta Attention en lugar de atención convencional

Rutas residuales e información posicional

  • Los residuales de atención son un componente para mejorar la ruta residual, no para optimización de eficiencia, y ya se habían aplicado en Kimi Linear
    • A diferencia de mHC (manifold-constrained Hyper-Connections) de DeepSeek V4, que amplía la ruta residual, los residuales de atención conectan los residuales entre capas
    • Usan como pesos de conexión los puntajes de atención que representan la importancia o contribución de cada residual
    • Según el informe técnico, mejoran de forma pequeña pero consistente la pérdida de validación y el rendimiento downstream, pero aumentan el costo de entrenamiento cerca de 4% y el de inferencia cerca de 2%
  • Se eliminan todas las capas RoPE y se aplica NoPE, es decir, sin embeddings posicionales, en todas las capas
    • En otras arquitecturas recientes había una tendencia a usar RoPE en atenciones locales como sliding window attention y NoPE en capas globales
    • Ya existían arquitecturas que usaban solo NoPE, pero dentro de lo confirmado Kimi K3 es el primer modelo frontier que lo aplica de forma total

Soporte multimodal nativo

  • Kimi K3 también añade soporte multimodal nativo

1 comentarios

 
GN⁺ 2 시간 전
Opiniones en Hacker News
  • A diferencia de los directores de laboratorios occidentales que presentan a Kimi como un simple producto de un ataque de destilación, en realidad está introduciendo enfoques nuevos y originales.

  • Sebastian Raschka es un excelente investigador y autor de modelos de lenguaje a gran escala, y recomiendo mucho su Substack.

    • No lo conocía antes, pero me impresionó que escriba yendo directo al punto y, aun así, de forma fácil de entender.
    • En un campo lleno de resúmenes generados por IA hechos a la ligera, me pareció una joya poco común, así que lo agregué a mi feed RSS.
  • “Curiosamente, Kimi K3 elimina todas las capas RoPE y, en su lugar, usa NoPE (No Positional Embeddings) en todas partes”.
    El solo hecho de que esto funcione es sorprendente. Si no hay información posicional, ¿no se convierte todo en una sopa de tokens? Me pregunto si la atención es lo suficientemente precisa como para que, solo aprendiendo que el segundo token acumula algo en el espacio de embeddings, pueda inferir que es el segundo.

    • Mediante el enmascaramiento causal, el modelo puede aprender embeddings posicionales implícitos. La idea común de que los bloques Transformer son invariantes a permutaciones en realidad no es cierta.
    • En un Transformer causal solo con decodificador, los embeddings posicionales no son estrictamente necesarios, pero en modelos no causales, como el encoder del artículo original de Transformer, sí lo son claramente.
      La intuición de la acumulación también es adecuada. Si algunas cabezas de atención siguen escribiendo valores en la misma zona del flujo residual, a medida que aumentan los tokens de entrada esos valores se acumulan mediante la suma de la atención y pueden funcionar como una especie de índice sin codificación posicional separada.
    • Las capas lineales usan decaimiento, como un filtro FIR, para proporcionar de forma natural una posición relativa. Entonces las capas de atención completa pueden concentrarse en conectar conceptos entre sí sin importar la distancia.
    • En este tipo de modelos híbridos de atención, al menos las capas de modelos de espacio de estados (SSM) deberían incorporar embeddings posicionales relativos mediante su estructura recurrente.
  • Es interesante que use NoPE en todas partes. Otros modelos suelen conservar RoPE en las capas locales, pero aquí parece que capas de atención lineal como Kimi Delta se encargaron discretamente del manejo posicional, lo que permitió omitirlo. Me pregunto si esto se mantendrá también a escala de frontera.

    • A pesar del nombre, Kimi Delta Attention (KDA) no es atención en el sentido habitual, sino algo más cercano a una RNN que puede paralelizarse eficientemente durante el entrenamiento. Es una estructura ligeramente modificada de Gated DeltaNet, una RNN con un estado oculto que actúa como una pequeña memoria de atención editable.
      Como se parece a una RNN, reconoce de forma inherente el orden de X, Y y Z en XYZ. Un Transformer básico procesa un conjunto sin orden, por lo que hay que indicarle por separado la posición entre los elementos.
      Como hay 3 capas KDA por cada capa de atención, y además 3 antes de la primera capa de atención, todos los tokens pueden aprender su información posicional antes de llegar a la primera capa de atención real.
      RoPE degrada parte de la información, así que si se puede omitir de esta forma, es una ventaja. Gemma-4 también tiene una estructura similar de 5:1, con cinco capas de sliding window attention (SWA) por cada capa de atención global. SWA es barata y de menor rendimiento, pero procesa información local y rellena los espacios entre capas globales potentes; en este modelo, KDA cumple el mismo rol.
      En Gemma, RoPE solo es necesario en SWA, que sí es atención real, y se omite en la atención global. Como KDA no es atención, no necesita embeddings posicionales.
      No sé cuánto más de frontera tendría que ser la escala, pero no hay razón para que no funcione también a mayor escala. Cuantos más parámetros haya, más fácil debería ser para las capas KDA transmitir información posicional.
    • Kimi K3 está, según los benchmarks, en un rango similar a Opus y Fable, así que me pregunto si una escala mayor que esta sería realmente de frontera. Todos están en el rango de 2 a 4 billones de parámetros, y esperaría que las principales diferencias estén en la calidad del entrenamiento y la arquitectura.
    • También hay un efecto secundario algo extraño. Los proveedores que probé no implementaron la caché KV guardando solo hasta el prompt de entrada más reciente, sino en bloques incrementales fijos de 1.024 tokens. Como resultado, en cada inferencia se agregan hasta 1.023 tokens de entrada con cache miss.