1 puntos por GN⁺ 1 시간 전 | 1 comentarios | Compartir por WhatsApp
  • Kimi Linear es una arquitectura híbrida que organiza KDA y MLA en una proporción 3:1; bajo las mismas condiciones de entrenamiento, registró mejor rendimiento que MLA completo en contextos de corto y largo plazo y en evaluaciones de aprendizaje por refuerzo en general
  • El módulo central, Kimi Delta Attention (KDA), subdivide la compuerta de olvido por cabeza de Gated DeltaNet a nivel de canal, de modo que cada dimensión de característica de la memoria RNN finita tenga una tasa de olvido independiente
  • Con una matriz de transición especial Diagonal-Plus-Low-Rank (DPLR) y un algoritmo paralelo por chunks, redujo la cantidad de cómputo frente al DPLR general, y la eficiencia del operador mejoró alrededor de un 100%
  • Al entrenar un modelo de 3B parámetros activos y 48B parámetros totales con 1.4T tokens, logró 51.0 puntos en MMLU-Pro 4K, 84.3 puntos y una aceleración de 3.98 veces en RULER 128K; con 1M tokens, el tiempo por token de salida fue 6.3 veces más rápido que MLA
  • En generación de textos largos, puede reducir la caché KV hasta un 75% sin cambiar las interfaces de caché ni de scheduling del pipeline existente de atención completa; también se publicaron el kernel de KDA, la implementación en vLLM y los checkpoints del modelo

El cuello de botella que crea la atención completa en el razonamiento de largo plazo

  • Los LLM de tipo agente y el escalamiento en tiempo de prueba basado en aprendizaje por refuerzo deben procesar durante la inferencia trayectorias largas, interacciones de uso de herramientas y espacios complejos de toma de decisiones
  • La atención softmax estándar tiene una complejidad temporal que crece de forma cuadrática y una caché KV que aumenta proporcionalmente a la longitud del contexto, lo que limita el throughput, la ampliación del contexto y las interacciones en tiempo real
  • La atención lineal puede reducir la complejidad computacional, pero su capacidad expresiva es limitada y, aun en modelado de lenguaje con secuencias cortas, rindió peor que la atención softmax
  • Los mecanismos recientes de gating y decaimiento, junto con la regla delta (delta rule), redujeron la brecha de calidad en secuencias de longitud media, pero las estructuras puramente lineales tienen restricciones para modelar secuencias largas y hacer búsquedas dentro del contexto debido a su capacidad finita de estado
  • Las arquitecturas híbridas que combinan algunas capas de atención global con muchas capas lineales surgieron como un compromiso entre calidad y eficiencia, pero los modelos existentes tenían escala limitada o carecían de evaluaciones en benchmarks variados

De la atención lineal a Gated DeltaNet

  • La atención lineal básica acumula continuamente asociaciones clave-valor en un estado recurrente con forma de matriz y lo usa como pesos rápidos (fast weight), una memoria asociativa temporal
    • Al no existir un criterio para decidir qué recuerdos eliminar, el estado se acumula sin límite y aparecen interferencias en contextos largos
  • DeltaNet realiza descenso de gradiente online sobre una pérdida de reconstrucción para que el estado recupere valores a partir de claves
    • Usa la regla delta clásica, que corrige continuamente el estado existente
    • La actualización de rango 1 equivale a una transformación de Householder generalizada y puede paralelizarse por chunks
  • Gated DeltaNet (GDN) añade una compuerta de olvido escalar αt para atenuar asociaciones antiguas
    • La compuerta funciona como decaimiento de pesos sobre los pesos rápidos e implementa un mecanismo de olvido similar a una regularización L2 dependiente de los datos
    • Controla la vida útil de la memoria y reduce la interferencia, manteniendo la estructura paralelizable de DeltaNet
  • GDN puede interpretarse como una codificación posicional multiplicativa que relaja la restricción de ortogonalidad de RoPE, en el sentido de que su matriz de transición depende de los datos y es aprendible

Control fino de memoria en Kimi Delta Attention

  • KDA reemplaza el decaimiento escalar único de GDN por una compuerta diagonalizada por canal, para controlar de manera independiente el decaimiento de memoria y la información posicional de cada dimensión de característica
  • La tasa de olvido por canal ajusta con más precisión la memoria RNN finita y limitada, y ofrece una granularidad similar a Gated Linear Attention (GLA)
  • La dinámica de transición se parametriza con una matriz DPLR especial y mantiene la consistencia con la regla delta clásica
  • Una serie de transformaciones matriciales de rango 1 se comprime en una representación densa, lo que permite procesamiento paralelo estable por chunks incluso bajo gating diagonal

Algoritmo paralelo por chunks

  • Divide la secuencia en chunks de longitud fija y usa como estado inicial de cada chunk el último estado del chunk anterior
  • Con la representación WY, agrupa varias actualizaciones de rango 1 en una sola representación comprimida y, siguiendo el desarrollo de Comba, evita requerir inversiones matriciales adicionales en los cálculos posteriores
  • La transformación UT reduce los FLOP de operaciones que no son multiplicaciones de matrices, elevando la utilización de hardware durante el entrenamiento
    • La inversa de una matriz triangular inferior se calcula fila por fila mediante sustitución hacia adelante de la eliminación gaussiana
  • La actualización de estado se realiza en forma matricial por chunk, y en la etapa de salida combina procesamiento recurrente entre chunks con procesamiento paralelo dentro de cada chunk
  • Al estructurar el cálculo interno del chunk alrededor de multiplicaciones de matrices, aprovecha el throughput de Tensor Core

Menor cantidad de operaciones que DPLR general

  • Tanto KDA como DPLR generalizado admiten decaimiento fino, por lo que se corresponden en términos de capacidad expresiva
  • El decaimiento fino puede causar problemas de precisión numérica en las divisiones dentro del chunk
    • GLA usa cálculos en dominio logarítmico y chunking secundario de precisión completa, pero esto limita el uso de multiplicaciones de matrices en media precisión y reduce la velocidad del operador
  • KDA vincula ambas variables de la transición DPLR a la clave k
    • Reduce de 4 a 2 los cálculos de matrices de chunks secundarios
    • Elimina 3 multiplicaciones de matrices adicionales
  • En mediciones del kernel por longitud de entrada, la eficiencia del operador de KDA mejora alrededor de un 100% frente a DPLR general

Configuración del modelo Kimi Linear

  • El backbone del modelo sigue a Moonlight y coloca una capa de mezcla de canales MoE después de la capa de mezcla de tokens
  • Las consultas, claves y valores de cada cabeza KDA se calculan pasando por ShortConv y Swish
    • A las consultas y claves se les añade normalización L2 para estabilidad de los autovalores
    • La dimensión de cabeza de claves y valores se fija en 128 en todos los experimentos
  • La compuerta de decaimiento por canal se parametriza con una proyección de bajo rango del mismo rango que la dimensión de cabeza, y usa una función de decaimiento similar a GDN y Mamba
  • Antes de la proyección de salida, se aplica RMSNorm por cabeza y una compuerta de salida dependiente de los datos
    • La compuerta de salida también se configura en bajo rango para mantener un rendimiento similar al de una compuerta de rango completo y permitir una comparación justa de parámetros
    • Esta compuerta mitiga Attention Sink

Híbrido 3:1 de KDA y MLA

  • Para compensar el límite de la atención puramente lineal en la recuperación de contextos largos, se insertan capas Full MLA de atención global completa entre capas KDA
  • En lugar de mezclar cabezas dentro de una misma capa, se alternan capas completas
    • La configuración por capas simplifica la infraestructura y mejora la estabilidad del entrenamiento
  • En los experimentos, la proporción 3:1, que repite 3 capas KDA seguidas de 1 capa MLA, ofreció el mejor equilibrio entre calidad y throughput
  • En generación de textos largos, solo las capas de atención completa mantienen la caché KV, por lo que se reducen el uso de memoria y de caché KV hasta un 75% mientras se preserva el flujo de información global

Uso de NoPE y resultados de evaluación

  • En todas las capas MLA se aplica NoPE, sin codificación posicional; KDA se encarga de la información posicional y del sesgo de recencia
  • KDA cumple un rol similar o incluso más fuerte que componentes auxiliares conscientes de la posición, como convoluciones cortas o atención de ventana deslizante
  • Con NoPE, MLA puede transformarse durante la inferencia en Multi-Query Attention (MQA) pura y eficiente
  • Al no requerir ajustes basados en frecuencias de RoPE ni técnicas como YaRN, se simplifica el entrenamiento de contextos largos
  • En una comparación entrenada de la misma manera con 1.4T tokens, Kimi Linear registró los siguientes resultados
    • 51.0 puntos en MMLU-Pro 4K, superando los 47.2 puntos de MLA y los 47.9 de GDN-H
    • 84.3 puntos y una aceleración de 3.98 veces en RULER 128K, por encima de los 81.3 puntos de MLA y los 80.5 de GDN-H
    • Con 1M tokens, el tiempo por token de salida (TPOT) fue de 1.84 ms, 6.3 veces más rápido que los 11.48 ms de MLA
    • Mantiene un TPOT bajo incluso en secuencias largas, lo que permite usar batches más grandes
  • El modelo preentrenado tiene 3B parámetros activos y 48B parámetros totales, y supera consistentemente a MLA completo en tareas de contexto corto, contexto largo y postentrenamiento estilo aprendizaje por refuerzo
  • Se publicaron el kernel de KDA, la integración con vLLM y el checkpoint Kimi-Linear-48B-A3B-Instruct
    • Puede reemplazarse sin modificar las interfaces de caché ni de scheduling del pipeline existente de atención completa

1 comentarios

 
GN⁺ 1 시간 전
Opiniones de Hacker News
  • Al ver el paper de Kimi K3 publicado recientemente, parece una arquitectura que escala a gran tamaño el Kimi Linear tratado aquí y agrega visión nativa, mejoras de aprendizaje por refuerzo, etc.
    https://arxiv.org/abs/2607.24653

  • Me pregunto si la inteligencia que se ve en los modelos de punta es realmente un fenómeno emergente que solo aparece al escalar la arquitectura.
    Que un modelo de 1 millón de parámetros con la misma estructura no pueda resolver ni acertijos básicos, mientras que uno de 1 billón de parámetros llegue a crear un contraejemplo para la conjetura jacobiana, parece ir contra la intuición. Darle más cómputo a un algoritmo de ordenamiento simple no hará que supere a quicksort, pero la investigación moderna en LLM parece una carrera por seguir agrandando el mismo algoritmo y la misma estructura esperando que aparezca la respuesta.

    • Esto es un fenómeno muy conocido en machine learning como la lección amarga (The Bitter Lesson). Hay que aprender el poder de los métodos generales que siguen escalando incluso cuando aumenta mucho el cómputo, y esos métodos son la búsqueda y el aprendizaje.
      Vale la pena leer también el texto original, que es breve: http://www.incompleteideas.net/IncIdeas/BitterLesson.html
    • Hoy ya dejé este campo y mi especialidad está más cerca del aprendizaje por refuerzo que de los LLM, pero al final creo que el significado y la inteligencia están contenidos en las representaciones internas. Un modelo pequeño puede no tener la capacidad suficiente para aprender desde cero el mapeo interno que conecta la entrada con el significado y la salida, o puede requerir un tiempo impracticable aunque en teoría sea posible, como con un ordenamiento simple.
      A los modelos grandes les resulta más fácil establecer puntos de apoyo en ese espacio de representación interna y, después de la optimización, puede que la mayoría de los pesos no hagan gran cosa. Todavía no está claro cuánta expresividad se necesita para aprender este espacio, pero hasta ahora parece que hacen falta miles de millones de parámetros.
      La pregunta más interesante es qué tan invariante a los datos debe ser el modelo. Creo que el razonamiento matemático y la programación elevaron mucho el rendimiento general porque son habilidades repetibles en una amplia gama de tareas. Entrenar de forma intensiva la lógica de programación independiente del lenguaje o de la tarea podría ser el camino hacia modelos más pequeños.
    • Aumentar la escala del modelo es una de las formas más consistentes y confiables de elevar la inteligencia. El entrenamiento de IA es un proceso en el que un algoritmo busca y refina computacionalmente otros algoritmos; al escalar, aumentan los recursos para explorar algoritmos mejores y más adecuados al objetivo.
      Como analogía, un modelo pequeño queda internamente limitado al nivel de bubble sort por restricciones de capacidad y señal de entrenamiento, mientras que un modelo grande puede explorar con más profundidad y encontrar un enfoque más cercano a quicksort.
      La inteligencia no es dicotómica; tanto un modelo de 1.000 millones de parámetros como uno de 10 billones tienen cierto grado de inteligencia. El primero depende demasiado de regularidades estadísticas y por eso es fácil descartarlo, mientras que el segundo simplemente avanzó lo suficiente como para encontrar nuevos contraejemplos a conjeturas abiertas. Entre ambos no hay tanto un salto repentino como pequeñas mejoras que se acumulan hasta convertirse en una avalancha.
      Aunque logros concretos como la capacidad matemática parezcan dar saltos bruscos, por debajo se acumulan gradualmente capacidades generales como cometer menos errores y recuperarse de ellos. Cuando estas capacidades se vuelven lo bastante buenas, empiezan a resolverse también tipos de problemas lógicos completamente nuevos.
    • Desde la perspectiva de la teoría del deep learning, la inteligencia proviene principalmente de la escalabilidad, y cuando una combinación bien diseñada de modelo y optimizador tiene un fuerte sesgo implícito hacia la simplicidad, el rendimiento puede seguir mejorando con el tamaño del modelo.
      El laboratorio de Marcus Hutter expresó esto mediante la inducción de Solomonoff y mostró que este sesgo es universalmente efectivo. Un sesgo efectivo aprovecha la maldición de la dimensionalidad a la inversa y puede seguir elevando el rendimiento en modelos grandes, de forma parecida a cómo con más datos se obtienen mejores respuestas.
      Sin embargo, la clase de modelos que exhibe estas propiedades es extremadamente estrecha, y se parece más a haber llegado con suerte a ese punto. Por eso los principios estadísticos generales siguen enseñando que, en general, no hay que esperar este comportamiento.
    • Las cosas que los humanos clasifican como problemas básicos y problemas muy difíciles pueden estar muy cerca entre sí en una escala absoluta. La diferencia es principalmente la proporción de humanos que puede resolverlos, pero incluso el límite inferior de la capacidad humana es bastante alto. Para la mayoría de los humanos, pocos animales resuelven problemas básicos, aunque sí son capaces de conductas y aprendizajes complejos, y su escala neuronal tampoco es absurdamente distinta de la humana.
      Pasar de 1 millón a 1 billón de parámetros es una expansión de un millón de veces. Es parecido a reducir el cerebro humano al 1% de su tamaño en cada dirección, es decir, a unos pocos milímetros.
  • Empecé a construir un modelo interno con Kimi Linear, pero el Gated Deltanet 2 que salió después parecía una evolución en términos de expresividad, y en nuestras propias pruebas efectivamente fue mejor.
    https://arxiv.org/abs/2605.22791

    • Al leerlo, se siente como si hubieran reimplementado LSTM.
  • Es excelente que hayan liberado como open source la implementación del kernel KDA y de vLLM para investigación, e incluso publicado checkpoints de modelos preentrenados y ajustados con instrucciones.

  • Si quieres creer que el éxito de Kimi se debe solo a un ataque de destilación, puedes ignorar esta investigación.

    • Ya sería bueno dejar de llamar a esto ataque de destilación.
    • Que un laboratorio chino esté haciendo innovaciones impresionantes y que quizá se haya beneficiado de la destilación son cosas compatibles. No sé cuánto contribuyó cada una, pero decir que solo una de las dos puede ser cierta es una falsa dicotomía.
    • Criticar la destilación suena como cuando un casino critica el conteo de cartas.
    • Quiero que Estados Unidos gane la carrera de la IA, pero me cuesta entender si la mayoría de los inventos actuales no son también destilación de conocimiento previo. Me pregunto si Anthropic sostiene que los datos que incorporó son secretos comerciales.
    • Un modelo de punta no se puede construir con un solo factor. Esto es solo una mejora incremental y no explica todo el éxito del modelo; independientemente de la postura sobre la destilación, el dataset de entrenamiento es enormemente importante.
  • Me pregunto cómo le va en recuperación en contextos largos frente a un modelo de atención completa del mismo tamaño, especialmente en needle-in-a-haystack o RULER. La mejora de eficiencia es excelente, pero los modelos híbridos de atención lineal suelen colapsar en esta parte.

  • Me pregunto si, cuando estos Transformers no estándar empiecen a usarse ampliamente, empresas como Etched tendrán problemas.

  • Este paper es material de 2025, ya pasaron 9 meses y en el intervalo se lanzaron nuevos modelos importantes.

    • Para K3 conviene leer este paper: https://arxiv.org/abs/2607.24653
      La contribución central del paper de K3 es Stable LatentMoE. Como algunos otros modelos, comprime los datos que se transmiten entre capas, por lo que el router requiere ciertas condiciones; K3 mejora el rendimiento con una estrategia de selección de expertos más equilibrada.
    • En su momento no se discutió lo suficiente: https://news.ycombinator.com/item?id=45766937
    • Parece que lo volvieron a subir porque el nuevo Kimi K3 incluye 69 capas KDA y 24 capas Gated MLA. Según tengo entendido, los modelos grandes anteriores de Kimi usaban solo capas MLA.