- La demanda de Kimi K3 creció mucho más de lo esperado y, en las últimas 48 horas, el uso de GPU se ha acercado al límite actual de capacidad
- Para proteger la experiencia de los suscriptores actuales, se suspenden temporalmente las nuevas suscripciones y se priorizan los recursos de cómputo para los miembros actuales
- Los suscriptores de pago existentes no se verán afectados, y Moonshot AI está acelerando la ampliación de capacidad de infraestructura
- En cuanto se asegure capacidad adicional, las nuevas suscripciones se reanudarán por lotes
- Además, planean dividir la membresía en dos planes dedicados según el propósito de uso
- Kimi Membership: para Kimi Web, App y Work
- Kimi Code Membership: para flujos de trabajo de programación
- Es una medida para asignar con mayor precisión los recursos de cómputo según la demanda de cada servicio y mantener una experiencia de uso estable
1 comentarios
Opiniones de Hacker News
Se ve muy bien la frase de que, como en las últimas 48 horas la demanda se acercó al límite de la capacidad actual, suspendieron temporalmente las nuevas suscripciones para proteger la experiencia de los suscriptores existentes y asignaron primero los recursos de cómputo a los miembros actuales.
Es una empresa que prioriza la satisfacción de los clientes actuales por encima del crecimiento rápido
Ayer agoté mi uso de Claude y pagué el plan de 20 dólares para probar Kimi. Elegí K3 en Kimi Code y le pedí que revisara toda la configuración de entradas relacionada con hardware, entrada/salida, control de hilos y red dentro del repositorio, y que redactara un informe; después de pensar 12 minutos, respondió que ya había agotado toda la cuota diaria.
Al día siguiente Fable hizo la misma tarea en 3 minutos, así que si vas a usar K3 es mejor no comprar el plan de 20 dólares
En la interfaz web también consumió un 23% del uso semanal, y con Cursor de 20 dólares al mes nunca he recibido ni una advertencia aunque haga mucho más trabajo. Al principio pensé que era problema de OpenCode, pero si en Kimi Code pasa igual, parece que no
Lo más interesante de Kimi es que tiene 3 veces más capas de atención RNN·lineal que capas de atención completas. Aún no lo he probado, pero parece una estructura muy razonable para tareas de contexto largo.
La razón de tener tantos parámetros parece ser la misma por la que xLSTM optimizado para cómputo tiene tantos parámetros, y viendo el éxito de este modelo da pena que en Europa no se haya desarrollado una familia xLSTM gigante. Como es un equipo práctico que elige lo que funciona bien en evaluaciones internas, también mantuvieron capas de atención normales, y no se puede garantizar que la implementación sea ideal, pero Kimi muestra lo que habría sido posible si se hubiera puesto una supercomputadora para entrenar LLM a gran escala en manos de investigadores adecuados. Al final, la mayor parte sigue siendo RNN, que es el campo de Hochreiter
Llevo unos 6 meses usando Kimi para tareas de programación y estoy satisfecho, así que no he sentido necesidad de volver a otros modelos. Solo de vez en cuando pruebo la misma tarea con Claude para ver si me estoy perdiendo de algo.
Uso OpenRouter y, como mi uso de LLM es limitado, la diferencia de costo es despreciable en cualquiera de los dos lados
Es refrescante que hayan detenido nuevas suscripciones en vez de bajar silenciosamente los límites esperando, como Google, que los usuarios no noten que el valor de su suscripción se redujo.
Gemini Apps especifica que puede cambiar los límites sin aviso para mantener la calidad ante restricciones de capacidad o aumentos repentinos de actividad: https://support.google.com/gemini/answer/16275805
En evaluaciones de programación de juegos con múltiples agentes, los modelos chinos suelen ser débiles en razonamiento de una sola pasada, pero compensan eso con uso de herramientas y mejora iterativa. Kimi K3 también quedó en el lugar 19 en coding de una sola pasada, pero en coding con agentes, donde se le da un entorno de ejecución y herramientas y se le invoca varias veces, quedó en 3.º, y solo Sol y Fable quedaron arriba en promedio por envío.
Para los ingenieros de software, el coding con agentes es lo más relevante, pero la velocidad también importa, y ahora mismo en Kimi eso se vuelve un problema real de usabilidad. Proveedores externos de inferencia como Fireworks ya habían reducido antes esa brecha con modelos anteriores. La tendencia de que los modelos open-weight de frontera se vuelvan el estándar es interesante, y cada vez será más difícil competir solo por tener un modelo de frontera
Datos: https://gertlabs.com/rankings?mode=agentic_coding
La calidad de este modelo está por encima de lo esperado y en especial hace muy bien code review y revisión de PR. Pero ahora mismo es demasiado lento por la demanda excesiva y el gran tamaño del modelo, así que incluso una revisión de código relativamente simple tarda muchísimo
Me pregunto si esta fiebre por Kimi es un aumento neto por la paradoja de Jevons, donde una oferta abundante provoca más consumo, o si simplemente es un cambio hacia un modelo más barato.
También me pregunto si hay buenos datos para ver el consumo total de tokens entre varios laboratorios y OpenRouter
Me pregunto si Anthropic y OpenAI seguirán siendo competitivos solo por ser, por ahora, las únicas empresas capaces de soportar una demanda de este nivel. Si ya es costoso y encima los fallos hacen perder tiempo del personal, a los clientes empresariales no les va a gustar
Parece que suspendieron las suscripciones porque consideraron que tal vez no podían garantizar a los clientes una calidad mínima de servicio