1 puntos por GN⁺ 19 시간 전 | 1 comentarios | Compartir por WhatsApp
  • La demanda de Kimi K3 creció mucho más de lo esperado y, en las últimas 48 horas, el uso de GPU se ha acercado al límite actual de capacidad
  • Para proteger la experiencia de los suscriptores actuales, se suspenden temporalmente las nuevas suscripciones y se priorizan los recursos de cómputo para los miembros actuales
  • Los suscriptores de pago existentes no se verán afectados, y Moonshot AI está acelerando la ampliación de capacidad de infraestructura
  • En cuanto se asegure capacidad adicional, las nuevas suscripciones se reanudarán por lotes
  • Además, planean dividir la membresía en dos planes dedicados según el propósito de uso
    • Kimi Membership: para Kimi Web, App y Work
    • Kimi Code Membership: para flujos de trabajo de programación
  • Es una medida para asignar con mayor precisión los recursos de cómputo según la demanda de cada servicio y mantener una experiencia de uso estable

1 comentarios

 
Opiniones de Hacker News
  • Se ve muy bien la frase de que, como en las últimas 48 horas la demanda se acercó al límite de la capacidad actual, suspendieron temporalmente las nuevas suscripciones para proteger la experiencia de los suscriptores existentes y asignaron primero los recursos de cómputo a los miembros actuales.
    Es una empresa que prioriza la satisfacción de los clientes actuales por encima del crecimiento rápido

    • Cuando GitHub hizo exactamente lo mismo antes, mucha gente se enojó, pero tanto entonces como ahora fue la decisión correcta
    • Siempre me ha molestado que en cualquier sitio web el botón de “Login” sea más pequeño que el de “Sign Up”
    • Entonces, ¿Hetzner también debería haber detenido los nuevos registros en vez de subir precios para regular la oferta y la demanda?
    • Tampoco hay que emocionarse demasiado. Como las firmas de capital de riesgo están metiendo muchísimo dinero en la IA, también podría ser que OpenAI o Anthropic estén financiando máquinas de quemar tokens para destilar datasets
  • Ayer agoté mi uso de Claude y pagué el plan de 20 dólares para probar Kimi. Elegí K3 en Kimi Code y le pedí que revisara toda la configuración de entradas relacionada con hardware, entrada/salida, control de hilos y red dentro del repositorio, y que redactara un informe; después de pensar 12 minutos, respondió que ya había agotado toda la cuota diaria.
    Al día siguiente Fable hizo la misma tarea en 3 minutos, así que si vas a usar K3 es mejor no comprar el plan de 20 dólares

    • Codex sigue razonando incluso cuando llega al límite y luego responde a la solicitud
    • Yo solo uso modelos completamente self-hosted, así que quizá sea un entorno distinto, pero me pregunto si en un flujo de trabajo real es común esperar 12 minutos sin ningún feedback. Yo voy observando la ruta que sigue el modelo y si veo que se va a un callejón sin salida, lo detengo o lo reoriento
    • A mí me pasó exactamente lo mismo. Pagué el plan anual de 20 dólares al mes de Kimi.com y envié una solicitud simple a Kimi K2.7 por API desde OpenCode, pero consumió toda la cuota de 5 horas, mientras que Cursor completó la misma solicitud en pocos minutos
      En la interfaz web también consumió un 23% del uso semanal, y con Cursor de 20 dólares al mes nunca he recibido ni una advertencia aunque haga mucho más trabajo. Al principio pensé que era problema de OpenCode, pero si en Kimi Code pasa igual, parece que no
    • Hace unos días, en Claude también sentí que perdí totalmente el tiempo porque una tarea relativamente simple consumió toda la cuota de 5 horas sin llegar a dar una respuesta
    • Me da curiosidad el tamaño de la aplicación objetivo. No es lo mismo si es una app de tareas en Node.js que usa archivos de texto como base de datos, o un código espagueti COBOL de un millón de líneas hecho en 1971
  • Lo más interesante de Kimi es que tiene 3 veces más capas de atención RNN·lineal que capas de atención completas. Aún no lo he probado, pero parece una estructura muy razonable para tareas de contexto largo.
    La razón de tener tantos parámetros parece ser la misma por la que xLSTM optimizado para cómputo tiene tantos parámetros, y viendo el éxito de este modelo da pena que en Europa no se haya desarrollado una familia xLSTM gigante. Como es un equipo práctico que elige lo que funciona bien en evaluaciones internas, también mantuvieron capas de atención normales, y no se puede garantizar que la implementación sea ideal, pero Kimi muestra lo que habría sido posible si se hubiera puesto una supercomputadora para entrenar LLM a gran escala en manos de investigadores adecuados. Al final, la mayor parte sigue siendo RNN, que es el campo de Hochreiter

    • ¿No era uno de los objetivos originales de la arquitectura Transformer eliminar las RNN que no se pueden paralelizar? No soy experto, solo leí algunos papers hace unos años
    • Hace como año y medio le dije a Hochreiter que no se quedara en experimentos de miles de millones de parámetros y que había que escalar xLSTM al tamaño de un LLM, pero parecía pensar que ya era demasiado tarde para conseguir inversión e interés. Qué lástima que hasta ahí llegue la ambición de Europa
    • Me preguntaba si era una RNN, un modelo de espacio de estados como Qwen o Mamba, o algo más cercano a RWKV; al revisarlo, parece similar a Linear DeltaNet que usa Qwen
  • Llevo unos 6 meses usando Kimi para tareas de programación y estoy satisfecho, así que no he sentido necesidad de volver a otros modelos. Solo de vez en cuando pruebo la misma tarea con Claude para ver si me estoy perdiendo de algo.
    Uso OpenRouter y, como mi uso de LLM es limitado, la diferencia de costo es despreciable en cualquiera de los dos lados

    • Me da curiosidad saber qué plan usas. En mi experiencia, tanto el plan de 20 dólares al mes de Kimi como el de 30 dólares al mes de Qwen estaban lejísimos de ser suficientes para usarlos como herramienta principal, pero por K3 sí me gustaría probar el plan de 49 o 99 dólares al mes
  • Es refrescante que hayan detenido nuevas suscripciones en vez de bajar silenciosamente los límites esperando, como Google, que los usuarios no noten que el valor de su suscripción se redujo.
    Gemini Apps especifica que puede cambiar los límites sin aviso para mantener la calidad ante restricciones de capacidad o aumentos repentinos de actividad: https://support.google.com/gemini/answer/16275805

  • En evaluaciones de programación de juegos con múltiples agentes, los modelos chinos suelen ser débiles en razonamiento de una sola pasada, pero compensan eso con uso de herramientas y mejora iterativa. Kimi K3 también quedó en el lugar 19 en coding de una sola pasada, pero en coding con agentes, donde se le da un entorno de ejecución y herramientas y se le invoca varias veces, quedó en 3.º, y solo Sol y Fable quedaron arriba en promedio por envío.
    Para los ingenieros de software, el coding con agentes es lo más relevante, pero la velocidad también importa, y ahora mismo en Kimi eso se vuelve un problema real de usabilidad. Proveedores externos de inferencia como Fireworks ya habían reducido antes esa brecha con modelos anteriores. La tendencia de que los modelos open-weight de frontera se vuelvan el estándar es interesante, y cada vez será más difícil competir solo por tener un modelo de frontera
    Datos: https://gertlabs.com/rankings?mode=agentic_coding

  • La calidad de este modelo está por encima de lo esperado y en especial hace muy bien code review y revisión de PR. Pero ahora mismo es demasiado lento por la demanda excesiva y el gran tamaño del modelo, así que incluso una revisión de código relativamente simple tarda muchísimo

    • Como Kimi K3 ya aparece en la tabla de precios de opencode-go, parece que ya se puede usar, aunque todavía no lo he confirmado. En Zen no está
    • Puede valer la pena probar la ruta de OpenRouter: https://openrouter.ai/moonshotai/kimi-k3
  • Me pregunto si esta fiebre por Kimi es un aumento neto por la paradoja de Jevons, donde una oferta abundante provoca más consumo, o si simplemente es un cambio hacia un modelo más barato.
    También me pregunto si hay buenos datos para ver el consumo total de tokens entre varios laboratorios y OpenRouter

    • Si fuera una migración hacia un modelo más barato, se habrían ido a DeepSeek v4 Flash. El Kimi más reciente es más caro que la mayoría de los otros modelos chinos, así que parece más bien un efecto de seguir la moda de “el modelo nuevo está buenísimo, hay que usarlo”. La clave será cuánto aguanta una validación cuidadosa, y las firmas de EE. UU. probablemente estén bastante nerviosas
  • Me pregunto si Anthropic y OpenAI seguirán siendo competitivos solo por ser, por ahora, las únicas empresas capaces de soportar una demanda de este nivel. Si ya es costoso y encima los fallos hacen perder tiempo del personal, a los clientes empresariales no les va a gustar

    • En el trabajo se ve la misma tendencia. El software en sí es barato, pero el despliegue real sigue concentrado en unas pocas empresas por la experiencia en hosting y la responsabilidad sobre el uptime. Aun así, también están apareciendo muchas herramientas de productividad para vibe coding que corren en laptops personales
    • Hace apenas unos meses Anthropic también atormentaba a los usuarios con distinción entre uso en horas pico y fuera de horas pico por problemas de demanda, y además tenía fallas frecuentes. Después de firmar con xAI, en general se estabilizó, y Moonshot también está buscando ahora contratos de recursos de cómputo
    • Una parte importante de los recursos de cómputo de OpenAI y Anthropic en realidad pertenece a hyperscalers. Podrán ponerles margen a los derechos de acceso a recursos asegurados por contratos de largo plazo, pero como los hyperscalers pueden ofrecer precios más bajos, no parece que eso vaya a durar mucho
    • Como Kimi es un modelo open-weight, rápidamente aparecerán proveedores de hosting aparte de Moonshot, así que este problema no será un gran obstáculo para la adopción de pesos abiertos
    • Estoy usando Synthetic y entiendo que planean hospedar Kimi3. Los modelos abiertos pueden distribuir la inferencia
  • Parece que suspendieron las suscripciones porque consideraron que tal vez no podían garantizar a los clientes una calidad mínima de servicio

    • Para ser precisos, solo suspendieron temporalmente las nuevas suscripciones y dieron prioridad de recursos de cómputo a los miembros existentes