- Al usar Kimi K3 y Claude en paralelo para tareas cotidianas de programación, fue difícil distinguir una diferencia real en la calidad de salida y en la cantidad de tokens necesarios para obtener respuestas
- La API de Kimi K3 cuesta $3 por millón de tokens de entrada y $15 de salida, mucho más barata que el modelo tope de Claude, que cuesta $10 y $50 respectivamente
- Kimi empieza desde $19 al mes y su nivel de programación de $39 al mes también ofrece bastante margen, mientras que en Claude el límite de uso se agotó rápido durante tareas con agentes y ni siquiera mantuvo el acceso a Fable en el plan de $20 al mes
- En el benchmark de ciberseguridad de Semgrep, GLM 5.2 lo superó al completar tareas que un Claude restringido rechazó, y además se publicó con licencia MIT y es más barato que el Opus más reciente
- Las restricciones aplicadas solo a modelos de EE. UU. solo reducen las opciones de los clientes estadounidenses, sin frenar la competencia de modelos abiertos del extranjero, así que hay menos razones para seguir pagando Claude cuando Kimi K3 ofrece una calidad similar a menor precio
Comparación de calidad y precio entre Kimi K3 y Claude
- Al usar Kimi K3 junto con Claude en trabajo de programación general, mostró las mismas tareas y calidad de salida, con un uso de tokens casi igual
- Fue distinto a la expectativa de que los modelos abiertos darían resultados más toscos o consumirían más tokens para llegar a la misma respuesta
- El precio de la API de Kimi K3 es de $3 por millón de tokens de entrada y $15 por millón de tokens de salida
- El modelo tope de Claude cuesta $10 y $50 respectivamente en la misma unidad
- Los planes de pago de Kimi empiezan desde $19 al mes, y el nivel de programación de $39 al mes ofrece más uso que los productos equivalentes de Claude
- Los planes de Claude tienen límites de uso estrictos, al punto de poder agotar la cuota antes del almuerzo incluso en tareas normales con agentes
- Claude no logró mantener el acceso a Fable en el plan de $20 al mes, así que se desactivó y se cambió a Opus, pero el nivel de Kimi no tiene esa misma condición
Política de IA de EE. UU. y competencia de modelos abiertos
- Mientras que el gobierno de EE. UU. retrasó el lanzamiento de Fable y aplicó restricciones al modelo final para rechazar varias categorías de tareas, los modelos abiertos de nivel frontera de laboratorios chinos pueden descargarse y quedan fuera del alcance regulatorio del gobierno estadounidense
- En el benchmark de ciberseguridad de Semgrep, GLM 5.2 superó a Claude
- El modelo restringido rechazó tareas, pero el modelo abierto sí las realizó, y esa diferencia afectó los resultados
- GLM 5.2 fue lanzado con licencia MIT y, sin presentarse como un modelo frontera, en tareas reales da mejores resultados que el Opus más reciente y además cuesta mucho menos
- GPT-5.6 de OpenAI también pasó por el proceso de restricciones gubernamentales, pero OpenAI tiene más margen que Anthropic porque puede ofrecer su modelo principal en el plan de $20 al mes
- En el futuro, el gobierno de EE. UU. podría aplicar a la IA y al código abierto el enfoque de subsidios, rescates y aranceles de protección que usó en la industria automotriz
- Mediante cooperación público-privada, podría apoyar modelos nacionales que solo se usen dentro de EE. UU. y no logren competir a nivel internacional
- Como resultado, los usuarios de EE. UU. podrían verse obligados a comprar modelos nacionales en vez de elegir la mejor calidad o el menor precio, y quizá no puedan acceder a los mejores modelos al mejor precio
1 comentarios
Comentarios en Hacker News
Ya sea que hayan llegado a un rendimiento similar mediante destilación o que lo hayan desarrollado de forma independiente desde el principio, el desenlace para los laboratorios punteros de EE. UU. estaba decidido desde el inicio. La destilación no es un ataque, y así como los laboratorios de frontera destilaron en sus modelos el conocimiento escrito por la humanidad, es natural que los laboratorios que vienen después compriman eso en modelos más baratos
Como en la práctica no hay forma de impedir que se guarden conversaciones para usarlas en el entrenamiento de modelos propios, parece mejor invertir en empresas de hardware antes que en empresas de modelos
Hace apenas 6 meses, mucha gente preveía que usar salidas de modelos como datos de entrenamiento causaría una catástrofe de aprendizaje recursivo y que todos los modelos fracasarían, así que no se debería hablar como si hubiera sido evidente desde el principio
La destilación vía API solo sirve para superar rápidamente el cold start en nuevos entornos de aprendizaje por refuerzo, y en realidad lo más importante es la calidad y diversidad del entorno de RL en el que aprende el modelo
EE. UU. todavía no ha optado por controles al estilo de las tierras raras de China, pero si la destilación se expande, incluso la parte que no lo haga probablemente tendrá que asumir costos regulatorios como bloqueos de acceso o controles excesivos. Igual que se fue tolerante con la copia de música pero hubo indignación con el arte visual, si esto se ve como robo o como negocio normal dependerá al final del consenso social, y sin un gran avance la brecha se reducirá
Llegamos a este punto mucho más rápido de lo esperado. Me pregunto cómo sería un mundo en el que los gobiernos occidentales definieran el acceso a modelos de frontera de pesos abiertos como un riesgo para la seguridad nacional y clasificaran su uso como un acto terrorista
Kimi K3 podría volverse como Napster, que todos usaban aunque supieran que era ilegal, o podría surgir un mercado subterráneo al estilo de la marihuana donde alguien del vecindario alquile por uso un equipo de 8×5090 en su sótano armado con piezas de eBay. Por otro lado, si el control funciona, las opciones abiertas podrían quedar reducidas a versiones debilitadas de Cohere y Mistral, y tal vez habría que pagar caro por los modelos “American Frontier” de Anthropic y OpenAI, rezagados frente a China
También podría aparecer un Kindle AI que venda influencia al mejor postor, como el Kindle Fire subsidiado por publicidad, metiendo propaganda de tabacaleras en el pipeline de entrenamiento y haciendo que el LLM diga que fumar es saludable
El gobierno de EE. UU. declaró recientemente restricciones similares a la Wolf Amendment para la colaboración científica de la NSF y trasladó la jurisdicción al ámbito militar, mientras intenta atraer a varios países a una Pax Silica orientada a excluir a China y, al mismo tiempo, imponer a sus aliados productos propios con funciones limitadas. Podrían quedar zonas neutrales como Suiza o Singapur, donde usuarios de EE. UU. y la UE puedan acceder al otro lado de la cortina sin perjuicios legales
https://nitter.net/RnaudBertrand/status/2069574934972797089
Le encargué a Kimi K3 una tarea que suelo probar con todos los modelos, y se quedó pensando mucho más tiempo; casi agotó las 5 horas de uso del plan de 19 dólares. Si hago la misma tarea en el plan de 20 dólares de OpenAI, toma solo unos minutos y casi no consume uso
Los límites de suscripción no ofrecen una cifra comparable como los tokens, así que es difícil medirlos, pero fue la primera suscripción de unos 20 dólares que sentí tan ajustada que una sola tarea menor me quitó uso que habría necesitado para trabajo real. Era lento y el costo por tarea parecía alto, aunque sí encontró un bug que Gemini 3.5 Flash había inventado por su cuenta
Cuando le pedí a GLM 5.2 pasar unas 50 líneas de JavaScript a Python, también repitió búsquedas web y revisiones, gastó 0.25 dólares en API, falló en la primera ejecución, pero funcionó en la segunda. Claude Code/Fable fue mucho más rápido pero cometió el mismo error, y espero que el exceso de auto-revisión en los modelos abiertos disminuya o que mejore la forma de hacer prompts
Los modelos chinos todavía no cumplen con ese criterio y parecen más enfocados en maximizar puntajes de benchmark que en eficiencia
max, pero pronto ofrecerá otros niveles. En el registro de seguimiento de benchmarks aparecía mucho retroceso e incertidumbre del tipo “Espera, pero...”, y enxhighymaxde GPT 5.6 y Fable también se veía algo parecido, aunque en menor gradoSi se admite una menor intensidad de razonamiento, podría mejorar la ineficiencia de tokens
https://platform.kimi.ai/docs/guide/use-thinking-effort
/code-reviewen una sesión limpia de otra terminal, y sin cambios de código el uso se disparó hasta 99%; con el 1% restante ni siquiera pudo escribirreview.mdNormalmente una revisión usa 10~20%, pero a veces desaparece 65~69% en solo 15 minutos; la variabilidad del uso es enorme
En el plan de pago de Kimi, la longitud de contexto de 1 millón de tokens solo está disponible desde 79 dólares al mes; por debajo de eso se limita a 256 mil tokens. En el plan más barato, de 15 dólares al mes con descuento por pago anual, K3 ni siquiera está disponible por ahora
https://www.kimi.com/code/docs/en/kimi-code/models.html
Yo más bien lo veo al revés. Kimi K3 tiene 2.8 billones de parámetros, y aunque no se ha revelado el tamaño de ChatGPT 5.6 ni de Opus 4.8, es posible que sea parecido; además, hay rumores de que Fable y Mythos rondan los 10 billones
El precio de entrada/salida por millón de tokens es de 3/15 dólares para K3, 5/30 dólares para ChatGPT 5.6 Sol y 5/25 dólares para Opus 4.8, así que la diferencia no es tan grande. Más que un punto de inflexión histórico, parece que los competidores están convergiendo al mismo rendimiento y vendiendo un poco más barato. Como los pesos de K3 también siguen cerrados, no parece que la situación vaya a cambiar
Incluso en este hilo la utilidad real de Kimi está dividida. Personalmente lo veo por debajo de Fable y 5.6 Sol, pero el centro de la discusión parece ser menos el rendimiento y más la reacción contra el rumbo regulatorio del gobierno de EE. UU.
Da la impresión de que también influye un deseo de que Kimi sea mejor, por la rabia y frustración con la situación actual
Depende mucho del tipo de tarea y de cómo se use, pero la idea de que K3 no está al nivel de los modelos punteros de EE. UU. no coincide con mi experiencia de uso
Aquí hace falta aclarar si ‘Claude’ se refiere a Opus o a Fable, y también en qué nivel está la intensidad de razonamiento
La expresión original fue imprecisa; no usa Fable ni K3 la mayor parte del tiempo, y normalmente resuelve tareas de alcance pequeño antes de revisarlas él mismo
La política de privacidad tampoco es un problema menor. Dicen que si usas la suscripción de Kimi, tus interacciones se usan para entrenar el modelo, y que solo no se usan si accedes directamente por API pagando el precio de API. Otra cosa es decidir si confiar en eso
Pienso esperar a que aparezcan otros proveedores en OpenRouter y luego evaluar su nivel de confianza. Aunque no confíe mucho en ellos, si es un proveedor que no entrena modelos directamente, es menos probable que los datos se usen para entrenamiento
El 99% de los usuarios no maneja propiedad intelectual especial de la que realmente deba preocuparse
Hasta ahora, al final, todo ha sido destilación. Como dijo Suhail, hay que llevar las ganancias de los modelos de IA casi a cero
Como fueron entrenados con los datos de la humanidad, deberían ser un regalo para la propia humanidad, y así se puede evitar que unos pocos controlen a la humanidad
Los modelos de código abierto ya alcanzaron el nivel de los mejores modelos comerciales. El último cuello de botella es el hardware, pero esa barrera también está bajando rápido
Seguir ejecutando Kimi K3 en casa sigue siendo muy caro, pero ya hay muchos modelos gratuitos y capaces que pueden correr en hardware razonable, y esta tendencia continuará