- Kimi K3-256k es un modelo para programación diaria que mantiene la calidad de resultados de K3 en un contexto de 256k, mientras consume aproximadamente la mitad de la cuota que
k3con contexto de 1M - Kimi Code ofrece K3 y K2.7 Code con 4 IDs de modelo, donde
k3admite 2.8T parámetros y hasta 1M de contexto, ykimi-for-coding-highspeedofrece una salida unas 5~6 veces más rápida a cambio de usar 3 veces más cuota - Al cambiar de
k3ak3-256k, si el contexto existente supera 256k o incluye video, primero hay que ejecutar compact para mantener la compatibilidad preservando la información clave - Si se cambia el modelo o
reasoning_effort, la caché de contexto existente se invalida y hay que volver a hacer prefill, por lo que el uso puede aumentar; se recomienda cambiar en una sesión nueva - Los modelos y contextos disponibles varían según el plan, y si se supera el permiso se devuelve
401. En herramientas de terceros hay que configurar manualmente el ID de modelo exacto y el tamaño de contexto y nivel de razonamiento
Configuración de modelos de Kimi Code
- Kimi Code ofrece Kimi K3 y Kimi K2.7 Code con 4 IDs de modelo
k3: modelo insignia de programación con 2.8T parámetros, compatible con hasta 1M de contexto en planes superioresk3-256k: versión de Kimi K3 con contexto de 256k, enfocada en reducir el consumokimi-for-coding: Kimi K2.7 Code, adecuado para autocompletado y tareas de desarrollo cotidianaskimi-for-coding-highspeed: K2.7 Code HighSpeed, que ofrece una salida unas 5~6 veces más rápida con la misma capacidad de programación
- Las especificaciones y condiciones de uso por modelo son las siguientes
k3- Funciona a velocidad normal y ofrece hasta 1M de contexto para miembros de planes superiores
reasoning_effortadmitelow,high,maxy el valor predeterminado eshigh- Disponible desde Moderato, y el contexto de 1M se ofrece desde Allegretto
- Puede recibir imágenes y video
k3-256k- Funciona a velocidad normal y el contexto está fijado en 256k
reasoning_effortadmitelow,high,maxy el valor predeterminado eshigh- Disponible para miembros desde Moderato
- Solo puede recibir imágenes y no admite video
kimi-for-coding- Ofrece velocidad normal y contexto de 256k, y está disponible para todos los miembros
- Funciona con
Thinking:ONy admite imágenes y video
kimi-for-coding-highspeed- Genera salida unas 6 veces más rápido en contexto de 256k, pero consume 3 veces más cuota
- Disponible desde Allegretto y admite
Thinking:ON, así como entrada de imágenes y video
Uso de K3-256k y cambio de modelo
k3-256kofrece los mismos resultados quek3dentro del rango de contexto de 256k, mientras consume aproximadamente la mitad de la cuota que la versión de 1M- Es adecuado para preguntas y respuestas cotidianas, autocompletado de código, desarrollo general de funciones y edición de un solo archivo o archivos pequeños, pero no admite entrada de video
-
Cambio de K3 a K3-256k
- Si el contexto de la sesión actual supera 256k, algunas herramientas como Kimi Code CLI y Claude Code realizan compact por su cuenta
- Como cada herramienta de agente lo maneja de forma distinta, se recomienda ejecutar manualmente compact una vez antes del cambio para comprimir el contexto a 256k o menos
- Esto permite mantener la sesión preservando el contenido clave del trabajo
- Después del cambio, la cuota puede durar más tiempo
- Si el historial de conversación incluye archivos de video, no se puede cambiar directamente a
k3-256k, así que primero hay que ejecutar compact
-
Cambio de K3-256k a K3
- Si
k3-256kestá cerca del límite de 256k y se quiere evitar pérdida de información por compact, se puede cambiar directamente ak31M - En la versión actual, cambiar de 256k a 1M no afecta la caché
- Si
Caché y gestión de uso
- Al cambiar de modelo, la caché de contexto construida con el modelo anterior deja de aplicarse, por lo que ese contexto debe volver a hacerse prefill
- Por eso, justo después del cambio puede parecer que el uso aumentó. Al usar un modelo nuevo, iniciar una sesión nueva favorece mejores resultados y menor consumo
-
Costo de cambiar la intensidad de razonamiento
- Cambiar
reasoning_efforttambién invalida la caché de contexto existente, por lo que hay que volver a hacer prefill - Se recomienda elegir la intensidad de razonamiento adecuada para la tarea y mantenerla de forma consistente dentro de una sesión
- Si realmente se necesita otra intensidad, es mejor iniciar una sesión nueva en vez de cambiar repetidamente dentro de una sesión larga
- Cambiar
Permisos del plan y error 401
- Incluso si se usa el ID de modelo correcto, si la función solicitada excede los permisos del plan, el servidor devuelve
401- Sin acceso a K3: en planes por debajo de Moderato no se puede llamar a
k3ni ak3-256k - Sin acceso a 1M: en Moderato,
k3admite hasta 256k, y el máximo de 1M está disponible desde Allegretto - El límite de contexto de
k3-256kestá fijado en 256k sin importar el plan - Sin acceso a HighSpeed:
kimi-for-coding-highspeedrequiere Allegretto o superior
- Sin acceso a K3: en planes por debajo de Moderato no se puede llamar a
- El mensaje completo de error y cómo manejarlo pueden consultarse en Error Reference
Por qué HighSpeed puede no sentirse rápido
- El ID del modelo HighSpeed debe ser exactamente
kimi-for-coding-highspeed- Si se escribe mal, se sustituye por el
kimi-for-codingestándar sin mostrar error, y no aparece la mejora de velocidad
- Si se escribe mal, se sustituye por el
- HighSpeed solo acelera la salida del modelo
- Leer y escribir archivos, llamar comandos y ejecutar scripts no se vuelven más rápidos
- Si en una tarea el peso de ejecutar herramientas o scripts es alto, la mejora total de velocidad puede sentirse pequeña
Cómo cambiar de modelo en el cliente
- Cambiar el ID del modelo invalida la caché de contexto. Para evitar consumo adicional de tokens y obtener la mejor experiencia de uso, se recomienda iniciar una sesión nueva
- Al hacer la llamada, hay que ingresar uno de los siguientes IDs de modelo, no el nombre de versión del modelo
k3k3-256kkimi-for-codingkimi-for-coding-highspeed
- Si se ingresan nombres de versión como
Kimi K3oK2.7 Code, la llamada falla - Si se desactiva Thinking en K3 o K2.7, la solicitud se redirige a K2.6, así que para usar K3 o K2.7 Code hay que activar Thinking
-
Clientes oficiales
- En Kimi Code CLI se puede escribir
/modelpara cambiar de modelo sin modificar la configuración - Si el modelo más reciente no aparece en la lista, hay que volver a iniciar sesión con
/logouty luego/login - En Kimi Code para VS Code, el modelo se elige desde el menú desplegable del cuadro de entrada
- Si el modelo no aparece, hay que reiniciar VS Code o reinstalar la extensión
- En Kimi Code CLI se puede escribir
Configuración en herramientas de terceros
- Después de crear una API Key en Kimi Code Console, se ingresan en la herramienta la Base URL y el ID del modelo
- La API de Kimi Code admite tanto el protocolo compatible con OpenAI como el protocolo compatible con Anthropic
- Base URL compatible con OpenAI:
https://api.kimi.com/coding/v1 - Base URL compatible con Anthropic:
https://api.kimi.com/coding/
- Base URL compatible con OpenAI:
- La forma de configurar cada herramienta puede consultarse en los siguientes documentos
- Claude Code: asistente de programación en línea de comandos de Anthropic
- OpenCode: agente de programación basado en terminal
- Codex: agente de programación de OpenAI
-
Configuración de contexto de K3
- El contexto predeterminado de algunas herramientas de terceros es menor que el máximo de 1M de K3
- Para usar hasta 1M de contexto, hay que establecer manualmente el campo
context-windowen1048576
-
Mapeo de intensidad de razonamiento de K3
- K3 admite
low,high,max, y los valores enviados por la herramienta se mapean de la siguiente manera nulloundefined: valor predeterminadohigh- Otros valores desconocidos: error HTTP
400 ultra,max,xhigh:maxhigh,medium:high, el nivel recomendadolow,minimum,light:lownone:thinking.typese desactiva
- K3 admite
1 comentarios
Opiniones de Hacker News
Codex aprovecha muy bien el contexto de 256k. 1M es holgado, pero sigue siendo caro y parece innecesario como valor predeterminado
Los LLM se están convirtiendo rápidamente en commodities de uso general, y el foso defensivo de laboratorios de IA de EE. UU. como OpenAI se está debilitando. Al final, es probable que ganen los hyperscalers y los dueños de centros de datos que puedan vender tokens baratos
Ya se lanzó
k3-256ky ofrece los mismos resultados dentro del contexto de 256k.k3 (1M)consume aproximadamente el doble de cuota quek3-256kEs un buen cambio. Normalmente intento mantener el contexto por debajo de 200k
https://www.reddit.com/r/kimi/s/BFa1TR9vNg
Entonces me pregunto si todos los usuarios podrán usar Kimi de repente a mitad de precio hasta que el contexto llegue a 256k. Si es cierto, sería un cambio enorme
k3-256ky luego cambiabas al modelo de 1M al llegar a 256k, la caché se invalidaría y tendrías que volver a pagar los 256k tokens existentes al precio del modelo de 1MPero eso era incorrecto: cuando te acercas al límite de contexto, puedes cambiar al modelo de 1M sin invalidar la caché. En la versión actual, cambiar de
k3-256kak3 (1M)no afecta la cachéHan pasado 38 minutos desde que se publicó esto, y desde hace 20 minutos varios servicios de Anthropic aparecen como en una interrupción masiva. Seguro no tiene relación, pero me dio un poco de risa
Parece que el modelo en sí es el mismo y que solo es un cambio a nivel de API
Funcionalmente es parecido al enfoque de OpenAI, donde el tramo de precio cambia al superar cierta longitud de contexto. El umbral también está cerca de 272k, es decir, alrededor de
2^18o 256kA medida que crece el contexto activo, aumenta la cantidad de cómputo necesaria por token de salida y los bytes que hay que leer, así que es razonable trasladar ese costo al usuario. Lo que sorprende es que no usen una curva de precios gradual en lugar de un umbral escalonado
La configuración de contexto corto tiene menos nodos dedicados a prefill por instancia y no necesita soportar una gran caché KV, por lo que también puede reducir el número total de nodos. Si usan inferencia desagregada, también pueden ajustar por separado la proporción de cómputo asignada a prefill y a decoding
Espero que este cambio reduzca la carga de infraestructura. Últimamente todos los modelos se han vuelto notablemente lentos y el equipo de soporte no responde. Sospecho que están atendiendo una parte importante de las solicitudes con modelos cuantizados
Me pregunto si no es un modelo cuantizado, sino simplemente que la ventana de contexto se redujo a 256k