1 puntos por GN⁺ 2 시간 전 | 1 comentarios | Compartir por WhatsApp
  • Kimi K3-256k es un modelo para programación diaria que mantiene la calidad de resultados de K3 en un contexto de 256k, mientras consume aproximadamente la mitad de la cuota que k3 con contexto de 1M
  • Kimi Code ofrece K3 y K2.7 Code con 4 IDs de modelo, donde k3 admite 2.8T parámetros y hasta 1M de contexto, y kimi-for-coding-highspeed ofrece una salida unas 5~6 veces más rápida a cambio de usar 3 veces más cuota
  • Al cambiar de k3 a k3-256k, si el contexto existente supera 256k o incluye video, primero hay que ejecutar compact para mantener la compatibilidad preservando la información clave
  • Si se cambia el modelo o reasoning_effort, la caché de contexto existente se invalida y hay que volver a hacer prefill, por lo que el uso puede aumentar; se recomienda cambiar en una sesión nueva
  • Los modelos y contextos disponibles varían según el plan, y si se supera el permiso se devuelve 401. En herramientas de terceros hay que configurar manualmente el ID de modelo exacto y el tamaño de contexto y nivel de razonamiento

Configuración de modelos de Kimi Code

  • Kimi Code ofrece Kimi K3 y Kimi K2.7 Code con 4 IDs de modelo
    • k3: modelo insignia de programación con 2.8T parámetros, compatible con hasta 1M de contexto en planes superiores
    • k3-256k: versión de Kimi K3 con contexto de 256k, enfocada en reducir el consumo
    • kimi-for-coding: Kimi K2.7 Code, adecuado para autocompletado y tareas de desarrollo cotidianas
    • kimi-for-coding-highspeed: K2.7 Code HighSpeed, que ofrece una salida unas 5~6 veces más rápida con la misma capacidad de programación
  • Las especificaciones y condiciones de uso por modelo son las siguientes
    • k3
      • Funciona a velocidad normal y ofrece hasta 1M de contexto para miembros de planes superiores
      • reasoning_effort admite low, high, max y el valor predeterminado es high
      • Disponible desde Moderato, y el contexto de 1M se ofrece desde Allegretto
      • Puede recibir imágenes y video
    • k3-256k
      • Funciona a velocidad normal y el contexto está fijado en 256k
      • reasoning_effort admite low, high, max y el valor predeterminado es high
      • Disponible para miembros desde Moderato
      • Solo puede recibir imágenes y no admite video
    • kimi-for-coding
      • Ofrece velocidad normal y contexto de 256k, y está disponible para todos los miembros
      • Funciona con Thinking:ON y admite imágenes y video
    • kimi-for-coding-highspeed
      • Genera salida unas 6 veces más rápido en contexto de 256k, pero consume 3 veces más cuota
      • Disponible desde Allegretto y admite Thinking:ON, así como entrada de imágenes y video

Uso de K3-256k y cambio de modelo

  • k3-256k ofrece los mismos resultados que k3 dentro del rango de contexto de 256k, mientras consume aproximadamente la mitad de la cuota que la versión de 1M
  • Es adecuado para preguntas y respuestas cotidianas, autocompletado de código, desarrollo general de funciones y edición de un solo archivo o archivos pequeños, pero no admite entrada de video
  • Cambio de K3 a K3-256k

    • Si el contexto de la sesión actual supera 256k, algunas herramientas como Kimi Code CLI y Claude Code realizan compact por su cuenta
    • Como cada herramienta de agente lo maneja de forma distinta, se recomienda ejecutar manualmente compact una vez antes del cambio para comprimir el contexto a 256k o menos
    • Esto permite mantener la sesión preservando el contenido clave del trabajo
    • Después del cambio, la cuota puede durar más tiempo
    • Si el historial de conversación incluye archivos de video, no se puede cambiar directamente a k3-256k, así que primero hay que ejecutar compact
  • Cambio de K3-256k a K3

    • Si k3-256k está cerca del límite de 256k y se quiere evitar pérdida de información por compact, se puede cambiar directamente a k3 1M
    • En la versión actual, cambiar de 256k a 1M no afecta la caché

Caché y gestión de uso

  • Al cambiar de modelo, la caché de contexto construida con el modelo anterior deja de aplicarse, por lo que ese contexto debe volver a hacerse prefill
  • Por eso, justo después del cambio puede parecer que el uso aumentó. Al usar un modelo nuevo, iniciar una sesión nueva favorece mejores resultados y menor consumo
  • Costo de cambiar la intensidad de razonamiento

    • Cambiar reasoning_effort también invalida la caché de contexto existente, por lo que hay que volver a hacer prefill
    • Se recomienda elegir la intensidad de razonamiento adecuada para la tarea y mantenerla de forma consistente dentro de una sesión
    • Si realmente se necesita otra intensidad, es mejor iniciar una sesión nueva en vez de cambiar repetidamente dentro de una sesión larga

Permisos del plan y error 401

  • Incluso si se usa el ID de modelo correcto, si la función solicitada excede los permisos del plan, el servidor devuelve 401
    • Sin acceso a K3: en planes por debajo de Moderato no se puede llamar a k3 ni a k3-256k
    • Sin acceso a 1M: en Moderato, k3 admite hasta 256k, y el máximo de 1M está disponible desde Allegretto
    • El límite de contexto de k3-256k está fijado en 256k sin importar el plan
    • Sin acceso a HighSpeed: kimi-for-coding-highspeed requiere Allegretto o superior
  • El mensaje completo de error y cómo manejarlo pueden consultarse en Error Reference

Por qué HighSpeed puede no sentirse rápido

  • El ID del modelo HighSpeed debe ser exactamente kimi-for-coding-highspeed
    • Si se escribe mal, se sustituye por el kimi-for-coding estándar sin mostrar error, y no aparece la mejora de velocidad
  • HighSpeed solo acelera la salida del modelo
    • Leer y escribir archivos, llamar comandos y ejecutar scripts no se vuelven más rápidos
    • Si en una tarea el peso de ejecutar herramientas o scripts es alto, la mejora total de velocidad puede sentirse pequeña

Cómo cambiar de modelo en el cliente

  • Cambiar el ID del modelo invalida la caché de contexto. Para evitar consumo adicional de tokens y obtener la mejor experiencia de uso, se recomienda iniciar una sesión nueva
  • Al hacer la llamada, hay que ingresar uno de los siguientes IDs de modelo, no el nombre de versión del modelo
    • k3
    • k3-256k
    • kimi-for-coding
    • kimi-for-coding-highspeed
  • Si se ingresan nombres de versión como Kimi K3 o K2.7 Code, la llamada falla
  • Si se desactiva Thinking en K3 o K2.7, la solicitud se redirige a K2.6, así que para usar K3 o K2.7 Code hay que activar Thinking
  • Clientes oficiales

    • En Kimi Code CLI se puede escribir /model para cambiar de modelo sin modificar la configuración
    • Si el modelo más reciente no aparece en la lista, hay que volver a iniciar sesión con /logout y luego /login
    • En Kimi Code para VS Code, el modelo se elige desde el menú desplegable del cuadro de entrada
    • Si el modelo no aparece, hay que reiniciar VS Code o reinstalar la extensión

Configuración en herramientas de terceros

  • Después de crear una API Key en Kimi Code Console, se ingresan en la herramienta la Base URL y el ID del modelo
  • La API de Kimi Code admite tanto el protocolo compatible con OpenAI como el protocolo compatible con Anthropic
  • La forma de configurar cada herramienta puede consultarse en los siguientes documentos
    • Claude Code: asistente de programación en línea de comandos de Anthropic
    • OpenCode: agente de programación basado en terminal
    • Codex: agente de programación de OpenAI
  • Configuración de contexto de K3

    • El contexto predeterminado de algunas herramientas de terceros es menor que el máximo de 1M de K3
    • Para usar hasta 1M de contexto, hay que establecer manualmente el campo context-window en 1048576
  • Mapeo de intensidad de razonamiento de K3

    • K3 admite low, high, max, y los valores enviados por la herramienta se mapean de la siguiente manera
    • null o undefined: valor predeterminado high
    • Otros valores desconocidos: error HTTP 400
    • ultra, max, xhigh: max
    • high, medium: high, el nivel recomendado
    • low, minimum, light: low
    • none: thinking.type se desactiva

1 comentarios

 
GN⁺ 2 시간 전
Opiniones de Hacker News
  • Codex aprovecha muy bien el contexto de 256k. 1M es holgado, pero sigue siendo caro y parece innecesario como valor predeterminado

  • Los LLM se están convirtiendo rápidamente en commodities de uso general, y el foso defensivo de laboratorios de IA de EE. UU. como OpenAI se está debilitando. Al final, es probable que ganen los hyperscalers y los dueños de centros de datos que puedan vender tokens baratos

    • No he probado muchos otros productos, pero el harness de Codex es tan atractivo que cuesta cambiarse. Me pregunto si hay alguien más que ofrezca un harness de esta calidad
    • Siento un profundo agradecimiento por las empresas de IA de frontera que invirtieron enormes cantidades de capital e I+D compleja en cada modelo. Es fácil olvidar ya cuánto costó llegar hasta este punto
  • Ya se lanzó k3-256k y ofrece los mismos resultados dentro del contexto de 256k. k3 (1M) consume aproximadamente el doble de cuota que k3-256k

  • Es un buen cambio. Normalmente intento mantener el contexto por debajo de 200k

    • En el hilo de Reddit sobre esta noticia, la misma frase también es el comentario principal
      https://www.reddit.com/r/kimi/s/BFa1TR9vNg
    • Depende del alcance del trabajo, pero creo que el punto adecuado está por debajo de 500k. En Claude, con 500 mil tokens puedes construir un proyecto bastante grande manteniendo todo el contexto desde el inicio hasta el momento actual
    • 256k debería ser suficiente para cualquiera
  • Entonces me pregunto si todos los usuarios podrán usar Kimi de repente a mitad de precio hasta que el contexto llegue a 256k. Si es cierto, sería un cambio enorme

    • Como es un modelo separado, pensé que si usabas k3-256k y luego cambiabas al modelo de 1M al llegar a 256k, la caché se invalidaría y tendrías que volver a pagar los 256k tokens existentes al precio del modelo de 1M
      Pero eso era incorrecto: cuando te acercas al límite de contexto, puedes cambiar al modelo de 1M sin invalidar la caché. En la versión actual, cambiar de k3-256k a k3 (1M) no afecta la caché
    • Entiendo que no es así. Parece significar que, con una ventana de contexto más pequeña, se acumulan menos tokens de entrada con el tiempo, por lo que en general resulta más barato
  • Han pasado 38 minutos desde que se publicó esto, y desde hace 20 minutos varios servicios de Anthropic aparecen como en una interrupción masiva. Seguro no tiene relación, pero me dio un poco de risa

  • Parece que el modelo en sí es el mismo y que solo es un cambio a nivel de API

  • Funcionalmente es parecido al enfoque de OpenAI, donde el tramo de precio cambia al superar cierta longitud de contexto. El umbral también está cerca de 272k, es decir, alrededor de 2^18 o 256k
    A medida que crece el contexto activo, aumenta la cantidad de cómputo necesaria por token de salida y los bytes que hay que leer, así que es razonable trasladar ese costo al usuario. Lo que sorprende es que no usen una curva de precios gradual en lugar de un umbral escalonado

    • Es probable que operen dos configuraciones de infraestructura según la longitud máxima de secuencia, así que el umbral escalonado no sorprende
      La configuración de contexto corto tiene menos nodos dedicados a prefill por instancia y no necesita soportar una gran caché KV, por lo que también puede reducir el número total de nodos. Si usan inferencia desagregada, también pueden ajustar por separado la proporción de cómputo asignada a prefill y a decoding
  • Espero que este cambio reduzca la carga de infraestructura. Últimamente todos los modelos se han vuelto notablemente lentos y el equipo de soporte no responde. Sospecho que están atendiendo una parte importante de las solicitudes con modelos cuantizados

    • Las teorías conspirativas sin fundamento quizá encajen en Reddit, pero no en HN
  • Me pregunto si no es un modelo cuantizado, sino simplemente que la ventana de contexto se redujo a 256k

    • Una ventana de contexto de 256k y si está cuantizado o no son cosas independientes. Como es difícil verificarlo directamente desde afuera, tampoco se puede descartar la posibilidad de que realmente esté cuantizado