2 puntos por GN⁺ 1 일 전 | 1 comentarios | Compartir por WhatsApp
  • Al usar Kimi K3 y Claude en paralelo para tareas cotidianas de programación, fue difícil distinguir una diferencia real en la calidad de salida y en la cantidad de tokens necesarios para obtener respuestas
  • La API de Kimi K3 cuesta $3 por millón de tokens de entrada y $15 de salida, mucho más barata que el modelo tope de Claude, que cuesta $10 y $50 respectivamente
  • Kimi empieza desde $19 al mes y su nivel de programación de $39 al mes también ofrece bastante margen, mientras que en Claude el límite de uso se agotó rápido durante tareas con agentes y ni siquiera mantuvo el acceso a Fable en el plan de $20 al mes
  • En el benchmark de ciberseguridad de Semgrep, GLM 5.2 lo superó al completar tareas que un Claude restringido rechazó, y además se publicó con licencia MIT y es más barato que el Opus más reciente
  • Las restricciones aplicadas solo a modelos de EE. UU. solo reducen las opciones de los clientes estadounidenses, sin frenar la competencia de modelos abiertos del extranjero, así que hay menos razones para seguir pagando Claude cuando Kimi K3 ofrece una calidad similar a menor precio

Comparación de calidad y precio entre Kimi K3 y Claude

  • Al usar Kimi K3 junto con Claude en trabajo de programación general, mostró las mismas tareas y calidad de salida, con un uso de tokens casi igual
    • Fue distinto a la expectativa de que los modelos abiertos darían resultados más toscos o consumirían más tokens para llegar a la misma respuesta
  • El precio de la API de Kimi K3 es de $3 por millón de tokens de entrada y $15 por millón de tokens de salida
    • El modelo tope de Claude cuesta $10 y $50 respectivamente en la misma unidad
  • Los planes de pago de Kimi empiezan desde $19 al mes, y el nivel de programación de $39 al mes ofrece más uso que los productos equivalentes de Claude
    • Los planes de Claude tienen límites de uso estrictos, al punto de poder agotar la cuota antes del almuerzo incluso en tareas normales con agentes
    • Claude no logró mantener el acceso a Fable en el plan de $20 al mes, así que se desactivó y se cambió a Opus, pero el nivel de Kimi no tiene esa misma condición

Política de IA de EE. UU. y competencia de modelos abiertos

  • Mientras que el gobierno de EE. UU. retrasó el lanzamiento de Fable y aplicó restricciones al modelo final para rechazar varias categorías de tareas, los modelos abiertos de nivel frontera de laboratorios chinos pueden descargarse y quedan fuera del alcance regulatorio del gobierno estadounidense
  • En el benchmark de ciberseguridad de Semgrep, GLM 5.2 superó a Claude
    • El modelo restringido rechazó tareas, pero el modelo abierto sí las realizó, y esa diferencia afectó los resultados
  • GLM 5.2 fue lanzado con licencia MIT y, sin presentarse como un modelo frontera, en tareas reales da mejores resultados que el Opus más reciente y además cuesta mucho menos
  • GPT-5.6 de OpenAI también pasó por el proceso de restricciones gubernamentales, pero OpenAI tiene más margen que Anthropic porque puede ofrecer su modelo principal en el plan de $20 al mes
  • En el futuro, el gobierno de EE. UU. podría aplicar a la IA y al código abierto el enfoque de subsidios, rescates y aranceles de protección que usó en la industria automotriz
    • Mediante cooperación público-privada, podría apoyar modelos nacionales que solo se usen dentro de EE. UU. y no logren competir a nivel internacional
    • Como resultado, los usuarios de EE. UU. podrían verse obligados a comprar modelos nacionales en vez de elegir la mejor calidad o el menor precio, y quizá no puedan acceder a los mejores modelos al mejor precio

1 comentarios

 
GN⁺ 1 일 전
Comentarios en Hacker News
  • Ya sea que hayan llegado a un rendimiento similar mediante destilación o que lo hayan desarrollado de forma independiente desde el principio, el desenlace para los laboratorios punteros de EE. UU. estaba decidido desde el inicio. La destilación no es un ataque, y así como los laboratorios de frontera destilaron en sus modelos el conocimiento escrito por la humanidad, es natural que los laboratorios que vienen después compriman eso en modelos más baratos
    Como en la práctica no hay forma de impedir que se guarden conversaciones para usarlas en el entrenamiento de modelos propios, parece mejor invertir en empresas de hardware antes que en empresas de modelos

    • Decir que era tan obvio roza la reescritura histórica a posteriori. La destilación sigue siendo un área de investigación activa, y el hecho de que hoy se puedan destilar modelos con tanta facilidad es un resultado interesante, no algo que se diera por sentado hace 12 meses
      Hace apenas 6 meses, mucha gente preveía que usar salidas de modelos como datos de entrenamiento causaría una catástrofe de aprendizaje recursivo y que todos los modelos fracasarían, así que no se debería hablar como si hubiera sido evidente desde el principio
    • Estoy muy de acuerdo con la premisa de que la destilación no es un ataque, pero K3 no es una versión destilada de Fable o Sol. Fable se publicó hace muy poco y Sol acaba de salir, mientras que en las evaluaciones de usuarios de Arena K3 supera a ambos en algunas áreas
      La destilación vía API solo sirve para superar rápidamente el cold start en nuevos entornos de aprendizaje por refuerzo, y en realidad lo más importante es la calidad y diversidad del entorno de RL en el que aprende el modelo
    • El impacto del ataque por destilación parece algo exagerado. Ahora la mayoría de los datos de ajuste fino son sintéticos y, como no se puede repetir simplemente el mismo contenido, se parece más a pedirle a otro LLM que redacte un material didáctico que explique un tema en detalle sin omitir nada
    • Casi todos los mercados dependen de alguna forma de regulación, desde “solo se prohíbe robar y todo lo demás es libre” hasta exigir enormes regulaciones para toda contratación pública
      EE. UU. todavía no ha optado por controles al estilo de las tierras raras de China, pero si la destilación se expande, incluso la parte que no lo haga probablemente tendrá que asumir costos regulatorios como bloqueos de acceso o controles excesivos. Igual que se fue tolerante con la copia de música pero hubo indignación con el arte visual, si esto se ve como robo o como negocio normal dependerá al final del consenso social, y sin un gran avance la brecha se reducirá
    • Anthropic incluso dificulta revisar conversaciones pasadas o ver los tokens de razonamiento y los subagentes. La idea es que todos sigan volviendo a su servicio y no aprendan a cavar su propio pozo
  • Llegamos a este punto mucho más rápido de lo esperado. Me pregunto cómo sería un mundo en el que los gobiernos occidentales definieran el acceso a modelos de frontera de pesos abiertos como un riesgo para la seguridad nacional y clasificaran su uso como un acto terrorista
    Kimi K3 podría volverse como Napster, que todos usaban aunque supieran que era ilegal, o podría surgir un mercado subterráneo al estilo de la marihuana donde alguien del vecindario alquile por uso un equipo de 8×5090 en su sótano armado con piezas de eBay. Por otro lado, si el control funciona, las opciones abiertas podrían quedar reducidas a versiones debilitadas de Cohere y Mistral, y tal vez habría que pagar caro por los modelos “American Frontier” de Anthropic y OpenAI, rezagados frente a China
    También podría aparecer un Kindle AI que venda influencia al mejor postor, como el Kindle Fire subsidiado por publicidad, metiendo propaganda de tabacaleras en el pipeline de entrenamiento y haciendo que el LLM diga que fumar es saludable

    • Sería como una nueva cortina de hierro que divide al mundo en bloques digitales. Cuanto más se prolongue la interrupción del intercambio, mayor será la posibilidad de que el internet abierto y la ciencia se separen en ecosistemas incompatibles entre sí
      El gobierno de EE. UU. declaró recientemente restricciones similares a la Wolf Amendment para la colaboración científica de la NSF y trasladó la jurisdicción al ámbito militar, mientras intenta atraer a varios países a una Pax Silica orientada a excluir a China y, al mismo tiempo, imponer a sus aliados productos propios con funciones limitadas. Podrían quedar zonas neutrales como Suiza o Singapur, donde usuarios de EE. UU. y la UE puedan acceder al otro lado de la cortina sin perjuicios legales
      https://nitter.net/RnaudBertrand/status/2069574934972797089
    • La desaparición de equipos Mac Studio con mucha RAM probablemente sea coincidencia
    • Si se ilegalizan los modelos open source, solo se perjudica a las empresas de EE. UU. El resto del mundo seguirá usando open source y obtendrá oportunidades de arbitraje frente a las empresas estadounidenses
    • Me pregunto si por “gobiernos occidentales” se refiere concretamente a EE. UU. No está claro por qué otros países, que no temen a China tanto como EE. UU., tendrían que preocuparse por esto de la misma manera
    • Incluso 8×RTX Pro 6000 tienen solo 768 GB de VRAM, así que no sé cómo harían correr K3
  • Le encargué a Kimi K3 una tarea que suelo probar con todos los modelos, y se quedó pensando mucho más tiempo; casi agotó las 5 horas de uso del plan de 19 dólares. Si hago la misma tarea en el plan de 20 dólares de OpenAI, toma solo unos minutos y casi no consume uso
    Los límites de suscripción no ofrecen una cifra comparable como los tokens, así que es difícil medirlos, pero fue la primera suscripción de unos 20 dólares que sentí tan ajustada que una sola tarea menor me quitó uso que habría necesitado para trabajo real. Era lento y el costo por tarea parecía alto, aunque sí encontró un bug que Gemini 3.5 Flash había inventado por su cuenta

    • Kimi tiende a seguir dudando de sí mismo y pensar demasiado tiempo. Repite párrafos tipo “Espera, en realidad...” sobre un detalle pequeño y gasta muchos tokens
      Cuando le pedí a GLM 5.2 pasar unas 50 líneas de JavaScript a Python, también repitió búsquedas web y revisiones, gastó 0.25 dólares en API, falló en la primera ejecución, pero funcionó en la segunda. Claude Code/Fable fue mucho más rápido pero cometió el mismo error, y espero que el exceso de auto-revisión en los modelos abiertos disminuya o que mejore la forma de hacer prompts
    • Hay que dejar de tomar el precio por millón de tokens como referencia principal. La cantidad real de tokens usados influye más en el costo que la tarifa publicada por token, así que lo importante es la curva de costo por tarea frente a inteligencia
      Los modelos chinos todavía no cumplen con ese criterio y parecen más enfocados en maximizar puntajes de benchmark que en eficiencia
    • Kimi K3 por ahora solo admite la intensidad de razonamiento en max, pero pronto ofrecerá otros niveles. En el registro de seguimiento de benchmarks aparecía mucho retroceso e incertidumbre del tipo “Espera, pero...”, y en xhigh y max de GPT 5.6 y Fable también se veía algo parecido, aunque en menor grado
      Si se admite una menor intensidad de razonamiento, podría mejorar la ineficiencia de tokens
      https://platform.kimi.ai/docs/guide/use-thinking-effort
    • Le pedí a Claude Code/Fable implementar una función y en unos 60 minutos usó 30% de una sesión de 5 horas de la suscripción de 100 euros. Después ejecuté solo /code-review en una sesión limpia de otra terminal, y sin cambios de código el uso se disparó hasta 99%; con el 1% restante ni siquiera pudo escribir review.md
      Normalmente una revisión usa 10~20%, pero a veces desaparece 65~69% en solo 15 minutos; la variabilidad del uso es enorme
    • Los precios de las suscripciones de IA son extraños. Cada modelo usa cantidades distintas, se mide con tokens opacos que la interfaz del proveedor o el modelo consume arbitrariamente, y encima se aplican límites opacos por ventana de tiempo
  • En el plan de pago de Kimi, la longitud de contexto de 1 millón de tokens solo está disponible desde 79 dólares al mes; por debajo de eso se limita a 256 mil tokens. En el plan más barato, de 15 dólares al mes con descuento por pago anual, K3 ni siquiera está disponible por ahora
    https://www.kimi.com/code/docs/en/kimi-code/models.html

    • Quisiera usar solo la API, pero en DeepSeek, combinar las herramientas Reasonix/whale con una alta tasa de aciertos de caché la vuelve casi gratis, así que no parece fácil cambiarse a otro servicio
  • Yo más bien lo veo al revés. Kimi K3 tiene 2.8 billones de parámetros, y aunque no se ha revelado el tamaño de ChatGPT 5.6 ni de Opus 4.8, es posible que sea parecido; además, hay rumores de que Fable y Mythos rondan los 10 billones
    El precio de entrada/salida por millón de tokens es de 3/15 dólares para K3, 5/30 dólares para ChatGPT 5.6 Sol y 5/25 dólares para Opus 4.8, así que la diferencia no es tan grande. Más que un punto de inflexión histórico, parece que los competidores están convergiendo al mismo rendimiento y vendiendo un poco más barato. Como los pesos de K3 también siguen cerrados, no parece que la situación vaya a cambiar

    • Según el anuncio oficial, los pesos completos del modelo se publicarán antes del 27 de julio de 2026
    • Si además se considera que OpenAI eliminó el límite de 5 horas y reinició con frecuencia el límite semanal, queda la duda de si Kimi de verdad es más barato también en precio efectivo
  • Incluso en este hilo la utilidad real de Kimi está dividida. Personalmente lo veo por debajo de Fable y 5.6 Sol, pero el centro de la discusión parece ser menos el rendimiento y más la reacción contra el rumbo regulatorio del gobierno de EE. UU.
    Da la impresión de que también influye un deseo de que Kimi sea mejor, por la rabia y frustración con la situación actual

    • K3 es bastante bueno y lo pondría entre Sol y Fable. La capacidad de Sol para diseño de UI no impresiona, pero K3 es fuerte en esa área, y Fable en general ofrece el rendimiento más rápido y consistente
      Depende mucho del tipo de tarea y de cómo se use, pero la idea de que K3 no está al nivel de los modelos punteros de EE. UU. no coincide con mi experiencia de uso
    • Parece una repetición de lo de DeepSeek. Cuando salió v3 también llovieron comentarios diciendo que las empresas de EE. UU. estaban acabadas, pero al final todo siguió igual
    • He escuchado incontables veces que los modelos de frontera llevan más de 6 meses de ventaja sobre los modelos de pesos abiertos, pero eso ya no es cierto. Por eso el criterio de evaluación está cambiando
    • Cuesta aceptar lo que ha hecho el gobierno de EE. UU. este año con la IA, así que también se entiende que haya ese tipo de reacción
  • Aquí hace falta aclarar si ‘Claude’ se refiere a Opus o a Fable, y también en qué nivel está la intensidad de razonamiento

    • La frase de que no nota diferencia en “tareas de programación cotidianas” suena a que le encargó trabajo que no entiende lo suficiente como para distinguir los resultados
    • La comparación era entre Fable High y K3 High, y el uso principal es desarrollo de videojuegos. Les encarga arreglar bugs visuales ambiguos, cambiar la apariencia de escenas o modelos, y agregar funciones grandes
      La expresión original fue imprecisa; no usa Fable ni K3 la mayor parte del tiempo, y normalmente resuelve tareas de alcance pequeño antes de revisarlas él mismo
  • La política de privacidad tampoco es un problema menor. Dicen que si usas la suscripción de Kimi, tus interacciones se usan para entrenar el modelo, y que solo no se usan si accedes directamente por API pagando el precio de API. Otra cosa es decidir si confiar en eso
    Pienso esperar a que aparezcan otros proveedores en OpenRouter y luego evaluar su nivel de confianza. Aunque no confíe mucho en ellos, si es un proveedor que no entrena modelos directamente, es menos probable que los datos se usen para entrenamiento

    • Esta preocupación cada vez parece más absurda. La mayoría de las entradas no son más que salidas previas generadas por el mismo modelo y órdenes vagas escritas por personas como “corrígelo sin cometer errores”, así que si los modelos futuros mejoran, está bien que se use para entrenamiento
      El 99% de los usuarios no maneja propiedad intelectual especial de la que realmente deba preocuparse
    • Aunque todos los usuarios aficionados usaran modelos de pesos abiertos, el mercado empresarial sin retención de datos seguiría ofreciendo suficientes oportunidades de negocio para empresas estadounidenses
    • Esta política es motivo suficiente para no usarlo. Pienso esperar hasta que aparezca un servicio de proveedor independiente posible gracias a los pesos abiertos
  • Hasta ahora, al final, todo ha sido destilación. Como dijo Suhail, hay que llevar las ganancias de los modelos de IA casi a cero
    Como fueron entrenados con los datos de la humanidad, deberían ser un regalo para la propia humanidad, y así se puede evitar que unos pocos controlen a la humanidad

    • Seguir viendo los grandes modelos chinos solo como “versiones destiladas” es ridículo. Mucha gente todavía no reconoce la ola que va a arrasar con los laboratorios de investigación de frontera en EE. UU., que pretendían cautivar a los usuarios con modelos censurados y limitados en rendimiento mientras aprovechaban cantidades enormes de datos
  • Los modelos de código abierto ya alcanzaron el nivel de los mejores modelos comerciales. El último cuello de botella es el hardware, pero esa barrera también está bajando rápido
    Seguir ejecutando Kimi K3 en casa sigue siendo muy caro, pero ya hay muchos modelos gratuitos y capaces que pueden correr en hardware razonable, y esta tendencia continuará