- OpenAI refleja las mejoras de eficiencia en los modelos, los sistemas de inferencia y el arnés de agentes en el precio y la velocidad de procesamiento, elevando el rendimiento por dólar de la IA empresarial
- Desde el 30 de julio, el precio de Luna baja 80% y el de Terra 20%; por cada millón de tokens en la API, Luna costará $0.20 de entrada y $1.20 de salida, y Terra $2 de entrada y $12 de salida
- Luna ofrece un rendimiento similar al de un modelo de vanguardia de hace un año por alrededor del 6% del costo por tarea y con casi 9 veces más velocidad; en Agents’ Last Exam registró un rendimiento superior al de Fable 5 y un costo estimado por tarea aproximadamente 99% menor
- El Fast mode de GPT‑5.6 Sol reemplaza a Priority Processing y ofrece hasta 2.5 veces más velocidad que Standard, manteniendo el nivel de inteligencia, al doble de precio
- Las empresas pueden ajustar el equilibrio entre inteligencia, velocidad y costo mediante evaluaciones por etapas, por ejemplo usando Sol para planificación y resolución de incertidumbre, y Luna para implementación y pruebas claramente definidas
Reducción de precios de Luna y Terra, y mejoras de velocidad en Sol
- Las mejoras de eficiencia en la ejecución de GPT‑5.6 se traducen en reducciones de precio para Luna y Terra, y en mejoras de velocidad de procesamiento de la API para Sol
- Luna, el modelo más rápido y económico, baja 80%, mientras que Terra, el modelo equilibrado para tareas cotidianas, baja 20%
- En las suscripciones pagas de Codex y ChatGPT Work, el uso de ambos modelos también se contabilizará con menos créditos
- El precio de las suscripciones y los presupuestos de asignación no cambian
- Luna puede usar herramientas para completar flujos de trabajo de varios pasos, reduciendo el costo operativo de tareas masivas que requieren alta calidad
- El precio de Sol no cambia
Elegir el modelo según el resultado de la tarea
- Para usar IA de forma eficiente, hay que equilibrar inteligencia, velocidad, confiabilidad y costo según la importancia, el costo de error, la urgencia y la escala de la tarea
- Incluso dentro de un mismo flujo de trabajo, el punto óptimo puede variar en cada etapa
- Luna ofrece un rendimiento similar al de un modelo que era de vanguardia hace un año por alrededor del 6% del costo por tarea y con casi 9 veces más velocidad
- En Agents’ Last Exam, que mide tareas profesionales, supera a Fable 5 y reduce el costo estimado por tarea en alrededor de 99%
- Las empresas pueden definir primero los resultados y estándares de calidad necesarios, y luego usar evaluaciones para distinguir dónde la inteligencia adicional mejora sustancialmente los resultados y dónde el procesamiento de bajo costo logra la misma calidad
- En flujos de trabajo de programación, Sol resuelve la incertidumbre y establece el plan
- Luna puede encargarse de implementar cambios claramente definidos, escribir y ejecutar pruebas, y evaluar resultados
- La familia GPT‑5.6 amplía las opciones para aplicar la inteligencia necesaria en cada etapa y pagar costos acordes con el valor generado
Mejoras de eficiencia desde el modelo hasta los agentes
- Las mejoras de eficiencia se logran en conjunto en el modelo, el sistema de inferencia que lo ejecuta y el arnés de agentes que conecta herramientas y contexto
- Los modelos GPT‑5.6 procesan las tareas por rutas más directas
- Un enrutamiento mejorado aumenta la utilización del hardware
- El software de producción optimizado genera tokens con mayor eficiencia
- Una mejor gestión del contexto ayuda a que los agentes no repitan trabajo ya completado
- Con los mismos recursos de cómputo se completa más trabajo útil, reduciendo el tiempo, los tokens y el costo por resultado
Optimización adicional asistida por Sol
- En un proceso dirigido por personas, GPT‑5.6 Sol reescribió y optimizó de forma autónoma kernels de producción
- Diseñó y ejecutó cientos de experimentos para mejorar la generación de tokens, supervisó el aprendizaje e intervino cuando surgieron problemas
- El trabajo en kernels redujo el costo de extremo a extremo de ofrecer el modelo en 20%, y los experimentos mejoraron la eficiencia de generación de tokens en más de 15%
- A medida que aumentan el rendimiento y la autonomía de los modelos, se forma un ciclo de retroalimentación que acelera la búsqueda de nuevas mejoras de eficiencia
- El proceso de ingeniería relacionado puede consultarse en Introducción a las mejoras de eficiencia de GPT‑5.6
Estrategia de cómputo para respaldar la escalabilidad
- Para satisfacer una demanda abundante de inteligencia se necesitan no solo más recursos de cómputo, sino también cómputo de alta productividad
- OpenAI construye un portafolio de infraestructura resiliente y asigna cada carga de trabajo al sistema más adecuado para ejecutarla
- La reducción de precios de Luna y Terra permite operar tareas masivas de forma económica a mayor escala
- Fast mode ofrece acceso más rápido a la API para tareas de Sol donde el tiempo de respuesta es importante
- Aumenta la viabilidad económica de operar ampliamente análisis de documentos a gran escala, clasificación de interacciones con clientes y tareas repetitivas de implementación
- Las cargas de trabajo complejas de Sol pueden procesarse más rápido cuando la velocidad es lo bastante importante como para justificar el costo adicional
- Modelos más potentes ayudan a los equipos técnicos con mejoras posteriores, acortando el tiempo necesario para aumentar el rendimiento y reducir costos
Funcionamiento y compatibilidad de Fast mode
- El Fast mode de la API reemplaza a Priority Processing y corresponde a
/fasten Codex - En GPT‑5.6 Sol, ofrece hasta 2.5 veces más velocidad que el procesamiento Standard al doble de precio, sin cambiar el nivel de inteligencia
- Mantiene compatibilidad hacia atrás, por lo que las solicitudes existentes a la API con la etiqueta
priorityseguirán funcionando
Disponibilidad y precios de la API
- GPT‑5.6 Terra y Luna siguen disponibles en ChatGPT Work, Codex y OpenAI API
- Los usuarios Free y Go de ChatGPT Work y Codex pueden acceder a Terra
- Los usuarios Plus, Pro, Business y Enterprise pueden elegir Terra y Luna
- Desde el 30 de julio, los precios de la API por cada millón de tokens son los siguientes
- Terra: entrada $2, salida $12
- Luna: entrada $0.20, salida $1.20
- Los precios de suscripción y los presupuestos de asignación de ChatGPT y Codex se mantienen, pero se reducen los créditos consumidos al usar Terra y Luna
- En AWS, el cambio de precios se aplicará gradualmente desde más tarde el 30 de julio
- Los precios completos pueden consultarse en precios de la API
1 comentarios
Comentarios en Hacker News
La frase de John Wanamaker, “la mitad del gasto en publicidad se desperdicia, pero no sé cuál mitad”, aplica mejor a la selección de modelos. Sabemos que la mayoría de las tareas no necesitan un modelo potente, pero distinguir entre tareas simples y difíciles es en sí un problema complicado y quizá imposible de decidir
HN podría operar como un BBS incluso con hardware de los años 70, pero en la práctica hacemos básicamente lo mismo con una CPU de unos 10 mil millones de transistores en vez de una de unas 10 mil, y ni siquiera lo pensamos
Me deja sin palabras eso de “desde hoy reducimos en 80% el costo de GPT‑5.6 Luna, nuestro modelo más rápido y barato”. Pensaba que habíamos entrado en una etapa de estancamiento con mejoras de 5–10% a lo largo de varios meses, pero con un cambio tan brusco ahora me pregunto dónde está el piso del precio
Los clústeres dinámicos de GPU se usarán para el 5% restante y para expandir la frontera, y también empezarán a resolverse nuevas tareas que hoy son demasiado difíciles para la mayoría de los trabajadores del conocimiento
Si de verdad hubo una mejora de eficiencia, seguramente hubo compensaciones como cuantización agresiva o compresión de caché KV que degradan la calidad
A medida que los tokens se vuelvan más rápidos y baratos cada año, se volverán viables las fábricas de IA que imitan equipos de especialistas y una paralelización mucho mayor
Sorprende que hayan hecho 5 veces más barato a Luna, que ya era barato y rendía bien. En el trabajo uso Sol y en casa Luna; la diferencia existe, pero no es abrumadora. Después de que los precios subieran durante un año, con Luna, Kimi K3 y GLM 5.2 da la impresión de que vuelven a bajar
OpenAI y Anthropic también subieron precios durante varios meses, y ahora un laboratorio estadounidense los recortó con fuerza, así que parece más bien la tendencia opuesta
Dicen que “con trabajo a nivel kernel redujimos en 20% el costo extremo a extremo de servir el modelo, y mediante experimentación aumentamos la eficiencia de generación de tokens en más de 15%”. Si el costo de servir GPT-5.6 bajó 20%, me pregunto si eso equivale a ahorrar decenas de miles de millones de dólares al mes
Según los documentos del IPO de SpaceX, Anthropic gastó 1,250 millones de dólares en alquilar capacidad de inferencia de dos centros de datos Colossus, pero considerando la capacidad existente en AWS y otros, no se sabe qué parte representa del total. Es probable que el costo mensual de inferencia de OpenAI también esté en miles de millones, así que una reducción de 20% sería un cambio enorme
Este cambio se siente como la transición de acceso telefónico a banda ancha. Ya recomendaba mucho Luna para investigación profunda, y poder ejecutarlo 5 veces más por el mismo costo es enorme
Incluso ahora ejecuto 10 agentes en paralelo para generar hipótesis, y 50 es difícil de imaginar. Si el costo de correr decenas de veces el mismo prompt y el mismo modelo sigue siendo bajo, la estadística se vuelve mucho más interesante y potente
El nuevo precio de Luna no era esperado, y no parece haber nada en el mercado que compita con esta relación precio-rendimiento
En apps de producción, OpenAI ahora es claramente el mejor proveedor. La API es estable, tiene muchas funciones y además ofrece gran precio-rendimiento en toda la línea de modelos. Durante mucho tiempo usé modelos de pesos abiertos como Kimi K2.5 en Fireworks, pero había problemas intermitentes, y con Anthropic y Google pasaba lo mismo. OpenAI es rápido y ofrece mejor precio-rendimiento en casi todos los niveles de inteligencia
Normalmente reviso la gráfica de precio-rendimiento de OpenRouter y activo
"Show Pareto"a la derecha. En proyectos personales todavía usaba GLM-5.2, pero ahora Luna se vuelve la opción fácilLa rebaja de 80% en el precio de Luna es muy agresiva. Para la mayoría de las tareas que no requieren inteligencia de frontera, es una opción abrumadoramente buena, y a veces Luna se compara con Opus 5
xhighde Sol ymaxde Luna. Sol entendía mejor el prompt, y con Luna había que dar instrucciones más específicas y clarasYa prepagé muchos tokens de DeepSeek v4 flash, y cuando los termine me gustaría probar comprar tokens de Luna por un tiempo. Prefiero modelos baratos y rápidos, y como ya estoy retirado no me molesta perder algo de tiempo cambiando manualmente a un modelo más fuerte de vez en cuando
Sorprende que Luna se haya vuelto 80% más barato. Como los costos de cómputo siguen bajando, el próximo año el uso del API de modelos potentes podría volverse más barato que una suscripción