Anthropic presentó Claude Opus 5 el 24 de julio de 2026. Se posiciona como un modelo con una mejora de “cambio generacional” para el nivel Opus, cuyo punto clave es ofrecer una inteligencia cercana a Fable 5 (modelo frontier) a la mitad del precio.
Resumen clave
- Posicionamiento: se acerca a la inteligencia de nivel frontier de Fable 5, pero a la mitad del precio. Fue designado como el nuevo modelo predeterminado de Claude Max y el modelo más potente disponible en Claude Pro.
- Benchmarks: alcanza nuevos SOTA en evaluaciones de coding y trabajo de conocimiento como Frontier-Bench y GDPval-AA. Sin embargo, en tareas de ciberseguridad aún queda por detrás de Mythos 5 (el modelo de más alto nivel de Anthropic).
- Rendimiento en coding: obtiene el mejor rendimiento entre todos los modelos en Frontier-Bench v0.1, con una mejora de más del doble frente a Opus 4.8 (con menor costo). En la configuración de máxima eficiencia de CursorBench, logra quedar a menos de 0.5% del puntaje máximo de Fable 5 a la mitad del costo.
- Trabajo de conocimiento/resolución de problemas: en ARC-AGI 3 obtiene un puntaje 3 veces mayor que el modelo siguiente; en Zapier AutomationBench logra una tasa de aprobación de aproximadamente 1.5 veces la del segundo lugar; y en OSWorld 2.0 (benchmark de uso de computadoras) supera el récord máximo de Fable 5 con un costo cercano a un tercio.
- Investigación científica: mejora frente a Opus 4.8 en todas las evaluaciones de ciencias de la vida. En química orgánica (inferir estructuras moleculares a partir de datos espectroscópicos) sube +10.2 puntos porcentuales, y en predicción de función a partir de secuencias de proteínas, +7.7 puntos porcentuales.
- Estilo de trabajo: se reforzaron mucho sus capacidades de autoverificación e iteración. Se presentan casos como reconstruir por código un modelo CAD 3D solo a partir de planos, sin información visual, o encontrar y corregir la causa raíz que un parche de la comunidad había pasado por alto.
- Alineamiento (Alignment): en auditorías internas de comportamiento fue evaluado como el modelo más alineado hasta la fecha. Tiene una menor tasa de comportamiento engañoso que Opus 4.8, Sonnet 5 y Fable 5, y también alcanza un nivel máximo en evitar acciones riesgosas irreversibles.
- Seguridad: en biología y ciberseguridad ofensiva queda por detrás de Mythos 5. La “detección” de vulnerabilidades está a un nivel similar al de Mythos 5, pero su capacidad de “desarrollo de exploits” es mucho menor (resultado de excluir deliberadamente el entrenamiento en tareas cyber).
- Salvaguardas: la intervención del clasificador cyber es aproximadamente 85% menor que en Fable 5. Permite detectar vulnerabilidades en código fuente, pero bloquea el escaneo basado en binarios, las pruebas de penetración y la generación de exploits. Las solicitudes relacionadas con biología que antes se bloqueaban en Fable 5 ahora se enrutan a Opus 5.
Precio y disponibilidad
- Disponible desde hoy en todas las plataformas; en la API es
claude-opus-5 - Precio: entrada a $5 / salida a $25 por millón de tokens (igual que Opus 4.8)
- Incluye modo Fast (aprox. 2.5 veces más rápido que el predeterminado, con precio 2 veces mayor)
- Sin requisitos de retención de datos (para uso general)
2 betas lanzadas en simultáneo
- Cambio de herramientas durante la conversación: permite cambiar las herramientas disponibles en medio de una conversación sin invalidar la caché del prompt
- Fallback automático: enruta automáticamente a otro modelo las solicitudes marcadas por el clasificador de seguridad (por defecto, usa el mejor modelo disponible en lugar de bloquear)
Resumen adicional de GN⁺
Neo lo resumió adicionalmente con base en el texto original
- Ofrece inteligencia cercana a Fable 5 a la mitad del costo por tarea, y se ofrece como modelo predeterminado de Claude Max y modelo de mayor rendimiento de Claude Pro
- Registra niveles máximos en evaluaciones de coding y trabajo de conocimiento como Frontier-Bench y GDPval-AA, y su puntaje en ARC-AGI 3 llega a triplicar al del modelo siguiente
- Verifica sus tareas por sí mismo e itera hasta tener éxito, construyendo pipelines de computer vision, corrigiendo causas raíz de bugs open source e implementando feeds de datos de mercado y test harnesses
- Cuesta $5 por millón de tokens de entrada y $25 por millón de tokens de salida, igual que Opus 4.8; el Fast mode, unas 2.5 veces más rápido, se ofrece al doble del precio base
- Sus capacidades peligrosas de doble uso son menores que las de Mythos 5; permite encontrar vulnerabilidades, pero bloquea escaneo de binarios, pruebas de penetración y generación de exploits, y puede aplicar sustitución automática por Opus 4.8 a solicitudes marcadas
Rendimiento y eficiencia de costos
- Claude Opus 5 ofrece mayor rendimiento al mismo precio que Opus 4.8, su modelo anterior
- Ajustando la configuración de effort, se puede priorizar la inteligencia o elegir ejecuciones más rápidas y económicas que ahorren tokens
- Es el modelo predeterminado de Claude Max y se ofrece como el modelo más potente en Claude Pro
- En Frontier-Bench v0.1 superó a todos los demás modelos y excedió por más del doble el rendimiento de Opus 4.8 con menor costo por tarea
- Son resultados de ejecuciones internas medidos por recompensa promedio de 5 intentos por tarea con el harness mini-SWE-agent y backend GKE
- Para las solicitudes que Opus 5 y Fable 5 rechazaron por el clasificador de seguridad, se usó Opus 4.8 como modelo sustituto
- En max effort de CursorBench 3.2, queda a menos de 0.5% del puntaje máximo de Fable 5, con la mitad del costo por tarea
- En high, xhigh y max effort, registró mayor rendimiento que todos los demás modelos bajo el mismo criterio de costo
- También muestra alta eficiencia de costos en evaluaciones de trabajo de conocimiento y resolución de problemas
- En ARC-AGI 3, su puntaje al resolver problemas nuevos triplica al del modelo siguiente
- En Zapier AutomationBench, su tasa de aprobación al mismo costo por tarea es aproximadamente 1.5 veces la del segundo lugar, e incluso con el effort mínimo aprueba más tareas que todos los demás modelos
- En OSWorld 2.0, superó a otros modelos en todos los rangos de costo y rebasó el mejor resultado de Fable 5 con un costo apenas superior a un tercio
Investigación científica y resultados visuales
- En todas las evaluaciones de ciencias de la vida, incluidas biología estructural, química orgánica y bioinformática, registró mejor rendimiento que Opus 4.8
- En un benchmark interno de química orgánica para inferir estructuras moleculares a partir de datos espectroscópicos, fue 10.2 puntos porcentuales superior
- En la tarea de predecir cómo afectan las variaciones de secuencia de proteínas a su función, fue 7.7 puntos porcentuales superior
- Puede generar resultados visuales mucho más sólidos que los modelos anteriores
Verificación de tareas e iteración autónoma
- Se reforzó su capacidad para verificar directamente los resultados e iterar con cuidado hasta tener éxito
- En una tarea de FreeCAD de Frontier-Bench, bajo condiciones en las que no podía ver directamente el plano de una pieza mecánica, escribió su propio pipeline de computer vision, extrajo la geometría a partir de píxeles sin procesar y reconstruyó la pieza 3D
- Lo logró después de varias iteraciones, mientras que los modelos competidores no pudieron resolverlo ni después de 5 intentos bajo las mismas condiciones
- En un bug real de un gestor de paquetes open source muy usado, encontró la causa raíz y corrigió incluso casos límite que el parche de la comunidad había pasado por alto
- Los modelos competidores solo corrigieron el síntoma superficial y luego determinaron que el bug estaba resuelto
- Un ingeniero de una firma de trading construyó en una sola sesión un feed de datos de mercado para una nueva bolsa
- Los modelos anteriores no podían completar la tarea aunque el ingeniero les diera un plan detallado
- Al no tener un feed en tiempo real para validar, creó su propio test harness para comprobar si parseaba correctamente los datos de la bolsa
Evaluaciones iniciales de usuarios en coding y agentes
- En FrontierCode 1.1 de Devin, se acercó al nivel de Fable con la mitad del costo y mostró fortalezas en depuración difícil y análisis de causa raíz
- En CursorBench quedó ligeramente por debajo de Fable 5, con características de comportamiento similares, y ofrece inteligencia cercana a Fable 5 con la velocidad y el costo de Opus
- En Zapier AutomationBench quedó primero sin usar más tokens que los modelos Claude anteriores
- En un workbook de estado de cuentas, ejecutó hasta el final el procedimiento de prevención de churn: identificación de clientes en riesgo, notificación a responsables y resumen para la organización de retención, logrando 100% de aprobación
- En análisis genómico, descartó factores de confusión mediante pruebas estadísticas adecuadas, validó los resultados con métodos independientes y sostuvo análisis largos de múltiples pasos
- En evaluaciones internas de Lovable, las tareas de coding con agentes más difíciles mejoraron 22% frente a Opus 4.7, y también se redujo la variación entre ejecuciones
- En la construcción de la misma app full-stack, generó los mejores trabajos de animación, juegos y 3D dentro de la familia Opus, y fue evaluado como la mayor mejora desde Opus 4.5
- En análisis abierto, cuanto más difíciles y ambiguas eran las tareas, mayor fue la mejora frente a Opus 4.8; las respuestas se volvieron más claras y concisas, y también mejoró la eficiencia en effort alto
- Al administrar entornos de desarrollo, creó sus propios monitores y manipuló cada entorno, pidiendo ayuda solo en asuntos que requerían juicio humano
- En la base de código de Fundamental Research Assistant, realizó cambios a gran escala siguiendo feedback y procesó en un solo flujo de agente tareas que normalmente se dividirían en varias partes
- En evaluaciones de frontend, abrió directamente páginas en anchos de escritorio y celular para encontrar y corregir productos ocultos debajo de la pantalla móvil y botones de pago fuera de pantalla
- Antes de entregar un PR, verificó rama, template e impacto en tests, y no se apresuró a publicar antes de validar, como modelos anteriores
- En un proceso de rediseño, distinguió las ventajas del diseño propuesto de un único punto conflictivo y propuso una solución de compromiso que corregía defectos manteniendo los beneficios
- En cambios de código, produjo diffs concisos sin código muerto, detectó mejor riesgos sutiles específicos de la base de código y fue adoptado para cargas de trabajo de producción
- Varios casos de uso y revisiones de código de Cosmos, plataforma integrada de agentes, se migrarán a Opus 5
- En evaluaciones de JetBrains, revisó más a fondo antes de escribir código, encontró errores lógicos durante la planificación y juzgó no solo si la respuesta funcionaba, sino también si funcionaba por las razones correctas
- En benchmarks de trading, registró el mayor rendimiento dentro de la familia Opus, reduciendo los tokens de razonamiento a cerca de un séptimo frente a Opus 4.8 y la latencia a menos de la mitad
Evaluaciones empresariales y de trabajo profesional
- En investigación financiera mejoró frente a Opus 4.8 en razonamiento numérico, trabajo con tablas y pensamiento crítico preciso
- En evaluaciones internas de Box, el rendimiento de análisis de contenido empresarial especializado fue 8% superior a Opus 4.8
- Los flujos de trabajo de análisis de datos mejoraron 11%, y la debida diligencia, 17%
- Se enfocó en tareas usadas por sectores de tecnología, salud y gobierno
- En modelado financiero difícil, la precisión aumentó en promedio 9 puntos porcentuales a lo largo de los distintos effort, los turnos de conversación y llamadas a herramientas se redujeron un tercio, y el tiempo requerido disminuyó 60%
- En tareas de agentes legales, destacaron las mejoras en gobierno corporativo y arbitraje
- Mantuvo calidad similar usando en promedio 26% menos tokens que Opus 4.8 con max reasoning
- En modificaciones de contratos al primer intento, obtuvo el puntaje más alto entre los modelos probados y casi duplicó a Opus 4.8
- También completó modificaciones de NDA con menos tiempo e iteraciones, manteniendo o aumentando la precisión
- En tareas largas, mejoró su capacidad para crear una presentación completa y luego revisarla, con mejores resultados también en comprensión visual, formato y errores en diapositivas
Alineamiento y capacidades de riesgo
- En auditorías automáticas de comportamiento previas al despliegue, Opus 5 mostró el nivel de alineamiento más alto entre los modelos de Anthropic
- Cumple mejor la constitución de Claude que Opus 4.8, Sonnet 5 y Fable 5
- Tiene la menor tasa de comportamiento engañoso y la menor vulnerabilidad ante inducción de uso indebido
- También es el que mejor evita acciones imprudentes que podrían causar efectos secundarios difíciles de revertir
- No elevó la frontera de capacidades peligrosas de doble uso y, en evaluaciones realizadas con socios civiles y gubernamentales, mostró menor rendimiento que Mythos 5 tanto en investigación biológica como en ciberseguridad ofensiva
- La evaluación detallada se puede consultar en la System Card
- Al igual que Opus 4.8, no fue entrenado deliberadamente en tareas cyber, pero con la mejora de capacidades generales su rendimiento relacionado también creció considerablemente
- La detección de vulnerabilidades se acerca a Mythos 5
- El desarrollo de exploits, que convierte vulnerabilidades encontradas en amenazas reales, queda muy por detrás de Mythos 5
- En la evaluación OSS-Fuzz, Opus 5 y Mythos 5 encontraron vulnerabilidades con tasas de éxito similares, pero el puntaje de desarrollo de exploits de Opus 5 fue mucho menor
Salvaguardas de ciberseguridad y biología
- Las salvaguardas están diseñadas para permitir usos beneficiosos de ciberseguridad y biología, y son similares a las de Opus 4.8 salvo por restricciones más fuertes agregadas a un conjunto estrecho de tareas cyber
- El clasificador cyber es relativamente menos restrictivo que el de Fable 5
- Permite descubrir vulnerabilidades en código fuente
- Bloquea escaneo de vulnerabilidades basado en binarios, pruebas de penetración y generación de exploits, actividades con alta probabilidad de estar vinculadas a actores maliciosos
- En las pruebas de Anthropic, se espera que haya aproximadamente 85% menos intervenciones del clasificador que con Fable 5
- En Claude.ai, Claude Code y Claude Cowork, las solicitudes marcadas se sustituyen por defecto por Opus 4.8; esto también se puede activar en la API
- Las empresas e investigadores que participan en el Cyber Verification Program pueden usar de inmediato Opus 5 con menos restricciones de seguridad
- En biología, mantiene salvaguardas similares a Opus 4.8 y se convierte en el modelo de investigación científica más potente entre los disponibles de forma general
- Aún tiene limitaciones importantes para investigación autónoma de larga duración, y Mythos 5 es más fuerte en este tipo de tareas biológicas
- Las solicitudes de biología bloqueadas en Fable 5 ahora se envían a Opus 5 en lugar de Opus 4.8
Precio y funciones para desarrolladores
- Está disponible en todas las plataformas, y el identificador del modelo en la Claude API es
claude-opus-5- $5 por millón de tokens de entrada y $25 por millón de tokens de salida, igual que Opus 4.8
- El acceso general no tiene requisitos de retención de datos, al igual que los modelos Opus anteriores
- Fast mode se ejecuta a aproximadamente 2.5 veces la velocidad predeterminada
- En Claude Platform cuesta el doble del precio base, y en Claude Code se ofrece mediante créditos de uso
- La beta de cambio de herramientas durante la conversación en Claude Platform permite cambiar las herramientas que Claude puede usar durante una conversación sin invalidar la caché del prompt
- Al activar el beta de sustitución automática en la API, las solicitudes a Opus 5 o Fable 5 marcadas por el clasificador de seguridad se envían automáticamente a otro modelo
- En lugar de bloquear la solicitud, por defecto la enruta al mejor modelo disponible
- Las formas de usar el modelo se pueden consultar en la guía de prompting de Opus 5
1 comentarios
Opiniones de Hacker News
Lo clave aquí no es tanto el rendimiento absoluto, sino que las organizaciones ahora pueden usar un modelo de nivel Fable sin la obligación de retener datos durante 30 días.
Opus 5, como el Opus anterior, no tiene requisitos de retención de datos para el acceso general, y la razón por la que Fable no tiene una puntuación ARC-AGI también es esta política de retención.
https://support.claude.com/en/articles/15425996-data-retenti..., https://www.anthropic.com/news/claude-opus-5, https://xcancel.com/arcprize/status/2064399134099153344
También es bueno que Fable 5 se mantenga solo con créditos, y parece probable que en adelante los modelos de gama más alta queden detrás de APIs de pago por uso o créditos, mientras otros modelos se complementan con suscripciones mensuales.
Entonces la información se guarda en algún lado, así que cuesta entender la forma en que se retienen los datos.
Actualmente estoy probando la conversión de imagen a HTML; hasta ahora Fable era el mejor, y Gemini 3.1 Pro sorprendentemente quedaba segundo.
Opus 5 sigue el diseño original con más precisión que Fable: implementa los botones como rectángulos redondeados en vez de tipo píldora, y las imágenes generadas también se acercan más al original.
Original: https://image.non.io/73e239a3-880f-4793-b65f-4810be2d9378.we...
Opus 5: https://html.non.io/solaraOpus/
Fable 5: https://html.non.io/solara/
El comportamiento responsive quedó desalineado, pero se siente como que llegó a alrededor del 90% de un producto terminado.
Original: https://image.non.io/9d5fed20-b476-49d3-841b-37eb553fb88e.we...
Opus 5: https://html.non.io/neonRamen/
Inkling no fue muy bueno: https://cdn-uploads.huggingface.co/production/uploads/608b8b...
Kimi 2.7, el predecesor del Kimi3 más reciente, lo hizo muy bien: https://cdn-uploads.huggingface.co/production/uploads/608b8b...
Entorno de prueba: https://huggingface.co/spaces/abidlabs/vlm-screenshot-to-web...
Sería más útil verificar qué tan bien traslada el diseño humano sin deformarlo.
Al ver tantos lanzamientos, no sorprende que el enrutamiento de modelos sea también una de las áreas de más rápido crecimiento en IA.
En más de 10 empresas existen modelos de distintas modalidades y tamaños, niveles de razonamiento, modos agente·Pro·alta velocidad, ejecuciones estándar·flexibles·por lotes, y distintos precios para tokens de entrada·salida·caché.
Las empresas que envían los prompts a la combinación más adecuada y económica están capturando mucho valor en el vacío que los desarrolladores de modelos están ignorando.
Es una repetición de la Bitter Lesson, y parece que las empresas líderes terminarán ofreciendo esta función directamente.
Como la mayoría del trabajo de oficina no requiere una AGI superpotente, el tráfico se dirige a modelos baratos, pero los laboratorios líderes se posicionan como si solo ellos pudieran ofrecer tanto una AGI poderosa como el reemplazo de empleados de oficina.
El enrutamiento hacia modelos de bajo costo podría abrir un agujero grande en esa narrativa.
Para cualquier tarea, es difícil aceptar algo que no sea el modelo más reciente y de mayor rendimiento, y la única regla necesaria es elegir el modelo más potente que aún tenga cuota disponible en el plan fijo.
A cambio de ahorrar costos, hay que aceptar bugs cuya gravedad y frecuencia no se pueden medir, y tampoco se sabe cuánto vale el seguro de dejar todo el razonamiento en manos de un modelo de primer nivel ni cuánto costará corregirlo después.
A nivel de proyecto, tampoco hay forma de probar cuánto habría cambiado el código si se hubiera usado otro modelo.
Si no quieres leer un PDF de unas 190 páginas, existe esta entrada de blog: https://www.anthropic.com/news/claude-opus-5
Al comparar el estilo de escritura de Opus 5 y Fable 5, Opus 5 sigue usando, como 4.8, las expresiones características de Claude de las que Fable se había apartado.
Como se repiten expresiones como “carry the argument”, “worth stating plainly”, “and the trap”, “The X matters more” y “move”, hace falta un benchmark de “inglés irritante”.
Fable 5 Max: https://gist.github.com/deet/3d97f854b48eac6658d642fa18bb24d...
Opus 5 Max: https://gist.github.com/deet/1a43693a732dfccb4d0d914bfc42692...
El estilo característico de Claude parece provenir en parte de su tendencia a hacer avanzar la conversación o la tarea de forma “proactiva”, y también sería útil un benchmark que cuantifique el rango de estilos por prompt.
El 55.7% de Anthropic y el ~21% del paper de OSWorld 2.0 eran métricas distintas.
Opus 4.8 completó con éxito total alrededor de 1 de cada 5 tareas, registrando una tasa de finalización de 20.6%, y en el resto obtuvo puntajes parciales, logrando un puntaje parcial de 54.8%.
Aun así, estas diferencias de métricas hacen dudar de si se pueden comparar benchmarks entre papers dentro de un margen de error razonable: https://arxiv.org/pdf/2606.29537
Los creadores de benchmarks prefieren cifras bajas que muestren margen de mejora, y los creadores de modelos prefieren cifras altas que destaquen capacidades, pero el 55.7% de Anthropic y el 54.8% del paper son, en la práctica, el mismo resultado.
Decir que “Opus 5 no supera en general a Fable 5” y luego enumerar en el blog que es mejor en la mayoría de los benchmarks vuelve confusa la comunicación.
La system card también indica que su capacidad de I+D en IA es similar a Claude Mythos 5, considerado Fable sin restricciones.
Opus 5 no aprendió explotación de vulnerabilidades de software, así que su capacidad de descubrimiento se acerca a Mythos 5, pero su capacidad de explotación para convertirse en una amenaza cibernética real queda muy por detrás.
Incluso un modelo que parece muy superior a Fable se lanzó sin mayor problema porque no hubo la promoción apocalíptica de Anthropic.
En teoría, según los criterios de Anthropic, debería estar al nivel de AGI, pero la realidad es que no es más que un viernes cualquiera.
Estos modelos están fuertemente protegidos, y dijeron que Mythos, sin salvaguardas, no pudo lanzarse por eso.
Fue parecido a cuando OpenAI anunció que un modelo sin salvaguardas había ingresado a servidores de HuggingFace.
Aunque GPT-6 salga en verano, ya casi nadie espera AGI, así que me da curiosidad cómo mantendrán el ciclo de exageración.
El caso promocional de que Opus 5 creó en una sola sesión un feed de datos de mercado y una herramienta de validación para una nueva bolsa resulta, curiosamente, un proyecto que se suele asignar a pasantes en empresas de trading.
Me pregunto por qué en el gráfico de Frontier Code la eficiencia por tarea del modo de pensamiento medio es abrumadoramente mayor, y por qué al aumentar la cantidad de razonamiento los resultados de la evaluación empeoran mucho.
Puede haber una ligera caída en el nivel máximo, pero este grado es inusual: https://imgur.com/a/Nv8V7Ry
Subjetivamente, en tramos de uso de 5 horas, el Opus 4.8 Medium de hoy y el Opus 5 Medium posterior al anuncio se sienten más eficientes que el Opus 4.8 de la semana pasada.
Si se usa más con prompts que como agente, se ven estos límites, y es posible que el nivel medio esté mejor equilibrado.
Me pregunto si pensar demasiado es malo, pero pensar muchísimo más vuelve a ser bueno.