- Entre los 170 modelos evaluados, Claude Opus 5 Adaptive Reasoning·Max Effort obtuvo el primer lugar con 61 puntos en el Intelligence Index, seguido por Xhigh Effort y Claude Fable 5, ambos con 60 puntos
- Intelligence Index v4.1 combina 9 evaluaciones que cubren tareas de agentes, programación, razonamiento científico, confiabilidad del conocimiento y razonamiento de contexto largo, e incorpora al rendimiento el tiempo de pensamiento extendido de los modelos de razonamiento
- En velocidad de salida, Mercury 2 es el más rápido con 901.6 tokens/s; la latencia del primer token más baja es la de Gemini 2.5 Flash-Lite, con 0.34 segundos; y Llama 4 Scout ofrece una ventana de contexto máxima de 10M de tokens
- Los precios se comparan no solo por el costo unitario por token, sino también por el costo por tarea, ponderando tokens de entrada, aciertos de caché, escritura en caché, razonamiento y respuesta; los costos de escritura y almacenamiento de caché varían según el proveedor
- Entre los modelos de pesos abiertos, GLM-5.2 (max) es el más alto con 51 puntos, pero queda 10 puntos por debajo del líder general, por lo que al elegir un modelo hay que considerar, además de la inteligencia, el costo, la velocidad, la latencia y la ventana de contexto
Ranking de inteligencia de Claude Opus 5
- Claude Opus 5 (Adaptive Reasoning, Max Effort) ocupa el primer lugar entre los 170 modelos evaluados, con 61 puntos en el Intelligence Index
- Los 5 modelos principales son los siguientes
- Claude Opus 5 (Adaptive Reasoning, Max Effort): 61 puntos
- Claude Opus 5 (Adaptive Reasoning, Xhigh Effort): 60 puntos
- Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback): 60 puntos
- GPT-5.6 Sol (max): 59 puntos
- Claude Opus 5 (Adaptive Reasoning, High Effort): 59 puntos
- La configuración Max Effort también ocupa el primer lugar entre 126 modelos de razonamiento; estos modelos realizan pensamiento extendido para procesar problemas complejos antes de responder
Composición de las evaluaciones del Intelligence Index v4.1
- Intelligence Index v4.1 combina las siguientes 9 evaluaciones
- GDPval-AA v2: trabajo real basado en agentes
- 𝜏³-Banking: uso de herramientas por agentes
- Terminal-Bench v2.1: programación con agentes y uso de terminal
- SciCode: programación
- Humanity's Last Exam: razonamiento y conocimiento
- GPQA Diamond: razonamiento científico
- CritPt: razonamiento de física
- AA-Omniscience: precisión del conocimiento y tasa de no alucinación
- AA-LCR: razonamiento de contexto largo
- Según el caso de uso, los resultados de evaluaciones específicas pueden ser más importantes que el puntaje general de inteligencia
- Entre las evaluaciones separadas también se incluyen los siguientes benchmarks
- AA-Briefcase: trabajo de conocimiento con agentes
- AutomationBench-AA: flujos de trabajo SaaS con agentes
- Harvey LAB-AA: trabajo legal con agentes
- EnterpriseOps-Gym-AA: operaciones de negocio con agentes
- IFBench: seguimiento de instrucciones
- APEX-Agents-AA: tareas de agentes de largo plazo
- ITBench-AA: análisis de causa raíz de incidentes en Kubernetes
- MMMU-Pro: razonamiento visual
Métricas de trabajo de conocimiento, confiabilidad y apertura
- AA-Briefcase Elo combina Elo de calidad de análisis, Elo de presentación y tasa de cumplimiento de criterios de evaluación
- La tasa de cumplimiento se convierte a Elo mediante enfrentamientos sintéticos uno a uno
- El Elo y los límites del intervalo de confianza del 95% se restringen para que no sean menores que 0
- AA-Omniscience Index mide la confiabilidad del conocimiento y las alucinaciones con un puntaje de -100 a 100
- Recompensa las respuestas correctas y penaliza las alucinaciones, pero no penaliza negarse a responder
- 0 puntos significa que hay la misma cantidad de respuestas correctas e incorrectas; un valor negativo significa que hay más respuestas incorrectas que correctas
- El Openness Index evalúa la apertura del modelo con un puntaje normalizado de 0 a 100; cuanto más alto, más abierto
- Se distingue si los pesos están publicados, y los modelos cuyos pesos están publicados pero requieren una licencia paga u otra condición para uso comercial se marcan como
Commercial Use Restricted
Ranking de modelos de pesos abiertos
- De los 170 modelos evaluados, 94 son modelos de pesos abiertos
- Los primeros lugares del Intelligence Index entre modelos de pesos abiertos son los siguientes
- GLM-5.2 (max): 51 puntos
- MiniMax-M3: 44 puntos
- DeepSeek V4 Pro (Reasoning, Max Effort): 44 puntos
- GLM-5.2 (max) registró el puntaje más alto entre los modelos de pesos abiertos
Velocidad de salida y tiempo de procesamiento por tarea
- Mercury 2 tiene la mayor velocidad de salida, con 901.6 tokens/s
- Gemini 3.5 Flash-Lite: 435.1 tokens/s
- HyperNova 60B 2605: 427.6 tokens/s
- Granite 4.0 H Small también aparece entre los primeros lugares
- La velocidad de salida es la cantidad de tokens por segundo recibidos mientras el modelo genera tokens, después de recibir el primer fragmento en modelos con streaming
- El tiempo por tarea del Intelligence Index se calcula dividiendo la cantidad de tokens de salida por tarea entre la velocidad de salida y aplicando el peso relativo de cada benchmark
- Se excluyen el tiempo hasta el primer token (TTFT) y otros overheads
- Si existe una API propia, se usa el rendimiento de esa API; si no hay una API propia, como en Meta Llama, se usa la mediana de varios proveedores
Latencia y tiempo de respuesta de extremo a extremo
- El modelo con menor tiempo hasta el primer token de respuesta es Gemini 2.5 Flash-Lite (Non-reasoning), con 0.34 segundos
- Command A+: 0.42 segundos
- North Mini Code: 0.49 segundos
- Gemini 2.5 Flash también se incluye entre los modelos de baja latencia
- La latencia del primer token es el tiempo que transcurre desde la solicitud a la API hasta recibir el primer token de respuesta
- En modelos de razonamiento, también incluye el tiempo de pensamiento previo a la respuesta
- En modelos que no admiten streaming, se aplica el tiempo hasta recibir la respuesta completa
- El tiempo de respuesta de extremo a extremo para 500 tokens suma los siguientes elementos
- El tiempo de entrada hasta recibir el primer token de respuesta
- El tiempo de pensamiento que usan los modelos de razonamiento antes de responder
- El tiempo para generar 500 tokens de respuesta según la velocidad de salida
- La cantidad de tokens de pensamiento usa el promedio medido con 60 prompts diferentes
Precios y costo por tarea
- La comparación de precios usa el costo en dólares por millón de tokens para aciertos de caché, tokens de entrada y tokens de salida
- En la lista, Devstral 2 y North Mini Code aparecen con $0.00 por millón de tokens, seguidos por Gemma 3 4B y Gemma 3 27B
- Los modelos más baratos según precio mixto son los siguientes
- Nova Micro: $0.03/1M tokens
- Sarvam 30B (high): $0.03/1M tokens
- Gemma 4 E4B (Non-reasoning): $0.03/1M tokens
- El costo por tarea del Intelligence Index se calcula dividiendo entre la cantidad de tareas el precio de los tokens de entrada, aciertos de caché, escritura en caché, razonamiento y respuesta de cada evaluación, y aplicando los pesos de las evaluaciones dentro del Index
- El costo de ejecutar el Index completo se calcula con el uso de tokens por evaluación, excluyendo ejecuciones repetidas, y el precio de cada tipo de token
- El precio mixto de caché mostrado usa solo el costo de aciertos de caché; otros costos de caché varían según el proveedor
- Anthropic cobra por separado la escritura en caché, con tarifas distintas para TTL de 5 minutos y de 1 hora; la de 1 hora es más cara
- Google Vertex/Gemini cobra costos de almacenamiento por hora además del precio por acierto de caché
- Algunos proveedores aplican precios por tramos a prompts de más de 200K tokens
- OpenAI y DeepSeek, entre otros, generalmente cobran solo el precio por acierto de caché, sin costos de escritura ni almacenamiento
Uso de tokens y ventana de contexto
- La cantidad de tokens de salida por tarea se calcula multiplicando los tokens de salida de cada evaluación por su peso relativo dentro del Intelligence Index y luego dividiéndolos por la cantidad de tareas, excluyendo repeticiones
- Los modelos con mayor ventana de contexto son los siguientes
- Llama 4 Scout: 10M de tokens
- Grok 4.20 0309: 2M de tokens
- Gemini 1.5 Pro (May)
- Grok 4.1 Fast
- La ventana de contexto es el límite máximo combinado de tokens de entrada y salida; el límite de tokens de salida suele ser mucho menor y varía según el modelo
- Una ventana de contexto grande está relacionada con los flujos de trabajo RAG para buscar información y razonar sobre grandes volúmenes de datos
Tamaño de los modelos de pesos abiertos
- El tamaño del modelo se distingue entre parámetros totales, que combinan pesos y sesgos entrenables, y parámetros activos, que son los que se ejecutan en la inferencia real
- En los modelos Mixture of Experts, el mecanismo de enrutamiento selecciona solo algunos expertos para cada token, por lo que los parámetros activos son menores que los totales
- En los modelos dense, se usan todos los parámetros, por lo que los parámetros activos y los parámetros totales son iguales
Alcance de la comparación y forma de uso
- Los modelos se comparan en múltiples dimensiones, como inteligencia, precio, velocidad de salida, latencia del primer token, tiempo de respuesta de extremo a extremo y tamaño de la ventana de contexto
- Las métricas de rendimiento se miden directamente con prompts estandarizados sobre 586 modelos
- En la página detallada de cada modelo se pueden consultar métricas específicas y comparaciones directas entre modelos similares, y el selector de modelos permite ajustar qué modelos se muestran en los gráficos
1 comentarios
Comentarios de Hacker News
Esta tabla de clasificación se ha vuelto, en la práctica, inútil para que el usuario final decida qué modelo usar y cuándo
Como cada modelo tiene fortalezas y debilidades en áreas y tareas específicas, una clasificación por una sola métrica no sirve; ya no existe un único “mejor modelo”, y según la complejidad de la tarea quizá ni siquiera haga falta el mejor modelo
Por ejemplo, se podría usar Fable para diseño de UI, Sol para diseño de sistemas backend y Kimi K3 para desarrollo de vulnerabilidades; al final, estas métricas se parecen más a números para presumir de las empresas de modelos
Pero un modelo más viejo y pequeño de la misma familia también lo resolvió bien, siendo 3 veces más rápido y costando una novena parte, y en ese momento me cayó el veinte
Aunque sea algo subjetivo, como cuál modelo maneja mejor un proyecto Elixir/Phoenix en 2026 de la forma más idiomática, podría ser útil cuando es difícil comparar todos los modelos directamente y las diferencias de rendimiento son grandes
Todas las estadísticas tienen distorsiones, pero aun así son mejores que no saber nada, y que un benchmark muestre el promedio de varias tareas significa justo eso: las estadísticas sirven para resumir
Pero si lo unes todo en un solo resultado, desaparecen todos los matices y solo queda una clasificación para presumir
Si yo fuera ejecutivo de Google, pensaría que duermen en la oficina no solo porque tienen mucho trabajo, sino porque les da vergüenza dejarse ver en público
Desde hace mucho han dicho que su máxima prioridad es dar la respuesta correcta a las preguntas lo más rápido posible
De las tres, parece la única empresa que no venera la AGI ni se mortifica por ella
Quizá ese sea su único objetivo
En la parte alta del índice de inteligencia están Claude Opus 5 Max con 61 puntos, Opus 5 Xhigh con 60, la combinación de modelo alternativo Claude Fable 5 Max y Opus 4.8 con 60, GPT-5.6 Sol Max con 59 y Opus 5 High con 59
Así que Opus 5 Xhigh está por encima de Sol Max, y Opus 5 High empata con Sol Max; me da curiosidad la diferencia de precio y velocidad entre esos modelos
En DeepSwe, Opus 5 le gana a Fable pero pierde contra Sol; en FrontierCode aplasta a todos, pero si el esfuerzo de razonamiento sube por encima de Medium cae bruscamente hasta nivel Sonnet
En particular, aborda todo de forma superficial, hay que enseñarle la app o el framework completo, y empieza con tonterías como volver a agregar funciones que ya existen bajo otra forma
Entre los componentes, el AA-Omniscience Index resulta interesante
Mide la confiabilidad del conocimiento y las alucinaciones: recompensa las respuestas correctas, penaliza las alucinaciones, pero no penaliza rechazar responder; parece una métrica que muestra más o menos la escala o densidad de parámetros
El orden es combinación de modelo alternativo Claude Fable 5, Gemini 3.1 Pro Preview, Claude Opus 5 Max, Grok 4.6 High, Gemini 3.6 Flash y GPT-5.6 Sol Max; desde hace tiempo Gemini 3.x ya daba esa sensación típica de modelo grande
El análisis de imágenes de Gemini 3.6 Flash también es sólido, pero le falta en coding o trabajo de agentes
Se dice que 3.x Flash cabe en un solo TPU 8i, y su velocidad de procesamiento de 234.7 tokens/s aplasta los 64.4 de Sol y 56.3 de Opus; incluso 3.1 Pro, con 113.9 tokens/s, es mucho más rápido
AA-Omniscience Accuracy encaja más con lo esperado: el enorme Fable lidera con 61%, seguido por grandes modelos de frontera como Sol, GPT-5.5 y Opus
Parece que Gemini se enfocó menos en sacar la mejor nota en coding y más en conocimiento general y eficiencia operativa; en las puntuaciones normalizadas por área, solo software queda menos competitivo
Antes de emocionarse, hay que ver la matriz de costo frente a inteligencia: https://artificialanalysis.ai/models?intelligence-index-toke...
El costo probablemente bajaría bastante
Ahora veo con otros ojos a Meta Muse Spark
No es el mejor en nada, pero aparece en buenos puntos por toda la tabla y tiene buen equilibrio entre costo y rendimiento
También me da curiosidad dónde quedaría Poolside Laguna S, que no aparece en la lista; en lo personal, me interesan mucho los modelos que funcionan bien y son rentables
Aunque sea un primer lugar por margen mínimo, si hay que cuidarse de que las “medidas de seguridad”, que en la práctica significan censura, rechacen responder o bajen a otro modelo, la utilidad cae muchísimo
Por eso casi dejé de usar Claude, salvo en parte de mi flujo de trabajo existente, y la fiabilidad importa más que la diferencia entre 61 y 57 puntos
Considerando la censura e incluso la verificación de identidad, que yo no he sufrido personalmente, Claude es el modelo más deteriorado e inestable, y la pequeña optimización de benchmark de la versión más reciente no vale la pena
Aplico una prueba de creación de juegos a todos los modelos, y Opus 5 se sintió como un salto de nivel generacional; los benchmarks no muestran bien cómo es en realidad, así que hay que probarlo directamente
No entiendo por qué Anthropic está tan obsesionada con el cambio automático y silencioso a una versión inferior, y dudo que exista хотя sea un solo usuario que prefiera que le bajen automáticamente el rendimiento en vez de rechazar la respuesta
El mismo trabajo lo hicieron sin problema Opus 4.5~4.8, Fable, Codex 5.4·5.5 y Sol 5.6
Opus 5 es demasiado cauteloso, así que es difícil usarlo de forma productiva y necesita más ajustes
Me gusta que Opus 5 no vuelva a explicar todo como 4.8
Mientras que GPT-5.6 Sol razona con demasiada profundidad incluso en cosas triviales, Opus 5 es un gran modelo y Anthropic hizo un buen trabajo
Cuando le dije que lo hiciera por su cuenta y sin especificaciones, gastó el 30% del uso semanal en 2 horas y 30 minutos; pero con especificaciones, en 30 minutos solo usó 2%, y el resultado fue mejor en estructura, longitud, validación, alcance y costo
Si dejas a Sol por su cuenta se vuelve incontrolable, así que ahora Sol redacta las especificaciones y Terra implementa, y este método está funcionando bien y también redujo el uso total
El resultado más interesante es que Opus 5 es, después de Fable 5, por mucho el modelo más caro
GPT-5.6 y Kimi K3 logran puntajes similares, con una diferencia de 1~2%, a la mitad del costo
En Medium, el costo baja a casi la mitad del de K3, y muy probablemente sea suficiente para el 95% de las tareas de programación
No estoy de ningún lado, pero en estos resultados GPT-5.6 Sol Max se ve mejor
Ofrece casi el mismo rendimiento por aproximadamente la mitad del costo, y si Opus 5 ya es así de caro frente a GPT-5.6, eso deja ver qué tan alto es el precio de Fable