1 puntos por GN⁺ 2 시간 전 | 1 comentarios | Compartir por WhatsApp
  • Entre los 170 modelos evaluados, Claude Opus 5 Adaptive Reasoning·Max Effort obtuvo el primer lugar con 61 puntos en el Intelligence Index, seguido por Xhigh Effort y Claude Fable 5, ambos con 60 puntos
  • Intelligence Index v4.1 combina 9 evaluaciones que cubren tareas de agentes, programación, razonamiento científico, confiabilidad del conocimiento y razonamiento de contexto largo, e incorpora al rendimiento el tiempo de pensamiento extendido de los modelos de razonamiento
  • En velocidad de salida, Mercury 2 es el más rápido con 901.6 tokens/s; la latencia del primer token más baja es la de Gemini 2.5 Flash-Lite, con 0.34 segundos; y Llama 4 Scout ofrece una ventana de contexto máxima de 10M de tokens
  • Los precios se comparan no solo por el costo unitario por token, sino también por el costo por tarea, ponderando tokens de entrada, aciertos de caché, escritura en caché, razonamiento y respuesta; los costos de escritura y almacenamiento de caché varían según el proveedor
  • Entre los modelos de pesos abiertos, GLM-5.2 (max) es el más alto con 51 puntos, pero queda 10 puntos por debajo del líder general, por lo que al elegir un modelo hay que considerar, además de la inteligencia, el costo, la velocidad, la latencia y la ventana de contexto

Ranking de inteligencia de Claude Opus 5

  • Claude Opus 5 (Adaptive Reasoning, Max Effort) ocupa el primer lugar entre los 170 modelos evaluados, con 61 puntos en el Intelligence Index
  • Los 5 modelos principales son los siguientes
    • Claude Opus 5 (Adaptive Reasoning, Max Effort): 61 puntos
    • Claude Opus 5 (Adaptive Reasoning, Xhigh Effort): 60 puntos
    • Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback): 60 puntos
    • GPT-5.6 Sol (max): 59 puntos
    • Claude Opus 5 (Adaptive Reasoning, High Effort): 59 puntos
  • La configuración Max Effort también ocupa el primer lugar entre 126 modelos de razonamiento; estos modelos realizan pensamiento extendido para procesar problemas complejos antes de responder

Composición de las evaluaciones del Intelligence Index v4.1

  • Intelligence Index v4.1 combina las siguientes 9 evaluaciones
    • GDPval-AA v2: trabajo real basado en agentes
    • 𝜏³-Banking: uso de herramientas por agentes
    • Terminal-Bench v2.1: programación con agentes y uso de terminal
    • SciCode: programación
    • Humanity's Last Exam: razonamiento y conocimiento
    • GPQA Diamond: razonamiento científico
    • CritPt: razonamiento de física
    • AA-Omniscience: precisión del conocimiento y tasa de no alucinación
    • AA-LCR: razonamiento de contexto largo
  • Según el caso de uso, los resultados de evaluaciones específicas pueden ser más importantes que el puntaje general de inteligencia
  • Entre las evaluaciones separadas también se incluyen los siguientes benchmarks
    • AA-Briefcase: trabajo de conocimiento con agentes
    • AutomationBench-AA: flujos de trabajo SaaS con agentes
    • Harvey LAB-AA: trabajo legal con agentes
    • EnterpriseOps-Gym-AA: operaciones de negocio con agentes
    • IFBench: seguimiento de instrucciones
    • APEX-Agents-AA: tareas de agentes de largo plazo
    • ITBench-AA: análisis de causa raíz de incidentes en Kubernetes
    • MMMU-Pro: razonamiento visual

Métricas de trabajo de conocimiento, confiabilidad y apertura

  • AA-Briefcase Elo combina Elo de calidad de análisis, Elo de presentación y tasa de cumplimiento de criterios de evaluación
    • La tasa de cumplimiento se convierte a Elo mediante enfrentamientos sintéticos uno a uno
    • El Elo y los límites del intervalo de confianza del 95% se restringen para que no sean menores que 0
  • AA-Omniscience Index mide la confiabilidad del conocimiento y las alucinaciones con un puntaje de -100 a 100
    • Recompensa las respuestas correctas y penaliza las alucinaciones, pero no penaliza negarse a responder
    • 0 puntos significa que hay la misma cantidad de respuestas correctas e incorrectas; un valor negativo significa que hay más respuestas incorrectas que correctas
  • El Openness Index evalúa la apertura del modelo con un puntaje normalizado de 0 a 100; cuanto más alto, más abierto
  • Se distingue si los pesos están publicados, y los modelos cuyos pesos están publicados pero requieren una licencia paga u otra condición para uso comercial se marcan como Commercial Use Restricted

Ranking de modelos de pesos abiertos

  • De los 170 modelos evaluados, 94 son modelos de pesos abiertos
  • Los primeros lugares del Intelligence Index entre modelos de pesos abiertos son los siguientes
    • GLM-5.2 (max): 51 puntos
    • MiniMax-M3: 44 puntos
    • DeepSeek V4 Pro (Reasoning, Max Effort): 44 puntos
  • GLM-5.2 (max) registró el puntaje más alto entre los modelos de pesos abiertos

Velocidad de salida y tiempo de procesamiento por tarea

  • Mercury 2 tiene la mayor velocidad de salida, con 901.6 tokens/s
    • Gemini 3.5 Flash-Lite: 435.1 tokens/s
    • HyperNova 60B 2605: 427.6 tokens/s
    • Granite 4.0 H Small también aparece entre los primeros lugares
  • La velocidad de salida es la cantidad de tokens por segundo recibidos mientras el modelo genera tokens, después de recibir el primer fragmento en modelos con streaming
  • El tiempo por tarea del Intelligence Index se calcula dividiendo la cantidad de tokens de salida por tarea entre la velocidad de salida y aplicando el peso relativo de cada benchmark
    • Se excluyen el tiempo hasta el primer token (TTFT) y otros overheads
  • Si existe una API propia, se usa el rendimiento de esa API; si no hay una API propia, como en Meta Llama, se usa la mediana de varios proveedores

Latencia y tiempo de respuesta de extremo a extremo

  • El modelo con menor tiempo hasta el primer token de respuesta es Gemini 2.5 Flash-Lite (Non-reasoning), con 0.34 segundos
    • Command A+: 0.42 segundos
    • North Mini Code: 0.49 segundos
    • Gemini 2.5 Flash también se incluye entre los modelos de baja latencia
  • La latencia del primer token es el tiempo que transcurre desde la solicitud a la API hasta recibir el primer token de respuesta
    • En modelos de razonamiento, también incluye el tiempo de pensamiento previo a la respuesta
    • En modelos que no admiten streaming, se aplica el tiempo hasta recibir la respuesta completa
  • El tiempo de respuesta de extremo a extremo para 500 tokens suma los siguientes elementos
    • El tiempo de entrada hasta recibir el primer token de respuesta
    • El tiempo de pensamiento que usan los modelos de razonamiento antes de responder
    • El tiempo para generar 500 tokens de respuesta según la velocidad de salida
  • La cantidad de tokens de pensamiento usa el promedio medido con 60 prompts diferentes

Precios y costo por tarea

  • La comparación de precios usa el costo en dólares por millón de tokens para aciertos de caché, tokens de entrada y tokens de salida
  • En la lista, Devstral 2 y North Mini Code aparecen con $0.00 por millón de tokens, seguidos por Gemma 3 4B y Gemma 3 27B
  • Los modelos más baratos según precio mixto son los siguientes
    • Nova Micro: $0.03/1M tokens
    • Sarvam 30B (high): $0.03/1M tokens
    • Gemma 4 E4B (Non-reasoning): $0.03/1M tokens
  • El costo por tarea del Intelligence Index se calcula dividiendo entre la cantidad de tareas el precio de los tokens de entrada, aciertos de caché, escritura en caché, razonamiento y respuesta de cada evaluación, y aplicando los pesos de las evaluaciones dentro del Index
  • El costo de ejecutar el Index completo se calcula con el uso de tokens por evaluación, excluyendo ejecuciones repetidas, y el precio de cada tipo de token
  • El precio mixto de caché mostrado usa solo el costo de aciertos de caché; otros costos de caché varían según el proveedor
    • Anthropic cobra por separado la escritura en caché, con tarifas distintas para TTL de 5 minutos y de 1 hora; la de 1 hora es más cara
    • Google Vertex/Gemini cobra costos de almacenamiento por hora además del precio por acierto de caché
    • Algunos proveedores aplican precios por tramos a prompts de más de 200K tokens
    • OpenAI y DeepSeek, entre otros, generalmente cobran solo el precio por acierto de caché, sin costos de escritura ni almacenamiento

Uso de tokens y ventana de contexto

  • La cantidad de tokens de salida por tarea se calcula multiplicando los tokens de salida de cada evaluación por su peso relativo dentro del Intelligence Index y luego dividiéndolos por la cantidad de tareas, excluyendo repeticiones
  • Los modelos con mayor ventana de contexto son los siguientes
    • Llama 4 Scout: 10M de tokens
    • Grok 4.20 0309: 2M de tokens
    • Gemini 1.5 Pro (May)
    • Grok 4.1 Fast
  • La ventana de contexto es el límite máximo combinado de tokens de entrada y salida; el límite de tokens de salida suele ser mucho menor y varía según el modelo
  • Una ventana de contexto grande está relacionada con los flujos de trabajo RAG para buscar información y razonar sobre grandes volúmenes de datos

Tamaño de los modelos de pesos abiertos

  • El tamaño del modelo se distingue entre parámetros totales, que combinan pesos y sesgos entrenables, y parámetros activos, que son los que se ejecutan en la inferencia real
  • En los modelos Mixture of Experts, el mecanismo de enrutamiento selecciona solo algunos expertos para cada token, por lo que los parámetros activos son menores que los totales
  • En los modelos dense, se usan todos los parámetros, por lo que los parámetros activos y los parámetros totales son iguales

Alcance de la comparación y forma de uso

  • Los modelos se comparan en múltiples dimensiones, como inteligencia, precio, velocidad de salida, latencia del primer token, tiempo de respuesta de extremo a extremo y tamaño de la ventana de contexto
  • Las métricas de rendimiento se miden directamente con prompts estandarizados sobre 586 modelos
  • En la página detallada de cada modelo se pueden consultar métricas específicas y comparaciones directas entre modelos similares, y el selector de modelos permite ajustar qué modelos se muestran en los gráficos

1 comentarios

 
GN⁺ 2 시간 전
Comentarios de Hacker News
  • Esta tabla de clasificación se ha vuelto, en la práctica, inútil para que el usuario final decida qué modelo usar y cuándo
    Como cada modelo tiene fortalezas y debilidades en áreas y tareas específicas, una clasificación por una sola métrica no sirve; ya no existe un único “mejor modelo”, y según la complejidad de la tarea quizá ni siquiera haga falta el mejor modelo
    Por ejemplo, se podría usar Fable para diseño de UI, Sol para diseño de sistemas backend y Kimi K3 para desarrollo de vulnerabilidades; al final, estas métricas se parecen más a números para presumir de las empresas de modelos

    • Hace un año salió un nuevo “mejor modelo”, me entusiasmé y le puse una tarea simple de programación: hacer cambios menores en 3 archivos, y lo resolvió bien
      Pero un modelo más viejo y pequeño de la misma familia también lo resolvió bien, siendo 3 veces más rápido y costando una novena parte, y en ese momento me cayó el veinte
    • Estaría bien tener benchmarks por stack tecnológico
      Aunque sea algo subjetivo, como cuál modelo maneja mejor un proyecto Elixir/Phoenix en 2026 de la forma más idiomática, podría ser útil cuando es difícil comparar todos los modelos directamente y las diferencias de rendimiento son grandes
    • Decir que es “totalmente inútil” o que ese es su “único propósito” es exagerado
      Todas las estadísticas tienen distorsiones, pero aun así son mejores que no saber nada, y que un benchmark muestre el promedio de varias tareas significa justo eso: las estadísticas sirven para resumir
    • Si abres el enlace, verás que no hay solo una métrica única; de hecho sí ofrecen todas las métricas necesarias para tomar una decisión
    • Los gráficos de Artificial Analysis, como costo por tarea o frecuencia de alucinaciones, sí tienen valor
      Pero si lo unes todo en un solo resultado, desaparecen todos los matices y solo queda una clasificación para presumir
  • Si yo fuera ejecutivo de Google, pensaría que duermen en la oficina no solo porque tienen mucho trabajo, sino porque les da vergüenza dejarse ver en público

    • Como son la única empresa que puede quemar subsidios sin perder, más bien pueden dormir tranquilos
    • Parece que Google valora más la velocidad con la que puede monetizar en todos sus productos que tener la IA más inteligente
      Desde hace mucho han dicho que su máxima prioridad es dar la respuesta correcta a las preguntas lo más rápido posible
    • También queda la duda de si Google siquiera quiere competir, como OpenAI o Anthropic, con modelos que maximicen la inteligencia
      De las tres, parece la única empresa que no venera la AGI ni se mortifica por ella
    • En el benchmark GPQA Diamond está empatada en primer lugar: https://artificialanalysis.ai/evaluations/gpqa-diamond
      Quizá ese sea su único objetivo
    • Los modelos Gemini también lideran o están entre los punteros en varias categorías, así que no parece correcto concluir que están tan rezagados como para dar vergüenza
  • En la parte alta del índice de inteligencia están Claude Opus 5 Max con 61 puntos, Opus 5 Xhigh con 60, la combinación de modelo alternativo Claude Fable 5 Max y Opus 4.8 con 60, GPT-5.6 Sol Max con 59 y Opus 5 High con 59
    Así que Opus 5 Xhigh está por encima de Sol Max, y Opus 5 High empata con Sol Max; me da curiosidad la diferencia de precio y velocidad entre esos modelos

    • En los gráficos de Artificial Analysis sobre costo y tiempo por unidad de inteligencia por tarea, Opus 5 High y Sol Max salen más o menos parecidos en costo y tiempo
      En DeepSwe, Opus 5 le gana a Fable pero pierde contra Sol; en FrontierCode aplasta a todos, pero si el esfuerzo de razonamiento sube por encima de Medium cae bruscamente hasta nivel Sonnet
    • Opus 5 no parece tan inteligente como Sol Max, y en algunas tareas incluso parece peor que Opus 4.8
      En particular, aborda todo de forma superficial, hay que enseñarle la app o el framework completo, y empieza con tonterías como volver a agregar funciones que ya existen bajo otra forma
  • Entre los componentes, el AA-Omniscience Index resulta interesante
    Mide la confiabilidad del conocimiento y las alucinaciones: recompensa las respuestas correctas, penaliza las alucinaciones, pero no penaliza rechazar responder; parece una métrica que muestra más o menos la escala o densidad de parámetros
    El orden es combinación de modelo alternativo Claude Fable 5, Gemini 3.1 Pro Preview, Claude Opus 5 Max, Grok 4.6 High, Gemini 3.6 Flash y GPT-5.6 Sol Max; desde hace tiempo Gemini 3.x ya daba esa sensación típica de modelo grande

    • Gemini 3.1 Pro es muy bueno para trabajo de conocimiento, y Google hizo muy bien esa parte
      El análisis de imágenes de Gemini 3.6 Flash también es sólido, pero le falta en coding o trabajo de agentes
    • Ver que 3.6 Flash tiene 24 puntos, por encima de los 22 de Sol, hace difícil asegurar que sea un indicador sustituto del tamaño de parámetros
      Se dice que 3.x Flash cabe en un solo TPU 8i, y su velocidad de procesamiento de 234.7 tokens/s aplasta los 64.4 de Sol y 56.3 de Opus; incluso 3.1 Pro, con 113.9 tokens/s, es mucho más rápido
      AA-Omniscience Accuracy encaja más con lo esperado: el enorme Fable lidera con 61%, seguido por grandes modelos de frontera como Sol, GPT-5.5 y Opus
      Parece que Gemini se enfocó menos en sacar la mejor nota en coding y más en conocimiento general y eficiencia operativa; en las puntuaciones normalizadas por área, solo software queda menos competitivo
    • Si no penaliza rechazar responder, entonces no es muy útil
    • El impacto del grounding podría ser igual o mayor que el tamaño del modelo, y Google claramente hace muy bien esa parte por razones obvias
  • Antes de emocionarse, hay que ver la matriz de costo frente a inteligencia: https://artificialanalysis.ai/models?intelligence-index-toke...

    • Sorprende que, considerando también la calidad del resultado, GPT-5.6 Sol Max sea más barato que todos los demás
    • Max mete muchísimo razonamiento extra, así que me pregunto cuánto cae la cantidad de tareas que puede resolver en High
      El costo probablemente bajaría bastante
  • Ahora veo con otros ojos a Meta Muse Spark
    No es el mejor en nada, pero aparece en buenos puntos por toda la tabla y tiene buen equilibrio entre costo y rendimiento
    También me da curiosidad dónde quedaría Poolside Laguna S, que no aparece en la lista; en lo personal, me interesan mucho los modelos que funcionan bien y son rentables

  • Aunque sea un primer lugar por margen mínimo, si hay que cuidarse de que las “medidas de seguridad”, que en la práctica significan censura, rechacen responder o bajen a otro modelo, la utilidad cae muchísimo
    Por eso casi dejé de usar Claude, salvo en parte de mi flujo de trabajo existente, y la fiabilidad importa más que la diferencia entre 61 y 57 puntos
    Considerando la censura e incluso la verificación de identidad, que yo no he sufrido personalmente, Claude es el modelo más deteriorado e inestable, y la pequeña optimización de benchmark de la versión más reciente no vale la pena

    • Me pregunto qué tipo de preguntas hacen para que les active la censura tan seguido
    • Por lo que lo he usado, para nada es un modelo hecho solo para benchmarks
      Aplico una prueba de creación de juegos a todos los modelos, y Opus 5 se sintió como un salto de nivel generacional; los benchmarks no muestran bien cómo es en realidad, así que hay que probarlo directamente
    • Cada vez que veo en línea que mejoraron los límites o el modelo y reconsidero mi principio de no pagarle nunca a Anthropic, reviso la model card y termino aún más convencido
      No entiendo por qué Anthropic está tan obsesionada con el cambio automático y silencioso a una versión inferior, y dudo que exista хотя sea un solo usuario que prefiera que le bajen automáticamente el rendimiento en vez de rechazar la respuesta
    • Le pedí a Claude Opus 5.0 que desplegara una web app en el PaaS de un entorno de pruebas usando una API key global y que trajera datos, pero se negó alegando un problema de seguridad porque los permisos eran demasiado amplios
      El mismo trabajo lo hicieron sin problema Opus 4.5~4.8, Fable, Codex 5.4·5.5 y Sol 5.6
      Opus 5 es demasiado cauteloso, así que es difícil usarlo de forma productiva y necesita más ajustes
    • Tal vez sea porque no haces nada importante, y Terence Tao no se queja por los “modelos de IA despiertos”
  • Me gusta que Opus 5 no vuelva a explicar todo como 4.8
    Mientras que GPT-5.6 Sol razona con demasiada profundidad incluso en cosas triviales, Opus 5 es un gran modelo y Anthropic hizo un buen trabajo

    • Cuando le di especificaciones de implementación a Sol, lo resolvió muy bien, así que no noté esta diferencia
      Cuando le dije que lo hiciera por su cuenta y sin especificaciones, gastó el 30% del uso semanal en 2 horas y 30 minutos; pero con especificaciones, en 30 minutos solo usó 2%, y el resultado fue mejor en estructura, longitud, validación, alcance y costo
      Si dejas a Sol por su cuenta se vuelve incontrolable, así que ahora Sol redacta las especificaciones y Terra implementa, y este método está funcionando bien y también redujo el uso total
  • El resultado más interesante es que Opus 5 es, después de Fable 5, por mucho el modelo más caro
    GPT-5.6 y Kimi K3 logran puntajes similares, con una diferencia de 1~2%, a la mitad del costo

    • La gráfica se basa en Max reasoning effort, que es lo que más usan los usuarios empresariales menos sensibles al precio
      En Medium, el costo baja a casi la mitad del de K3, y muy probablemente sea suficiente para el 95% de las tareas de programación
  • No estoy de ningún lado, pero en estos resultados GPT-5.6 Sol Max se ve mejor
    Ofrece casi el mismo rendimiento por aproximadamente la mitad del costo, y si Opus 5 ya es así de caro frente a GPT-5.6, eso deja ver qué tan alto es el precio de Fable

    • Para compararlos bien, habría que comparar Opus High y Sol Max