1 puntos por GN⁺ 3 시간 전 | 1 comentarios | Compartir por WhatsApp
  • Al comparar 1,008 SVG de 7 modelos frontier, no se encontró evidencia clara de pelicanmaxxing, es decir, de mejorar el rendimiento para ajustarse a un prompt famoso
  • Se ejecutaron 48 prompts combinando 8 animales y 6 vehículos, 3 veces por modelo, y GPT-5.6 Luna evaluó por separado la consistencia del animal, del vehículo y de la acción con una escala de 1 a 5
  • El pelícano quedó en 6.º lugar entre 8 animales, la bicicleta en 5.º entre 6 vehículos, y la combinación pelícano-bicicleta también terminó en el puesto 42 de 48
  • Incluso en el análisis de regresión ajustado por dificultad, los efectos por laboratorio no fueron estadísticamente significativos, y el único efecto significativo —el de bicicleta en Gemini 3.5 Flash— tampoco superó la corrección por comparaciones múltiples
  • Las 21 imágenes de pelícano-bicicleta apuntaban hacia la derecha, pero también lo hacía el 60% del total; con este experimento solo no se puede determinar si hubo SVGmaxxing, es decir, una mejora general en la generación de SVG

Benchmark de “pelícano en bicicleta”

  • Simon Willison lleva años probando el mismo prompt —“genera un SVG de un pelícano montando una bicicleta”— cada vez que se lanza un LLM importante
  • Lo que empezó como una prueba en tono de broma se convirtió en un benchmark informal famoso de IA, y en los hilos de Hacker News donde se presentan modelos nuevos también suele recibir muchos votos la discusión sobre sus resultados
  • benchmaxxing se refiere a optimizar modelos de IA para lograr puntajes altos en benchmarks populares
  • Dado que el rendimiento del modelo puede influir en la elección de los usuarios, aquí se evalúa la posibilidad de pelicanmaxxing, es decir, que un laboratorio haya optimizado su modelo para esta prueba específica
  • El código del experimento y el pipeline de procesamiento de datos están publicados en este repositorio de GitHub

Diseño del experimento que produjo 1,008 SVG

  • Se construyeron 48 prompts combinando 8 animales y 6 vehículos
    • Animales: pelican, flamingo, heron, otter, raccoon, antelope, whale, cat
    • Vehículos: bicycle, unicycle, skateboard, scooter, plane, boat
  • En todos los prompts solo se sustituyeron el animal y el vehículo de la frase usada por Simon Willison
  • Los animales y vehículos no se eligieron con un procedimiento estricto, pero sí buscando variedad tanto en similitud con el original como en dificultad
    • flamingo y heron son similares a pelican
    • cat, raccoon y otter se eligieron como casos fáciles
    • antelope es difícil, y whale es un caso muy distinto a pelican
  • Se probaron los siguientes 7 modelos a través de OpenRouter
    • GPT-5.6 Terra
    • Claude Sonnet 5
    • Gemini 3.5 Flash
    • Grok 4.5
    • Qwen3.7-Max
    • GLM-5.2
    • DeepSeek V4 Pro
  • Para cada prompt se generaron 3 muestras con temperature 1.0 y el mismo ajuste de esfuerzo de razonamiento, reuniendo un total de 1,008 SVG

Pipeline de renderizado, evaluación y extracción de características

  • Los resultados generados se procesaron en tres etapas
    • Renderizado: se convirtió cada SVG a PNG y, si no había SVG o fallaba el renderizado, se regeneraba hasta obtener un resultado válido
      • Hubo 11 reintentos a lo largo de 1,008 generaciones
    • Evaluación: GPT-5.6 Luna calificó por separado la consistencia del animal, del vehículo y de la acción con puntajes de 1 a 5
      • Para los rankings de animales y vehículos se usaron los puntajes individuales de cada categoría
      • Cuando se necesitaba una sola cifra por imagen, se usó el judge score, el promedio de las tres calificaciones
    • Extracción de características: Gemini 3.1 Flash-Lite registró el animal y el vehículo detectados, la dirección del sujeto y elementos de la escena
  • Si un laboratorio hubiera entrenado para ese benchmark específico, se esperaría que la fila del pelícano, la columna de la bicicleta o la celda pelícano-bicicleta recibieran puntajes más altos de lo que correspondería por su dificultad base

Diferencias observadas a simple vista

  • Se compararon las cuadrículas completas de imágenes por modelo, pero no se encontró ningún caso en que la imagen de pelícano-bicicleta fuera claramente superior a otros resultados del mismo modelo
  • La primera muestra de GLM-5.2 parecía algo mejor, pero en ese mismo grupo también apareció una imagen heron-skateboard de alta calidad, por lo que fue difícil atribuirlo a una optimización especial
  • Los laboratorios que producían buenas imágenes de pelícano-bicicleta también tendían a dibujar bien otras combinaciones de animal y vehículo
  • Como la evaluación visual es difícil de reproducir y puede variar entre personas, se añadió un análisis cuantitativo

Desempeño individual del pelícano y de la bicicleta

  • Sumando los puntajes del animal en todos los modelos, el pelícano quedó 6.º de 8
    • Quedó por debajo de cat, whale, raccoon, heron y antelope
    • Los 7 laboratorios dibujaron mejor a cat, whale y raccoon que a pelican
  • Como el pelícano puede ser más difícil de dibujar que un gato, este ranking por sí solo no basta para descartar la posibilidad de entrenamiento específico
  • La bicicleta quedó penúltima entre los 6 vehículos, casi al nivel del último lugar, plane
  • Una bicicleta requiere dos ruedas coincidentes, un cuadro que conecte ambos ejes, manubrio, asiento y pedales
    • El modelo evaluador consideró que en cerca de dos tercios de las imágenes de bicicletas faltaba uno de esos elementos o no estaba conectado correctamente
  • La bicicleta también es más difícil que un vehículo simple como skateboard, así que incluso con entrenamiento específico podría seguir quedando baja en el ranking relativo

La ambigüedad creada por el prompt “plane”

  • Al usar “plane” en vez de “airplane”, algunos modelos lo interpretaron no como una aeronave sino como un plano geométrico
  • Como resultado, se generaron imágenes donde el animal estaba de pie sobre una superficie plana en lugar de montar un avión
  • Los únicos casos en que el extractor de características no encontró ningún vehículo ocurrieron con plane
    • No detectó vehículo en 25 de las 168 imágenes de plane
    • En los otros 5 vehículos no hubo casos así
  • El 20% de las imágenes de plane recibió puntajes de vehículo de 1 o 2
    • En bicycle fue 5%
    • En boat, scooter y skateboard no hubo imágenes con puntajes de 1 o 2

Ranking por combinación y ajuste por dificultad

  • El promedio de la combinación pelícano-bicicleta quedó en el puesto 42 de 48
  • Como cada combinación puede tener una dificultad base distinta, se aplicó una regresión de efectos fijos sobre las 1,008 imágenes completas
    • La fórmula base fue score ~ lab + animal × vehicle
    • Se añadieron términos de interacción por laboratorio para pelican, bicycle y pelican-bicycle
    • Se usaron errores estándar robustos
  • El término animal × vehicle absorbe la dificultad propia distinta de cada una de las 48 combinaciones
  • Con los términos de interacción por laboratorio se midió, frente al laboratorio promedio, el incremento específico del benchmark y su intervalo de confianza

El análisis de regresión no encontró efectos significativos

  • El efecto del pelícano por laboratorio fue de entre -0.11 y +0.14 puntos, y ninguno fue estadísticamente significativo
    • El menor valor p fue 0.25
  • El efecto de la bicicleta por laboratorio fue desde -0.18 puntos en Grok 4.5 (p=0.11) hasta +0.27 puntos en Gemini 3.5 Flash (p=0.022)
    • Entre los 7 efectos hubo tanto valores positivos como negativos
    • El único modelo que cumplió p<0.05 fue Gemini 3.5 Flash
  • Tras excluir los efectos de pelícano y bicicleta de cada laboratorio, ningún incremento adicional para la combinación específica pelícano-bicicleta cumplió p<0.05
    • El mayor efecto positivo fue +0.35 puntos en GLM-5.2, pero con p=0.12
    • Fue el resultado más cercano a una señal en el experimento, pero siguió dentro del rango del azar
  • Todos los intervalos de confianza del efecto del pelícano y del efecto de la celda pelícano-bicicleta incluyeron 0
  • Si se hacen 21 pruebas con p<0.05, se espera aproximadamente 1 falso positivo solo por azar
    • 21 × 0.05 ≈ 1.05, y de hecho el único resultado significativo fue el efecto de bicicleta en Gemini
    • El umbral con corrección de Bonferroni fue 0.05/21 ≈ 0.002, así que el p=0.022 de Gemini no lo supera
  • El ancho promedio de los intervalos de confianza fue de alrededor de ±0.6 puntos, por lo que al experimento le costaba detectar incrementos menores que eso

Composición de imágenes orientadas a la derecha

  • Las 21 imágenes de pelícano-bicicleta generadas por los 7 laboratorios apuntaban hacia la derecha
    • Fue la única combinación entre las 48 en la que todas las imágenes coincidieron en la dirección
  • Aun así, el 60% de las 1,008 imágenes totales también apuntaba a la derecha, por lo que esa orientación ya era común en general
  • La proporción de orientación a la derecha por vehículo fue: scooter 83%, bicycle 81%, skateboard 60%, plane 58%, unicycle 45% y boat 35%
  • La proporción por animal fue: antelope y pelican 78% cada uno, heron 77%, whale 65%, flamingo 64%, otter 45%, cat 40% y raccoon 36%
  • Como dibujar un pelícano o una bicicleta de frente es difícil, los modelos suelen elegir una composición lateral izquierda-derecha, y por eso también hay pocas imágenes con dirección ambigua
  • Otras combinaciones también mostraron una alta coincidencia de dirección
    • antelope-scooter y pelican-scooter tuvieron 20 de 21 imágenes en la misma dirección
    • heron-bicycle tuvo 19 de 21 en la misma dirección
  • Que una de las 48 combinaciones mostrara 21 imágenes en la misma dirección no basta por sí solo para considerarlo un outlier especial

Búsqueda de rastros de memorización en los elementos de la escena

  • Gemini 3.1 Flash-Lite extrajo en formato libre los elementos de la escena detectados en las imágenes para revisar si se repetía una composición memorizada
  • En algunas combinaciones ciertos elementos aparecían con frecuencia
    • En todas las imágenes flamingo-boat aparecía el sol
    • En el 38% de las imágenes otter-plane aparecía una bufanda
    • En el 38% de las imágenes cat-bicycle aparecía una canasta
  • En pelícano-bicicleta también hubo elementos relativamente frecuentes, pero no se encontró un patrón repetitivo especial que lo distinguiera de otras combinaciones de animal y vehículo

Un solo modelo evaluador y presupuesto limitado

  • Todos los puntajes los asignó un único modelo evaluador, GPT-5.6 Luna, mirando las imágenes una por una
    • No se hizo una alineación suficientemente rigurosa de los criterios de evaluación ni se comprobó la consistencia al reevaluar
    • Si el modelo evaluador no puede juzgar los dibujos de forma confiable, el valor de los resultados cuantitativos disminuye
  • También existe la limitación de que el modelo evaluador y el modelo participante GPT-5.6 Terra pertenecen a la misma familia de productos
    • Aun así, como cada laboratorio generó las 48 combinaciones, incluso si hubiera preferencia por el estilo visual de algún laboratorio eso elevaría los puntajes de toda su cuadrícula
    • El análisis compara diferencias entre combinaciones dentro de cada laboratorio, así que esa preferencia no cambia el resultado central
  • Este experimento no puede detectar SVGmaxxing orientado no a un prompt concreto, sino a la generación de SVG en general o a categorías como “animales montando vehículos”
    • En ese caso subiría el rendimiento de todas las celdas a la vez, y no se distinguiría de un modelo simplemente bueno generando SVG
    • Google/DeepMind ha realizado este tipo de optimización de forma pública
  • El costo total del experimento fue de unos 80 dólares en créditos de API
    • Se limitó a 3 muestras por celda, 1 modelo evaluador y 7 modelos participantes
    • No fue posible iterar lo suficiente sobre el prompt y el pipeline, por lo que quedaron problemas como el de “plane” frente a “airplane”

No hay evidencia de optimización para un prompt específico

  • El pelícano no se dibujó mejor que otros animales, la bicicleta tampoco fue superior a otros vehículos, y ningún laboratorio dibujó esa combinación significativamente mejor de lo que cabría esperar por su desempeño individual con pelícanos y bicicletas
  • GLM-5.2 registró el mayor incremento en una celda específica pelícano-bicicleta, pero el efecto fue pequeño y no estadísticamente significativo
  • Que las 21 imágenes apuntaran a la derecha llama la atención, pero en general esa composición es común y otras tres combinaciones también superaron el 90% de coincidencia
  • Más que pelicanmaxxing, una forma más plausible sería SVGmaxxing, es decir, reforzar la generación de SVG en general, pero este experimento no permite identificar qué laboratorio lo estaría haciendo

1 comentarios

 
GN⁺ 3 시간 전
Comentarios de Hacker News
  • También fui probando de vez en cuando otras combinaciones de animales y vehículos, y mi sueño era encontrar evidencia de que cierto laboratorio de IA dibuja especialmente bien al pelícano en bicicleta
    La metodología de Dylan para generar 1,008 SVG con 8×6 combinaciones es mucho más sólida de lo que pensaba. Pero no encontró ningún caso en el que, en algún modelo, el pelícano en bicicleta saliera notablemente mejor que otras combinaciones

    • Puede que no lo hayan optimizado solo para el pelícano, sino para SVG en general. Generar SVG complejos fue un buen benchmark al principio porque permite poner a prueba programación general y conocimiento espacial, pero si atacas esta tarea directamente, no es tan difícil
    • Algo parecido pasó con TPC, que creó benchmarks de SQL. Si tu rendimiento en TPC era malo, no podías competir; si era bueno, obtenías el derecho a participar en evaluaciones comparativas sobre tareas reales de clientes
      En un mercado saturado, pasar el benchmark es el costo de entrada, pero una optimización estrecha —como hardcodear solo una escena específica sin mejorar problemas adyacentes— es problemática. Me recuerda al benchmark “Quack3” para tarjetas ATI en el mundo GPU
    • Una prueba más fundamental sería evaluar la generación de dibujos SVG en general. Se podría construir un pipeline que tome una imagen aleatoria, le agregue una descripción, le pida a un LLM que genere el SVG, luego lo rasterice y lo compare con similitud visual determinista, o hacer que otro LLM puntúe qué tanto se parece al original
    • También valdría la pena cambiar de especie. La espátula o la garza, del mismo orden que el pelícano, Pelecaniformes, podrían ser candidatas
  • Que el pelícano en bicicleta mire hacia la derecha es natural. Como la transmisión de la bicicleta está a la derecha, para mostrarla sin que la tape el cuadro se termina dibujando el lado derecho, y es muy probable que esa composición también esté reflejada en los datos de entrenamiento
    Evidencia: https://www.rei.com/c/bikes
    Si uno mira con detalle, todas las bicicletas apuntan a la derecha sin importar la dirección del animal, y salvo la ballena, las dos piernas de todos los pasajeros también están del lado derecho de la bicicleta. Eso sugiere una gran falta de comprensión real sobre cómo funciona una bicicleta

  • Cada vez que Simon Willison subía un SVG, siempre aparecía la reacción de ignorar la evaluación diciendo “seguro que ya entrenaron con eso”, pero también hubo textos que explicaban lógicamente qué tan fácil sería detectar ese entrenamiento. Me alegró ver un análisis cuantitativo de los resultados de animales pequeños montando bicicletas
    https://simonwillison.net/2025/Nov/13/training-for-pelicans-...

    • También hay una posibilidad más matizada. Antes casi no había ilustraciones de pelícanos en bicicleta, pero ahora existen materiales dibujados directamente por artistas hábiles, y el rendimiento podría mejorar si los laboratorios los recolectan como cualquier otro contenido de la web
      Estos resultados muestran que esa mejora todavía ni siquiera ha ocurrido. Incluso es posible que el rendimiento haya empeorado por haber aprendido de malos resultados en línea
    • Solo con resultados generalizados a partir de un número pequeño de combinaciones animal-vehículo, es difícil verlo como evidencia fuerte de que no se haya entrenado con ese material, ya sea de forma directa o amplia
  • Si la explicación más plausible es optimización para SVG, entonces también hay que preguntarse qué significa aquí “optimización”. La capacidad misma de dibujar mejor SVG es una habilidad útil

    • No tiene nada de terrible que los laboratorios de IA maximicen una capacidad técnica. Como los benchmarks son prácticamente la única forma de comparar cuantitativamente los modelos actuales, si molesta la optimización para benchmarks, mejor contribuir a crear benchmarks mejores
  • Le agregué una variante más a un experimento parecido. Revisé si, cuando no se especifica ni un ave ni un medio de transporte, el modelo elige por sí solo un pelícano en bicicleta
    Resultado: https://www.modelbias.ai/pelican-on-a-bicycle-test

    • Aunque es un dibujo simple, hubo resultados estéticamente excelentes de un pingüino en patineta, incluso en modelos de bajo rendimiento. La familia Opus incluso parece haber empeorado con el tiempo
    • Como no requiere evaluación subjetiva y depende menos de la complejidad del animal y del medio de transporte, es más convincente y robusto que el análisis del artículo original
  • Los datos originales están publicados en GitHub: https://github.com/dylanjcastillo/blog/tree/main/_extras/pel...

  • Hacer que un LLM produzca SVG es muy difícil y poco natural, parecido a pedirle a un pintor humano que dibuje recitándole una lista de coordenadas. Los modelos actuales de generación de imágenes pueden crear fácilmente bicicletas con estructura perfecta y pelícanos realistas, pero el resultado sigue siendo solo una imagen rasterizada
    Falta el paso de descomponer la imagen y reproducirla como rutas SVG o comandos de pincel, y hacerlo bien requiere una comprensión real de la estructura de la escena, algo en lo que la IA todavía es débil

    • Un gran pintor humano puede visualizar en su mente el proceso de dibujar, y eso quizá no sea tan distinto de cómo un LLM construye internamente un SVG. Anthropic llamó recientemente a ese espacio interno workspace, y puede que solo les parezca extraño a humanos que no están familiarizados con SVG
    • Esta prueba evalúa la generación de SVG en sí, no raster
    • Modelos de imagen con salida de texto como Image2, o modelos de texto de propósito general que leen imágenes como Claude, pueden vectorizar imágenes rasterizadas. Pero la calidad sigue siendo baja, así que el resultado hecho a mano en Inkscape por una persona no especialista es mejor
  • En cuanto se conoce una forma de puntuar salidas de LLM, quienes deciden el financiamiento y los laboratorios empiezan a interesarse en esa métrica y a ajustarse a ella. En el mejor de los casos, mejorarán la capacidad de SVG en general y optimizarán también la generación de pelícanos, pero una vez que ya es una métrica conocida, se vuelve difícil usarla como evaluación independiente confiable