2 puntos por GN⁺ 2024-09-10 | 1 comentarios | Compartir por WhatsApp
  • El resumen del partido generado por IA de ESPN omitió el contexto clave de que se trataba del juego de retiro de Alex Morgan, mostrando que un resumen automatizado puede acertar en el resultado y aun así perder la historia importante para los lectores
  • San Diego Wave perdió 4-1 ante North Carolina Courage, y Morgan jugó 15 minutos, cobró un penal y luego agradeció al público y se despidió
  • El resumen de ESPN Generative AI Services se publicó en el sitio web y la app a las 8:52 p. m. ET y, a lo largo de 215 palabras, cubrió los goles y el desarrollo del partido, pero no mencionó ni una sola vez a Morgan
  • ESPN dijo que cada resumen con IA pasa por una revisión de editores humanos, pero no está claro si esta omisión se escapó del proceso de revisión o fue excluida por criterio editorial
  • Aunque existía un artículo aparte sobre el último partido de Morgan, los resúmenes con IA que se ofrecen a aficionados de deportes con menor cobertura deben ganarse la confianza con una capacidad para seleccionar el contexto

La escena clave del partido que el resumen con IA dejó fuera

  • Alex Morgan, una jugadora emblemática del fútbol de Estados Unidos, disputó el domingo su último partido profesional con San Diego Wave, y su equipo perdió 4-1 ante North Carolina Courage
  • Durante el partido, Morgan se quitó los tachones en el mediocampo y saludó entre lágrimas al público del Snapdragon Stadium
    • La afición coreó el nombre de Morgan y las jugadoras la rodearon y aplaudieron
    • Morgan jugó 15 minutos en el partido y cobró un penal
    • Después del juego, agradeció al público por su apoyo y se despidió
  • El partido se transmitió simultáneamente en varias cadenas y servicios de streaming

La omisión en el resumen de ESPN Generative AI Services

  • ESPN Generative AI Services empezó a ofrecer esa semana resúmenes de partidos de la NWSL y de la Premier Lacrosse League
  • El resumen en cuestión se publicó en el sitio web y la app de ESPN a las 8:52 p. m. ET
  • El resumen organizó de forma estándar el resultado, las goleadoras y el desarrollo del partido, pero en sus 215 palabras no mencionó a Morgan
    • También omitió que era el último partido profesional de Morgan, ganadora de dos World Cups y una medalla de oro olímpica
    • El resumen incluía una frase que decía que “[la jugadora de San Diego Kennedy] Wesley fue la standout player al aportar tanto en defensa como en ataque”

Las preguntas que deja la revisión de editores humanos

  • En el anuncio del servicio, ESPN dijo que cada resumen generado por IA es revisado por editores humanos para verificar calidad y precisión
  • No está claro por qué Morgan quedó fuera
    • Es posible que un editor humano no haya notado la omisión de Morgan
    • También queda abierta la posibilidad de que se haya decidido que no valía la pena mencionar ese contexto
  • Aunque los hechos incluidos en el resumen eran correctos, el hecho de dejar fuera a Morgan y la importancia de esa noche lo convierte en un caso donde no se logró transmitir el contexto completo del partido

Un artículo aparte y una corrección posterior

  • ESPN publicó un artículo aparte de Jeff Kassouf centrado en Morgan
  • Ese artículo trataba la emotiva última noche de Morgan, pero al estar en el menú lateral del resumen generado por IA era fácil pasarlo por alto
  • ESPN corrigió el resumen del partido el lunes 9 de septiembre a las 8:59 a. m. ET para agregar una mención a Alex Morgan

Los límites de los resúmenes con IA en deportes con poca cobertura

  • ESPN dijo que los resúmenes generados por IA buscan reforzar la cobertura de deportes con menor atención mediática y ofrecer a los aficionados contenido que antes no estaba disponible
  • Un resumen de partido que pierde contexto importante deja claro que enumerar hechos no es suficiente
  • Un redactor humano puede ver no solo el resultado, sino también los momentos importantes para las jugadoras, la liga y la afición, pero este resumen con IA no logró cumplir ese papel

1 comentarios

 
GN⁺ 2024-09-10
Comentarios de Hacker News
  • Da bastante risa usar esto como ejemplo para pegarle al contenido generado por IA. Las empresas de contenido deportivo para la web llevan al menos 10 años, mucho antes de que los LLM se volvieran famosos, generando artículos automáticamente
    Por lo general era por el posicionamiento en buscadores, porque mientras más contenido pareciera relevantemente relacionado, mejor les iba con la optimización para motores de búsqueda
    Es muy probable que esto ya hubiera pasado muchas veces antes de la IA, solo que no se notó o no recibió demasiada atención. Este caso se parece más a que ESPN perdió el pulso de lo que pasaba y no se aseguró de que un redactor actualizara manualmente ese artículo en particular. ESPN desde hace tiempo tenía fama de preferir cantidad sobre calidad
    Fuente: trabajé como desarrollador del lado técnico en una empresa que hace este tipo de contenido

    • Aun así, en este caso la IA tampoco lo hizo mejor
      Ya de por sí es bastante deprimente que este tipo de contenido genérico, mezclado con jerga deportiva, sea rentable
    • Entonces, ¿la IA es igual de mala que el método anterior, pero exige más datos y mayor consumo de energía?
    • La parte de “asegurarse de que uno de los redactores actualizara manualmente este artículo en particular” sugiere que ese sistema nunca estuvo realmente bien armado antes, y viendo el resultado de este artículo, claramente tampoco ahora
      Se nota que muchos artículos deportivos son básicamente de rellenar espacios en blanco. Por eso suben de inmediato la nota de AP y luego el periodista realmente encargado publica otra por la noche o a la mañana siguiente
    • La caída de ESPN viene de mucho antes que los LLM, y el uso de IA solo está acelerando esa espiral descendente al volverla más evidente
    • No sé qué internet has estado viendo estos últimos más de 5 años. No pasa solo con el “contenido” deportivo; todo tipo de contenido está ahogado en páginas de optimización para motores de búsqueda de baja calidad
      Sea generación automática o no, igual no sirve de mucho, y los LLM solo lo hacen más barato
  • ESPN transmitió este partido tanto por ESPN2 como por ESPN+. Entonces, es muy probable que ya le estuvieran pagando a dos comentaristas expertos para aportar contexto antes, durante y después del juego, y explicar las jugadas importantes
    ¿No les pasan ese material como transcripción de subtítulos al bot que redacta? Como los comentarios ya se procesan como subtítulos en tiempo real, parece una mejora realmente fácil

    • Me dio curiosidad y lo probé yo mismo. Transcribí el partido con whisper-small.en y luego le pedí a ChatGPT un resumen con un prompt neutral
      “La siguiente es una transcripción de un partido de fútbol. Por favor, redacta un artículo de 200 palabras sobre este encuentro con el estilo de un periodista deportivo profesional y experimentado.”
      El resumen empezaba así: “En su último partido profesional, Alex Morgan ofreció una actuación cargada de emoción y resiliencia, aunque San Diego Wave cayó 3-1 ante North Carolina Courage. Jugado en Snapdragon Stadium, en San Diego, este encuentro no fue solo una competencia, sino un homenaje a una de las figuras más icónicas del fútbol.”
      El marcador estaba mal. El resto está aquí: https://chatgpt.com/share/de8c60d1-69ab-4291-99dc-d4d95af3d3...
    • En deportes hay muchísimos datos estructurados, y especialmente para una marca como ESPN el estándar para describirlos con precisión también es alto
      Si metes varias horas de transcripción a un LLM, hay mucho riesgo de alucinación por cosas que el narrador dijo con emoción sobre oportunidades de gol o hechos que al final nunca ocurrieron
      En cambio, tareas simples como “convierte en oraciones la lista de goles, tiempos, goleadores y asistentes” pueden hacerse con algoritmos deterministas sin LLM, y puede que eso haya sido lo que pasó aquí. Algunos de los problemas gramaticales del texto original se sienten más como una mala combinación de reglas de sustitución anteriores a los LLM
      Sí se podría construir un sistema que valide iterativamente la primera salida de un LLM que resume una transcripción larga, y confirme su precisión comparándola con datos estructurados que ya se conocen. Podrías obtener contenido más rico y una tasa de error aceptable, y hasta ingenieros de aprendizaje automático de primer nivel podrían armar un prototipo en un hackatón
      Pero para una organización grande y adversa al riesgo no es nada fácil. Es difícil ganarle a la lógica de “lo que tenemos ahora es imperfecto, pero al menos no se equivoca en los hechos”
    • He hecho consultoría para varias empresas que se ven a sí mismas como compañías de “medios/periodismo”, y algo que siempre me sorprendió fue que el equipo técnico estuviera separado del equipo de contenido y muchas veces tuviera muy poco acceso a los recursos de medios
      Es bastante distinto de esa idea de “tener acceso a todo” que uno esperaría en una empresa tecnológica o de lo que suele considerarse sentido común
      No tengo idea de cómo trabaja ESPN; solo estoy infiriendo a partir de lo que vi en otros lugares
    • Pensé exactamente lo mismo. Parece que todavía están en una etapa muy temprana
  • Si en ningún lado de la entrada o del prompt estaba la información de que “este es el último partido de Alex Morgan”, entonces, ¿cómo se supone que el resumen de IA iba a meter eso en la nota del partido?
    Si le hubieran dado a cualquier pasante adolescente una tabla con las goleadoras y los minutos de los goles, habría escrito algo parecido. Pero eso tampoco justifica que medios y sitios deportivos usen IA generativa para todo, y entiendo por qué la gente está molesta con ESPN

    • Si esa información no estaba, no podía inventársela, y ese es el problema. Uno de los grandes argumentos de venta de la IA generativa es sacar a las personas del proceso de escritura, pero si alguien tiene que ver realmente el partido y explicarle en el prompt lo que pasó, entonces no sé cuál sería el sentido de esa tecnología
      Así es como se ve la adopción de IA generativa: usar insumos de baja calidad para fabricar algo que parece una nota. Este es el brillante futuro que nos trajo OpenAI
    • El punto de la crítica no es tanto “qué tan tonta es la IA”, sino que esto es más bien un ejemplo de cómo el contenido de IA puede quedarse corto, incluso si, como dice ESPN, una persona lo revisó
    • Esto parece menos una limitación inherente de la IA y más un problema de cómo usarla mejor
      En vez de meterle al LLM solo los eventos del partido y pedirle un resumen, se ve una ruta clara para mejorar: incluir en el prompt resúmenes de 10 artículos recientes sobre los jugadores, entrenadores, etc. que participaron en el partido, y quizá también 10 artículos históricos importantes
      Luego puedes pedirle que resuma el partido, pero que use la otra información como referencia para elevar la calidad del artículo. ¿No suena eso exactamente a algo para lo que un LLM sí puede servir?
    • Cualquiera que vaya a leer esa nota ya sabía muy bien que era el último partido de Alex Morgan. Si ESPN, que tiene una influencia enorme en los medios deportivos, no logra detectar eso y reflejarlo en el artículo, entonces no veo por qué una editorial debería usar el servicio de resúmenes de ESPN en vez de cualquier startup de Y Combinator
    • Para incluir ese tipo de información en el prompt, habría que construir una especie de sistema de generación aumentada por recuperación. Se podría hacer de forma semiautomática, pero solo si se invierte más esfuerzo en el sistema
  • ESPN enfatizó que “cada resumen generado por IA es revisado por un editor humano para garantizar calidad y precisión”, pero cuesta creerlo
    El objetivo central de hacer que la IA escriba notas es reducir la cantidad de personas a las que hay que pagarles, así que probablemente no esté sobre la mesa pagar para que expertos capacitados revisen cuidadosamente cada artículo
    Se puede ceder en la minuciosidad de la revisión, en el nivel de especialización del editor, o en no poner a una persona en cada nota, pero no van a pagar para que editores especializados hagan bien el trabajo. De eso sí estoy seguro

    • No creo que esa lógica cierre del todo. Con notas generadas se puede ahorrar mucho dinero, pero si el contenido no es preciso, se pierde la confianza de los anunciantes, que son los clientes
      Incluso si dejas 1 editor por cada 10 reporteros reemplazados, sigue siendo un ahorro enorme
      Tal vez dentro de unas cuantas generaciones más también reemplacen a los editores, pero yo no creo que todavía estemos ahí
  • ESPN sacó a las personas del periodismo, y la IA sacó a las personas del contenido periodístico
    En el anuncio del servicio, ESPN enfatizó que “cada resumen generado por IA es revisado por un editor humano para garantizar calidad y precisión”. No está claro si el editor humano no notó la ausencia de Morgan o si decidió que no valía la pena mencionarla
    Durante los últimos 100 años, echarle la culpa al pasante ha sido un excelente chivo expiatorio

    • Mi lectura es parecida. Da más bien la impresión de que “un adolescente en India revisa por encima 1,000 notas generadas por IA al día buscando expresiones ofensivas o cosas que puedan acabar en demanda, y eso es todo”
  • Realmente detesto los resúmenes de partidos con IA de WTT (World Table Tennis)
    Los highlights hechos por IA se cortan en medio del rally, se saltan puntos completos o incluso sets enteros. Tampoco captan cosas importantes que pasan entre punto y punto, y hasta se comen la narración emocionante, las celebraciones después de los puntos o el apretón de manos final

    • Odio todo lo que genera la IA. ¿También existe una especie de valle inquietante para el texto?
  • ¿Cómo se generan este tipo de resúmenes con IA? Me da curiosidad si le meten el archivo completo del video del partido y escupe un resumen, o si más bien le pasan un registro de puntuación con marcas de tiempo hecho por una persona y la IA le agrega frases para convertirlo en una nota

    • Antes, cuando esto se hacía antes de la IA, toda la información del partido estaba en una API y se llenaba una plantilla con eso
      Ahora probablemente meten las llamadas crudas de la API y usan un prompt como “escribe una nota de resumen del partido usando estos datos”, y sale un resultado. Claro, supongo que el prompt habrá estado más trabajado que eso. Aunque siendo ESPN, quién sabe
      Eso sí, no recuerdo para nada que retiring_players viniera en la respuesta de la API
      Y agrego algo: los resúmenes jugada por jugada están documentados de forma realmente extrema. Sorprende. En deportes populares como Gridiron Football o Basketball, a veces hasta incluyen la posición de los jugadores por segundo. Estos datos vienen de feeds como los de SportsRadar
      Probablemente no metan ese nivel de detalle en el prompt, pero sí hay información de resumen bastante buena, como cuántos triples metió alguien y desde dónde los lanzó
    • Si yo hiciera este prototipo, empezaría usando como entrada solo un registro jugada por jugada en texto semiestructurado
      Si además incluyes planteles, lesiones y calendario, incluso con un prompt bastante básico probablemente mejoraría bastante
      Ese tipo de datos ya existe hoy para la mayoría de los partidos en vivo a través de varios servicios web. ESPN también debería tener recursos de sobra para traer esa información internamente
    • Hay varias empresas que ofrecen datos deportivos en tiempo real vía API o resúmenes postpartido, así que probablemente usen algo de eso
    • Usan box score y eventos jugada por jugada
    • La brecha entre las expectativas y la realidad de la “IA generativa” ya es demasiado grande como para seguir ignorándola
      Si un sistema de miles de millones de dólares se rompe por “error humano”, entonces puede que sus capacidades estén muy exageradas. Si además necesitas consultas cuidadosamente diseñadas, “prompt engineering”, datos 100% libres de errores, una cantidad enorme de energía y personas revisando de nuevo la salida, entonces no sé qué fue exactamente lo que ganamos
      ¿No será ya hora de admitir que esta fase de la IA es una burbuja?
  • Estos sitios web están llenos de rastreadores y anuncios, y en general no hacen más que inflar muchísimo artículos de esfuerzo bajísimo que reportan cosas más bien irrelevantes