4 puntos por GN⁺ 2023-07-23 | 1 comentarios | Compartir por WhatsApp
  • La comunidad de World of Warcraft inventó deliberadamente una actualización de Glorbo que no existe, y zleague.gg, que reprocesaba automáticamente publicaciones de Reddit, la publicó como si fuera una noticia real
  • zleague.gg operaba resumiendo hilos de Reddit con IA para crear textos largos con “key takeaways” y párrafos estandarizados, en un modelo orientado a aparecer en búsquedas de Google
  • Usuarios de r/WoW mezclaron ficción y distorsiones, como una supuesta pista en Hearthstone de 1994, Klikclac, Halfhill Market y una raza jugable Klaxxi, para hacer caer al bot
  • El artículo generado automáticamente se publicó con el título “World of Warcraft Players Excited For Glorbo’s Introduction”, luego fue eliminado y ahora solo queda un espejo en archivo
  • Incluso si se atribuye la fuente a Reddit, quedó en evidencia que hay muy poca supervisión y casi ningún mecanismo de control en esta estructura que convierte publicaciones de la comunidad en contenido mediante IA

Sitio de scraping con IA cae en la actualización falsa de Glorbo

  • Usuarios del subreddit r/WoW de World of Warcraft se dieron cuenta de que zleague.gg copiaba publicaciones de Reddit, las resumía con IA y luego las publicaba como entradas de blog
  • zleague.gg tenía como negocio principal una app de juegos, y en un blog complementario estaba creando artículos a partir de hilos de Reddit
  • Para engañar al bot, los usuarios escribieron un largo hilo sobre la supuesta llegada de Glorbo al juego
    • Glorbo no es una función real de World of Warcraft
    • El texto incluía contexto falso, como que “ya había sido insinuado en Hearthstone desde 1994”
    • Se mezclaban nombres reales del juego, como Dragonflight, Chen Stormstout y Karazhan, para que sonara creíble

Ficciones incluidas en el artículo automático y problemas de operación

  • Basándose en ese hilo falso, zleague.gg publicó automáticamente un artículo titulado “World of Warcraft Players Excited For Glorbo’s Introduction”
  • El resumen del artículo publicado incluía afirmaciones que no coincidían con la realidad
    • Que los jugadores estaban entusiasmados por la llegada de Glorbo y su impacto en el juego
    • Que el objeto indispensable Klikclac podría afectar a los jugadores casuales
    • Que corría el rumor de que Stormsong Valley se convertiría en la nueva ubicación de Halfhill Market y de un minijuego de simulación de granja
    • Reacciones positivas a cambios anteriores, como si los Klaxxi hubieran sido añadidos como raza jugable
  • El artículo permaneció en línea durante un tiempo, luego fue eliminado, y puede verse en este espejo de archivo
  • Todos los nombres de autor del sitio parecen ser falsos, y toda la operación da la impresión de tener casi nula supervisión
  • Aunque se cite la publicación de Reddit y se identifique al autor, automatizar el ingreso de publicaciones de la comunidad a una IA y publicar el resultado tal cual crea un problema aparte
  • Estos sitios buscan captar tráfico desde Google, y será difícil detenerlos a menos que Google rebaje o prohíba los sitios basados en IA

1 comentarios

 
GN⁺ 2023-07-23
Opiniones de Hacker News
  • Casi no juego y el único dispositivo que tengo es una Nintendo Switch, pero cuando me atoro jugando el nuevo Zelda termino buscando en internet
    Vi que como los primeros 10 resultados publican artículos casi con el mismo formato, e incluso comparten exactamente los mismos errores en las respuestas
    La mayoría de los sitios de tips o FAQ de Zelda no parecen tener contenido original, sino más bien un anillo de webs basura que se regurgitan entre sí con IA
    Al menos uso bloqueador de anuncios y bloqueo de JavaScript, así que no les doy ingresos por publicidad

    • Los wikis y sitios de guías de juegos llevan tiempo convertidos en un basurero de SEO
      Supongo que es porque generan ingresos por anuncios
      No creo que sea que Google no tenga datos para decidir a qué sitios debería darles autoridad de dominio, pero sí entiendo que esto es una pelea hostil y constante entre el spam de SEO y los motores de búsqueda
    • También da risa que cuando ChatGPT responde preguntas sobre juegos, sea extrañamente verboso y le meta un párrafo introductorio sorprendentemente largo antes de contestar una pregunta simple
      Se parece muchísimo a esos sitios llenos de anuncios que te ponen un bloque rarísimo de introducción y tardan una eternidad en llegar a la respuesta
    • Un poco fuera de tema, pero relacionado. ToTK está realmente muy mal en accesibilidad, especialmente en lo cognitivo y sensorial
      Termino usando seguido el mapa de ZD TotK aunque no quiera: https://www.zeldadungeon.net/tears-of-the-kingdom-interactiv...
      No tiene nada de divertido tratar de recordar dónde estaba cierto enemigo. ¿A alguien de verdad le parece entretenido? Aunque los enemigos reaparecen con cada luna roja, el compendio no registra dónde están los enemigos con los que ya peleaste
      Necesito otro Savage Lynel Bow, pero no recuerdo dónde vi un Silver Lynel. No me dan ganas de rastrear todo el mapa fiándome solo de la señal vaga del sensor de la Purah Pad, que encima suena cuando ya casi estás encima. Hasta me pregunto si tengo que llevar notas aparte
      La idea de la función de registro es buena, pero omite demasiadas cosas. Las descripciones de las misiones muchas veces son insuficientes, y los marcadores a menudo solo señalan dónde está la persona que te dio la misión, así que ayudan poco
      Agradezco los subtítulos, pero no entiendo por qué tantas partes avanzan sin voz
      Como juego en PC, en lo personal no me afecta, pero igual me pregunto por qué no hay reasignación de botones
      Aunque desactives el FSR interno y el AA para evitar que a veces se vea como una papa borrosa, si no está claro dónde mirar, incluso con buena vista puede ser difícil encontrar objetos. El brillo de Ultrahand ayuda, pero es una solución malísima
      Tampoco hay configuración para daltonismo. De verdad, ¿qué se supone que están haciendo?
      Dejaron pasar demasiadas oportunidades para hacer este gran juego mucho más accesible. Nintendo dejó muy claro que no le importa la accesibilidad, y eso da mucha pena porque la accesibilidad hace que la experiencia sea mejor para todos
    • En Kagi esos sitios basura son relativamente obvios, así que simplemente los bloqueo
      De lo poco confiable que quedaba en este tema estaban GameFAQs, IGN y las revistas de videojuegos
    • Es realmente trágico. Cuando era niño, GameFAQs era prácticamente la única fuente y entraba mucho; además, esas guías aparecían bien posicionadas en Google
      El sitio sigue existiendo, pero ahora Google primero te muestra 20 sitios saturados de anuncios donde, para ver una guía de una sección de 5 minutos, tienes que ir haciendo clic en páginas nuevas como si fuera una lista infinita
  • Jaja, hice https://meat-gpt.sonnet.io. Es un sitio hecho para burlarse de las startups mediocres de IA, y no voy a spoilear cómo lo hace
    Hoy una de mis principales fuentes de tráfico, a veces incluso entre 70 y 80%, son esos pésimos catálogos de apps de IA. No solo incluyen mi MeatGPT, sino que además alucinan y se inventan descripciones hermosamente idiotas sobre qué hace el servicio
    Sinceramente, no creo que esto pudiera funcionar mejor. Es como si agarraran el jugoso pedazo de carne de mi sitio y se siguieran golpeando la cara con él mientras gritan “denme más”
    Me gusta el arte generativo y también hice una granja de contenido medieval autopublicada[1], pero esto hace que el texto se escriba solo a través de varios sitios
    [1] https://tidings.potato.horse

    • Ahora estoy completamente convencido de que existe un problema de alineación
  • La clave es esta frase:

    But again, there’s nothing to stop this. These subreddits can’t only fill themselves with joke articles to screw up a site like this, even if this one specific example is good for a laugh.
    La mayoría de los hilos serían conversaciones normales, y sitios de discusión como Reddit podrían convertirse en una fuente simple para resumir y generar noticias “gratis”.
    También pienso que HN podría usarse como fuente de noticias tecnológicas. Bastaría con resumir la publicación objetivo y añadir un resumen de los comentarios principales del hilo y el tono general.
    No digo que yo lo vaya a hacer, pero si a mí se me ocurrió, es muy probable que alguien ya lo haya intentado mucho más en serio.

    • Sigo escuchando esto tanto en HN como en la vida real, pero desde la perspectiva de un periodista me parece que falla un poco porque deja fuera el valor del reporteo.
      Algunas noticias sí podrían hacerse solo raspando cosas como hilos de Reddit, pero gran parte del buen periodismo incluye reporteo que produce información nueva a partir de fuentes confiables.
      Incluso sin reporteo, si no puedes escribir algo que aporte al acervo de conocimiento del mundo, no tiene valor para consumidores ni anunciantes. Lo mismo pasa incluso en el mundo del spam de SEO. Tiene que haber algún esfuerzo por diferenciarse de la competencia para ocupar los primeros resultados.
      Los hilos de Reddit muchas veces están llenos de reacciones emocionales a noticias ya producidas de esa forma. En algún punto, un ser humano tiene que salir y hablar con otros humanos, crear un ángulo o argumento nuevo, seguir preguntas y conectar puntos que nadie había unido todavía. Eso es noticia; no un resumen de actitudes ya existentes.
    • Hice un sitio web que funciona más o menos así: toma posts de HN con más de 400 votos, reúne la lista de títulos, le pide a una IA que filtre lo no relacionado con tecnología (temas del Bay Area, política, etc.), y luego raspa las publicaciones seleccionadas, redacta resúmenes y los publica en un sitio estático.
      Como otras fuentes usa subreddits de Reddit y feeds RSS, blogs oficiales de lenguajes y páginas de releases de GitHub.
      La IA se deja engañar bastante fácil. Eso se puede evitar si se le da más contexto y se añade una etapa de revisión para comprobar que se sigan las reglas editoriales.
      Otra idea que estoy considerando es usar un modelo más barato (gpt-turbo-3.5) para escribir y un modelo más sofisticado (gpt4) para revisar.
    • Aunque no quieras simplemente resumir comentarios, la sección de comentarios de la mayoría de los artículos puede verse como una investigación crowdsourced sobre el tema.
      Después de leer una discusión interesante ahí, es fácil salir con una lista corta de artículos relacionados, libros y demás, y a menudo hasta con explicaciones directas y muy vivas de personas involucradas.
    • Escribo esto de forma anónima. De verdad existen startups haciendo esto, y no debería dar más detalles.
      La información quiere ser libre. Por ahora es un plugin de navegador que permite leer el DOM y etiquetarlo, y ese trabajo humano alimenta el sistema de entrenamiento.
      La idea empezó como una versión independiente en plugin de navegador de las Community Notes de Twitter, y luego se expandió al entrenamiento de modelos que parecen usuarios recorriendo la web y leyendo el DOM.
      Como no están pegándole a la API, ¿entonces tampoco pagan tarifas? El que elige las interacciones es el usuario.
      Parece que la única defensa para frenar una IA entrenada para verse como doom scrolling sería el rate limiting.
    • No podrían publicar solo ese tipo de textos, pero sí podrían avergonzar a quienes disfrazan autores de IA como si fueran humanos.
      Como mínimo, habría que indicar de alguna forma que ese texto fue escrito por IA. Si no, este engaño podría usarse para avergonzar a alguien que era percibido como autor humano.
  • Esto está pasando más allá de este sitio en particular, en muchos sitios de noticias de videojuegos.
    En mi feed de Google News veo regularmente artículos que resumen hilos de Reddit; su exactitud periodística es dudosa y claramente son textos generados por IA.
    Aun así, cuando funciona bien, resulta bastante útil y oportuno.
    Ya pasó como un año desde que vimos aparecer una IA de texto generativo decente, así que me imagino un día en que, en vez de conectarme a internet con un dispositivo, llame por teléfono a una voz de IA para preguntarle si hay correos urgentes o para escuchar solo un resumen de las noticias que de verdad me importan.
    La web pasó de ser algo que de verdad amaba a convertirse en una relación abusiva tan incrustada en la vida diaria que ya no puedo cortar del todo.
    Le doy la bienvenida a un intermediario de IA que se banque leer por mí el spam de SEO, los títulos clickbait y los comentarios sin sentido, y luego me sintetice solo lo importante de forma útil.

    • Conectarse a internet sin un agente de IA va a terminar pareciéndose a andar sin cubrebocas durante COVID.
  • Interesante. Se parece mucho a la experiencia contracultural que viví como hacker en los 80.
    La sensación de pelear contra “The Man” ahora podría continuar contra “The AI”. Bien por los nerds de los videojuegos.

    • Creo que este tipo de cosas termina mostrando hasta qué punto los creadores de esa cosa, esta vez los creadores de IA, no respetaron lo suficiente la posibilidad de que el público la use de formas imprevistas o abusivas.
      A la gente no le importa cómo los desarrolladores quieren que se use. A la gente le interesa qué puede lograr que haga.
      Ahí están los hot rods, el overclocking y muchos otros ejemplos.
    • Siento que esto se repite cada vez que aparece una herramienta nueva y lo bastante poderosa.
      Las personas menos atadas a jerarquías pueden moverse rápido, y de hecho lo hacen. Cuando llega un cambio grande, pueden meterse por esas grietas y causar bastante daño, y las organizaciones enormes luego se ponen al día y desvían recursos a reforzar lo que ven como fallas: por lo general, cualquier cosa que reduzca su control sobre un sistema o sobre piezas de conexión.
      Ojalá todo se vuelva todavía más rápido y más caótico. Los mejores resultados salen cuando la gente con poder de acción se lanza con rudeza por cariño y no por dinero.
  • Es un movimiento un poco raro que un sitio spam, seguramente desesperado por tráfico, ahora elimine una publicación que se volvió viral.

    • Sí. Pero por otro lado, esto es contenido MFA.
      Lo peor aquí no es la mala fama, sino acabar en una blacklist de Google o del mercado de publicidad programática. Lo primero te quita tráfico; lo segundo te quita la capacidad de monetizar.
      Irónicamente, parece que la guerra contra el contenido basura generado por IA la van a librar las empresas de ad tech, que necesitan sostener de forma convincente que sus clientes no están tirando dinero en inventario publicitario sin valor.
    • Gane dinero como gane, la gente que llega en este contexto tiene pocas probabilidades de convertir.
      Bajar el artículo al menos también reduce un poco el daño reputacional.
  • Ayer, mientras buscaba la opción de estabilización de video en Linux, me sorprendió ver un artículo que describía con mucha seguridad una herramienta que supuestamente mantenían los “autores” de ffmpeg.
    Así que la busqué, pero no pude encontrarla, y cuando hice la búsqueda poniendo el nombre entre comillas, solo aparecía mencionada en tres artículos escritos por la misma empresa.

    • Ya está empezando a pasar. El contenido generado por LLM lleno de alucinaciones está cubriendo la web.
      Si la relación señal-ruido se desploma y se vuelve prácticamente imposible separar la paja del grano, internet pronto será completamente inútil.
      Ese paper de los transformers de IA de verdad fue una caja de Pandora.
  • Ojalá los desarrolladores de Warcraft ahora llamen Glorbo a uno de los futuros añadidos reales.

    • Si Blizzard todavía hace bromas del Día de los Inocentes, ya tienen listo el material para el próximo año.
  • Lo predigo ahora mismo. Glorbo va a entrar en el próximo parche.

  • Este post también es la misma basura, literalmente igual que los posts de IA de los que se queja.
    No es más que un artículo periodístico hecho a partir de un hilo de reddit.