- En los archivos antiguos de PhysicsForums, una comunidad científica iniciada en 2001, se encontraron rastros de publicaciones generadas por LLM insertadas con fechas del pasado y atribuidas a nombres de usuarios ya existentes
- Al contrastar la relación monótonamente creciente entre el ID de las publicaciones y la hora de publicación, se detectó un patrón de inserción retroactiva; tras excluir excepciones legítimas como la fusión con MathHelpBoards, se estima que unas 115,000 publicaciones fueron escritas por LLM
- El caso representativo de la cuenta ravenprp mostraba solo 74 publicaciones en los registros de Wayback Machine de 2019, pero ahora aparece con 2,891; las 2,817 publicaciones añadidas se reparten desde antes o alrededor de la creación de la cuenta hasta después de su último inicio de sesión
- Se estima que las publicaciones generadas por LLM representan alrededor del 1.6% del total de publicaciones y cerca del 3% del total de palabras, pero al incluir también las FAQ y los resúmenes, la proporción de palabras escritas por humanos en todo el sitio baja a 66%
- Greg Bernhardt respondió que las funciones de IA y los experimentos con cuentas de prueba no cumplieron sus estándares de calidad, pero atribuir textos a identidades de usuarios existentes sin su consentimiento daña la confianza de la comunidad y la integridad del archivo
El valor archivístico de un viejo foro científico
- PhysicsForums es una comunidad científica iniciada en 2001 por Greg Bernhardt, con una fuerte orientación de foro para dar pistas sobre tareas de física
- El sitio creció con relativa constancia hasta 2012, pero luego el interés se desplazó hacia sitios centralizados como StackExchange, y para 2025 solo quedaba una comunidad pequeña
- A diferencia de muchos foros web tempranos, PhysicsForums mantuvo sus URL desde 2003 hasta 2025 y no borró publicaciones antiguas ni cerró el sitio, por lo que quedó como una cápsula del tiempo del internet de principios de los 2000
Señales extrañas reveladas por la cuenta ravenprp
- La cuenta ravenprp aparece hoy como si hubiera escrito 2,891 publicaciones en 7 meses, entre septiembre de 2006 y abril de 2007
- Eso equivale a más de 13 publicaciones por día en promedio, y por su contenido parece asumir múltiples identidades: profesor universitario, estudiante de ingeniería mecánica, reclutador de una planta química, ingeniero estructural, biólogo, físico médico, químico e ingeniero aeroespacial, entre otros
- Algunas publicaciones figuran como escritas desde 3 años antes de la creación de la cuenta hasta 1 año después de su último inicio de sesión
- Incluso hay una publicación que bromea sobre “un modelo de lenguaje desarrollado por OpenAI”, aunque eso sería 7 años antes de la fundación de OpenAI
- En los registros de Wayback Machine de 2019, esta cuenta tenía 74 publicaciones, pero ahora aparece con 2,891
- Parece que en algún momento se insertaron publicaciones directamente en la base de datos, y que la fecha de registro del perfil o la información del último inicio de sesión no se actualizaron en consecuencia
- Si se observan solo las 74 publicaciones originales, ravenprp se parece más a un estudiante de ingeniería eléctrica que preguntaba por libros de MATLAB, trataba problemas con el IC temporizador 555 y compartía enlaces sobre la ecuación de Bernoulli
- Los pensamientos y textos de la persona real en esas 74 publicaciones quedan casi sepultados por las 2,817 publicaciones añadidas a la misma cuenta
El patrón de inserción retroactiva revelado por los ID de publicación
- Las publicaciones y los hilos de PhysicsForums tienen ID numéricos secuenciales
- En condiciones normales, un ID de publicación más grande debería corresponder a una hora de publicación más tardía
- Puede haber excepciones por eliminaciones, restauraciones, división de hilos o problemas de base de datos, pero la tendencia general debería ser monótonamente creciente
- En una muestra aleatoria de 30,000 publicaciones, esta regla se mantiene en la mayor parte del período
- Una de las grandes excepciones es la fusión con MathHelpBoards en 2022
- Se integró un archivo de unas 150,000 publicaciones conservando sus fechas originales
- Excluyendo la fusión con MathHelpBoards y los casos que parecen cercanos a su fecha real de escritura, se estima que unas 115,000 publicaciones fueron escritas por LLM y luego atribuidas a cuentas humanas
- Los usuarios afectados son al menos 110 según una muestra representativa
- Incluyen autores de comentarios tempranos, autores de una sola vez, lectores de largo plazo e incluso al fundador y administrador Greg Bernhardt
- A cada cuenta se le terminan asociando posturas cuya aceptación por parte del usuario real es imposible de saber
Problemas de calidad causados por FAQ y resúmenes generados por LLM
- En un hilo de 2007 sobre la HP 50g Graphing Calculator, una respuesta y una FAQ aparentemente generadas por LLM no mejoran el valor de la información original
- La respuesta escrita por LLM en ese hilo solo acierta en un dato —la existencia del “HP 50g Connectivity Kit”— y el resto no aparece reflejado en el manual de la HP 50g ni en otras fuentes reales
- La FAQ menciona las funciones “GET” y “PUT”, pero ni esas funciones ni “HP 50g Spreadsheet” aparecen en el manual, y las búsquedas tampoco muestran resultados fuera de ese hilo
- En el conteo de palabras de ese hilo, la parte escrita por LLM representa el 92%
- Summary: 99 palabras, no humano
- Springo: 38 palabras, humano
- Phys.org: 34 palabras, no humano
- Shinny_head: 11 palabras, humano
- Ravenprp: 164 palabras, no humano
- FAQ: 260 palabras, no humano
- A escala de todo el sitio, se estima que las publicaciones LLM insertadas retroactivamente representan alrededor del 1.6% del total de publicaciones y cerca del 3% del total de palabras
- Si se incluyen las FAQ y los resúmenes generados por LLM, la proporción de palabras escritas por humanos en todo PhysicsForums queda en 66%
La comunidad detecta escritos de IA y cambios ocultos
- En noviembre de 2024, usuarios de PhysicsForums detectaron una anomalía: la cuenta Azntoon parecía haber publicado en un hilo de 2022 pese a que su último inicio de sesión había sido en 2012
- En ese momento, la discusión concluyó que podía tratarse de un problema de base de datos
- Después, la fecha de último inicio de sesión de Azntoon cambió a diciembre de 2022
- Desde 2022, usuarios del foro vienen discutiendo políticas sobre respuestas generadas por ChatGPT
- Vanadium 50 se quejó de que las “barely-lucid posts” de ChatGPT generaban mucho trabajo y podían verse como una especie de ataque DoS
- Greg Bernhardt dijo que Stack Overflow parecía estar intentando prohibirlas, y que PhysicsForums al menos debería marcar el contenido de ChatGPT como citado
- El 1 de abril de 2023, como evento del Día de los Inocentes, el nombre visible cambió a ChatGPT, pero eso no se interpretó como que las publicaciones reales hubieran sido escritas por ChatGPT
- Los usuarios afectados por el contenido LLM quedaron ocultos en el autocompletado de búsqueda, y también se quitaron los enlaces al perfil desde las publicaciones
- Eso hace más difícil comprobar anomalías como la fecha del último inicio de sesión al hacer clic en el perfil
- Mientras se redactaba el texto, la comunidad también detectó problemas con las FAQ y se abrió una discusión sobre FAQ de baja calidad
- Al parecer, las FAQ no eran visibles para usuarios que habían iniciado sesión
- Las FAQ fueron eliminadas, pero los resúmenes generados por LLM en la parte superior de los hilos cerrados siguen ahí
La respuesta de Greg Bernhardt y la explicación de las pruebas
- Greg Bernhardt respondió a preguntas sobre el uso de LLM en PhysicsForums diciendo que se estaban probando varias funciones de IA para aumentar el valor de la comunidad
- En un formulario de feedback de 2024, muchos miembros dijeron que no querían funciones de IA, y él respondió que probablemente tendrían que mejorarse mucho o eliminarse
- También señaló que el año anterior habían probado respuestas de IA con cuentas de prueba, pero que no habían cumplido los estándares de calidad
- Ante preguntas adicionales, dijo que habían imaginado un bot que ofreciera respuestas de alta calidad en hilos sin respuesta por más de un año, pero que fracasó
- También comentó que, como los hilos sin respuesta desordenan el foro, están considerando la posibilidad de limpiarlos todos
Identidad de cuenta e integridad del archivo
- Rellenar cuentas de usuarios existentes con textos generados por LLM sacude la expectativa de que la identidad de la cuenta en una comunidad en línea pertenece al usuario
- Incluso si una cuenta es relativamente anónima, los textos que esa persona escribió con ese nombre y el tiempo que invirtió están conectados con una identidad real
- Si se rompe el contrato social de interactuar principalmente con humanos, disminuye el valor de la interacción humana que ofrecen las comunidades en línea
- El contenido web antiguo ya es difícil de rastrear por servidores desaparecidos y sitios cerrados, y si además se mezcla con datos generados por IA con fechas del pasado, la investigación sobre archivos de internet se vuelve aún más difícil
- Administrar un foro implica presiones como costos de servidor, mantenimiento de bases de datos, bots, DDoS, publicidad y competencia por clics, pero si para sobrevivir se daña la identidad central de la comunidad y la confianza de los usuarios, se debilita la base misma del sitio
1 comentarios
Opiniones en Hacker News
Algo que siento cada vez más con el contenido generado por LLM es que nadie lo quiere.
Si quiero hablar con una IA, hablo directamente con una IA. La razón por la que leo blogs o foros de discusión es porque quiero ver textos escritos por humanos, no textos basura de LLM copiados y pegados bajo el nombre de una persona.
Últimamente gasto bastante tiempo y energía evitando contenido de LLM en la web. Si estoy leyendo algo y veo un estilo ChatGPT como “As we dive into the ever-evolving realm of...”, vuelvo atrás de inmediato, y en la búsqueda de imágenes meto un montón de filtros de exclusión como
-AI,-Midjourney,-StableDiffusion. Algunas búsquedas incluso las limito a antes de 2022.Si Google agregara un filtro global de “eliminar contenido generado” que funcionara bien, creo que lo activaría y nunca lo volvería a apagar. También hubo estudios que muestran que los usuarios rechazan de inmediato el contenido que parece hecho por IA, sin importar su calidad, así que los editores tienen incentivos para lavar humanamente los textos de IA y hacerlos pasar por escritos por personas. Lo de manipular timestamps y secuestrar cuentas antiguas es la primera vez que lo veo.
En Reddit he visto cosas como “no estoy seguro, pero ChatGPT dice esto”, y peor aún, gente que publica copias pegadas de ChatGPT como si fueran propias. Lo gracioso es que se nota porque el estilo parece texto escrito por alguien de Recursos Humanos.
Si alguien no tiene acceso a un buen modelo, podría tener algo de valor, pero nadie prefiere el formato de crear una página estática de diez párrafos para responder torpemente una sola pregunta. Una interfaz real de chatbot puede presentarme la información de una forma adaptada a mí, pero un texto basura tipo lista no es más que el mínimo común denominador pensado para el público más amplio posible.
Otro problema es que reformular información no crea información nueva. Cuando busco qué tipo de aceite ponerle a un auto o una receta de muffins de arándanos, necesito evidencia real, como si el fabricante indicó usar cierto grado de aceite o si alguien realmente horneó la receta y verificó el resultado. Regurgitar texto de otras fuentes, en general, no aporta nada a mi vida.
Cuando siento que un texto fue generado por un LLM, lo tomo como una señal de que el autor no sabe más que yo, y no tengo forma de creer que esa información sea correcta.
Muchos clientes detestan a los vendedores, y algunos se van de la tienda o ni siquiera entran por culpa de ellos, con lo que la tienda pierde ventas. Aun así, esta práctica ha continuado. Con la IA hay que prepararse para lo peor. Ni la ética, ni el criterio de negocio, ni la racionalidad impedirán que las empresas metan IA a la fuerza. Parece que consideran más importante irritar a los clientes.
La tendencia de que, alrededor de principios de la década de 2010, Google empezó a dejar de posicionar gradualmente en los primeros resultados los posts de foros tradicionales y blogs, independientemente de su calidad, si no eran sitios “grandes”, coincide con mi experiencia con mi blog.
Por otro lado, es impresionante que desde 2003 hasta 2025 no hayan cambiado la URL, no hayan borrado publicaciones antiguas y el sitio tampoco haya desaparecido. Los marcadores de 2008 de mi blog todavía funcionan.
El CMS ya desapareció y todo se volvió un sitio estático, pero hay demasiadas organizaciones que, cuando “refrescan” su presencia web, ni siquiera hacen una limpieza de este nivel.
Debates relacionados de la época: https://techcrunch.com/2014/01/23/googles-search-filters-now..., http://googlesystem.blogspot.com/2014/03/bring-back-forum-se..., https://www.ghacks.net/2014/01/23/search-discussions-blogs-p..., https://www.seroundtable.com/google-search-filters-gone-1799..., https://www.webmasterworld.com/google/4687960.htm, https://www.thecoli.com/threads/i-cant-google-search-by-disc..., https://www.neogaf.com/threads/anyone-else-annoyed-google-re..., https://webapps.stackexchange.com/questions/57249/has-the-op..., https://www.bladeforums.com/threads/how-to-do-google-discuss..., https://browsermedia.agency/blog/alternatives-discussion-sea...
Los foros y blogs tenían una cultura que Reddit o las redes sociales no pueden reproducir, y da pena perderla.
Me entristece que esto le haya pasado a PhysicsForums. Hace 15 años fue uno de los primeros sitios web que usaba con frecuencia por mi pasión por la física y, más adelante, cuando empecé mi carrera.
Sobre todo leía y a veces también contribuía, y todavía recuerdo a miembros que me hacían pensar que algún día sería tan inteligente y sabría tanto como ellos. En medio de la migración hacia las redes sociales después de la Primavera Árabe, cuando la era en que los foros eran el centro de la discusión empezó a quedar atrás, el ambiente comenzó a cambiar.
Desde alrededor de 2018 ya no lo visitaba salvo cuando llegaba desde Google y luego desde búsquedas en Kagi, pero el archivo sigue siendo útil para responder preguntas. Me cuesta estar de acuerdo con la conclusión del artículo de que, si los enlaces no se comparten en Twitter, a nadie le importa.
Es un texto que deja demasiado enterrado el punto clave. Casi al final de la historia, el dueño del sitio confirma que él mismo agregó comentarios de IA fechados retroactivamente. Tal vez era obvio.
Al crear una cuenta en una comunidad en línea, suele existir un contrato social de que principalmente vas a interactuar con personas. Puede haber cuentas promocionales, bots y anunciantes, pero el acuerdo entre los usuarios y el proveedor de la comunidad es que el proveedor intenta defendernos de esas cosas, y nosotros aportamos participación y contenido.
Por eso el experimento de Meta con usuarios generados por IA es ridículo y repugnante. Si puedes interactuar con algo que finge ser humano, y el resultado, en el mejor de los casos, es basura tibia, desaparece el valor de la interacción humana por internet.
Esto es un desastre. No veo un futuro en el que la verborrea generada artificialmente no termine aplastando todas las partes de internet hasta volverlas inutilizables. Tal vez la era del contenido generado por usuarios ya haya terminado.
También hay cuentas bot de suplantación, pero se pueden bloquear fácilmente mirando la cantidad de seguidores. Una vez que conozco la clave pública que usa Lyn, puedo confiar en que lo que se publique bajo ella es suyo.
Podría publicar tonterías de un LLM, pero la gente se daría cuenta rápido y lo dejaría de seguir. Lo importante es que, salvo que yo lo quiera, no hay un algoritmo que decida qué aparece en mi feed, así que es difícil que contenido aleatorio de LLM entre en mi feed.
Otra opción son las pruebas de identidad de conocimiento cero, que permiten demostrar que eres humano sin exponer información personal ni depender de que un servidor central inicie sesión por ti: https://zksync.mirror.xyz/kWRhD81C7il4YWGrkDplfhIZcmViisRe3l...
He oído que en algunos servidores de Discord no te dan acceso a todos los canales a menos que hayas conocido personalmente a un administrador, que alguien dentro del grupo responda por ti, o que te “verifiques” por videollamada.
Ese es el futuro. Hace falta algo con una estructura como Discord, pero con mecanismos tipo página web: un espacio donde pueda haber no solo publicaciones, sino también colecciones de documentos, y al que se pueda acceder desde un navegador.
Sin embargo, según cómo funcione el descubrimiento, esta nueva “internet” ya no será una forma fácil de escapar de una realidad o lugar concretos. Un gran motor del uso de internet en los 90 y los 2000 era la curiosidad por explorar cosas nuevas que no estaban disponibles en la comunidad local, y el viejo Google confiable era una pieza clave de eso.
Para las personas realmente antisociales será un mal cambio, aunque ese tipo de gente quizá prospere más bien en un entorno lleno de IA. Si los posibles nuevos hubs de entrada a una internet humana de grupo a grupo mantienen lobbies abiertos, tal vez se puedan obtener las ventajas de ambos lados.
Al final quizá terminemos con autenticación de identidad online emitida por bancos o gobiernos.
Sin duda habrá mercado para un juego en el que te vuelves influencer famoso al instante, pero será mucho más pequeño que el mercado de las redes sociales.
No termino de entender el problema del “backdating” o del secuestro de cuentas. ¿Cómo se hizo exactamente? Leí el artículo y aun así siento que se me escapó algo.
Según la respuesta de Greg Bernhardt, hay varias pruebas de IA en marcha para agregar valor a la comunidad, y muchos miembros no quieren funciones de IA. El año pasado experimentaron con respuestas de IA desde cuentas de prueba, pero no cumplieron con sus estándares de calidad, y pidió que le avisaran si encontraban cuentas de prueba que se les hubieran pasado.
No tengo idea de por qué reutilizaron cuentas humanas antiguas como “cuentas de prueba” de IA.
Me gusta la suposición de que originalmente eran cuentas reales.
Si administras un foro o un blog con una sección de comentarios activa, ¿cómo te sentirías si los usuarios entraran, miraran y no dijeran nada durante una semana? Al principio creas temas con tu propio nombre y escribes respuestas útiles, pero al final pareces un tonto hablando solo.
Si es un foro con buen tráfico y muchos anuncios spam, seguro que esa tentación aparece cuando los visitantes se van porque no hay publicaciones nuevas.
Hace años, en un foro algo estancado, creé dos cuentas con nombres parecidos desde la misma IP y discutí conmigo mismo. Al principio pensé que el administrador u otros usuarios se darían cuenta, pero pronto aprendí que pasan tantas cosas raras que ninguna conducta parece lo bastante rara.
La idea —o la realidad— de que el dueño de un sitio pueda secuestrar las cuentas de la gente para crear textos basura suplantando su identidad, quizá por ingresos publicitarios, es indignante y deprimente
Los problemas de confianza y atribución siempre existieron en la web, pero por varias razones ahora se sienten mucho peores. No sé cuánto más tiene que empeorar para que ocurra algún gran cambio
Tampoco sé bien cuál es la solución. ¿Registrar tu nombre o handle como marca y, aun sin mucho dinero, al menos amenazar con demandas? ¿Que todo el mundo firme sus textos con una clave privada usando infraestructura de clave pública, y que gastemos CPU verificando firmas para detectar suplantaciones? ¿Capturar expectativas colectivas implícitas y formalizarlas dentro del marco fragmentado de los sistemas legales del mundo? Por ejemplo, montar un “negocio” pequeño pero plausible que venda consejos y opiniones bajo ese nombre, y luego cuestionar que el suplantador dañó la marca.
Además, la forma en que están redactadas esas respuestas también resulta bastante incómoda. Aunque uno tenga un título de ingeniería, cuando responde en línea en tono juguetón casi nunca dice “como ingeniero”. Porque para responder con esa autoridad ética habría que hacer un análisis suficiente. Pero los bots parecen no tener ese reparo
La persona llamada ravenprp era estudiante de ingeniería hace algunos años. Quizá sea menos grave porque no comentaba con su nombre real, pero por la naturaleza del contenido de este sitio, fácilmente podría darse una situación en la que se suplante “como ingeniero” a alguien que realmente trabaja en un área y tiene reputación profesional
El sitio incluso tiene el registro histórico de esa persona haciendo y respondiendo preguntas durante su formación, así que puede inducir muy bien a la gente a creer que un ingeniero real está respondiendo preguntas. Sé que el concepto de reputación profesional individual se ha debilitado mucho en el mundo moderno hiper-corporativizado, pero cuanto más lo pienso, más me parece que esto es pésimo y, de hecho, casi peligroso
Siempre me pregunté si la gente podría poner alguna marca criptográfica en sus textos para vincularlos con algún archivo. Pensaba sobre todo en respaldar reseñas de Yelp para que no desaparecieran, pero no sé si también serviría para impedir textos que alguien no escribió
El foro de ShackNews https://www.shacknews.com/chatty era parecido. Si retrocedes en el tiempo, puedes encontrar publicaciones sobre lo que estaba ocurriendo durante el 9/11
Por lo que se ve, a la gente de Estados Unidos y quizá de Europa parece gustarle todo tipo de foros especializados como PhysicsForum. En cambio, la gente en China parece preferir lugares centralizados
Por ejemplo, Zhihu (zhihu.com) era un clon de Quora, pero ahora se convirtió en el sitio más grande para encontrar discusiones profundas prácticamente de cualquier área: matemáticas, aprendizaje automático, historia, física, ingeniería, ciencia en general, etc. Muchísimos investigadores, expertos y aficionados comparten sus perspectivas
En cambio, la calidad de Quora parece haber empeorado año tras año, y la mayoría de los expertos están dispersos en toda clase de foros especializados. Me pregunto por qué surgió esta diferencia