1 puntos por GN⁺ 2 시간 전 | 1 comentarios | Compartir por WhatsApp
  • De los 22 artículos revisados en NeurIPS, WACV y ECCV TerraBytes, 15 (68%) tenían citas o listas de autores manipuladas, o frases claramente generadas por LLM; los dos artículos que denunciaban autores falsos también fueron aceptados como presentaciones orales con la condición de corregir las referencias
  • Se estima que en la literatura académica de 2025 hubo alrededor de 146,900 citas alucinadas, y el 85.3% de las citas alucinadas rastreadas desde bioRxiv hasta la versión publicada seguían presentes incluso después de pasar la revisión
  • El problema se extendió más allá de los envíos y llegó a la revisión: el 21% de las revisiones de ICLR 2026 fueron clasificadas como completamente generadas por IA, y en ICML 2026 se detectó uso de LLM en unas 795 revisiones escritas por revisores que tenían prohibido usar LLM
  • Más que el uso de LLM en sí, el problema es presentar resultados no verificados; errores en las referencias, discrepancias numéricas entre el texto y las tablas, promoción exagerada de resultados y secciones de discusión que solo repiten métricas son señales de que el manuscrito no fue revisado lo suficiente
  • Se publicó bib-audit, que compara referencias contra varios registros, pero como envía parte de manuscritos confidenciales a un LLM alojado, los revisores deben verificar primero la confidencialidad y las políticas de LLM de cada conferencia

La escala detectada al revisar 22 artículos

  • Dos revisores evaluaron durante el verano un total de 22 artículos en NeurIPS, WACV y el workshop geoespacial TerraBytes de ECCV
    • En 15 artículos (68%) encontraron señales claras de generación por LLM, como citas completamente fabricadas, listas de autores alteradas de artículos reales, terminología alucinada, frases sin sentido o citas irrelevantes
    • Un revisor detectó estos problemas en 6 de 11 artículos (55%), y el otro en 9 de 11 (82%)
  • Los resultados por conferencia fueron los siguientes
    • Track Datasets and Benchmarks de NeurIPS: 2 de 5 artículos
    • Track Position Paper de NeurIPS: 2 de 2 artículos
    • TerraBytes: 1 de 2 y 4 de 5, respectivamente
    • WACV: ambos revisores, 3 de 4 artículos
  • Los artículos que ameritaban desk reject solo por problemas de citas fueron 5 y 9, respectivamente
    • Dos artículos de WACV habían cambiado, desde el primer ítem de la bibliografía, los autores de artículos reales por nombres falsos
    • Un artículo de NeurIPS tenía terminología alucinada o sin sentido a lo largo de 53 páginas, por lo que revisar las referencias en sí no tenía sentido
    • Los dos Position Papers de NeurIPS fueron considerados generados por LLM, y 4 de los 5 artículos asignados en TerraBytes también tenían citas o autores falsos

Citas alucinadas extendidas por toda la literatura académica

  • En abril de 2026, un análisis de Nature identificó que al menos decenas de miles de publicaciones de 2025 podrían contener referencias incorrectas generadas por IA
  • Una auditoría de Zhao y otros sobre arXiv, bioRxiv, SSRN y PubMed Central estimó que solo en 2025 hubo unas 146,900 citas alucinadas
    • No estaban concentradas en unos pocos actores maliciosos, sino dispersas de forma delgada entre muchos artículos
    • Era más probable que aparecieran en investigadores al inicio de su carrera y equipos pequeños
    • Al rastrear las versiones publicadas de preprints de bioRxiv con citas alucinadas, el 85.3% permanecía igual
  • En una auditoría de The Lancet sobre 2.5 millones de artículos biomédicos, la proporción de artículos con al menos una referencia falsa aumentó seis veces en dos años
    • Pasó de 1 por cada 2,828 artículos en 2023 a 1 por cada 458 en 2025
    • A inicios de 2026 llegó a 1 por cada 277
  • En un análisis de 100 citas alucinadas en artículos publicados de NeurIPS 2025, todas las citas habían pasado por revisión de 3 a 5 expertos
    • Los artículos que contenían esas citas eran 53, alrededor del 1% de todos los aceptados, y todavía siguen en los proceedings

Evaluación por pares escrita por IA y posibilidad de manipulación

  • Un análisis de Pangram sobre ICLR 2026 clasificó 15,899 revisiones, es decir, 21%, como completamente generadas por IA
    • Más de la mitad de todas las revisiones tuvo algún tipo de participación de IA
  • Organization Science registró un aumento del 42% en envíos desde la aparición de ChatGPT, y actualmente mide algún nivel de uso de IA en más del 30% de la evaluación por pares
  • La detección de prompt injection en ICML 2026 encontró uso de LLM en unas 795 revisiones escritas por 506 revisores bajo Policy A, a quienes se les prohibía usar LLM
    • Eso equivale a cerca del 1% de todas las revisiones
    • En NeurIPS también se observaron revisiones éticas claramente generadas por IA y varias refutaciones generadas por IA
  • Las revisiones de IA pueden elevar la evaluación reescribiendo el abstract de forma adversarial, sin cambiar el contenido científico del artículo
    • En el experimento de Li y otros, el ataque más fuerte logró una tasa de éxito de alrededor del 38%
    • En una escala de 10 puntos, el puntaje de aceptación subió 1.31 puntos con el revisor Gemini 3 Flash y 0.88 puntos con el revisor GPT 5.4 Mini
    • El atacante ni siquiera necesitaba saber qué modelo de revisión se estaba usando

Manipulaciones y señales de detección encontradas en revisiones reales

  • Los peores casos fueron dos envíos que mantenían la conferencia, el título y otros autores de artículos reales, pero cambiaban solo a autores conocidos personalmente por nombres ficticios parecidos
    • Aunque el revisor recomendó rechazo y los reportó directamente a los organizadores, ambos fueron aceptados como presentaciones orales condicionadas a corregir las referencias
  • Un artículo de WACV que citaba SatMAE escribió los autores como “Yuyang Cong, Saurabh Khanna, Chen Meng, et al.”
  • Artículos de NeurIPS de 53 y 40 páginas contenían terminología alucinada y referencias manipuladas, y uno incluso dejó notas internas del LLM junto a varias citas
  • Tanto los autores falsos como las referencias completamente falsas revelan que el manuscrito no fue revisado lo suficiente
    • Deja en duda si realmente leyeron el trabajo citado, si lo citaron en el contexto correcto y si otras partes del artículo, el código o el dataset son confiables
    • La postura es que un artículo con referencias alucinadas no está listo para aceptación y debería recibir desk reject
  • Señales de alta probabilidad de escritura por LLM

    • Señales estilísticas comunes incluyen frases contrastivas como “It’s not X, it’s Y” y “The real X is Y”, exceso de negritas y em dash, frases densas difíciles de interpretar y promoción exagerada de los resultados
    • Una señal más sutil es cuando los números o métricas del texto no coinciden con las tablas
    • Estas discrepancias aparecen si, después de volver a ejecutar experimentos, no se le indica al agente que actualice o verifique todos los números
    • Claude tiende a comprimir en el texto principal cifras que deberían ir en el apéndice o en el código, y a repetir tal cual las métricas de las tablas en la sección de discusión
    • También son señales de alerta los modelos personalizados que llaman SOTA a mejoras de menos del 1% sin promedio ni desviación estándar, fórmulas complejas donde bastaría una cita y experimentos de ablación que deberían estar en el apéndice

Cambios en el trabajo de revisión

  • El proceso de revisión cambió: justo después de leer el abstract, ahora se ojean primero las referencias y se verifica rápidamente si todo el artículo parece salida de un LLM
  • Al aumentar el tiempo dedicado a buscar huellas de LLM, también se debilita la premisa de que los artículos fueron enviados de buena fe
    • La sensación es que disminuyó mucho la cantidad de artículos interesantes, escritos por humanos y que valen la pena leer
    • Aun así, salvo por las referencias alucinadas, muchos problemas son similares a los de revisar artículos humanos de baja calidad de antes
  • El uso de LLM en sí no es un criterio de revisión
    • Si un LLM ayudó en la redacción, pero la investigación es interesante, los experimentos son válidos y se puede reproducir, no hay problema
    • El problema es enviar sin revisar la salida de un LLM y pedirle feedback al revisor
  • Al exigir que quienes envían artículos hagan 4 o 5 revisiones, las conferencias también aumentan el volumen de revisión no remunerada
    • Los revisores dedican noches o fines de semana a revisar, y si descubren tarde una cita alucinada, ese tiempo se desperdicia
    • Para aprender de una revisión, el investigador primero debe leer y reflexionar lo suficiente sobre su propio trabajo

Cómo usar LLM en investigación y escritura

  • Se usan LLM como Claude todos los días, pero la salida siempre se verifica, edita y reescribe
    • Tras usar Claude para un borrador de revisión bibliográfica, se leen directamente los artículos originales y las publicaciones
    • Se buscan y reemplazan los estudios originales citados por blogs, se reorganiza el material y se eliminan detalles innecesarios
  • Antes de enviar un artículo, se lee todo el manuscrito cuidadosamente y se revisan manualmente las referencias
    • Se le pide a Claude que encuentre partes ambiguas y luego que entreviste con preguntas de opción múltiple para alinear la intención
    • Incluso después de ejecutar bib-audit, se verifican ítems individuales en bases de datos como Google Scholar, IEEE y CVF
    • También se reutiliza BibTeX real acumulado durante años en Zotero
  • Se busca feedback de otras personas desde temprano y, si hace falta, se reestructura todo el texto incluso durante el borrador
    • Se considera que el trabajo apurado justo antes del deadline es una causa de los artículos de baja calidad generados con LLM
    • Es importante el criterio de investigación formado desde antes de los LLM, y preocupa un entorno donde investigadores jóvenes generan investigación sin dirección
  • Cómo controlar el estilo de Claude

    • Las frases escritas por agentes son demasiado densas y fluyen mal, por lo que se limitan los em dash y los punto y coma
    • Fable 5 tiende a abusar de los dos puntos en lugar de em dash y a producir un estilo de marketing B2B SaaS
    • El objetivo son frases que puedan leer personas fuera del área, sin ser demasiado agresivas ni demasiado planas
    • Funcionó bien una skill con reglas entre escritura científica y ASD-STE100 Simplified Technical English
    • Primero hay que definir el propósito del texto y su audiencia, y luego ajustar el formato a esos lectores
    • El estilo predeterminado de Claude no es adecuado para lectores científicos
    • Si quedan demasiadas negritas, listas y frases de marketing, también puede ponerse en duda el origen del contenido y si fue verificado

Por qué hace falta filtrar en la etapa de envío más que solo divulgar públicamente

  • La obligación de divulgar el uso de LLM puede ser útil para investigadores de buena fe, pero se cree que no cambiará mucho el comportamiento real
    • TorchGeo agregó una política de IA con niveles “sin uso de LLM”, “asistido por LLM” y “escrito completamente por LLM”, pero es poco probable que alguien elija voluntariamente la última opción
    • Aunque haya sido escrito con LLM, si el resultado fue verificado, es reproducible y es un buen artículo, puede aceptarse
  • Se necesita un mecanismo de desk reject o una herramienta de marcado que detecte errores comunes de LLM y determine si un manuscrito está en condiciones de ser revisado
  • La responsabilidad recae en autores, asesores, area chairs, organizadores y conferencias
    • Los autores no deberían enviar en masa artículos de bajo esfuerzo para inflar su CV
    • Asesores y mentores deben impedir envíos de bajo esfuerzo de sus estudiantes
    • Los organizadores deben crear formas de filtrarlos en medio de envíos masivos
  • El problema de los incentivos de publicación existía desde antes de los LLM, y Lipton y Steinhardt ya resumieron en 2018 el adorno matemático, el mal uso del lenguaje y los incentivos desalineados
  • Que un LLM pueda convertir un proyecto de clase o resultados de investigación automatizados en un artículo con formato NeurIPS no significa que deba enviarse si no hay una contribución real de investigación
    • Con Opus 4.6 y el repositorio autoresearch de Karpathy se pudieron crear resultados y un artículo que parecían SOTA en LandCoverAI, pero no se enviaron porque no eran una contribución de investigación
    • AAAI 2027 recibió 48,000 abstracts, lo que agranda aún más la escala del problema del filtrado automático

Auditoría automática de referencias con bib-audit

  • bib-audit es una skill de Claude Code con licencia MIT que compara títulos, años y listas completas de autores de las referencias contra registros de entidades registradoras
  • Puede recibir como entrada .bib, .bbl y PDF
  • Los resultados se ordenan desde los errores más graves
    • Artículos inexistentes
    • Identificadores manipulados y autores falsos
    • Metadatos incorrectos de artículos reales, listas de autores truncadas y diferencias de año entre preprints y versiones publicadas
    • Errores de formato como guion simple en rangos de páginas, DOI guardados como URL o iniciales en formato J.D.
  • No solo revisa si existe el título: compara la lista completa de autores, por lo que puede encontrar reemplazos de autores como en el caso de SatMAE
  • Los ítems enlazados solo por búsqueda de título, sin DOI ni ID de arXiv, no se afirman de forma concluyente y se devuelven como recomendaciones que requieren verificación manual
    • En una revisión no se deben inferir motivaciones; hay que reportar solo hechos observados, como “el primer autor en el registro de arXiv no es Yuyang Cong, sino Yezhen Cong”
  • La revisión de .bib es de solo lectura, no tiene dependencias adicionales y puede configurarse para fallar solo ante discrepancias en ítems fijados por identificador, por lo que puede usarse como puerta de CI antes del envío
  • Además de Claude, puede instalarse en Codex, Copilot, Cursor y otros agentes mediante npx skills add isaaccorley/skills

Confidencialidad y políticas de conferencia que los revisores deben verificar

  • El proceso de auditoría envía parte de las referencias de manuscritos confidenciales a un LLM alojado, por lo que puede violar políticas de conferencia aunque el revisor no use un LLM para escribir la revisión
  • La política de ECCV 2026 prohíbe usar LLM locales o por API para escribir revisiones o meta-revisiones, y también prohíbe por separado compartir partes sustanciales del envío con un LLM
  • Las guías para revisores de WACV califican las revisiones generadas por LLM como una conducta muy irresponsable
    • Si se infringe, el propio artículo del revisor puede recibir desk reject
    • También se prohíbe mostrar material confidencial a alguien que no sea revisor, y un LLM alojado no es un revisor
  • La política de LLM de NeurIPS limita lo que los revisores pueden compartir con servicios de LLM
  • Los autores pueden ejecutar bib-audit directamente antes de enviar, pero los revisores deben revisar necesariamente las políticas de LLM y confidencialidad de la conferencia antes de usarlo

1 comentarios

 
GN⁺ 2 시간 전
Comentarios en Hacker News
  • En el proceso actual de publicación de investigación en IA, la IA ya se encarga de redactar, revisar, leer y resumir artículos
    NeurIPS también está realizando un experimento de revisión asistida por IA, y hay demasiados artículos en las principales conferencias como para que una persona los lea todos
    Los humanos están siendo desplazados muy rápidamente por la automatización en el proceso de publicación académica

    • Más que sacar a los humanos del proceso de publicación, esto parece automatizar la producción masiva de artículos de mala calidad
      Pasé por algo parecido en una revisión reciente de EMNLP, y la IA todavía está muy lejos de poder juzgar la calidad de una investigación
      El bien público que es la revisión por pares honesta está siendo abusado, pero fuera de restringir el acceso al sistema de revisión con una especie de puntaje social extremo, no parece haber una solución clara
    • El siguiente paso probablemente será que revistas gestionadas por IA les cobren suscripciones a otras IAs, y que universidades gestionadas por IA asciendan a la IA con más artículos y citas
    • Es importante que incluso los artículos donde se detectó uso de IA siguieran siendo aceptados
      Como la gran mayoría de los investigadores usa IA activamente, no quieren castigar eso ni crear un entorno que también los perjudique a ellos, y el ambiente general parece inclinarse por no preocuparse y aceptarlo
      Al final, esto revela la dura realidad de que casi nadie se tomó la ciencia en serio desde el principio
    • Esto me hace pensar en desiertos de razonamiento (reasoning deserts), parecidos a los desiertos alimentarios
      Se refiere a espacios donde, por cálculos económicos, se ofrecen sustitutos que solo se parecen en la superficie, sin los componentes reales necesarios para la salud y el bienestar humanos
    • No se está desplazando a los humanos mediante automatización, sino que se está volviendo irrelevante a la academia misma
      Si esta es la cara normal de la academia, hasta dan ganas de simpatizar con quienes piden recortes al financiamiento de la investigación
  • Este es el resultado lógico de un sistema de publica o desaparece
    Si se eliminara ese sistema, la mayor parte del problema también desaparecería, y aunque los administradores quieran métricas simples, en investigación no existen

    • La productividad de publicaciones en ciencia es como medir en desarrollo de software la cantidad de líneas de código escritas
      Incluso la deuda técnica es igual: hay incontables artículos, pero probablemente la mayoría no sea reproducible, y no sabemos cuáles
    • Entonces uno se pregunta si existe alguna métrica de evaluación de investigación que, aunque compleja, realmente sirva
      Las métricas de publicación y citación pueden manipularse, pero son concretas, y los artículos muy citados por lo general sí son útiles, así que sus autores reciben recompensa
      Si quitamos eso sin preparar una alternativa mejor, podría terminar dependiendo aún más que ahora de las conexiones y la labia
    • Los profesores ya tienen que cumplir varios requisitos además de publicar, como dar clases, servicio, trabajo en comités, asesorar y graduar estudiantes de posgrado, y todo eso cuenta en la evaluación para la titularidad
  • Presentar tal cual errores creados por IA debería tratarse como una falta equivalente al plagio y recibir castigos similares

    • Entiendo que ya se están implementando políticas que prohíben enviar artículos a revistas por más de un año si no se declara honestamente el uso de IA, y parece que arXiv va en una dirección parecida
      Declararlo o no y el uso excesivo son cosas distintas, pero si ni siquiera revisaron alucinaciones y errores, entonces el problema esencial no es la IA sino la incompetencia y la flojera
  • Las estadísticas mensuales de envíos a arXiv probablemente se verían mejor en escala logarítmica
    Para 2027, la academia podría terminar pareciéndose a Moltbook

    • Si la tendencia de crecimiento logarítmico ya había empezado antes de la era de los artículos con LLM, uno podría esperar ingenuamente que solo refleje el aumento de popularidad de las prepublicaciones en arXiv
    • La dirección general es correcta, pero la situación cambia mucho según el campo y el subcampo
      Los artículos basura se concentran en temas grandes y vistosos, y el aprendizaje automático en particular está muy mal, pero también hay temas importantes y de nicho que estos autores todavía no tocan
      Esas áreas siguen dominadas por investigadores serios, aunque si uno no estudia directamente el tema es difícil siquiera enterarse de que existen
  • Esto es un efecto secundario de que la academia no se tomó en serio la accesibilidad abierta de artículos y revistas
    Si los artículos no estuvieran bloqueados por las restricciones de acceso de las revistas, sería fácil verificar al menos si los trabajos citados y las citas mismas existen

    • El problema, más que la academia, son las editoriales que quieren extraer la mayor ganancia posible apoyándose en su marca
      La revisión por pares se parece al papel de moderador de Reddit: se hace sin pago y solo por prestigio, mientras la plataforma y la editorial se quedan con el beneficio
      Es una estructura donde el autor paga por publicar y otros autores incluso corrigen gratis, así que es natural que los académicos suban preprints o artículos populares a sus sitios personales
    • La existencia de un artículo normalmente puede confirmarse fácilmente incluso en revistas cerradas con solo el índice público de la revista, la información de autor y resumen, y la cita del DOI
      Pero verificar si el contenido citado realmente coincide con lo que afirma requiere leer e interpretar el artículo, así que el acceso abierto por sí solo no lo vuelve simple; incluso con una primera revisión por IA sigue siendo un trabajo muy pesado
    • Esto muestra una falla humana crónica que se repite en cualquier grupo. Nadie quiere limpiar su propia casa
    • La existencia de los artículos citados ya puede verificarse fácilmente
    • Al menos en la investigación biomédica, la mayoría pasa a acceso abierto al momento de publicarse o después de un año
  • Me pregunto si de verdad es cierto que al enviar un artículo a una conferencia uno queda obligado a revisar 4 o 5 artículos
    Eso significaría que incluso buenos trabajos terminan siendo evaluados a la fuerza por personas cuya procedencia y experiencia son desconocidas

    • Sí, y 4 o 5 incluso es una cifra baja
      A mí me obligaron a revisar 7; me postulé para 30 artículos entre 30 mil que sí quería revisar, pero no me asignaron ninguno, y terminé con 7 trabajos para los que no tenía suficiente experiencia
    • En las conferencias de la familia ACL no se elige a personas totalmente al azar; deben ser autores con al menos 2 artículos en eventos principales de ACL o en Findings, y al menos 1 artículo adicional en ACL Anthology o en conferencias importantes de ML/IA
      Pero como los envíos no dejan de aumentar y faltan revisores voluntarios, la revisión obligatoria sí se está aplicando en la práctica: criterios de incentivos para revisión
  • Vale la pena revisar la paradoja de Chavda: https://zencapital.substack.com/p/chavdas-paradox

  • Al principio pensé que Caleb e Isaac eran los nombres de dos algoritmos para detectar uso de IA en artículos publicados, pero en realidad eran los nombres de dos autores que escribieron con ayuda de IA
    Si ambos hubieran llegado a conclusiones distintas, me daría curiosidad saber cuánto se superponían los artículos que cada uno marcó como problemáticos

  • Aún está en fase alfa, pero estoy desarrollando una aplicación de verificación de citas https://veruscite-data.com/ con la idea de publicarla en Show HN en unas semanas
    Quienes ya estén familiarizados con herramientas de IA generativa pueden usar directamente las funciones que Caleb e Isaac ofrecieron en el texto, pero esta herramienta tiene mejor eficiencia de tokens y ofrece una GUI que facilita revisar y corregir las referencias extraídas