1 puntos por GN⁺ 15 시간 전 | 1 comentarios | Compartir por WhatsApp
  • Tras analizar el texto completo de 12,750 artículos de arXiv, el resultado mostró que cerca de un tercio de los artículos recientes se leían como si hubieran sido escritos por una máquina, y la tasa de detección del trimestre completo más reciente fue de alrededor de 32%
  • Usaron artículos de 2021~2022 como grupo de control de escritura humana y fijaron el umbral para ajustarlo a una tasa de falsos positivos de 0.4%; además, emplearon los PDF de la versión 1 y intervalos de confianza del 95% con bootstrap
  • Después de la aparición de ChatGPT, la tasa de detección subió en dos ocasiones y alcanzó un pico de alrededor de 39% a inicios de 2026; hasta julio de 2026, en la ventana de los 12 meses más recientes, ciencias de la computación marcó 65.0% y matemáticas 0.7%
  • Los artículos de matemáticas, con abundancia de fórmulas y estructura de teorema-demostración, pueden medirse a la baja porque difieren de la distribución sobre la que se entrenó el detector, y tampoco se puede evaluar el desempeño frente a las combinaciones privadas de modelos y prompts que realmente usaron los autores
  • Los resultados de detección no permiten identificar a los autores ni la proporción de contenido generado por IA, y tampoco distinguen entre una edición ligera y una generación completa, por lo que deben interpretarse no como base para culpar a individuos sino como un límite inferior de la proporción de estilo mecánico

Un diseño de medición basado en la tasa de falsos positivos

  • Una cifra como “N% del contenido es IA” pierde valor si no se observa junto con la proporción en que el detector también clasifica documentos humanos reales
    • Si clasifica como escritura mecánica al 40% de los artículos nuevos, pero arroja el mismo resultado en 20% de los artículos previos a ChatGPT, la cifra que primero hay que explicar es la tasa de falsos positivos de 20%
  • El detector fue calibrado para ajustarse al estilo de escritura académica
    • Con una tasa de falsos positivos de 0.4%, deja pasar correctamente 99.6% de los documentos científicos reales previos a los LLM
    • Detecta 85% de los documentos académicos escritos por IA
  • Tomaron los artículos enviados en 2021~2022 como datos correctos de escritura humana y fijaron el umbral para que exactamente solo 0.4% fuera clasificado
  • Todos los resultados representan la proporción de artículos que superan el umbral diseñado para que los documentos previos a los LLM permanezcan por diseño en 0.4%
  • Los años previos a ChatGPT funcionan como grupo de control incorporado
    • Si la tendencia al alza fuera un artefacto del propio detector, 2021~2022 tendría que mostrar niveles tan altos como 2026, pero no fue así

Muestra y método de análisis

  • En 10 grupos de disciplinas, se muestrearon unas 25 publicaciones por campo y por mes desde enero de 2023 hasta julio de 2026, y al añadir 8 meses de grupo de control de 2021~2022 se analizaron en total 12,750 artículos
  • Se usó el PDF de la versión 1 de cada artículo para evitar que redacciones revisadas en 2026 se mezclaran con la muestra de 2023 de ese mismo trabajo
  • En lugar del resumen, se analizó el texto completo
    • Hubo casos en que el mismo artículo marcaba menos de 20% en el resumen, pero superaba 70% en el cuerpo, por lo que analizar solo el abstract puede reducir la señal
  • A todas las cifras se les aplicaron intervalos de confianza del 95% mediante bootstrap

Tendencia general y brecha entre disciplinas

  • La tasa de detección se mantuvo en 0.4% durante 2021~2022 y comenzó a subir a los pocos meses de la aparición de ChatGPT
  • Después subió en dos ocasiones, registró alrededor de 32% en el trimestre completo más reciente y alcanzó un pico de cerca de 39% a inicios de 2026
  • Hasta julio de 2026, los resultados por disciplina de los 12 meses más recientes fueron los siguientes
Disciplina Grupo de control previo a los LLM Proporción reciente detectada Intervalo de confianza del 95%
Ciencias de la computación 0.2% 65.0% 59.3~70.3%
Biología cuantitativa 3.5% 56.3% 51.0~61.7%
Ingeniería eléctrica y sistemas 1.7% 51.3% 46.0~57.0%
Economía y finanzas 2.5% 47.0% 41.3~52.7%
Física aplicada 1.3% 34.0% 29.0~39.7%
Estadística 1.8% 31.3% 26.0~36.7%
Física de la materia condensada 0.0% 24.0% 19.3~29.0%
Física de altas energías 0.5% 14.0% 10.0~18.0%
Astrofísica 0.0% 10.7% 7.3~14.3%
Matemáticas 0.0% 0.7% 0.0~1.7%
  • Ciencias de la computación fue la más alta con cerca de 65%, y matemáticas la más baja con alrededor de 0.7%, pero el valor bajo de matemáticas es difícil de interpretar
  • La columna del grupo de control es el promedio de la tasa de detección de 2021~2022 en cada disciplina a lo largo de tres configuraciones de sensibilidad
  • Como las áreas con mayores aumentos no coinciden con las que tenían niveles más altos en el grupo de control previo a los LLM, un punto de partida alto por sí solo no basta para explicar la subida posterior

Límites estadísticos del grupo de control por disciplina

  • El grupo de control previo a ChatGPT por disciplina consta de 200 artículos cada uno
  • Con una tasa de falsos positivos de 0.4%, entre los 2,000 artículos de control de las 10 disciplinas solo 8 quedan clasificados, así que las proporciones por disciplina bajo un único umbral se miden de forma gruesa
  • El límite inferior total de falsos positivos quedó suficientemente estimado, y el diseño del estudio se apoya en eso, pero las cifras del grupo de control por disciplina son solo aproximaciones
  • Para fijar con precisión tasas menores de 1% por disciplina harían falta miles de artículos de control en cada área, pero en arXiv antes de 2023 no existe esa cantidad de publicaciones que cumpla ese requisito

Puntajes bajos y puntos ciegos del detector

  • Un puntaje bajo puede significar baja adopción de IA, o puede reflejar puntos ciegos del detector
  • Los artículos de matemáticas se centran en fórmulas y estructuras de teorema-demostración; si se eliminan las fórmulas y las referencias, queda poca prosa, y además esa prosa difiere del inglés científico con el que se entrenó el detector
    • Incluso un artículo de matemáticas escrito con mucha ayuda de un modelo puede recibir un puntaje bajo si su prosa queda fuera de la distribución del detector
    • Por eso, solo con los resultados de matemáticas es difícil distinguir entre baja adopción y baja sensibilidad de detección
  • Como las disciplinas con mayor proporción de prosa y mejor ajuste a la distribución de entrenamiento del detector fueron las que más subieron, este factor de confusión por sí solo no basta para explicar la tendencia general al alza
  • El ranking de las áreas con puntajes bajos debe leerse como un límite inferior de la adopción de IA
  • El detector tiene distinta sensibilidad según el modelo generador, y no puede evaluar la combinación exacta de modelos privados y prompts que realmente usaron los autores
  • Un alcance de detección imperfecto reduce la tasa detectada, así que las proporciones medidas son un límite inferior de la fracción real de estilo mecánico; el desempeño por generador puede consultarse en la explicación del detector

Lo que no se puede saber a partir del resultado de detección

  • El detector estima si un documento se lee como si hubiera sido escrito por una máquina basándose en tasas de error conocidas y probabilidades calibradas
  • No puede distinguir entre un documento editado ligeramente y uno generado por completo, y una sola puntuación no puede servir como base para culpar a una persona en particular
  • Lo que se mide no es la identidad del autor ni la proporción generada, sino la fracción de estilo mecánico, incluyendo ediciones con fuerte apoyo de IA
  • Los artículos de arXiv pueden revisarse en la página de verificación gratuita, y el texto general en la página de verificación de texto; no obtienen ingresos de la operación del detector

1 comentarios

 
Comentarios en Hacker News
  • Un artículo del workshop PyHPC que escribí en 2011 fue clasificado como 27% escrito por máquina, y mi tesis doctoral de 2012 quedó en 40%, justo por debajo del umbral de 42%
    Ya no publico artículos, pero no sé si yo escribía como un LLM o si los LLM aprendieron de mis textos. Un paper de IEEE CLUSTERS de 2015 incluso dio 74%

    • Los detectores iniciales también clasificaban la Declaración de Independencia de EE. UU. como 100% escrita por IA, así que estas herramientas no funcionan bien
      Lo más peligroso es que gente que no entiende cómo funcionan las use como base para afirmar que hubo uso de IA y termine perjudicando gravemente a estudiantes; eso ya está ocurriendo en todos los niveles educativos
    • “Los intentos de detectar contenido generado por IA o deepfakes tienen fallas fundamentales. Esto se debe a que los resultados de detección pueden usarse para entrenar generadores de datos falsos aún mejores. Al final se llega a un estado de equilibrio de incertidumbre digital, donde en el ámbito digital no se puede afirmar que nada sea real. Ya no importa si un resultado digital vino de un humano o de una IA; lo único que importa es si me resulta útil. El contenido útil debe ser relevante, ajustarse a los hechos y, de ser posible, sorprenderme lo suficiente como para enseñarme algo nuevo.” - https://seanpedersen.github.io/posts/digital-uncertainty/
    • ¿No será posible que esos papers realmente hayan entrado en el dataset de entrenamiento?
    • Si entrenaron con obras protegidas y luego además hicieron destilación, el ruido por falsos positivos no puede más que ser absurdamente grande
  • Se analizó el texto completo de 12,750 papers de arXiv entre 2021 y 2026 para investigar la proporción clasificada como escrita por máquina y cuánto aumentó después del lanzamiento de ChatGPT
    El detector fue ajustado intencionalmente para evitar falsos positivos, y antes de ChatGPT la tasa de detección era de alrededor de 0.4%. En enero de 2026, cerca del 39% de todos los papers, y hasta 65% en ciencias de la computación, fueron clasificados como escritos por IA; matemáticas casi no se movió desde 0.7%, aunque puede que el detector no haya captado bien un estilo centrado en demostraciones. Esto es solo una estimación de una señal estadística, no evidencia de que un autor específico haya usado IA, y “escrito por máquina” también puede incluir edición asistida fuertemente por IA

    • Me pregunto qué detector usaron y cómo pueden estar seguros de su precisión cuando todos los detectores comerciales de IA ya han sido cuestionados
    • Los resultados de series temporales se ven bastante convincentes, pero me pregunto si la forma de entrenar el detector es independiente de este análisis
      Podría haber filtración, por ejemplo si documentos previos a ChatGPT quedaron incluidos en los datos positivos de entrenamiento
    • Si publicaran casos de falsos positivos de documentos previos a los LLM, podríamos entender qué cosas activan al detector
      Me pregunto si incluso antes de los LLM ya había unos pocos autores que escribían como un LLM
    • Si se extendiera hasta papers anteriores a 2020, se podría entender mejor la precisión de referencia del sistema de detección
    • Me pregunto si el modelo puede ejecutarse localmente, o si podrían publicar una tabla de resultados de todos los preprints de arXiv
      No quiero sobrecargar el servidor revisando tantos papers
  • En el uso corporativo de LLM realmente operan incentivos de teoría de juegos
    Los desarrolladores usan Claude Code a lo loco para producir en masa código y documentación que parecen mejores, y la gerencia lo fomenta porque no ve desventajas inmediatas. La calidad estructural es incierta, pero con métricas equivocadas solo se ve el volumen de producción, así que tomaría años decidir si vale la pena a cambio del deterioro de la capacidad cognitiva. Quien no use LLM todo el día inevitablemente quedará atrás en producción, y es muy probable que la misma presión opere también en la ciencia, donde importa la cantidad de publicaciones

    • En la investigación biomédica básica, los LLM en general se ignoran porque no logran interpretar la mayor parte de los datos crudos de experimentos húmedos
      Aun así, muchas startups y profesores asistentes nuevos dicen estar abriendo nuevas áreas con “IA”, pero en la práctica los enfoques más efectivos usan aprendizaje automático más que LLM
    • Con ayuda de ChatGPT-5.6 Sol estoy portando una geometría de Rhino3D basada en Python, de 2,800 líneas, a OCCT/FreeCAD también basado en Python, y al llegar a más o menos la mitad ya creció hasta 36,000 líneas
      Seguí dándole instrucciones con el objetivo de minimizar duplicación y reducir código, pero el resultado se acerca más a “aunque sea horrible, me sirve”. Ese nivel de utilidad tampoco se puede ignorar, pero me asusta la gerencia que mira un inodoro desbordado y cree que el valor se maximizó
    • El código de LLM es mejor que el de un desarrollador incompetente y peor que el de un desarrollador promedio con ganas, pero por lo general es suficientemente usable
      La verdadera pregunta difícil es la calidad frente al tiempo y costo invertidos, y por ahora me parece que, al precio de suscripción, el código generado por opus/fable sale suficientemente a cuenta
    • Antes del alza de precios me preocupaba mucho que la gerencia empujara su uso sí o sí, pero ahora espero que la IA se haya vuelto demasiado cara como para justificar una adopción adicional en grandes empresas
      La herramienta nueva en sí es buena, pero no me gusta que me obliguen a usar una herramienta específica solo para cumplir métricas de gestión
    • El deterioro de la capacidad cognitiva podría ser justamente el objetivo
      Si los humanos pasan a depender de la IA, las empresas ganan influencia para cambiar las leyes a su favor. Aunque la ciudadanía se oponga a los enormes centros de datos urbanos, las empresas podrían presionar diciendo que sin la IA que suministran esos centros nadie puede hacer nada, así que volver a los humanos incapaces y dependientes podría ser el punto central
  • Como con todos los métodos de detección de IA que usan solo texto, preocupa la precisión
    En particular, no veo cómo pueden estar seguros de que combinar al final las puntuaciones de tres detectores no introduzca sesgo, y sin el código fuente también es difícil revisar cómo funciona o reproducir la investigación. Investigaciones privadas escritas por mí mismo antes de los LLM también recibieron puntuaciones altas, y en otros papers casi todas las oraciones aparecían marcadas en rojo como “machine-leaning” sin que eso afectara la puntuación. El mismo texto también daba puntajes muy distintos según tuviera o no formato LaTeX. La conclusión debería ser: “detectar texto generado es difícil, y no se deben aceptar los resultados solo porque parecen confirmar la hipótesis”. Este comentario también lo acabo de escribir yo mismo, y aun así salió con una puntuación alta de escritura por máquina

    • El uso que más preocupa es emplear estas herramientas en escuelas para detectar estudiantes que hacen trampa
  • Al examinar el mismo problema en el entorno académico, se concluyó que es imposible detectar de forma confiable la escritura de IA solo a partir del texto.
    Si un humano y un LLM escribieran por casualidad exactamente el mismo párrafo, no habría forma de distinguir una sola entrada como sintética o humana. En la práctica sí existen rastros característicos de los LLM, pero cambian con el tiempo y según el modelo, por lo que no se puede distinguir entre texto humano que parece sintético y texto sintético que parece humano. Un enfoque más interesante es analizar cómo cambiaron en un corpus de ensayos el vocabulario, las características lingüísticas, los embeddings de estilo, los embeddings generales, las faltas de ortografía, los errores y las referencias tras la introducción de los LLM. Está claro que el estilo académico cambió a nivel colectivo, pero rastrear la causa es difícil

    • Salvo en fragmentos muy breves, las expresiones posibles provocan rápidamente una explosión combinatoria, así que no estoy de acuerdo con la explicación de que una clasificación perfecta sea imposible por tratarse de combinaciones finitas.
      Como decía Chomsky, casi toda oración que una persona dice o entiende es una combinación de palabras que aparece por primera vez en la historia del universo. La dificultad mayor es que los LLM no generan una sola formulación fija, y la densidad informativa del texto es baja, por lo que se necesita bastante volumen para hacer pruebas estadísticas con intervalos de confianza estrechos
  • Si el 65% de los artículos que uno lee muestran rasgos de redacción de IA, termina recibiendo la influencia del estilo de IA incluso sin usar IA directamente.
    Esto probablemente se note más en investigadores nuevos que todavía están formando su estilo

    • La influencia del estilo de IA aparecerá de forma parcial, por ejemplo en palabras concretas o expresiones retóricas, pero el texto generado por IA normalmente suena a IA de manera consistente a lo largo de toda la salida.
      Para que un humano mantenga durante mucho tiempo los patrones sintácticos de la IA, tendría que captar patrones que hoy nadie puede comprender del todo y ajustar cada cláusula con el detalle de una falsificación pictórica. Además, el estilo de IA también cambia: delve, que era una señal representativa, cayó con fuerza desde mediados de 2024 y ahora casi ha desaparecido de las salidas de LLM. La escritura humana que aprendió a imitar eso, en cambio, se parece menos al estilo actual de la IA
    • Ese 20% podría significar que las herramientas de detección no son tan confiables como se cree, o que la IA aprendió de la escritura humana y parte del estilo humano previo ahora se volvió característica del texto basura de IA.
      Incluso antes de la IA ya había personas que producían texto basura
  • Como no soy hablante nativo de inglés, no me sorprende el resultado de que la mayoría de mis artículos sean marcados por detectores de IA.
    No porque le pida a un LLM que escriba el paper completo, sino porque no estoy acostumbrado al estilo científico y los editores estadounidenses lo exigen. Uno puede escribir las ideas en oraciones básicas y luego usar un LLM para pulirlas. Si escribo cada párrafo yo mismo y luego lo refino para que suene más científico, aunque el contenido sea totalmente mío, puede ser clasificado como generado por LLM. A la inversa, si se pule suficientemente bien el inglés, un artículo escrito por un LLM también puede parecer humano

    • Es exactamente la forma de uso que esperaba, y no veo motivo para considerarlo incorrecto
    • No tengo problemas con mi nivel de inglés y hasta escribí mi tesis de maestría directamente en inglés, pero redactar en estilo científico es muy pesado.
      Si volviera a escribir un paper, no pensaría redactarlo todo a mano; mientras verifique que el contenido coincide con mi intención y corrija lo que esté mal escrito, no hay problema. Incluso entre artículos escritos por angloparlantes nativos hay muchos que mejorarían mucho si se reescribieran con un LLM
    • Esto es una conducta incorrecta
    • Convertir algo en “más científico” no es una simple corrección de estilo que preserve fielmente el significado original.
      La formulación detallada de cada párrafo influye mucho en qué se transmite y cómo, así que cuesta verlo como un artículo totalmente propio. También es dudoso por qué habría que perseguir desde el inicio un estilo que “suene científico”; los mejores papers se leen de forma conversacional y sin grandilocuencia. Entiendo que existe presión externa, pero las frases básicas del autor probablemente sean mejores que las oraciones del LLM
    • Entre usar un LLM para corregir gramática y ortografía y usarlo para generar texto hay una frontera sutil
  • Estos artículos suelen tener muchas partes verbosas y trilladas, así que la IA podría haber escrito el 90%, y los humanos solo la parte realmente novedosa y la explicación de su importancia.
    Quizá esa forma de trabajar sí se esté expandiendo

    • Si el 90% de un paper son frases trilladas, primero habría que preguntarse si tiene contenido que valga la pena publicar como artículo académico
    • En la actividad científica, escribir es en gran parte tiempo desperdiciado, y si una máquina puede hacerlo con soltura, hay poca razón para que el investigador lo redacte por sí mismo.
      Algunos serán artistas de la escritura, pero la mayoría no lo son
  • Es posible que el detector simplemente haya aprendido como rasgos de IA las palabras y términos técnicos que aumentaron en la literatura desde 2022.
    Por ejemplo, los LLM y quienes los usan hablan con frecuencia de LLM, así que la propia expresión “large language model” podría ser clasificada como algo típico de IA. Esa expresión era rara antes de 2022 y hoy aparece mucho tanto en textos actuales como en textos generados por IA, pero no es una buena característica para distinguir entre escritura humana moderna y escritura de IA. En un grupo de control donde razonablemente pueda asumirse que casi no hubo texto generado por LLM incluso después de 2023, la tasa de detección debería ser mucho menor que en arXiv. Nature y Science tampoco estarán totalmente libres, pero si se examina hasta 2026 debería aparecer una curva de aumento mucho menor que la de arXiv

    • Es una posibilidad válida, pero por intuición parece explicar solo una pequeña parte de los artículos realmente detectados.
      Al actualizar el detector vería cómo mitigar esto, pero es difícil conseguir un dataset limpio posterior a 2023. Si se hace con otro detector de IA, al final no podrá ser mejor que ese detector
  • Al preguntar a varios investigadores que estudian cosas como protocolos de consenso si preferían escribir papers o hacer investigación, casi todos eligieron la investigación en sí.
    Si les gustara más escribir, probablemente habrían elegido otra profesión. Si un LLM pudiera convertir diagramas de investigación, código, etc., en papers o borradores, incluso podría aumentar la cantidad de buenos artículos científicos. Eso reduciría la fricción de “quiero investigar, pero escribir papers es una molestia”. Si se ponen en dos ejes la capacidad de investigación y la aversión a escribir, los LLM podrían sacar resultados de investigadores con valores altos en ambas dimensiones. También aumentarán los malos papers, pero a largo plazo es posible que el efecto neto sea positivo