Reemplazar la “revisión por pares” por “replicación por pares” (2021)
(blog.everydayscientist.com)- En muchas áreas de la ciencia falta reproducción independiente, pero la revisión por pares actual se convierte en una barrera con alta probabilidad de error y retrasa la comunicación de investigaciones importantes
- La replicación por pares propuesta no consiste en que revisores anónimos evalúen el manuscrito, sino en que otros laboratorios reproduzcan efectivamente los resultados clave y que eso se incorpore a la decisión de publicación
- Los investigadores que participen en la replicación aparecerían en una línea separada del artículo, obtendrían citas y un ítem para el CV, y los autores defenderían sus resultados mediante reproducibilidad en vez de responder a pedidos de experimentos adicionales de los revisores
- En experimentos que requieren técnicas avanzadas, mucho tiempo o muchos recursos, no todo puede replicarse fácilmente, por lo que editores, autores y revisores deben elegir qué reproducir equilibrando rigor y viabilidad
- Para reducir replicaciones fallidas, intentos repetidos y journal shopping, hacen falta mecanismos de transparencia como prerregistro, publicación de casos fallidos y conservación de artículos rechazados
La replicación por pares como alternativa propuesta a la revisión por pares
- La verificación ideal en ciencia no consiste en que algunos expertos estampen su aprobación en un manuscrito, sino en confirmar si los hallazgos del artículo se reproducen en el mundo real
- La mejor prueba de una nueva metodología no es la revisión del artículo, sino que un colega investigador realmente use la técnica
- Hay muy pocos incentivos para que un laboratorio independiente vuelva a verificar resultados ya publicados, por lo que la mayoría de los artículos publicados no se replican después de manera independiente
- En la replicación por pares, un preprint o manuscrito se envía a otro laboratorio, y ese laboratorio reproduce efectivamente los hallazgos clave
- Si los hallazgos clave se replican, el manuscrito se aprueba y se publica
- Los autores pueden pedir opiniones a colegas y corregir el manuscrito, pero el editor no se encarga de recopilar comentarios ni de exigir revisiones
Cómo incluir los resultados de la replicación en el artículo
- El artículo publicado incluye, junto con los datos originales, los resultados de los intentos de replicación
- Se puede mostrar en forma de tabla qué reactivos y técnicas fueron iguales a los del experimento original
- Cuantos más parámetros hayan cambiado entre el experimento original y el experimento de replicación, más robusto será el hallazgo final si se obtienen resultados similares
- El lector puede juzgar directamente, a partir de los resultados de la replicación, si el conjunto de la evidencia respalda las afirmaciones del artículo
Incentivos para los participantes
- La revisión por pares tradicional exige mucho tiempo y esfuerzo si se hace bien, pero ofrece muy poca recompensa
- En la replicación por pares, los nombres de los investigadores que hicieron la replicación aparecen en una línea separada del artículo publicado
- Los revisores pueden recibir citas
- Obtienen otra forma de recompensa publicable que pueden incluir en el CV
- Los autores pueden mostrar que sus resultados se mantienen incluso después de una verificación rigurosa
- En la revisión tradicional, los autores deben realizar experimentos adicionales y responder a las críticas de los revisores; en la replicación por pares, los revisores asumen el rol de defender experimentalmente los hallazgos del manuscrito
Viabilidad y efectos colaterales
- También hay muchas investigaciones difíciles de replicar
- Cuando requieren técnicas científicas avanzadas
- Cuando requieren mucho tiempo
- Cuando requieren muchos recursos, como los experimentos con ratones
- El editor debe decidir, junto con los autores y revisores, qué experimentos reproducir
- El objetivo es equilibrar rigor y viabilidad
- Algunas partes de experimentos muy complejos pueden quedar sin replicar
- En ese caso, el lector debe juzgar directamente cómo evaluar el artículo completo
- La replicación por pares convierte un proceso de revisión confrontativo en una colaboración entre colegas para buscar la verdad
- Al sumar la mirada y el razonamiento de otros investigadores, pueden incorporarse nuevos controles o enfoques experimentales alternativos que fortalezcan el hallazgo original
- Una mayor circulación de procedimientos experimentales ayuda a futuras colaboraciones, nuevos enfoques y capacitación técnica de estudiantes y posdoctorandos
- Puede convertirse en un canal para difundir el conocimiento tácito de laboratorio que queda encerrado dentro de cada laboratorio
- Si otros investigadores intentan reproducir de verdad los resultados experimentales, se vuelve más difícil hacer pasar datos o imágenes manipuladas como auténticas, lo que puede reducir la mala conducta científica
Problemas previstos y cómo empezar
- La replicación por pares puede hacer que pase más tiempo desde el envío hasta la publicación final
- La revisión por pares tradicional también suele tomar varios meses, por lo que en muchos casos el experimento de replicación podría no agregar tiempo real
- Si los autores envían fragmentos de la investigación sin esperar a que todo el manuscrito esté completo, se puede reducir el tiempo
- Lo ideal sería preparar la replicación de hallazgos parciales mediante un mecanismo independiente de las revistas, como ReviewCommons
- Cuando una replicación falla, hace falta criterio
- Hay que decidir si la replicación fallida es esencial para el manuscrito
- También hay que evaluar si el intento de replicación se realizó de manera suficientemente adecuada
- Puede hacer falta un segundo intento de replicación, pero hay que evitar repetir hasta que salga bien y detenerse ahí
- El prerregistro del plan de replicación puede ayudar a reducir esto
- Los detalles de la replicación fallida deben incluirse obligatoriamente en el artículo publicado
- También persiste el problema del journal shopping, cuando un autor es rechazado en una revista por una replicación fallida y luego vuelve a enviar el trabajo a otra revista
- Los artículos rechazados deben conservarse de alguna manera para asegurar transparencia y rendición de cuentas
- También se necesitan mecanismos para que los investigadores que participaron en la replicación reciban crédito por su esfuerzo
- La división de roles sería la siguiente
- Editor: filtra los manuscritos enviados y rechaza ciencia claramente defectuosa, experimentos que no vale la pena replicar, omisiones de controles esenciales o resultados muy aburridos
- Editor: encuentra revisores adecuados y decide, junto con autores y revisores, qué experimentos replicar y cómo hacerlo
- Editor: consulta con los revisores y emite el juicio final sobre si los hallazgos del artículo son lo bastante reproducibles como para una publicación formal
- Authors: escriben el manuscrito, buscan feedback por canales como bioRxiv y lo corrigen antes de enviarlo a una revista
- Authors: apoyan a los revisores con el diseño experimental, reactivos y, si hace falta, acceso a personal o equipos especiales
- Referees: intentan reproducir de buena fe los resultados experimentales clave del manuscrito y, si hace falta, realizan experimentos o controles adicionales y organizan los resultados
- Readers: juzgan si la evidencia respalda las afirmaciones, basándose en la confianza de que los experimentos clave fueron replicados independientemente en otro laboratorio, y citan ciencia reproducible
- Como forma de empezar, podría hacerse un piloto en una revista como eLife, pero no hace falta esperar a que las editoriales tradicionales den el primer paso
- Una vía rápida podría ser que organizaciones como Review Commons encuentren buenos candidatos en bioRxiv, recluten junto con los autores a revisores que realicen la replicación y luego envíen el paquete completo a una revista
- Cuando los científicos vean artículos verificados por replicación por pares en publicaciones reales, les costará tomar en serio artículos que solo pasaron por revisión por pares, y la mejor ciencia competirá con hallazgos no reproducidos
1 comentarios
Opiniones de Hacker News
No sé si este método podría funcionar realmente, y parece que quienes no son científicos subestiman mucho el trabajo que implica reproducir todos los artículos
Depende del área, pero reproducir correctamente un solo artículo puede tomar meses. No hay que repetir el ensayo y error del artículo original, y quizá se puedan recibir muestras para acortar la preparación, pero si no funciona al primer intento, hay que depurar el experimento y comprobar que no haya errores, lo que aumenta mucho el tiempo
Además, este trabajo ofrece muy poco beneficio al científico que reproduce el estudio, y solo consume dinero y tiempo. Si alguien está lo bastante interesado como para ampliar esa investigación, de todos modos intentará reproducirla; y si tiene éxito, el artículo posterior respaldará indirectamente al artículo original, aunque no sea un artículo de reproducción directa
Sin embargo, el gran problema es que, si el experimento posterior fracasa, por lo general no se publica. Y eso no se resuelve simplemente diciendo que se publiquen resultados negativos. Para producir un resultado negativo sólido hace falta mucho más trabajo que hacer el experimento y abandonarlo si no parece prometedor
Aunque un resultado haya sido reproducido, puede no publicarse si no se cumplen otras condiciones. Por ejemplo, supongamos que un equipo, al buscar un material novedoso para resolver un problema complejo de ingeniería, encuentra una sustancia que fue sintetizada una vez en la década de 1980 y nunca reproducida. Como parece que podría tener las propiedades deseadas, la sintetizan; la estructura es correcta, pero no tiene las propiedades esperadas. Entonces es muy probable que no escriban un artículo y pasen al siguiente candidato. Aunque varios equipos hagan lo mismo al mismo tiempo, quienes vengan después no podrán saber nada
“Una característica única del proceso de revisión es que todos los datos y experimentos reportados en el artículo deben repetirse exitosamente en el laboratorio de un miembro del consejo editorial para verificar su reproducibilidad antes de la publicación”
https://en.wikipedia.org/wiki/Organic_Syntheses
Por ejemplo, reducir en x la cantidad de artículos exigidos y, a cambio, exigir x reproducciones, de modo que cada quien tenga un historial de reproducciones en su área de especialidad. También habría que crear partidas de financiamiento para estudios de reproducción y pasarlas a un sistema independiente. Harían falta mecanismos como asignación aleatoria. La reproducción debe valorarse igual que la investigación original
Los departamentos pequeños de nivel R2 podrían convertirse en centros de reproducción. En biología, química y algunas áreas de la psicología, esto podría ser más fácil que en física de partículas. Se puede empezar por los campos donde el costo de reproducción sea relativamente bajo e ir afinando los detalles. En algunos casos es bastante posible, aunque en otros campos quizá siga siendo difícil para siempre
En robótica hay demasiados artículos que toman tres o cuatro algoritmos o modelos de aprendizaje automático ya conocidos y los aplican a hardware comercial. Cualquiera con formación en el área puede predecir casi todos los resultados. Para cada espacio de problemas popular —prótesis de mano, drones de vigilancia de incendios forestales, robots guía para museos— aparecen cientos de variantes cada mes, mucho más de lo que podría ser realmente útil
Tal vez haga falta un procedimiento aparte para los estudios que afirman haber hecho descubrimientos verdaderamente importantes. No sé exactamente cuál debería ser, pero, francamente, quizá también debería reducirse la cantidad misma de artículos
El objetivo de la publicación científica es compartir nuevos resultados con otros científicos, para que otros puedan construir sobre ellos o verificar su exactitud.
Aunque siempre ha existido un componente de “reconocimiento del mérito”, desde la perspectiva de maximizar el avance científico, lo que realmente importa es la comunicación.
Hace mucho tiempo, publicar era más bien un proceso informal: hacer circular cartas o, si se trataba de un gran resultado, autoeditar un libro. Más tarde, las editoriales crearon revistas formales, y algunas revistas empezaron a recibir tantos envíos que ya no podían publicar solo por reputación ni verificarlos fácilmente. Las revistas populares comenzaron a aplicar criterios editoriales básicos para filtrar artículos pésimamente escritos y spam evidente, y como los editores no eran expertos en todos los campos, pidieron ayuda a voluntarios. Eso es la revisión por pares.
Después, los burócratas exigieron una forma de medir la productividad de los científicos para asignar presupuestos y ascensos, y tomaron como indicador el historial de publicaciones en unas cuantas revistas prestigiosas. Como resultado, lo que era un proceso útil de “compartir resultados” se convirtió, a ojos de los externos, en algo parecido a obtener puntos académicos, y la publicación misma empezó a verse como el objetivo final, no como una etapa intermedia en el proceso de verificación de resultados.
Además, algunos externos malinterpretan este proceso y se enojan ante el hecho de que los resultados intermedios puedan estar equivocados. En vez de aceptar que el núcleo de la publicación es compartir ampliamente los resultados para aumentar la posibilidad de verificación, o de crear mejores indicadores de ascenso, intentan bloquear el proceso central de intercambio, volverlo ineficiente y reducir el alcance y la velocidad de difusión de las publicaciones. Esta confusión podría manejarse de una manera mucho más inteligente.
Aquí también entra como variable la forma en que el público no científico recibe la información de la academia. Antes, la academia era un grupo relativamente cerrado que perseguía el conocimiento en sí mismo, por lo que este problema era menos importante. Lo nuevo es que la sociedad se ha obsesionado con la idea de que la conducción del Estado y la administración pública deben depender en gran medida de los resultados y opiniones de la academia.
El entusiasmo por las políticas basadas en la ciencia golpea por tres frentes. El hecho de que los resultados de investigación puedan influir en políticas públicas puede cambiar los incentivos de la propia forma de hacer ciencia. Que los resultados académicos tengan influencia externa también cambia qué ciencia se realiza y puede atraer a actores deshonestos. Cuando aumenta la influencia, el público poco informado ve resultados todavía preliminares o no replicados y saca conclusiones inmaduras. Incluso una investigación estrecha o débil puede recibir atención excesiva si parece un buen garrote para golpear al adversario.
Nos guste o no, los académicos terminan siendo evaluados por sus publicaciones, y creo que casi nadie lo malinterpreta. El problema es que esos incentivos son malos. Crear una nueva categoría de publicación que exija replicación podría ser posible en algunos campos como la óptica/fotónica, pero sería casi imposible en áreas como la física experimental de partículas.
En campos puramente intelectuales como las matemáticas, la física teórica o la filosofía, es muy probable que un sistema así no sea necesario. El aprendizaje automático, que está en un punto intermedio, parece fácil de replicar en teoría, pero, por ejemplo, entrenar líneas base para modelos de lenguaje a gran escala puede volverse demasiado costoso.
Tampoco ayuda la percepción pública de que un artículo publicado en una revista prestigiosa equivale a una verdad establecida.
Hoy la publicación ya no cumple el mismo papel que antes de internet. Ahora es trivial escribir y lograr publicar un artículo convincente sin investigación: http://theatlantic.com/ideas/archive/…
La revisión por pares no es un mecanismo para garantizar la replicación, sino para garantizar la legibilidad y comprensibilidad de un artículo.
Algunos experimentos cuestan miles de millones de dólares, por lo que aplicar una “replicación por pares” a todos los artículos es imposible.
En cambio, sí se podrían agregar metadatos sobre los artículos replicados.
Las conferencias pueden ser distintas, pero entiendo que la revisión por pares se parece más a verificar si la metodología, el alcance, las afirmaciones, la dirección, las conclusiones y la relevancia son válidas y confiables.
Si alguien dedica tiempo a intentar replicar algo descrito solo en uno o dos artículos, eso es valioso para la comunidad y debería alentarse. Mejor aún si se usa como oportunidad para que un estudiante de doctorado perfeccione sus habilidades. No es vistoso ni completamente nuevo, pero es útil e importante.
Estos estudios deberían publicarse en revistas normales. Si solo se crean revistas dedicadas a replicaciones, su factor de impacto será pésimo y nadie les prestará atención.
Siempre hay gente que, si algo no es una solución al 100%, lo considera inapropiado y no hace nada. La revisión por pares ha demostrado ser insuficiente, pero la gente se aferra a ella desesperadamente. Algunas disciplinas deberían exigir replicación para todo. No voy a señalar específicamente a la psicología ni a las ciencias sociales en general, pero la tasa de fallos de replicación en algunos campos está en un nivel difícil de aceptar.
Hay que cambiar los criterios de valor: reconocer la replicación como una vía válida para la titularidad y los ascensos, y convertirla en un componente obligatorio del doctorado.
En ambas ocasiones, las evaluaciones incluían frases como “el artículo está muy bien escrito, al punto de que podría leerlo incluso un estudiante de licenciatura”. Al final, la revisión por pares garantiza el rol de guardián de acceso.
Durante un tiempo en Reddit existía el lema “si no hay foto, no pasó”
Al menos en ciencias de la computación/aprendizaje automático hace falta si no hay código, no pasó. Los papers son ambiguos, y a veces, aunque haya fórmulas, no todos los componentes están definidos
La reproducción por pares en este campo es una tarea fácil y de bajo costo que podría servir de ejemplo para otras áreas científicas
Investigaciones como los avances recientes sobre Alzheimer se benefician de la reproducción y, de todos modos, también se reproducen por el interés comercial. Pero en temas de nicho más ordinarios no hay dinero para reproducir todos los estudios. Que la investigación en ciencias de la computación/inteligencia artificial sea cómoda de reproducir no significa que eso pueda extenderse a toda la investigación
Por eso existe la revisión por pares. Es un mecanismo para filtrar estudios que no parecen plausibles o que son de bajo esfuerzo y baja relevancia, no algo diseñado para prevenir fraudes
Ahora que existen GitHub, GitLab y otros, esto debería ser el estándar. Si un paper que trata sobre una implementación no proporciona código, por lo general es muy probable que sea humo
Me gusta la idea de dividir la “revisión por pares” en dos, y acordar un umbral de citaciones según el cual, cuando un área supere cierto número de citas, el paper deba reproducirse. Las revistas también deberían tener una sección dedicada a intentos de reproducción
En algunas áreas, además del conocimiento especializado, para hacer buenos experimentos se necesita una habilidad práctica que llaman “mano”. Por ejemplo, trabajar con compuestos sensibles al aire o con materiales en estados condensados o cristalinos. En los experimentos de mi tesis armé a mano parte del equipo
A veces también se necesitan instalaciones especiales. En mi proyecto doctoral se usaron equipos por unos 500 mil dólares, y parte del equipo que usé ya estaba descontinuado y no se podía conseguir para cuando me gradué
Creo que una alternativa más realista es exigir revisión de reproducibilidad y la entrega de un mapa metodológico para cada paper
Lo primero sería un proceso de ida y vuelta en el que el revisor, basándose en el paper, hace preguntas y verifica cosas con el objetivo de reproducir los resultados, pero sin exigir la reproducción real. Suele ser útil para encontrar detalles omitidos que el autor asume que todos en el área conocen. De hecho, he visto doctorandos de biología perder meses rastreando detalles experimentales que no estaban en el paper
Lo segundo sería el resultado de lo primero. En vez de meter un apéndice largo en el texto principal, se crearía junto con el revisor por pares un documento separado que cubra cuidadosamente los experimentos y la metodología, poniendo el nombre del revisor para que no pueda pasar por encima del tema a la ligera
He leído demasiados papers a los que les faltaba información importante para la reproducción. En aprendizaje automático/aprendizaje por refuerzo, cuando hay código, he encontrado innumerables detalles de implementación que no estaban en el paper. Incluso hay resultados que muestran que esos detalles pueden determinar el éxito o el fracaso de ciertos algoritmos [1]. También he visto casos en los que detalles clave estaban escritos solo en comentarios del código
Más terrible aún fue el caso de un paper que afirmaba haber evaluado un método en un benchmark, pero al revisar resultó que esa tarea no existía en ese benchmark. Habían hecho un fork del benchmark y creado su propia tarea sin dejarlo claro [2]
Cosas así hacen que uno pierda la confianza en ciertas direcciones científicas. También he visto a varios investigadores junior concluir que toda la casa parecía construida con naipes y abandonar por completo la investigación
[1] https://arxiv.org/abs/2005.12729
[2] https://arxiv.org/abs/2202.02465
Si esto les parece demasiado engorroso o caro, hay que recordar que las editoriales obtienen ganancias récord. Los recursos ya existen
https://youtu.be/ukAkG6c_N4M
Ahora, cuando reviso manuscritos, presto mucha más atención a si hay suficiente información para reproducir el experimento o la simulación. Está bien que se publiquen papers con interpretaciones equivocadas, porque otras personas pueden descubrirlo mientras hacen su propia investigación. Pero no se debería permitir que se publiquen papers cuyos resultados no se pueden reproducir
El contenido demasiado largo para la sección experimental debería ir en documentos de información suplementaria electrónica. Eso sí, me gustaría que al descargar el PDF la información suplementaria viniera adjunta al paper. Tener que rastrearla por separado es realmente molesto. Hay áreas, como la caracterización de materiales, donde es común proporcionar información suplementaria con muchos datos y detalles
Los datasets grandes deberían ir a repositorios o a revistas de datasets. Así, los métodos siguen pasando por revisión por pares y el dataset recibe un DOI, lo que facilita su reutilización. También es una buena forma de duplicar la cantidad de papers de un estudiante al final del doctorado
Hacer un fork de un benchmark para crear tu propia tarea y no dejarlo claro es simplemente perverso
Aunque sea difícil o imposible de reproducir, la ciencia observacional sigue siendo una rama de la ciencia
Pensemos en la primera foto de un calamar gigante vivo en su hábitat natural, publicada en 2005: https://royalsocietypublishing.org/doi/10.1098/rspb.2005.315...
¿Quién pensaría en serio que no debió haberse publicado hasta que otra persona reprodujera ese resultado?
¿También habría que decir que los resultados de ensayos clínicos de medicamentos no deben publicarse hasta que sean reproducidos?
¿Cómo se reproduce “A stellar occultation by (486958) 2014 MU69: results from the 2017 July 17 portable telescope campaign”, donde una estrella, el objeto transneptuniano 486958 Arrokoth y una región específica de Argentina tenían que alinearse con precisión?: https://ui.adsabs.harvard.edu/abs/2017DPS....4950403Z/abstra...
¿Cómo se reproducen los resultados de un sobrevuelo cercano de Pluto o de volar un helicóptero en Mars?
También está el artículo “Insights from a laboratory fire”, que conocí por “In The Pipeline”: https://www.nature.com/articles/s41557-023-01254-6
Trata de que los incendios en laboratorios de química son relativamente comunes pero se reportan poco, y que sus consecuencias pueden ser fatales. En este caso, ¿qué relevancia tendría la reproducción por pares?
En esos casos, reproducir significa que otra persona pueda ejecutar ese código sobre ese dataset y obtener los mismos resultados
¿Los laboratorios tienen que mejorar sus entornos de software y aprender herramientas nuevas? ¿Tienen que abandonar el viejo know-how secreto? Justamente ese es el punto
El problema no es la publicación de nuevos hallazgos, sino la falta de incentivos para verificarlos después de publicados
Una nueva observación del calamar gigante sigue siendo muy valiosa, aunque ya no sea novedosa. Por eso deberían incentivarse nuevas observaciones
El sobrevuelo de Pluto o el helicóptero de Mars tampoco son muy buenos ejemplos, en realidad. Habría que enviar otra sonda, y es probable que en el futuro abunden los casos y datos sobre vehículos voladores en la atmósfera de Mars. También se pueden hacer muchísimas simulaciones. A Pluto se le seguirán apuntando espectrómetros y varios instrumentos
Incluso en estos casos, aunque los datos provengan del mismo aparato experimental, que equipos distintos los analicen de forma independiente puede aumentar la solidez. No todo es blanco o negro. La observación está en un espectro; algunas son mucho más confiables que otras, y la reproducción es un factor dentro de eso
En el caso de los incendios de laboratorio, se necesita más de un caso para saber qué fenómenos se deben a particularidades de un laboratorio específico. Se requiere algo como un análisis estadístico y de factores. Aquí, reproducir no significa prender fuego deliberadamente a laboratorios reales
Es como la investigación de accidentes automovilísticos. No se mata gente a propósito, pero se sigue necesitando investigación basada en hechos reales, con nuevos artículos que confirmen o refuten observaciones anteriores
En un mundo perfecto también reproduciríamos la recolección de datos, pero no vivimos en un mundo perfecto
Con los ensayos clínicos de medicamentos pasa lo mismo. Como las empresas afirman que los datos originales son secretos comerciales, siempre hay una pelea para obtenerlos. Por eso la verificación independiente es muy costosa, pero creo que sería mucho mejor si la FDA exigiera publicar el 100% de los datos recopilados, y no solo conclusiones editadas y algunos materiales de apoyo
Por ejemplo, la FDA dijo que tardaría décadas en publicar los datos originales de los ensayos clínicos de las vacunas contra COVID. ¿Por qué tendría que ser así? Y eso fue después de que una demanda lo obligara
Durante la maestría en ciencias de la computación dediqué bastante tiempo a los detalles de implementación de artículos, pero algo que descubrí una y otra vez fue que los papers no mencionaban todos los puntos débiles ni los casos de falla de la técnica. Aunque había excelentes excepciones
Por la presión de publicar o perecer, hay muy poca honestidad en la investigación. Por suerte también hay gente que publica su trabajo de manera transparente, pero en general la ciencia está hundida en un mar de investigaciones llenas de falta de transparencia y fracasos de reproducción
CI/CD obliga a codificar con precisión cómo compilar y desplegar algo para llevarlo a producción. Docker y las máquinas virtuales son una forma de esquivar este problema ofreciendo una “mi computadora” fácil de copiar y compartir
En el campo de los lenguajes de programación, las conferencias empezaron a permitir que los autores enviaran artefactos empaquetados. Por lo general son código fuente, datos de entrada, datos de entrenamiento, etc., y normalmente se evalúan por separado después de la revisión del artículo.
Los artefactos suelen ser evaluados por un comité separado, normalmente compuesto por estudiantes de posgrado, y como siempre, todo es trabajo voluntario. Incluso con lineamientos explícitos, ya es bastante difícil ejecutar el mismo código en otro entorno y obtener los mismos resultados. Si la “reproducción” de una técnica de software exige que otro equipo la reimplemente desde cero, parece inviable.
Ni siquiera puedo imaginar lo difícil que sería escribir instrucciones para que otro laboratorio reproduzca con éxito experimentos de frontera en física, química o biología. No es solo un problema de equipo especializado; es lo que ocurre en la frontera de la ciencia, donde se hace investigación de punta.
Este tipo de propuesta se siente como escrita por una persona no científica que nunca ha vivido el proceso de revisión por pares en ningún campo. La realidad no funciona así.
En las ciencias “duras”, la reproducción muchas veces no parece ser tan difícil. LK-99 es un caso interesante: aunque había bastante consenso en que el artículo estaba escrito a las apuradas y le faltaban detalles, la gente parecía reproducir el experimento con éxito. Era ciencia de punta, pero la reproducción en sí no fue el problema. La mayor parte de la ciencia no es el LHC.
El verdadero problema de la reproducción se encuentra en campos más “blandos”. Ahí no se trata solo de aleatoriedad o de la dificultad del experimento. Es común ver artículos, o incluso campos enteros, que en principio son irreproducibles. Los investigadores no creen que otros deban poder reproducir su trabajo, o a veces intentan impedirlo. La forma más común es reunir datos de una manera irreproducible y no publicarlos deliberadamente; a veces el problema está en el propio diseño del estudio.
Al ver esto, la inferencia más natural es que no quieren intentos de reproducción porque saben que existe la posibilidad de que sus afirmaciones no sean ciertas.
Por eso, que los revisores por pares o las revistas verifiquen algo muy básico —por ejemplo, si esa afirmación es reproducible al menos en principio— ya sería un buen comienzo. Seguirán existiendo artículos que se reproducen bien pero cuyas conclusiones son erróneas, artículos con metodologías ilógicas y artículos que se reproducen porque son demasiado obvios, pero hay muchísima fruta al alcance de la mano.
La revisión por pares es la solución correcta para el problema equivocado: https://open.substack.com/pub/experimentalhistory/p/science-...
La reproducción es un objetivo valioso, pero tiene que haber incentivos de carrera. Creo que en la mayoría de los programas la reproducción de investigaciones debería incorporarse como parte del plan de estudios. Podría contar como un paso hacia el doctorado en lugar de un artículo.
La distinción entre vínculos fuertes y vínculos débiles también se parece a cómo algunas culturas desaprueban los estimulantes, mientras otras desaprueban los relajantes.