1 puntos por GN⁺ 2023-08-07 | 1 comentarios | Compartir por WhatsApp
  • En muchas áreas de la ciencia falta reproducción independiente, pero la revisión por pares actual se convierte en una barrera con alta probabilidad de error y retrasa la comunicación de investigaciones importantes
  • La replicación por pares propuesta no consiste en que revisores anónimos evalúen el manuscrito, sino en que otros laboratorios reproduzcan efectivamente los resultados clave y que eso se incorpore a la decisión de publicación
  • Los investigadores que participen en la replicación aparecerían en una línea separada del artículo, obtendrían citas y un ítem para el CV, y los autores defenderían sus resultados mediante reproducibilidad en vez de responder a pedidos de experimentos adicionales de los revisores
  • En experimentos que requieren técnicas avanzadas, mucho tiempo o muchos recursos, no todo puede replicarse fácilmente, por lo que editores, autores y revisores deben elegir qué reproducir equilibrando rigor y viabilidad
  • Para reducir replicaciones fallidas, intentos repetidos y journal shopping, hacen falta mecanismos de transparencia como prerregistro, publicación de casos fallidos y conservación de artículos rechazados

La replicación por pares como alternativa propuesta a la revisión por pares

  • La verificación ideal en ciencia no consiste en que algunos expertos estampen su aprobación en un manuscrito, sino en confirmar si los hallazgos del artículo se reproducen en el mundo real
  • La mejor prueba de una nueva metodología no es la revisión del artículo, sino que un colega investigador realmente use la técnica
  • Hay muy pocos incentivos para que un laboratorio independiente vuelva a verificar resultados ya publicados, por lo que la mayoría de los artículos publicados no se replican después de manera independiente
  • En la replicación por pares, un preprint o manuscrito se envía a otro laboratorio, y ese laboratorio reproduce efectivamente los hallazgos clave
    • Si los hallazgos clave se replican, el manuscrito se aprueba y se publica
    • Los autores pueden pedir opiniones a colegas y corregir el manuscrito, pero el editor no se encarga de recopilar comentarios ni de exigir revisiones

Cómo incluir los resultados de la replicación en el artículo

  • El artículo publicado incluye, junto con los datos originales, los resultados de los intentos de replicación
  • Se puede mostrar en forma de tabla qué reactivos y técnicas fueron iguales a los del experimento original
  • Cuantos más parámetros hayan cambiado entre el experimento original y el experimento de replicación, más robusto será el hallazgo final si se obtienen resultados similares
  • El lector puede juzgar directamente, a partir de los resultados de la replicación, si el conjunto de la evidencia respalda las afirmaciones del artículo

Incentivos para los participantes

  • La revisión por pares tradicional exige mucho tiempo y esfuerzo si se hace bien, pero ofrece muy poca recompensa
  • En la replicación por pares, los nombres de los investigadores que hicieron la replicación aparecen en una línea separada del artículo publicado
    • Los revisores pueden recibir citas
    • Obtienen otra forma de recompensa publicable que pueden incluir en el CV
  • Los autores pueden mostrar que sus resultados se mantienen incluso después de una verificación rigurosa
  • En la revisión tradicional, los autores deben realizar experimentos adicionales y responder a las críticas de los revisores; en la replicación por pares, los revisores asumen el rol de defender experimentalmente los hallazgos del manuscrito

Viabilidad y efectos colaterales

  • También hay muchas investigaciones difíciles de replicar
    • Cuando requieren técnicas científicas avanzadas
    • Cuando requieren mucho tiempo
    • Cuando requieren muchos recursos, como los experimentos con ratones
  • El editor debe decidir, junto con los autores y revisores, qué experimentos reproducir
    • El objetivo es equilibrar rigor y viabilidad
    • Algunas partes de experimentos muy complejos pueden quedar sin replicar
    • En ese caso, el lector debe juzgar directamente cómo evaluar el artículo completo
  • La replicación por pares convierte un proceso de revisión confrontativo en una colaboración entre colegas para buscar la verdad
  • Al sumar la mirada y el razonamiento de otros investigadores, pueden incorporarse nuevos controles o enfoques experimentales alternativos que fortalezcan el hallazgo original
  • Una mayor circulación de procedimientos experimentales ayuda a futuras colaboraciones, nuevos enfoques y capacitación técnica de estudiantes y posdoctorandos
  • Puede convertirse en un canal para difundir el conocimiento tácito de laboratorio que queda encerrado dentro de cada laboratorio
  • Si otros investigadores intentan reproducir de verdad los resultados experimentales, se vuelve más difícil hacer pasar datos o imágenes manipuladas como auténticas, lo que puede reducir la mala conducta científica

Problemas previstos y cómo empezar

  • La replicación por pares puede hacer que pase más tiempo desde el envío hasta la publicación final
    • La revisión por pares tradicional también suele tomar varios meses, por lo que en muchos casos el experimento de replicación podría no agregar tiempo real
    • Si los autores envían fragmentos de la investigación sin esperar a que todo el manuscrito esté completo, se puede reducir el tiempo
    • Lo ideal sería preparar la replicación de hallazgos parciales mediante un mecanismo independiente de las revistas, como ReviewCommons
  • Cuando una replicación falla, hace falta criterio
    • Hay que decidir si la replicación fallida es esencial para el manuscrito
    • También hay que evaluar si el intento de replicación se realizó de manera suficientemente adecuada
    • Puede hacer falta un segundo intento de replicación, pero hay que evitar repetir hasta que salga bien y detenerse ahí
    • El prerregistro del plan de replicación puede ayudar a reducir esto
    • Los detalles de la replicación fallida deben incluirse obligatoriamente en el artículo publicado
  • También persiste el problema del journal shopping, cuando un autor es rechazado en una revista por una replicación fallida y luego vuelve a enviar el trabajo a otra revista
    • Los artículos rechazados deben conservarse de alguna manera para asegurar transparencia y rendición de cuentas
    • También se necesitan mecanismos para que los investigadores que participaron en la replicación reciban crédito por su esfuerzo
  • La división de roles sería la siguiente
    • Editor: filtra los manuscritos enviados y rechaza ciencia claramente defectuosa, experimentos que no vale la pena replicar, omisiones de controles esenciales o resultados muy aburridos
    • Editor: encuentra revisores adecuados y decide, junto con autores y revisores, qué experimentos replicar y cómo hacerlo
    • Editor: consulta con los revisores y emite el juicio final sobre si los hallazgos del artículo son lo bastante reproducibles como para una publicación formal
    • Authors: escriben el manuscrito, buscan feedback por canales como bioRxiv y lo corrigen antes de enviarlo a una revista
    • Authors: apoyan a los revisores con el diseño experimental, reactivos y, si hace falta, acceso a personal o equipos especiales
    • Referees: intentan reproducir de buena fe los resultados experimentales clave del manuscrito y, si hace falta, realizan experimentos o controles adicionales y organizan los resultados
    • Readers: juzgan si la evidencia respalda las afirmaciones, basándose en la confianza de que los experimentos clave fueron replicados independientemente en otro laboratorio, y citan ciencia reproducible
  • Como forma de empezar, podría hacerse un piloto en una revista como eLife, pero no hace falta esperar a que las editoriales tradicionales den el primer paso
  • Una vía rápida podría ser que organizaciones como Review Commons encuentren buenos candidatos en bioRxiv, recluten junto con los autores a revisores que realicen la replicación y luego envíen el paquete completo a una revista
  • Cuando los científicos vean artículos verificados por replicación por pares en publicaciones reales, les costará tomar en serio artículos que solo pasaron por revisión por pares, y la mejor ciencia competirá con hallazgos no reproducidos

1 comentarios

 
GN⁺ 2023-08-07
Opiniones de Hacker News
  • No sé si este método podría funcionar realmente, y parece que quienes no son científicos subestiman mucho el trabajo que implica reproducir todos los artículos
    Depende del área, pero reproducir correctamente un solo artículo puede tomar meses. No hay que repetir el ensayo y error del artículo original, y quizá se puedan recibir muestras para acortar la preparación, pero si no funciona al primer intento, hay que depurar el experimento y comprobar que no haya errores, lo que aumenta mucho el tiempo
    Además, este trabajo ofrece muy poco beneficio al científico que reproduce el estudio, y solo consume dinero y tiempo. Si alguien está lo bastante interesado como para ampliar esa investigación, de todos modos intentará reproducirla; y si tiene éxito, el artículo posterior respaldará indirectamente al artículo original, aunque no sea un artículo de reproducción directa
    Sin embargo, el gran problema es que, si el experimento posterior fracasa, por lo general no se publica. Y eso no se resuelve simplemente diciendo que se publiquen resultados negativos. Para producir un resultado negativo sólido hace falta mucho más trabajo que hacer el experimento y abandonarlo si no parece prometedor

    • Quienes no son científicos también tienden a sobrestimar el efecto de la revisión por pares, e incluso a equipararla con validez
      Aunque un resultado haya sido reproducido, puede no publicarse si no se cumplen otras condiciones. Por ejemplo, supongamos que un equipo, al buscar un material novedoso para resolver un problema complejo de ingeniería, encuentra una sustancia que fue sintetizada una vez en la década de 1980 y nunca reproducida. Como parece que podría tener las propiedades deseadas, la sintetizan; la estructura es correcta, pero no tiene las propiedades esperadas. Entonces es muy probable que no escriban un artículo y pasen al siguiente candidato. Aunque varios equipos hagan lo mismo al mismo tiempo, quienes vengan después no podrán saber nada
    • Si pudiéramos esperar razonablemente que los artículos sean correctos, me parecería aceptable incluso una reducción a la mitad de la productividad del campo
    • Existe al menos una revista científica que publica solo estudios reproducidos: Organic Syntheses
      “Una característica única del proceso de revisión es que todos los datos y experimentos reportados en el artículo deben repetirse exitosamente en el laboratorio de un miembro del consejo editorial para verificar su reproducibilidad antes de la publicación”
      https://en.wikipedia.org/wiki/Organic_Syntheses
    • Es simple, pero no fácil. Bastaría con crear una ruta de titularidad basada en estudios de reproducción, o reconocerlos al mismo nivel que la investigación original en los paquetes de evaluación para la titularidad
      Por ejemplo, reducir en x la cantidad de artículos exigidos y, a cambio, exigir x reproducciones, de modo que cada quien tenga un historial de reproducciones en su área de especialidad. También habría que crear partidas de financiamiento para estudios de reproducción y pasarlas a un sistema independiente. Harían falta mecanismos como asignación aleatoria. La reproducción debe valorarse igual que la investigación original
      Los departamentos pequeños de nivel R2 podrían convertirse en centros de reproducción. En biología, química y algunas áreas de la psicología, esto podría ser más fácil que en física de partículas. Se puede empezar por los campos donde el costo de reproducción sea relativamente bajo e ir afinando los detalles. En algunos casos es bastante posible, aunque en otros campos quizá siga siendo difícil para siempre
    • Para decirlo fríamente, el 99% de los artículos no significa nada. No añade nada al conocimiento colectivo de la humanidad
      En robótica hay demasiados artículos que toman tres o cuatro algoritmos o modelos de aprendizaje automático ya conocidos y los aplican a hardware comercial. Cualquiera con formación en el área puede predecir casi todos los resultados. Para cada espacio de problemas popular —prótesis de mano, drones de vigilancia de incendios forestales, robots guía para museos— aparecen cientos de variantes cada mes, mucho más de lo que podría ser realmente útil
      Tal vez haga falta un procedimiento aparte para los estudios que afirman haber hecho descubrimientos verdaderamente importantes. No sé exactamente cuál debería ser, pero, francamente, quizá también debería reducirse la cantidad misma de artículos
  • El objetivo de la publicación científica es compartir nuevos resultados con otros científicos, para que otros puedan construir sobre ellos o verificar su exactitud.
    Aunque siempre ha existido un componente de “reconocimiento del mérito”, desde la perspectiva de maximizar el avance científico, lo que realmente importa es la comunicación.
    Hace mucho tiempo, publicar era más bien un proceso informal: hacer circular cartas o, si se trataba de un gran resultado, autoeditar un libro. Más tarde, las editoriales crearon revistas formales, y algunas revistas empezaron a recibir tantos envíos que ya no podían publicar solo por reputación ni verificarlos fácilmente. Las revistas populares comenzaron a aplicar criterios editoriales básicos para filtrar artículos pésimamente escritos y spam evidente, y como los editores no eran expertos en todos los campos, pidieron ayuda a voluntarios. Eso es la revisión por pares.
    Después, los burócratas exigieron una forma de medir la productividad de los científicos para asignar presupuestos y ascensos, y tomaron como indicador el historial de publicaciones en unas cuantas revistas prestigiosas. Como resultado, lo que era un proceso útil de “compartir resultados” se convirtió, a ojos de los externos, en algo parecido a obtener puntos académicos, y la publicación misma empezó a verse como el objetivo final, no como una etapa intermedia en el proceso de verificación de resultados.
    Además, algunos externos malinterpretan este proceso y se enojan ante el hecho de que los resultados intermedios puedan estar equivocados. En vez de aceptar que el núcleo de la publicación es compartir ampliamente los resultados para aumentar la posibilidad de verificación, o de crear mejores indicadores de ascenso, intentan bloquear el proceso central de intercambio, volverlo ineficiente y reducir el alcance y la velocidad de difusión de las publicaciones. Esta confusión podría manejarse de una manera mucho más inteligente.

    • Está muy bien resumido, y creo que esta perspectiva es la más clara.
      Aquí también entra como variable la forma en que el público no científico recibe la información de la academia. Antes, la academia era un grupo relativamente cerrado que perseguía el conocimiento en sí mismo, por lo que este problema era menos importante. Lo nuevo es que la sociedad se ha obsesionado con la idea de que la conducción del Estado y la administración pública deben depender en gran medida de los resultados y opiniones de la academia.
      El entusiasmo por las políticas basadas en la ciencia golpea por tres frentes. El hecho de que los resultados de investigación puedan influir en políticas públicas puede cambiar los incentivos de la propia forma de hacer ciencia. Que los resultados académicos tengan influencia externa también cambia qué ciencia se realiza y puede atraer a actores deshonestos. Cuando aumenta la influencia, el público poco informado ve resultados todavía preliminares o no replicados y saca conclusiones inmaduras. Incluso una investigación estrecha o débil puede recibir atención excesiva si parece un buen garrote para golpear al adversario.
    • En general es correcto, pero hay partes que no coinciden con mi experiencia en la academia. En la publicación hay muchísimas estrategias gamificadas.
      Nos guste o no, los académicos terminan siendo evaluados por sus publicaciones, y creo que casi nadie lo malinterpreta. El problema es que esos incentivos son malos. Crear una nueva categoría de publicación que exija replicación podría ser posible en algunos campos como la óptica/fotónica, pero sería casi imposible en áreas como la física experimental de partículas.
      En campos puramente intelectuales como las matemáticas, la física teórica o la filosofía, es muy probable que un sistema así no sea necesario. El aprendizaje automático, que está en un punto intermedio, parece fácil de replicar en teoría, pero, por ejemplo, entrenar líneas base para modelos de lenguaje a gran escala puede volverse demasiado costoso.
    • Para compartir resultados ampliamente existe arXiv. El problema es que ahora el volumen de difusión es tan grande que resulta difícil de manejar.
      Tampoco ayuda la percepción pública de que un artículo publicado en una revista prestigiosa equivale a una verdad establecida.
    • El análisis parece retratar a todos los científicos como personas puras. Hay que recordar el escándalo reciente en el que el presidente de Stanford se vio involucrado por manipulación de datos.
      Hoy la publicación ya no cumple el mismo papel que antes de internet. Ahora es trivial escribir y lograr publicar un artículo convincente sin investigación: http://theatlantic.com/ideas/archive/…
  • La revisión por pares no es un mecanismo para garantizar la replicación, sino para garantizar la legibilidad y comprensibilidad de un artículo.
    Algunos experimentos cuestan miles de millones de dólares, por lo que aplicar una “replicación por pares” a todos los artículos es imposible.
    En cambio, sí se podrían agregar metadatos sobre los artículos replicados.

    • Me parece que la legibilidad y la comprensibilidad deberían ser responsabilidad del editor o de la revista. Al fin y al cabo, ellos sí cobran.
      Las conferencias pueden ser distintas, pero entiendo que la revisión por pares se parece más a verificar si la metodología, el alcance, las afirmaciones, la dirección, las conclusiones y la relevancia son válidas y confiables.
    • Hay que bajar la barrera de publicación para los estudios de replicación, y creo que ese es el problema central.
      Si alguien dedica tiempo a intentar replicar algo descrito solo en uno o dos artículos, eso es valioso para la comunidad y debería alentarse. Mejor aún si se usa como oportunidad para que un estudiante de doctorado perfeccione sus habilidades. No es vistoso ni completamente nuevo, pero es útil e importante.
      Estos estudios deberían publicarse en revistas normales. Si solo se crean revistas dedicadas a replicaciones, su factor de impacto será pésimo y nadie les prestará atención.
    • También parece posible agregarlos al artículo original como autores o colaboradores especiales.
      Siempre hay gente que, si algo no es una solución al 100%, lo considera inapropiado y no hace nada. La revisión por pares ha demostrado ser insuficiente, pero la gente se aferra a ella desesperadamente. Algunas disciplinas deberían exigir replicación para todo. No voy a señalar específicamente a la psicología ni a las ciencias sociales en general, pero la tasa de fallos de replicación en algunos campos está en un nivel difícil de aceptar.
    • No hay que dejar que lo perfecto impida lo bueno. Aunque no podamos replicar todos los campos, en muchos se puede empezar hoy.
      Hay que cambiar los criterios de valor: reconocer la replicación como una vía válida para la titularidad y los ascensos, y convertirla en un componente obligatorio del doctorado.
    • A diferencia de la afirmación de que “la revisión por pares no garantiza la replicación, sino la legibilidad y la comprensibilidad”, en el último año me rechazaron un artículo dos veces seguidas.
      En ambas ocasiones, las evaluaciones incluían frases como “el artículo está muy bien escrito, al punto de que podría leerlo incluso un estudiante de licenciatura”. Al final, la revisión por pares garantiza el rol de guardián de acceso.
  • Durante un tiempo en Reddit existía el lema “si no hay foto, no pasó”
    Al menos en ciencias de la computación/aprendizaje automático hace falta si no hay código, no pasó. Los papers son ambiguos, y a veces, aunque haya fórmulas, no todos los componentes están definidos
    La reproducción por pares en este campo es una tarea fácil y de bajo costo que podría servir de ejemplo para otras áreas científicas

    • Eso es una afirmación demasiado simplista. Subestima la profundidad de la academia
      Investigaciones como los avances recientes sobre Alzheimer se benefician de la reproducción y, de todos modos, también se reproducen por el interés comercial. Pero en temas de nicho más ordinarios no hay dinero para reproducir todos los estudios. Que la investigación en ciencias de la computación/inteligencia artificial sea cómoda de reproducir no significa que eso pueda extenderse a toda la investigación
      Por eso existe la revisión por pares. Es un mecanismo para filtrar estudios que no parecen plausibles o que son de bajo esfuerzo y baja relevancia, no algo diseñado para prevenir fraudes
    • Ciencias de la computación y aprendizaje automático eran mi campo, aunque ahora ya no hago investigación. Antes siempre publicaba un archivo de código. Si alguien quería reproducirlo, podía descargarlo y ejecutarlo
      Ahora que existen GitHub, GitLab y otros, esto debería ser el estándar. Si un paper que trata sobre una implementación no proporciona código, por lo general es muy probable que sea humo
  • Me gusta la idea de dividir la “revisión por pares” en dos, y acordar un umbral de citaciones según el cual, cuando un área supere cierto número de citas, el paper deba reproducirse. Las revistas también deberían tener una sección dedicada a intentos de reproducción

    1. Rebrandear la revisión por pares como “revisión de legibilidad”, que es en lo que los revisores suelen concentrarse hoy
    2. Publicar una “declaración de reproducibilidad” como documento separado. La idea es que el revisor haga que los autores expliquen en detalle la metodología experimental y la estrategia, incluyendo aspectos concretos que alguien de fuera de esa subespecialidad podría no conocer. El crédito por esta idea es para NalNezumi en este hilo
    • Todos los papers experimentales que he leído tenían una sección Experimental, donde daban detalles de cómo lo hicieron. En general era una explicación concisa, pero suficientemente general
      En algunas áreas, además del conocimiento especializado, para hacer buenos experimentos se necesita una habilidad práctica que llaman “mano”. Por ejemplo, trabajar con compuestos sensibles al aire o con materiales en estados condensados o cristalinos. En los experimentos de mi tesis armé a mano parte del equipo
      A veces también se necesitan instalaciones especiales. En mi proyecto doctoral se usaron equipos por unos 500 mil dólares, y parte del equipo que usé ya estaba descontinuado y no se podía conseguir para cuando me gradué
  • Creo que una alternativa más realista es exigir revisión de reproducibilidad y la entrega de un mapa metodológico para cada paper
    Lo primero sería un proceso de ida y vuelta en el que el revisor, basándose en el paper, hace preguntas y verifica cosas con el objetivo de reproducir los resultados, pero sin exigir la reproducción real. Suele ser útil para encontrar detalles omitidos que el autor asume que todos en el área conocen. De hecho, he visto doctorandos de biología perder meses rastreando detalles experimentales que no estaban en el paper
    Lo segundo sería el resultado de lo primero. En vez de meter un apéndice largo en el texto principal, se crearía junto con el revisor por pares un documento separado que cubra cuidadosamente los experimentos y la metodología, poniendo el nombre del revisor para que no pueda pasar por encima del tema a la ligera
    He leído demasiados papers a los que les faltaba información importante para la reproducción. En aprendizaje automático/aprendizaje por refuerzo, cuando hay código, he encontrado innumerables detalles de implementación que no estaban en el paper. Incluso hay resultados que muestran que esos detalles pueden determinar el éxito o el fracaso de ciertos algoritmos [1]. También he visto casos en los que detalles clave estaban escritos solo en comentarios del código
    Más terrible aún fue el caso de un paper que afirmaba haber evaluado un método en un benchmark, pero al revisar resultó que esa tarea no existía en ese benchmark. Habían hecho un fork del benchmark y creado su propia tarea sin dejarlo claro [2]
    Cosas así hacen que uno pierda la confianza en ciertas direcciones científicas. También he visto a varios investigadores junior concluir que toda la casa parecía construida con naipes y abandonar por completo la investigación
    [1] https://arxiv.org/abs/2005.12729
    [2] https://arxiv.org/abs/2202.02465
    Si esto les parece demasiado engorroso o caro, hay que recordar que las editoriales obtienen ganancias récord. Los recursos ya existen
    https://youtu.be/ukAkG6c_N4M

    • Yo también he visto a doctorandos de biología perder meses rastreando detalles experimentales que no estaban en los papers
      Ahora, cuando reviso manuscritos, presto mucha más atención a si hay suficiente información para reproducir el experimento o la simulación. Está bien que se publiquen papers con interpretaciones equivocadas, porque otras personas pueden descubrirlo mientras hacen su propia investigación. Pero no se debería permitir que se publiquen papers cuyos resultados no se pueden reproducir
      El contenido demasiado largo para la sección experimental debería ir en documentos de información suplementaria electrónica. Eso sí, me gustaría que al descargar el PDF la información suplementaria viniera adjunta al paper. Tener que rastrearla por separado es realmente molesto. Hay áreas, como la caracterización de materiales, donde es común proporcionar información suplementaria con muchos datos y detalles
      Los datasets grandes deberían ir a repositorios o a revistas de datasets. Así, los métodos siguen pasando por revisión por pares y el dataset recibe un DOI, lo que facilita su reutilización. También es una buena forma de duplicar la cantidad de papers de un estudiante al final del doctorado
      Hacer un fork de un benchmark para crear tu propia tarea y no dejarlo claro es simplemente perverso
  • Aunque sea difícil o imposible de reproducir, la ciencia observacional sigue siendo una rama de la ciencia
    Pensemos en la primera foto de un calamar gigante vivo en su hábitat natural, publicada en 2005: https://royalsocietypublishing.org/doi/10.1098/rspb.2005.315...
    ¿Quién pensaría en serio que no debió haberse publicado hasta que otra persona reprodujera ese resultado?
    ¿También habría que decir que los resultados de ensayos clínicos de medicamentos no deben publicarse hasta que sean reproducidos?
    ¿Cómo se reproduce “A stellar occultation by (486958) 2014 MU69: results from the 2017 July 17 portable telescope campaign”, donde una estrella, el objeto transneptuniano 486958 Arrokoth y una región específica de Argentina tenían que alinearse con precisión?: https://ui.adsabs.harvard.edu/abs/2017DPS....4950403Z/abstra...
    ¿Cómo se reproducen los resultados de un sobrevuelo cercano de Pluto o de volar un helicóptero en Mars?
    También está el artículo “Insights from a laboratory fire”, que conocí por “In The Pipeline”: https://www.nature.com/articles/s41557-023-01254-6
    Trata de que los incendios en laboratorios de química son relativamente comunes pero se reportan poco, y que sus consecuencias pueden ser fatales. En este caso, ¿qué relevancia tendría la reproducción por pares?

    • En algunos de los casos mencionados, aunque desde luego no en la mayoría, hay un dataset en algún lugar y código que se ejecutó sobre ese dataset
      En esos casos, reproducir significa que otra persona pueda ejecutar ese código sobre ese dataset y obtener los mismos resultados
      ¿Los laboratorios tienen que mejorar sus entornos de software y aprender herramientas nuevas? ¿Tienen que abandonar el viejo know-how secreto? Justamente ese es el punto
    • Como los resultados que aún no se publican no pueden reproducirse, es natural que un fenómeno nuevo no esté reproducido en el momento en que se publica por primera vez
      El problema no es la publicación de nuevos hallazgos, sino la falta de incentivos para verificarlos después de publicados
      Una nueva observación del calamar gigante sigue siendo muy valiosa, aunque ya no sea novedosa. Por eso deberían incentivarse nuevas observaciones
      El sobrevuelo de Pluto o el helicóptero de Mars tampoco son muy buenos ejemplos, en realidad. Habría que enviar otra sonda, y es probable que en el futuro abunden los casos y datos sobre vehículos voladores en la atmósfera de Mars. También se pueden hacer muchísimas simulaciones. A Pluto se le seguirán apuntando espectrómetros y varios instrumentos
      Incluso en estos casos, aunque los datos provengan del mismo aparato experimental, que equipos distintos los analicen de forma independiente puede aumentar la solidez. No todo es blanco o negro. La observación está en un espectro; algunas son mucho más confiables que otras, y la reproducción es un factor dentro de eso
      En el caso de los incendios de laboratorio, se necesita más de un caso para saber qué fenómenos se deben a particularidades de un laboratorio específico. Se requiere algo como un análisis estadístico y de factores. Aquí, reproducir no significa prender fuego deliberadamente a laboratorios reales
      Es como la investigación de accidentes automovilísticos. No se mata gente a propósito, pero se sigue necesitando investigación basada en hechos reales, con nuevos artículos que confirmen o refuten observaciones anteriores
    • En algunos de esos casos se pueden reproducir o revisar las conclusiones derivadas de los datos originales. Por ejemplo, muchos equipos usan los mismos datos originales de grandes colisionadores, JWST y otros grandes proyectos científicos para llegar a conclusiones que compiten entre sí
      En un mundo perfecto también reproduciríamos la recolección de datos, pero no vivimos en un mundo perfecto
      Con los ensayos clínicos de medicamentos pasa lo mismo. Como las empresas afirman que los datos originales son secretos comerciales, siempre hay una pelea para obtenerlos. Por eso la verificación independiente es muy costosa, pero creo que sería mucho mejor si la FDA exigiera publicar el 100% de los datos recopilados, y no solo conclusiones editadas y algunos materiales de apoyo
      Por ejemplo, la FDA dijo que tardaría décadas en publicar los datos originales de los ensayos clínicos de las vacunas contra COVID. ¿Por qué tendría que ser así? Y eso fue después de que una demanda lo obligara
  • Durante la maestría en ciencias de la computación dediqué bastante tiempo a los detalles de implementación de artículos, pero algo que descubrí una y otra vez fue que los papers no mencionaban todos los puntos débiles ni los casos de falla de la técnica. Aunque había excelentes excepciones
    Por la presión de publicar o perecer, hay muy poca honestidad en la investigación. Por suerte también hay gente que publica su trabajo de manera transparente, pero en general la ciencia está hundida en un mar de investigaciones llenas de falta de transparencia y fracasos de reproducción

    • Al entrar a trabajar, uno entiende rápido por qué usamos CI/CD, Docker, virtualización. Es otra forma del mismo problema: el temible “en mi computadora sí funciona”
      CI/CD obliga a codificar con precisión cómo compilar y desplegar algo para llevarlo a producción. Docker y las máquinas virtuales son una forma de esquivar este problema ofreciendo una “mi computadora” fácil de copiar y compartir
    • En la maestría tuve una experiencia muy parecida. Si ni siquiera sabemos si una técnica funciona para empezar, me hizo pensar seriamente qué es exactamente lo que están “revisando” los pares
  • En el campo de los lenguajes de programación, las conferencias empezaron a permitir que los autores enviaran artefactos empaquetados. Por lo general son código fuente, datos de entrada, datos de entrenamiento, etc., y normalmente se evalúan por separado después de la revisión del artículo.
    Los artefactos suelen ser evaluados por un comité separado, normalmente compuesto por estudiantes de posgrado, y como siempre, todo es trabajo voluntario. Incluso con lineamientos explícitos, ya es bastante difícil ejecutar el mismo código en otro entorno y obtener los mismos resultados. Si la “reproducción” de una técnica de software exige que otro equipo la reimplemente desde cero, parece inviable.
    Ni siquiera puedo imaginar lo difícil que sería escribir instrucciones para que otro laboratorio reproduzca con éxito experimentos de frontera en física, química o biología. No es solo un problema de equipo especializado; es lo que ocurre en la frontera de la ciencia, donde se hace investigación de punta.
    Este tipo de propuesta se siente como escrita por una persona no científica que nunca ha vivido el proceso de revisión por pares en ningún campo. La realidad no funciona así.

    • ¿La teoría de lenguajes de programación es realmente ciencia? Se le llama ciencias de la computación, pero no creo que sea ciencia en el sentido de estudiar y entender la naturaleza. Las computadoras son construcciones artificiales, y las ciencias de la computación están mucho más cerca de la ingeniería que de la ciencia. Hablar de reproducir experimentos en teoría de lenguajes de programación, en sí mismo, suena un poco absurdo.
      En las ciencias “duras”, la reproducción muchas veces no parece ser tan difícil. LK-99 es un caso interesante: aunque había bastante consenso en que el artículo estaba escrito a las apuradas y le faltaban detalles, la gente parecía reproducir el experimento con éxito. Era ciencia de punta, pero la reproducción en sí no fue el problema. La mayor parte de la ciencia no es el LHC.
      El verdadero problema de la reproducción se encuentra en campos más “blandos”. Ahí no se trata solo de aleatoriedad o de la dificultad del experimento. Es común ver artículos, o incluso campos enteros, que en principio son irreproducibles. Los investigadores no creen que otros deban poder reproducir su trabajo, o a veces intentan impedirlo. La forma más común es reunir datos de una manera irreproducible y no publicarlos deliberadamente; a veces el problema está en el propio diseño del estudio.
      Al ver esto, la inferencia más natural es que no quieren intentos de reproducción porque saben que existe la posibilidad de que sus afirmaciones no sean ciertas.
      Por eso, que los revisores por pares o las revistas verifiquen algo muy básico —por ejemplo, si esa afirmación es reproducible al menos en principio— ya sería un buen comienzo. Seguirán existiendo artículos que se reproducen bien pero cuyas conclusiones son erróneas, artículos con metodologías ilógicas y artículos que se reproducen porque son demasiado obvios, pero hay muchísima fruta al alcance de la mano.
    • En muchas áreas de la ciencia, la frontera a menudo consiste apenas en dos o tres equipos de investigación de 5 a 30 personas cada uno, dispersos entre varias instituciones de investigación del mundo.
    • ¿De verdad es tan difícil estandarizar que los investigadores proporcionen un Dockerfile? La reproducción del entorno ya es un problema resuelto.
  • La revisión por pares es la solución correcta para el problema equivocado: https://open.substack.com/pub/experimentalhistory/p/science-...
    La reproducción es un objetivo valioso, pero tiene que haber incentivos de carrera. Creo que en la mayoría de los programas la reproducción de investigaciones debería incorporarse como parte del plan de estudios. Podría contar como un paso hacia el doctorado en lugar de un artículo.

    • Hay miedo a la frontera. Por eso, en vez de entusiasmo por encontrar nuevos candidatos a superconductores a temperatura y presión ambiente, abundan los comentarios que intentan desacreditar al único candidato conocido.
      La distinción entre vínculos fuertes y vínculos débiles también se parece a cómo algunas culturas desaprueban los estimulantes, mientras otras desaprueban los relajantes.