- Los participantes que usaron consejos de IA redujeron drásticamente sus respuestas de “no sé”, del 44% al 3%; mientras que la precisión cayó del 27% al 9%, la confianza subió del 30% al 76%
- Para distinguirlo de una delegación racional a una herramienta, los investigadores usaron preguntas en las que la IA suele equivocarse, como detalles visuales de películas, y Step 3.5 Flash, que por lo general daba respuestas incorrectas
- Algunos participantes podrían haber respondido correctamente si hubieran estado solos, pero eligieron una respuesta equivocada después de preguntarle a la IA, lo que confirma que un mal consejo de la IA puede perjudicar incluso juicios previos
- Con recompensas monetarias, las respuestas “no sé” mejoraron al 8% y la precisión al 16%, pero siguieron muy por debajo de los valores de referencia sin IA: 44% y 27%
- El simple hecho de poder usar IA puede debilitar el hábito de reconocer los límites del propio conocimiento, lo que preocupa especialmente en niños y estudiantes cuyo pensamiento crítico aún está en desarrollo
El impacto de los consejos de la IA en el juicio y la confianza
- Un estudio de tres universidades de Francia e Italia midió cómo cambian la suspensión del juicio, la precisión y la confianza cuando se tiene acceso a consejos de IA
- La proporción de respuestas “no sé” disminuyó del 44% al 3%
- La precisión cayó del 27% al 9%
- La confianza subió del 30% al 76%
- En el estudio participaron Valerio Capraro, de University of Milano-Bicocca; Chiara Marcoccia, de École Normale Supérieure; y Walter Quattrociocchi, de Sapienza University of Rome
- Las preguntas se centraron en detalles visuales de películas en los que los modelos de IA suelen fallar, como el color del uniforme del equipo en 《Bend It Like Beckham》
- Se usó intencionalmente Step 3.5 Flash, que por lo general se equivoca en este tipo de preguntas, para distinguir que la reducción del juicio no era resultado de una delegación racional a una herramienta confiable
- Algunos participantes eligieron una respuesta incorrecta después de preguntarle a la IA incluso en preguntas que podrían haber contestado bien por sí mismos
- Las recompensas monetarias mejoraron parcialmente los resultados, pero no alcanzaron el nivel de referencia de la condición sin IA
- Las respuestas “no sé” aumentaron del 3% al 8%, pero quedaron por debajo del 44% de referencia
- La precisión subió del 9% al 16%, pero no alcanzó el 27% de referencia
Rendición cognitiva y preocupaciones educativas
- Investigadores de Wharton llamaron
rendición cognitiva (cognitive surrender)al fenómeno en el que las personas aceptan respuestas incorrectas de la IA en un 80% de los casos y muestran más confianza que quienes trabajan sin IA - En estos resultados, no solo se confía en respuestas equivocadas de la IA: la mera disponibilidad de la IA inhibe el hábito de reconocer lo que uno no sabe
- Capraro enfatiza que la capacidad de decir “no sé” es importante para los seres humanos porque implica reconocer los límites del propio conocimiento
- Los niños que crecen con sistemas de IA antes de desarrollar habilidades de pensamiento crítico son un grupo de especial preocupación
- La renovación de la búsqueda con IA de Google reemplazó enlaces por resúmenes generados por IA con tono seguro, y Common Sense Media calificó este diseño como un “riesgo inaceptable” para los estudiantes
- Si se siguen usando productos de IA diseñados para responder y no decir “no sé”, los humanos también pueden aprender el mismo comportamiento
1 comentarios
Opiniones en Hacker News
Este estudio es bastante flojo. Como señala bien este comentario sobre el PDF, no hay nada en lo que se probó que sea exclusivo de los sistemas de IA.
Los investigadores les dieron a los participantes un LLM sabiendo que daba respuestas incorrectas a ciertas preguntas y luego les hicieron precisamente esas preguntas, en una condición en la que podían no responder si no estaban seguros.
Es como darles un libro de texto de un campo desconocido con algunos datos erróneos y evaluarles justo el contenido incorrecto de ese libro. Naturalmente, aumenta la probabilidad de que los participantes respondan y de que respondan mal.
Me interesan mucho los efectos de los LLM modernos sobre el aprendizaje y la confianza, como la tendencia a adular o la pereza cognitiva, pero este estudio no comprobó ninguno de esos factores, y el diseño experimental casi no cambiaría si se reemplazara el LLM por un libro de texto con errores.
Un mejor título sería “una IA muy imprecisa hizo que las personas fueran menos precisas”, pero eso naturalmente lleva a preguntar: “¿y qué pasa con una IA moderadamente precisa?”.
Así como no deberías comprarles a tus empleados malos libros de texto si no quieres respuestas erróneas, quizá también debas evitar darles IA en áreas que no conocen bien.
Además, buscar respuestas en un libro de texto es mucho más engorroso que preguntarle a un LLM, así que es probable que el efecto sea menor. Si no hay obligación de responder, poca gente se pondrá a revisar un libro de texto, y menos aún si en la portada dice “puede contener respuestas incorrectas”.
Me pregunto con qué frecuencia un gerente repite consejos de IA sin preguntarle a un experto, o desconfía de un experto solo porque la IA dijo otra cosa. A veces la IA tendrá razón, pero cuando se equivoca es muy difícil corregirlo.
Los subreddits de consejos e información han empeorado gravemente en calidad por el uso de IA. Aunque quien pregunta quiere respuestas de personas que saben de primera mano, muchos pasan la pregunta a ChatGPT y luego publican el resultado como si fuera su propio conocimiento e intuición.
No sé qué tan bueno sea el estudio, pero en ese espacio medio real que es Reddit el fenómeno es evidente. No es solo que no digan “no sé”; buscan activamente oportunidades para fingir que saben.
Mi solución es verificar constantemente las fuentes originales y la evidencia, pero lleva mucho tiempo y esfuerzo, y también es difícil decidir qué verificar primero.
Es preferible decir “ingresa xyz en ChatGPT” o compartir un enlace a un documento estructurado. Si solo copias y pegas el resultado, en ese proceso no agregas ningún valor.
Podría obtener información en IMDB o en videos de DIY, pero lo que quiero es una explicación con contexto y consejos adaptados a mi zona. Alguien que me conoce también sabe qué me resulta fácil o difícil, y puede decirme que cierta película o truco no encaja, o incluso a qué tienda debería ir.
La clave siempre fueron moderadores activos que ponen atención y una enorme cantidad de tiempo. Cuando los usuarios que publican contenido de baja calidad superan un punto crítico, los buenos usuarios se van y ya no hay recuperación.
Desde el pesimismo sobre la IA, aunque la IA se vuelva más inteligente, seguirá complaciendo a los usuarios, y las personas la usarán para reforzar con más seguridad ideas tontas, especialmente en áreas que no conocen bien.
Aunque pudiera resolverse técnicamente, es probable que no quieran un modelo que les diga que están equivocados y elijan mentiras fluidas que refuercen sus creencias.
La libertad de expresión te hace pensar que podrías estar equivocado, pero la libertad de asociación te permite evitarlo. La IA ampliará las cámaras de eco reconfortantes de internet a una escala difícil de imaginar.
Era una época en la que las computadoras empezaban a calcular varios órdenes de magnitud más rápido que los humanos, y trata el colapso del Hartford Civic Center como un fracaso por confiar ciegamente en la salida de la computadora. Por suerte no hubo muertos.
Parece un caso algo seleccionado, pero esta combinación de “baja precisión y alta confianza” me recordó ese accidente. Me preocupa que hagan falta muertes de civiles o responsabilidad legal para que se asienten los usos correctos de una nueva tecnología; como mínimo, se podría empezar por 1) no usarla en sistemas críticos para la seguridad y 2) no reemplazar a expertos por algoritmos.
https://www.engr.psu.edu/ae/thesis/failures/MKP/failures/fai...
Pero quienes hacen trabajo real con IA y pagan mucho dinero prefieren que la IA les diga que están equivocados antes que equivocarse frente a un cliente.
No es fácil de resolver y hace falta equilibrio, porque debe dar la respuesta correcta y a la vez seguir instrucciones. Un modelo más inteligente tiene más probabilidades de saber qué es correcto, por lo que en general es mejor que un modelo pequeño que asume que el usuario tiene razón y luego sigue alucinando.
Aun así, sería interesante que el usuario pudiera elegir fácilmente cuánto quiere que la IA refute su personalidad o las ideas ingresadas.
Sin un pipeline adecuado de generación aumentada por recuperación (RAG) o búsqueda web, no queda más que presentar alucinaciones con la máxima confianza.
Habría sido más interesante si hubieran experimentado con un modelo de primera línea bien alineado para rechazar respuestas cuando la probabilidad de los tokens es baja. El experimento actual solo demuestra que la gente tiende a confiar en textos bien escritos mostrados en una UI de chat.
Para quienes todavía valoran la verdad, esta frase de Richard Feynman puede servir de guía: “Tengo la ventaja de haber descubierto lo difícil que es saber algo de verdad, cuán cuidadosamente hay que comprobar los experimentos, y lo fácil que es cometer errores y engañarse a uno mismo…”
https://www.youtube.com/watch?v=tWr39Q9vBgo
La estructura de recompensas del estudio era: pago de 0.10 dólares si la respuesta era correcta, descuento de 0.10 dólares si era incorrecta, y sin cambios si se negaban a responder.
No se indicaba si los participantes realmente recibían dinero ni si debían pagar la pérdida cuando el saldo final era negativo.
Creo que el efecto en sí es real, pero probablemente no tan grande como muestran los datos. Si hubiera estado en juego una cantidad mucho mayor, el sentido común habría actuado con más fuerza.
Está bien que se haya dado a conocer el estudio, pero ninguno de los enlaces de la fuente lleva directamente al estudio citado, sino a su propio dominio o a Business Insider.
Marcoccia, C. et al., 《AI Advice Suppresses People’s Willingness to Say “I Don’t Know”, Even When the Advice Is Wrong and Accuracy Is Incentivized》, PsyArXiv, 15 de julio de 2026.
Quiero saber si la IA genera una diferencia sustancial frente a un entorno donde simplemente se puede acceder a respuestas incorrectas.
Hay que comprobar si se obtiene el mismo resultado cuando los resultados de búsqueda dan una respuesta incorrecta a la pregunta, cuánto influyen características propias de la IA como la tendencia a adular o la interacción conversacional, o si simplemente se trata de que la gente cree fácilmente lo que lee.
En resumen, estudiaron tanto una interfaz de chat con LLM que da respuestas incorrectas como una condición con acceso a respuestas incorrectas pregeneradas, y en ambos experimentos obtuvieron resultados similares.
Se dice que algunos docentes hacen que los estudiantes escriban tareas con ChatGPT y luego critiquen las partes incorrectas.
También podría ser interesante, en contextos donde normalmente presentarían una respuesta de IA copiada tal cual, mostrar primero la respuesta de la IA y hacer que la comunidad discuta qué se le escapó.