2 puntos por GN⁺ 1 일 전 | 1 comentarios | Compartir por WhatsApp
  • Los participantes que usaron consejos de IA redujeron drásticamente sus respuestas de “no sé”, del 44% al 3%; mientras que la precisión cayó del 27% al 9%, la confianza subió del 30% al 76%
  • Para distinguirlo de una delegación racional a una herramienta, los investigadores usaron preguntas en las que la IA suele equivocarse, como detalles visuales de películas, y Step 3.5 Flash, que por lo general daba respuestas incorrectas
  • Algunos participantes podrían haber respondido correctamente si hubieran estado solos, pero eligieron una respuesta equivocada después de preguntarle a la IA, lo que confirma que un mal consejo de la IA puede perjudicar incluso juicios previos
  • Con recompensas monetarias, las respuestas “no sé” mejoraron al 8% y la precisión al 16%, pero siguieron muy por debajo de los valores de referencia sin IA: 44% y 27%
  • El simple hecho de poder usar IA puede debilitar el hábito de reconocer los límites del propio conocimiento, lo que preocupa especialmente en niños y estudiantes cuyo pensamiento crítico aún está en desarrollo

El impacto de los consejos de la IA en el juicio y la confianza

  • Un estudio de tres universidades de Francia e Italia midió cómo cambian la suspensión del juicio, la precisión y la confianza cuando se tiene acceso a consejos de IA
    • La proporción de respuestas “no sé” disminuyó del 44% al 3%
    • La precisión cayó del 27% al 9%
    • La confianza subió del 30% al 76%
  • En el estudio participaron Valerio Capraro, de University of Milano-Bicocca; Chiara Marcoccia, de École Normale Supérieure; y Walter Quattrociocchi, de Sapienza University of Rome
  • Las preguntas se centraron en detalles visuales de películas en los que los modelos de IA suelen fallar, como el color del uniforme del equipo en 《Bend It Like Beckham》
  • Se usó intencionalmente Step 3.5 Flash, que por lo general se equivoca en este tipo de preguntas, para distinguir que la reducción del juicio no era resultado de una delegación racional a una herramienta confiable
  • Algunos participantes eligieron una respuesta incorrecta después de preguntarle a la IA incluso en preguntas que podrían haber contestado bien por sí mismos
  • Las recompensas monetarias mejoraron parcialmente los resultados, pero no alcanzaron el nivel de referencia de la condición sin IA
    • Las respuestas “no sé” aumentaron del 3% al 8%, pero quedaron por debajo del 44% de referencia
    • La precisión subió del 9% al 16%, pero no alcanzó el 27% de referencia

Rendición cognitiva y preocupaciones educativas

  • Investigadores de Wharton llamaron rendición cognitiva (cognitive surrender) al fenómeno en el que las personas aceptan respuestas incorrectas de la IA en un 80% de los casos y muestran más confianza que quienes trabajan sin IA
  • En estos resultados, no solo se confía en respuestas equivocadas de la IA: la mera disponibilidad de la IA inhibe el hábito de reconocer lo que uno no sabe
  • Capraro enfatiza que la capacidad de decir “no sé” es importante para los seres humanos porque implica reconocer los límites del propio conocimiento
  • Los niños que crecen con sistemas de IA antes de desarrollar habilidades de pensamiento crítico son un grupo de especial preocupación
  • La renovación de la búsqueda con IA de Google reemplazó enlaces por resúmenes generados por IA con tono seguro, y Common Sense Media calificó este diseño como un “riesgo inaceptable” para los estudiantes
  • Si se siguen usando productos de IA diseñados para responder y no decir “no sé”, los humanos también pueden aprender el mismo comportamiento

1 comentarios

 
GN⁺ 1 일 전
Opiniones en Hacker News
  • Este estudio es bastante flojo. Como señala bien este comentario sobre el PDF, no hay nada en lo que se probó que sea exclusivo de los sistemas de IA.
    Los investigadores les dieron a los participantes un LLM sabiendo que daba respuestas incorrectas a ciertas preguntas y luego les hicieron precisamente esas preguntas, en una condición en la que podían no responder si no estaban seguros.
    Es como darles un libro de texto de un campo desconocido con algunos datos erróneos y evaluarles justo el contenido incorrecto de ese libro. Naturalmente, aumenta la probabilidad de que los participantes respondan y de que respondan mal.
    Me interesan mucho los efectos de los LLM modernos sobre el aprendizaje y la confianza, como la tendencia a adular o la pereza cognitiva, pero este estudio no comprobó ninguno de esos factores, y el diseño experimental casi no cambiaría si se reemplazara el LLM por un libro de texto con errores.

    • El título dice “el consejo de la IA redujo 3 veces la precisión de las personas”, pero para juzgar la precisión de las personas primero hay que conocer la precisión de la propia IA usada. Si usaron una IA limitada para ser mucho peor que una expectativa razonable, no se puede culpar ni a las personas ni a la IA; es como pedirle a un experto que mienta y luego concluir que “escuchar a expertos reduce la precisión”.
      Un mejor título sería “una IA muy imprecisa hizo que las personas fueran menos precisas”, pero eso naturalmente lleva a preguntar: “¿y qué pasa con una IA moderadamente precisa?”.
    • Dudo que el hecho de que un libro de texto pudiera producir el mismo resultado vuelva inútil la conclusión del estudio. El punto central es que, si se ofrece en un área donde no se es experto una herramienta que parece autoritativa pero está equivocada, se debilita la capacidad de decir “no sé” incluso cuando la respuesta es incorrecta.
      Así como no deberías comprarles a tus empleados malos libros de texto si no quieres respuestas erróneas, quizá también debas evitar darles IA en áreas que no conocen bien.
      Además, buscar respuestas en un libro de texto es mucho más engorroso que preguntarle a un LLM, así que es probable que el efecto sea menor. Si no hay obligación de responder, poca gente se pondrá a revisar un libro de texto, y menos aún si en la portada dice “puede contener respuestas incorrectas”.
    • Puede verse como algo no distinto de un libro de texto, pero en la vida real es raro que la gente use libros de texto de esa manera, mientras que los LLM sí se usan así con muchísima frecuencia.
    • Lo preocupante es que, en estos campos, la gente no puede distinguir si el consejo de la IA es malo, así que es muy probable que acepte sin más consejos disparatados pero dichos con seguridad.
      Me pregunto con qué frecuencia un gerente repite consejos de IA sin preguntarle a un experto, o desconfía de un experto solo porque la IA dijo otra cosa. A veces la IA tendrá razón, pero cuando se equivoca es muy difícil corregirlo.
    • El estudio en sí está bien. Lo flojo son el artículo y el título original, que sacan conclusiones que no están en el estudio; y es irónico que el artículo de TNW parezca 100% generado por IA.
  • Los subreddits de consejos e información han empeorado gravemente en calidad por el uso de IA. Aunque quien pregunta quiere respuestas de personas que saben de primera mano, muchos pasan la pregunta a ChatGPT y luego publican el resultado como si fuera su propio conocimiento e intuición.
    No sé qué tan bueno sea el estudio, pero en ese espacio medio real que es Reddit el fenómeno es evidente. No es solo que no digan “no sé”; buscan activamente oportunidades para fingir que saben.

    • Las publicaciones y videos anteriores a 2022 son recursos de información equivalentes al acero de baja radiación producido antes de la era de las bombas atómicas. No todo es valioso, pero ahora la influencia de la IA se ha filtrado de manera tan amplia incluso en textos informativos de expertos que esto se volvió importante.
      Mi solución es verificar constantemente las fuentes originales y la evidencia, pero lleva mucho tiempo y esfuerzo, y también es difícil decidir qué verificar primero.
    • Si respondes “si ni siquiera te tomaste el trabajo de escribirlo, yo tampoco me tomaré el trabajo de leerlo”, la gente se enfurece, e incluso te manda una respuesta escrita por IA explicando por qué estás equivocado.
      Es preferible decir “ingresa xyz en ChatGPT” o compartir un enlace a un documento estructurado. Si solo copias y pegas el resultado, en ese proceso no agregas ningún valor.
    • Ya no sigo siendo amigo de quienes no entienden la propuesta de una conversación y de inmediato la cortan respondiendo “¿por qué no lo buscas?”.
      Podría obtener información en IMDB o en videos de DIY, pero lo que quiero es una explicación con contexto y consejos adaptados a mi zona. Alguien que me conoce también sabe qué me resulta fácil o difícil, y puede decirme que cierta película o truco no encaja, o incluso a qué tienda debería ir.
    • La mayoría de los subreddits de consejos e información que solía leer ya se habían venido abajo con publicaciones pésimas incluso antes de la IA, y algunos a los que todavía estoy suscrito están sorprendentemente bien.
      La clave siempre fueron moderadores activos que ponen atención y una enorme cantidad de tiempo. Cuando los usuarios que publican contenido de baja calidad superan un punto crítico, los buenos usuarios se van y ya no hay recuperación.
    • En HN también vi varias veces respuestas del tipo “no sé, pero lo metí en CrapGPT y respondió esto”. Antes de dar una respuesta así, habría que preguntarse qué valor se agregó frente a que quien hizo la pregunta use la IA por su cuenta.
  • Desde el pesimismo sobre la IA, aunque la IA se vuelva más inteligente, seguirá complaciendo a los usuarios, y las personas la usarán para reforzar con más seguridad ideas tontas, especialmente en áreas que no conocen bien.
    Aunque pudiera resolverse técnicamente, es probable que no quieran un modelo que les diga que están equivocados y elijan mentiras fluidas que refuercen sus creencias.
    La libertad de expresión te hace pensar que podrías estar equivocado, pero la libertad de asociación te permite evitarlo. La IA ampliará las cámaras de eco reconfortantes de internet a una escala difícil de imaginar.

    • Henry Petroski explica en 《To Engineer is Human》 que la aparición de la calculadora en la era de las calculadoras debilitó el sentido numérico de los ingenieros estructurales, los llevó a intentar trabajos cercanos al límite de sus capacidades e incluso redujo su capacidad de verificar cálculos computacionales.
      Era una época en la que las computadoras empezaban a calcular varios órdenes de magnitud más rápido que los humanos, y trata el colapso del Hartford Civic Center como un fracaso por confiar ciegamente en la salida de la computadora. Por suerte no hubo muertos.
      Parece un caso algo seleccionado, pero esta combinación de “baja precisión y alta confianza” me recordó ese accidente. Me preocupa que hagan falta muertes de civiles o responsabilidad legal para que se asienten los usos correctos de una nueva tecnología; como mínimo, se podría empezar por 1) no usarla en sistemas críticos para la seguridad y 2) no reemplazar a expertos por algoritmos.
      https://www.engr.psu.edu/ae/thesis/failures/MKP/failures/fai...
    • La IA reciente tiende a ser menos complaciente, y la tendencia a adular es un problema ampliamente conocido que las empresas de IA también están corrigiendo. Como se vio cuando OpenAI retiró GPT-4o, claramente hay gente a la que eso no le gusta.
      Pero quienes hacen trabajo real con IA y pagan mucho dinero prefieren que la IA les diga que están equivocados antes que equivocarse frente a un cliente.
      No es fácil de resolver y hace falta equilibrio, porque debe dar la respuesta correcta y a la vez seguir instrucciones. Un modelo más inteligente tiene más probabilidades de saber qué es correcto, por lo que en general es mejor que un modelo pequeño que asume que el usuario tiene razón y luego sigue alucinando.
    • El comportamiento de la IA que interactúa con humanos terminará decidiéndose en función de la generación de ingresos. Incomodar al usuario o contradecirlo normalmente no es una estrategia de negocio preferida.
      Aun así, sería interesante que el usuario pudiera elegir fácilmente cuánto quiere que la IA refute su personalidad o las ideas ingresadas.
    • No necesito los LLM y casi no los uso porque tampoco ayudan mucho en trabajos originales, así que si la gente a mi alrededor se vuelve mucho más torpe por culpa de la IA, en realidad me alegraría. Porque me haría más fácil tener éxito en mi vida.
    • Mucha gente desde hace tiempo prefiere mentiras cómodas a verdades incómodas.
  • Sin un pipeline adecuado de generación aumentada por recuperación (RAG) o búsqueda web, no queda más que presentar alucinaciones con la máxima confianza.
    Habría sido más interesante si hubieran experimentado con un modelo de primera línea bien alineado para rechazar respuestas cuando la probabilidad de los tokens es baja. El experimento actual solo demuestra que la gente tiende a confiar en textos bien escritos mostrados en una UI de chat.

  • Para quienes todavía valoran la verdad, esta frase de Richard Feynman puede servir de guía: “Tengo la ventaja de haber descubierto lo difícil que es saber algo de verdad, cuán cuidadosamente hay que comprobar los experimentos, y lo fácil que es cometer errores y engañarse a uno mismo…”
    https://www.youtube.com/watch?v=tWr39Q9vBgo

    • Hay que tener cuidado porque al menos una, quizá varias cuentas de YouTube están creando videos de baja calidad de Feynman generados por IA. No se debe confiar automáticamente en material solo porque parezca anterior a esta época desastrosa.
  • La estructura de recompensas del estudio era: pago de 0.10 dólares si la respuesta era correcta, descuento de 0.10 dólares si era incorrecta, y sin cambios si se negaban a responder.
    No se indicaba si los participantes realmente recibían dinero ni si debían pagar la pérdida cuando el saldo final era negativo.
    Creo que el efecto en sí es real, pero probablemente no tan grande como muestran los datos. Si hubiera estado en juego una cantidad mucho mayor, el sentido común habría actuado con más fuerza.

  • Está bien que se haya dado a conocer el estudio, pero ninguno de los enlaces de la fuente lleva directamente al estudio citado, sino a su propio dominio o a Business Insider.

    • El original es https://osf.io/preprints/psyarxiv/5y6m4_v1.
      Marcoccia, C. et al., 《AI Advice Suppresses People’s Willingness to Say “I Don’t Know”, Even When the Advice Is Wrong and Accuracy Is Incentivized》, PsyArXiv, 15 de julio de 2026.
  • Quiero saber si la IA genera una diferencia sustancial frente a un entorno donde simplemente se puede acceder a respuestas incorrectas.
    Hay que comprobar si se obtiene el mismo resultado cuando los resultados de búsqueda dan una respuesta incorrecta a la pregunta, cuánto influyen características propias de la IA como la tendencia a adular o la interacción conversacional, o si simplemente se trata de que la gente cree fácilmente lo que lee.

    • El estudio se puede leer en https://osf.io/preprints/psyarxiv/5y6m4_v1.
      En resumen, estudiaron tanto una interfaz de chat con LLM que da respuestas incorrectas como una condición con acceso a respuestas incorrectas pregeneradas, y en ambos experimentos obtuvieron resultados similares.
  • Se dice que algunos docentes hacen que los estudiantes escriban tareas con ChatGPT y luego critiquen las partes incorrectas.
    También podría ser interesante, en contextos donde normalmente presentarían una respuesta de IA copiada tal cual, mostrar primero la respuesta de la IA y hacer que la comunidad discuta qué se le escapó.

    • En educación debemos seguir exigiendo enfoques con evidencia científica, y no desperdiciar la educación de los niños con experimentos educativos improvisados de alguien. Ya pasamos por intentos similares con Bill Gates.