1 puntos por GN⁺ 2024-08-03 | 1 comentarios | Compartir por WhatsApp

Gratificación diferida y resultados en la adultez: la prueba del malvavisco no predice de forma confiable el funcionamiento adulto

  • Resumen del estudio
    • Este estudio amplía el enfoque analítico de Watts et al. (2018) para investigar la validez predictiva a largo plazo de la gratificación diferida.
    • Los participantes (n = 702; 83% blancos, 46% hombres) completaron la prueba del malvavisco a los 54 meses (1995-1996) y una encuesta a los 26 años (2017-2018).
    • Usando análisis prerregistrados, se encontró que el desempeño en la prueba del malvavisco no predice fuertemente el logro, la salud ni la conducta en la adultez.
    • Se encontraron correlaciones leves con el logro educativo (r = .17) y el índice de masa corporal (r = - .17), pero casi todos los coeficientes de regresión ajustados no fueron significativos.
    • No se encontraron patrones claros de moderación entre la gratificación diferida y el nivel socioeconómico o el género.
    • Los resultados indican que el desempeño en la prueba del malvavisco no predice de manera confiable los resultados en la adultez.
    • Se discute la validez predictiva y de constructo de la capacidad de gratificación diferida.

Declaración de disponibilidad de datos

  • Este estudio fue prerregistrado en Open Science Framework (osf.io/67XFN).
  • Como los datos usados en este estudio (ola adulta de SECCYD) no son públicos, se proporciona la sintaxis del análisis.
  • Se proporcionan la matriz de correlaciones y las estadísticas descriptivas de las variables principales.
  • Las olas previas de recolección de datos de la muestra SECCYD están disponibles en Inter-University Consortium for Political and Social Research (icpsr.umich.edu/web/ICPSR/series/233).

Resumen de GN⁺

  • Este estudio muestra que la prueba del malvavisco no es confiable para predecir el logro, la salud y la conducta en la adultez.
  • Aunque hay correlaciones leves con el logro educativo y el índice de masa corporal, la mayoría de los coeficientes de regresión ajustados no son significativos.
  • Incluye una discusión sobre la validez predictiva y de constructo de la capacidad de gratificación diferida.
  • Este estudio es útil para reexaminar las creencias previas sobre la validez a largo plazo de las pruebas de gratificación diferida.
  • Como estudio relacionado con una temática similar, se recomienda el trabajo de Moffitt et al. (2011).

1 comentarios

 
GN⁺ 2024-08-03
Opiniones de Hacker News
  • Los resultados del estudio original fueron cuestionados por un estudio de 2018 de mayor escala. El estudio original incluyó a 90 estudiantes, mientras que el seguimiento trabajó con 900; encontró la misma correlación, pero se dice que la mayor parte desapareció al controlar por ingreso del hogar.
    La conclusión natural es que el ingreso del hogar es un predictor tanto de la capacidad de postergar la gratificación como del rendimiento académico. Si uno crece en un hogar pobre, el acceso a recursos materiales es menos estable y predecible, por lo que puede ser racional aprovechar una oportunidad inmediata en lugar de esperar una recompensa mayor en el futuro, y también puede faltar apoyo académico. Este nuevo estudio va más allá y considera que incluso la correlación en sí es débil.
    [0] Watts, T. W., Duncan, G. J., & Quan, H. (2018). Revisiting the Marshmallow Test: A Conceptual Replication Investigating Links Between Early Delay of Gratification and Later Outcomes. Psychological Science, 29(7), 1159-1177. https://doi.org/10.1177/0956797618761661

    • El ingreso del hogar es predictor de muchas cosas. Está fuertemente correlacionado con el código postal y funciona casi igual; a partir de ahí también se puede predecir bastante bien la raza o la orientación política.
      Mucha gente piensa ingenuamente que, si se eliminan los datos explícitos de raza, la raza desaparece del modelo, pero en realidad permanece de forma indirecta. Lo mismo ocurre no solo con la raza o la política, sino con muchos otros factores, por eso la estadística causal es un campo mucho más distinto y difícil. Aquí “predictor” no significa causa, sino correlación, pero no me gusta mucho el término porque genera confusión.
    • No sé en el caso de los niños, pero tiene sentido que los adultos pobres tengan peor control de impulsos. Tienen más preocupaciones, menos cosas que esperar con ilusión, y quizá trabajen 12 horas en vez de 8.
      Los ricos que trabajan de más también tendrán muchos malos hábitos, pero como tienen carreras exitosas, eso se trata como un mecanismo de afrontamiento y se separa como parte de su vida. Si este tipo de estudios termina apareciendo como una racionalización de la postura de esa clase, solo porque hay una superposición entre la población de investigadores y la clase media alta, entonces mi cinismo quedará justificado.
    • El simple hecho de que la mayor parte de la correlación desapareciera al controlar por ingreso del hogar no demuestra mucho. Es probable que las actitudes hacia las recompensas a largo plazo estén influidas por factores culturales particulares compartidos dentro del hogar, y que esos factores afecten tanto al ingreso como al rendimiento académico.
      Para sacar una conclusión habría que encontrar un experimento natural en el que la diferencia de ingresos sea completamente exógena y no se deba a factores compartidos.
    • En la tabla 3, ser blanco es un predictor muy significativo (p=0.007) de poder esperar más de 7 minutos, pero en la tabla 7 no se reporta en absoluto la categoría blanco dentro del apartado de raza. Me pregunto si eso significa que las diferencias entre niños blancos se explican por completo por el estatus socioeconómico y otras covariables.
      Si, por el contrario, significa que ser negro tiene un efecto que no se explica por otras covariables, sería bastante polémico.
    • No es una conclusión tan obvia. Por ejemplo, también podría haber rasgos genéticos que influyan en el autocontrol.
  • Al ver varios detalles de este experimento, mi confianza e interés en las ciencias sociales disminuyeron mucho. Desde mi formación en biología cuantitativa, al mirar este tipo de estudios veo una larga lista de factores que pueden llevar al investigador a concluir erróneamente que la hipótesis es verdadera.
    En este caso, parece que el investigador no tenía suficiente interés en hacer un estudio de alta calidad, sino que partió de creencias morales o juicios de valor, ejecutó el experimento y luego interpretó los resultados de manera que respaldaran su “hipótesis”. Por la naturaleza de las ciencias sociales, hacer un experimento honesto de verdad es muy difícil.

    • Precisamente por esa razón se puede leer más de un siglo de críticas extensas y exhaustivas contra la mayor parte de las “ciencias” sociales. Muchas personas crecieron aprendiendo que hay una diferencia categórica entre las ciencias duras, como la física y la química, y las ciencias blandas, como las ciencias sociales y muchos subcampos de la biología y la medicina.
      Pero esa distinción ha desaparecido en gran medida del espíritu de la época, y ahora mucha gente acepta como sólido cualquier cosa publicada en una “revista científica”. Esto es un gran retroceso en la alfabetización científica del público y sienta las bases para que la gente empiece a desconfiar cada vez más incluso de las conclusiones de las verdaderas ciencias duras.
    • En los experimentos de psicología, parece que el diablo siempre está en los detalles. Es posible que el experimentador le haya dado señales sutiles al niño, y que lo único que se haya evaluado fuera qué tan bien el niño leía esas señales.
      Podrían influir muchas cosas: cuál fue la redacción exacta del “trato” propuesto al niño, si los resultados cambian cuando cambia esa redacción, si era una época de escasez o abundancia de alimentos, y cuáles eran las normas culturales de ese momento sobre “cómo debía comportarse” un niño. Incluso que la edad promedio de los niños fuera 6 meses mayor o menor podría cambiar los resultados, y hasta el agua, el aire o la pintura del lugar de prueba podrían estar relacionados.
      Ante estos posibles factores de confusión, parece que se necesitan más estadísticas y controles que en un experimento de colisión de física sobre electrones. Pero incluso los físicos, en entornos simples y reproducibles, establecieron el estricto criterio de 5 sigma para declarar descubrimientos, y las anomalías de 3 sigma van y vienen. Como en psicología es difícil imaginar de forma realista un estándar así, me cuesta verla como una ciencia empírica confiable.
    • Leí textos en los que tanto psicólogos como sociólogos criticaron este experimento concreto durante años. Solo era popular entre gente de internet que se considera a sí misma “nerd cool” y actúa como experta en todo.
      Si uno lee los textos más aburridos de científicos reales, ve que llevan años planteando objeciones.
    • Incluso el efecto Dunning-Kruger es un mal uso de la estadística. Ese efecto aparece también en muestras generadas al azar, porque los datos tienen un piso y un techo.
      Si una puntuación es baja, hay un margen limitado para estimarla aún más baja, por lo que es fácil sobreestimar la propia capacidad; si la puntuación es alta, hay un margen limitado para estimarla aún más alta, por lo que es fácil subestimar la propia capacidad.
    • Hay una razón por la que muchos científicos clasifican diplomáticamente a las “ciencias” sociales como ciencias blandas. Feynmann, que era un científico menos diplomático, las llamó pseudociencia.
  • Lo interesante es que, cuando se hace el estudio original, uno quiere que el experimento satisfaga su hipótesis, y cuando se construye sobre investigaciones previas, uno quiere que la reproducción tenga éxito. Pero con resultados famosos como estos, más bien uno termina deseando que fallen, porque así la gente habla de tus resultados.
    Estos experimentos pueden verse afectados de maneras incontables, inconscientes y sutiles, por los deseos del experimentador. Además, un factor de confusión interesante de la prueba del malvavisco es que mide la confianza en que la recompensa realmente se entregará tanto como la capacidad de esperar por ella. Si vives en un entorno impredecible, conviene más comértelo y ya

    • Como alguien que vivió en un entorno impredecible en la Rusia de los 90, la frase más precisa sería: “si vives en un entorno impredecible, conviene mudarte a uno predecible”.
      Vi a mucha más gente ahorrar para el futuro y, de hecho, me sorprendió ver más de lo contrario en Canadá, que es un entorno predecible
    • Recuerdo que ese factor de confusión se usaba como explicación para pasar por alto, a grandes rasgos, los problemas de reproducibilidad de la prueba del malvavisco, pero no recuerdo quién lo verificó realmente.
      Este artículo es puro disparate, así que parece mostrar que se puede inventar cualquier factor de confusión para explicarlo
    • Los recursos para estudios de reproducción son finitos, así que hay que asignarlos. Mientras más famoso es un resultado, más tiende a atraer intentos de reproducción buenos y escépticos.
      Este enfoque siempre me pareció bastante razonable. Eso sí, reproducir toma tiempo, y algunas personas tratan como una catástrofe que los resultados “malos” no se corrijan de inmediato
    • A menudo eso claramente ocurre. Cuando vi el paper que se cita con frecuencia para “refutar” Dunning-Kruger, me sorprendió lo pésima que era la metodología.
      https://www.lesswrong.com/posts/6Tqm8Jet9mzo6buj9/the-dunnin...
  • Prácticamente todos los estudios que aprendí en Psicología AP en la secundaria no lograron reproducirse, incluido este. En retrospectiva, esa clase fue, en el mejor de los casos, una pérdida de tiempo y, en el peor, dio mala información para tomar decisiones de vida

    • La reputación de autores como estos debería ser arrastrada por el lodo. La página de Wikipedia de Daniel Kahneman no lo hace parecer un estafador, pero él citó con confianza estudios que no se reprodujeron y también avaló datos falsos de otros estafadores
    • La psicología y la psiquiatría no son ciencias, sino ramas pseudocientíficas de la filosofía, como la osteopatía o la frenología. Se parecen más a un grupo religioso que lee hojas de té que a disciplinas que hagan experimentos controlados y reproducibles, emitan diagnósticos clínicos basados en evidencia o midan y examinen el órgano que afirman tratar
  • Otra interpretación de la prueba del malvavisco es que mide la confianza tanto como el autocontrol. Si no crees que el investigador te vaya a dar dos malvaviscos, no vas a esperar

    • Eso explicaría la baja motivación por el rendimiento académico como baja confianza en el investigador ;)
    • Esto parece requerir pruebas repetidas. En las primeras rondas habría que hacer que no hubiera recompensa después
    • O tal vez sea una completa tontería sin ningún poder predictivo, que se puede interpretar como uno quiera
    • O quizá el segundo malvavisco no sea tan atractivo. Si te ofrecen uno ahora o dos después, podrías elegir uno ahora porque no quieres dos
  • Los niños que confían en los adultos que prometen algo tienden a retrasar la gratificación.
    https://pubmed.ncbi.nlm.nih.gov/26799458/
    También tiene sentido desde la perspectiva de la teoría de juegos. Si tienes un modelo interno según el cual deberías usar una distribución previa normal para el tiempo de espera hasta que los adultos cumplan sus promesas —es decir, la experiencia de que la mayoría de los adultos en tu vida suelen cumplirlas—, entonces esperar es racional.
    En cambio, si por experiencia debes asumir una distribución previa de ley de potencia, entonces en algún punto es completamente racional cortar pérdidas. Esta interpretación es, en cierto modo, bonita porque implicaría que el éxito en la vida se correlaciona con tener padres confiables, y por el factor tiempo supongo que en realidad también hay causalidad

  • ¿Hay alguna prueba psicológica famosa que sí se haya reproducido?

    • El experimento de conformidad de Asch parece reproducirse: https://journals.plos.org/plosone/article?id=10.1371/journal...
      Además, los experimentos de psicología tienden a volverse famosos porque son polémicos, y eso en sí puede crear un sesgo en contra de la reproducibilidad. Tal vez los experimentos psicológicos aburridos que arrojan resultados poco sorprendentes se reproduzcan sin problemas con frecuencia
    • Estoy bastante seguro de que la prueba de “¿publicarás disparates como si fueran hechos por fama o dinero?” se ha reproducido muchas veces en varios campos
    • El experimento de la apatía del espectador se reprodujo varias veces, y lo mismo ocurre con el experimento de Milgram
    • https://www.bps.org.uk/research-digest/ten-famous-psychology...
      Es un tema complicado en muchos sentidos
  • En mi entorno, anecdóticamente, esto sí coincidía. Entre las personas con las que crecí y fui a la escuela, quienes posponían la gratificación inmediata y tenían metas a largo plazo terminaron bastante bien, mientras que quienes vivían dejándose llevar, sin plan, apenas lograban mantenerse a flote con dificultad.
    También en mi propia vida hubo una gran diferencia en los resultados entre cuando tenía una meta o una visión y cuando simplemente iba tirando como saliera. Creo que en las áreas importantes —hobbies, pareja, carrera, familia y relaciones— se necesitan metas, visión y criterios.

    • Si no les hiciste la prueba del malvavisco a tus amigos cuando eran chicos, sinceramente no sé si estamos hablando de lo mismo. El estudio original es un caso de aplicar una extrapolación enorme a un fenómeno muy extraño y específico.
      “Que te vaya bien en la vida”, “postergar la gratificación” y “metas a largo plazo” están lejos de ser rasgos concretamente medibles. Por ejemplo, ¿cómo evaluamos a alguien que siempre espera a que los juegos estén en oferta, pero que, por haber sufrido inseguridad alimentaria, no puede rechazar comida gratis aunque no sea saludable? Para evaluar rasgos así hay incontables variables. Lo que este estudio dice es que probablemente no sea sensato extrapolar pinceladas tan amplias a partir de un indicador pequeño.
    • Si existe ese rasgo de personalidad, es bastante evidentemente cierto que importa para el éxito. Pero si puede medirse poniendo un malvavisco frente a un niño de cuatro años y medio es una pregunta completamente distinta.
    • En mi entorno podían darse ambos casos. Una persona fue a una universidad de la Ivy League y al final terminó en un puesto técnico común; otra también salió de una Ivy League, pero tuvo dificultades para encontrar trabajo.
      En cambio, personas que vivían dejándose llevar llegaron a los mismos puestos técnicos comunes, y quienes fracasaron en la escuela y apenas terminaron un community college acabaron con pequeños negocios exitosos porque siguieron abriéndose su propio camino.
    • No creo que sea necesariamente así. Conozco a muchas personas a las que les fue bastante bien en la vida moviéndose de forma oportunista, no centrada en objetivos. Tener metas para la pareja, la familia y las relaciones suena como una receta para el desastre.
    • Por eso este tipo de estudios de psicología basura son sutilmente dañinos. Puede que exista un efecto real, pero quizá no sea un efecto del nivel de bebés y malvaviscos.
  • Algunos campos de investigación siempre serán arte, no ciencia. La literatura, el arte y la psicología humana son así.
    Un gran escritor, artista o terapeuta puede hacer aportes enormes, pero no puede realizar experimentos rigurosos y establecer la verdad en números. Y eso está bien.
    Lo que no está bien es la pandilla de psicólogos académicos que, por no tener formación en disciplinas cuantitativas y “duras”, ni siquiera se dan cuenta de que están diciendo estupideces. Aquí “duras” no significa difíciles, sino bien definidas.

  • Recuerdo haber vivido de niño situaciones parecidas a la prueba del malvavisco, pero ahí no aprendí a postergar la gratificación, sino que si esperas o te sacrificas, te toman de tonto.
    “Si renuncias a esto ahora, luego te daré dos” muchas veces se convertía en “no hay segundo malvavisco, y tampoco recuperarás el primero”. ¿Cuántas veces tienen que vivir algo así otros niños para aprender a no postergar la gratificación? A eso lo critican como “falta de control de impulsos”, pero yo lo llamaría algo aprendido por experiencia.

    • La escasez de comida te lo enseña rápido. Casi todo el empleo en las franjas salariales bajas funciona así.
      Promesas como “si haces soporte al cliente para esta gran empresa tecnológica, podrás pasar a un puesto en el área corporativa”, pero en la práctica el porcentaje de personas contratadas a las que realmente les sale bien es cercano al 0%. Una de las cosas buenas de Reddit es que hizo muy visible el sistema de promesas incumplidas que sostiene la mayoría de los trabajos de retail y servicios.