- En las ciencias sociales y de la vida, existe cierto nivel de correlación entre casi todas las variables
- Este fenómeno no es simple coincidencia ni un error estadístico, sino un hecho real derivado de factores genéticos y ambientales complejamente entrelazados
- A medida que aumenta el tamaño de la muestra, aparecen correlaciones significativas en la mayoría de los pares de variables, y los investigadores terminan prestando más atención al patrón general de correlaciones que a cada correlación individual
- El “crud factor” significa que existen pequeñas correlaciones en casi todos los pares de variables, por lo que incluso con una teoría arbitraria y una selección arbitraria de variables es muy probable obtener resultados significativos
- En esta situación, el significado del nivel de significancia tradicional (0.05) se debilita, lo que exige cautela al interpretar estadísticas en ciencias sociales
Panorama general y contexto
- En psicología y sociología, está ampliamente aceptada la idea de que “todo está correlacionado con todo hasta cierto punto”
- Determinadas características están determinadas por diversos factores genéticos y ambientales, y esos factores también presentan correlaciones entre sí
- Por lo tanto, en la práctica, casi todas las variables medibles tienen algún grado de interrelación
El “Crud Factor” y los hallazgos estadísticos
- El “crud factor” se refiere al fenómeno por el cual, en investigaciones de ciencias sociales (y en parte de ciencias de la vida), siempre existen pequeñas correlaciones incluso entre pares de variables elegidos al azar
- En un gran conjunto de datos de 57,000 estudiantes de preparatoria de Minnesota en 1966, se analizaron 105 tablas cruzadas (crosstabulation) entre variables como familia, educación, actividades recreativas, carrera y religión, y todas resultaron estadísticamente significativas
- El 96% del total descartó la posibilidad de azar con una probabilidad extremadamente baja, al nivel de p<10⁻⁶
- Al ampliar el número de variables a 45, el 92% de las 990 combinaciones totales resultó estadísticamente significativo
- La mediana (median) de relaciones significativas entre una variable y todas las demás fue de 41 de 44
Casos reales entre variables
- También se encontraron altos niveles de significancia estadística en las relaciones entre la puntuación del MCAT y variables como número de hermanos, orden de nacimiento, sexo, planes profesionales y preferencia religiosa
- Ej.: las estudiantes obtienen puntajes más altos que los hombres, los puntajes tienden a bajar cuanto mayor es el número de hermanos, los primogénitos/hijos únicos son más inteligentes que los menores, y existen diferencias marcadas entre grupos religiosos, entre otras
- También se observó alta significancia en las relaciones con varias variables dentro de cinco denominaciones protestantes representativas
- Ej.: la probabilidad de que un hijo único sea Presbyterian es casi el doble que la de ser Baptist, además de diferencias por denominación en agrado por la escuela y aspiraciones profesionales, entre muchas otras correlaciones
Caso de los ítems del MMPI
- De los 550 ítems del MMPI (prueba de personalidad), 507 (92%) mostraron diferencias significativas según el sexo
- Algunos ítems permiten explicar con claridad diferencias de tendencia muy marcadas, mientras que en otros las razones son complejas o imposibles de explicar
- Como estos resultados aparecen en estudios a gran escala con muestras muy grandes, se trata de un fenómeno real y no de un error estadístico (type I error)
Correlaciones en ciencias sociales y límites de la validación teórica
- Incluso si se combinan al azar una teoría y pares de variables, si la correlación promedio (crud factor) está alrededor de 0.30, en la práctica es posible encontrar una diferencia significativa aproximadamente una de cada tres veces
- Esto ocurre con mucha más frecuencia que el nivel de significancia (0.05) que normalmente se considera relevante en ciencias sociales
- Como las correlaciones aparecen con facilidad incluso entre pares de variables que el investigador no predijo teóricamente, la significancia estadística por sí sola difícilmente respalda una relación causal sustantiva
- Las causas complejas (genes/ambiente) y la riqueza de los datos observacionales generan estas correlaciones en muchas direcciones
Conclusión práctica
- Al interpretar datos de ciencias sociales y validar teorías, es necesario tener siempre presente el “crud factor” como “correlaciones ordinarias pero realmente existentes”
- En lugar de confiar ciegamente en estadísticas de significancia (por ej., p<0.05), hace falta un enfoque más centrado en la causalidad sustantiva entre variables y en la interpretación de patrones
- Como en el aforismo de Thorndike, “todas las cosas buenas tienden a venir juntas”, en el mundo real demasiadas cosas están entrelazadas entre sí
1 comentarios
Opinión en Hacker News
Habla de una de las cosas que más me molestan
La gente malinterpreta la expresión "estadísticamente significativo (statistically significant)" como si quisiera decir "notable / con significado"
Encuentran una diferencia medida y asumen que la estadística dice que es 'importante', pero esa es una forma equivocada de verlo
En realidad, una prueba de significancia solo te dice la probabilidad de que la diferencia observada sea una 'buena medición'
Es decir, con cierto nivel de confianza puedes decir que "la diferencia realmente existe"
Si la diferencia medida también es 'significativa' en un sentido de juicio de valor, eso hay que evaluarlo por separado, y normalmente se juzga según el tamaño de la diferencia medida
Parece demasiado obvio, pero es un error muy común en la industria y en muchos campos científicos
Por ejemplo: "esta medida cambió el [indicador] con p<0.001, ¡qué significativo! El tamaño del cambio es 0.000001%"
En esos casos, hay que volver a pensar si de verdad es 'significativo'
Aun así, quisiera agregar algo sobre el ejemplo
Un p-value muy pequeño no siempre implica un efecto 'importante', pero tampoco es independiente del tamaño del efecto
El p-value en sí sale de (tamaño del efecto)/(ruido/raíz cuadrada del tamaño de muestra)
Es decir, un estadístico de prueba mayor implica un p-value menor
Un p-value muy pequeño suele venir de un efecto grande o de un tamaño de muestra (n) enormemente grande
Por eso solo con una N extremadamente grande un efecto minúsculo puede dar p<0.001
Pero en la investigación real, si sale p<0.001, por las limitaciones de tamaño de muestra también es bastante probable que el efecto sea realmente grande
Dice que la significancia estadística es la parte menos interesante de los resultados y enfatiza que los resultados deben explicarse con tamaño del efecto
No se trata solo de si el tratamiento tiene efecto, sino de cuánto efecto tiene
– Gene V. Glass
Pero más que llamarlo una simple 'pet peeve', lo veo como una mala interpretación patológica de la estadística
Este malentendido puede llevar a conclusiones erróneas, especialmente en medios populares de salud y wellness
Muchos estudios de salud y nutrición se reportan como estadísticamente significativos, pero el efecto real suele ser mínimo
Y aun así la gente confía en esos resultados y cambia mucho su vida y sus hábitos, cuando en realidad no hay base para hacerlo
Peor todavía es cuando no defines una hipótesis para validar de antemano y en cambio escarbas datos pasados hasta encontrar correlaciones 'estadísticamente significativas'
Ahí propone pensar la significancia como una forma de actualizar probabilidades
La idea es que una sola prueba (o estudio) actualiza la probabilidad en X%, así que para un juicio 'significativo' normalmente hacen falta más experimentos
Es un texto muy típico del estilo "rationalist"
Junto a observaciones correctas sobre fenómenos estadísticos, también mete formulaciones políticas raras como condimento
Ejemplo de frase: "las consideraciones teóricas y empíricas suscitan dudas sobre la inferencia causal acerca de 'sesgo algorítmico' o 'grupos protegidos': puede que no sea deseable excluirlos, y quizá sea imposible o no tenga sentido"
Es una frase demasiado rara, aparece de golpe sin explicar el contexto
Parece estar argumentando que, como una variable latente oculta determina la criminalidad, está bien usar
is_blacken una black box (modelo de libertad condicional), y me parece absurdoEn realidad, el interés por cómo funciona un modelo es un problema más profundo que la interpretación estadística
Si en el proceso de selección del modelo hay demasiados grados de libertad, puedes diseñarlo para que produzca cualquier resultado
Por ejemplo, si en un modelo de libertad condicional entra una variable como
likes_hiphop, habría que revisar por qué está ahí y si realmente era el 'modelo óptimo'Al final, el hecho de que en los fenómenos sociales haya tantas correlaciones entre variables nos recuerda que cualquier modelo puede ser, al menos en parte, un producto político
La expresión "consideraciones teóricas y empíricas" se refiere a la discusión anterior
O sea: como todo está correlacionado con todo, ver una correlación no te permite asegurar que tenga un significado esencial
Los científicos sociales construyen modelos complejos y observan muchas variables, buscando correlaciones que respalden sus hipótesis, pero se señala que esas correlaciones pueden aparecer en cualquier parte, así que como evidencia real son débiles
Y tampoco puede afirmarse que el modelo realmente usó una variable como
is_blackEl simple hecho de que alguna black box produzca resultados desfavorables para personas negras no significa que realmente contenga una variable
is_blackEspecialmente en temas como genética e IQ, a menudo se les ve sacar conclusiones con estudios y datos de base débil
Creo que el modelado en ciencias sociales necesariamente necesita un marco teórico, pero me pregunto si el TFA (artículo original) mantendría la misma postura en temas políticos específicos
Por ejemplo, me pregunto si diría exactamente lo mismo en el caso de usar una variable
is_whiteen contrataciones de organizaciones para grupos minoritariosTiene ese estilo de proyectar que es muy inteligente mientras lanza especulaciones sin fundamento como si fueran hechos
También me llama la atención cuánto gusta gwern, en particular, en la comunidad de scaling/AI
Me da pena que el texto no mencione la cita de The Hitchhiker's Guide to the Galaxy
Me recuerda el mensaje de que "como toda la materia del universo afecta de alguna manera a toda la demás, en teoría bastaría mirar un pedazo de pastel de hadas para inferir el universo entero, el sol, los planetas, sus órbitas y hasta la historia social y económica"
Distintas configuraciones T_zero se conectan con T_current (estado actual), y aun con la misma configuración física, el estado previo "universo-pastel" podría ser diferente
Además, eso asume un sistema completamente determinista
Enlace con explicación relacionada
Antes se descubría la verdad del mundo incluso sin estadística
Es cierto que, después de surgir, la estadística se volvió una herramienta útil, pero al abusarse también aumentó el problema de disfrazar la estupidez como si fuera inteligencia
Así que esta observación sobre el 'ruido de correlación' también vale la pena cuestionarla
Ante todo van primero la lógica y el conocimiento básico del dominio
Creo que limitarse a contar números puede llevar a malentendidos
Solo con lógica no puedes aprender conocimiento nuevo
La lógica solo vuelve a explicar lo que ya sabes, y el conocimiento básico requiere experiencia o experimentación
Como la observación del mundo real nunca es perfecta, la interpretación estadística es indispensable
Antes de la estadística era: (a) los ricos se sentaban a pensar profundamente sobre el mundo, (b) una figura carismática predicaba según su propia voluntad, o (c) una persona inteligente acertaba de vez en cuando
Con la llegada de la estadística, cualquiera pudo saber qué está bien o mal con base en resultados, y dejó de ser territorio exclusivo de las élites
Claro, una de las ventajas de la inferencia estadística es la 'intercomparación (intercomparison)', en el sentido de que puedes sacar conclusiones a partir de diferencias sin entender por completo el proceso en sí
Pero precisamente por eso también se vuelve más fácil manipular o malinterpretar resultados
Video relacionado
No tiene que ver con el tema, pero este blog me parece realmente hermoso
El drop cap, los comentarios en línea que se ven a la derecha de la pantalla, la barra de progreso y demás hacen sentir el cariño puesto en el proyecto
Este texto es realmente enorme
Me dan ganas de poder escribir yo también algo tan completo
Si ves otros textos del autor, parece que produce sin parar como una máquina
Claro, también ayudaría bastante que alguien le diera apoyo financiero
Este debate existe desde hace décadas
Es importante no perder una mirada crítica
Pero personalmente, cuanto más me toca lidiar con esta lógica en el trabajo, más siento que en realidad no es tan útil y está algo vacía
El 'crud' existe dentro de los patrones como una especie de radiación cósmica de fondo estadística, y en vez de descartarlo como algo sin significado, a veces puede ser importante
A veces hay asociaciones entre variables que no se explican fácilmente, y otras veces son clave para entender potenciales variables de confusión que hay que controlar
No siempre hay correlación; también existen casos en que la asociación real es cero
Definir un 'tamaño de efecto no nulo y significativo' también es algo muy arbitrario y subjetivo
Siento que debe haber un marco más productivo para mirar este fenómeno
Correlated. ¿Otro caso más?<i>Everything Is Correlated</i> - discusión anterior
Por eso la ciencia experimental es distinta de los estudios observacionales
El análisis estadístico solo te da una razón para confiar más en una hipótesis, y debe reforzarse con un enfoque verdaderamente experimental
Los ejemplos del blog son sobre todo casos de medicina, ciencias sociales y del comportamiento, etc., donde es difícil hacer experimentos bien controlados o donde por falta de tamaño de muestra cuesta aclarar la causalidad
Claro, un fallo de diseño no se arregla con análisis (You can’t fix by analysis what you bungled by design - fuente), pero aun así va en la dirección de reducir sesgos
Sobre la cita del texto: “Esto vuelve ambiguo el significado de las pruebas de significancia; no es más que calcular con mucha precisión la probabilidad de los datos en un escenario que sabemos a priori que es falso”
Creo que es común llegar a resultados útiles aceptando y calculando con modelos simplificados que, en sentido estricto, sabemos que son falsos
Por ejemplo, las leyes de Newton o el análisis de circuitos eléctricos también son posibles gracias a simplificaciones, y hasta en la banca se ha calculado el año como de 360 días
Si en la práctica funciona bien, me pregunto qué es lo que se me está escapando
Visto como una búsqueda de la verdad, eso es un dilema serio para la investigación
(incluyendo cómo calcular pagos en periodos menores a 1 mes)
Dicho de otro modo, Einstein es una versión refinada de Newton
Así como la relatividad especial converge al movimiento newtoniano en el límite de bajas velocidades
En estadística, en realidad no existe lo 'falso'; hay que interpretarlo como "no es cierto con probabilidad x%"
Si quieres bajar x, tienes que 'hacer más estadística', y la forma más segura es aumentar el tamaño de muestra (N)
Lo que el texto hace completamente mal es asumir que, con una N suficientemente grande, puedes tratar verdad/falsedad de forma absoluta
Porque llegas a niveles de probabilidad del tipo 'aunque el universo se recreara un millón de veces, quizá saldría una sola vez'
Pero en la realidad, la mayoría de trabajos en ciencias sociales, medicina, economía, etc. operan con N muy pequeñas, así que los problemas estadísticos son inevitablemente grandes
Por eso intentan 'hacer más estadística', pero en la práctica no pueden aumentar N y terminan manipulando cifras o aumentándola apenas un poco y diciendo que el problema quedó resuelto