2 puntos por GN⁺ 2025-08-24 | 1 comentarios | Compartir por WhatsApp
  • En las ciencias sociales y de la vida, existe cierto nivel de correlación entre casi todas las variables
  • Este fenómeno no es simple coincidencia ni un error estadístico, sino un hecho real derivado de factores genéticos y ambientales complejamente entrelazados
  • A medida que aumenta el tamaño de la muestra, aparecen correlaciones significativas en la mayoría de los pares de variables, y los investigadores terminan prestando más atención al patrón general de correlaciones que a cada correlación individual
  • El “crud factor” significa que existen pequeñas correlaciones en casi todos los pares de variables, por lo que incluso con una teoría arbitraria y una selección arbitraria de variables es muy probable obtener resultados significativos
  • En esta situación, el significado del nivel de significancia tradicional (0.05) se debilita, lo que exige cautela al interpretar estadísticas en ciencias sociales

Panorama general y contexto

  • En psicología y sociología, está ampliamente aceptada la idea de que “todo está correlacionado con todo hasta cierto punto”
  • Determinadas características están determinadas por diversos factores genéticos y ambientales, y esos factores también presentan correlaciones entre sí
  • Por lo tanto, en la práctica, casi todas las variables medibles tienen algún grado de interrelación

El “Crud Factor” y los hallazgos estadísticos

  • El “crud factor” se refiere al fenómeno por el cual, en investigaciones de ciencias sociales (y en parte de ciencias de la vida), siempre existen pequeñas correlaciones incluso entre pares de variables elegidos al azar
  • En un gran conjunto de datos de 57,000 estudiantes de preparatoria de Minnesota en 1966, se analizaron 105 tablas cruzadas (crosstabulation) entre variables como familia, educación, actividades recreativas, carrera y religión, y todas resultaron estadísticamente significativas
    • El 96% del total descartó la posibilidad de azar con una probabilidad extremadamente baja, al nivel de p<10⁻⁶
  • Al ampliar el número de variables a 45, el 92% de las 990 combinaciones totales resultó estadísticamente significativo
    • La mediana (median) de relaciones significativas entre una variable y todas las demás fue de 41 de 44

Casos reales entre variables

  • También se encontraron altos niveles de significancia estadística en las relaciones entre la puntuación del MCAT y variables como número de hermanos, orden de nacimiento, sexo, planes profesionales y preferencia religiosa
    • Ej.: las estudiantes obtienen puntajes más altos que los hombres, los puntajes tienden a bajar cuanto mayor es el número de hermanos, los primogénitos/hijos únicos son más inteligentes que los menores, y existen diferencias marcadas entre grupos religiosos, entre otras
  • También se observó alta significancia en las relaciones con varias variables dentro de cinco denominaciones protestantes representativas
    • Ej.: la probabilidad de que un hijo único sea Presbyterian es casi el doble que la de ser Baptist, además de diferencias por denominación en agrado por la escuela y aspiraciones profesionales, entre muchas otras correlaciones

Caso de los ítems del MMPI

  • De los 550 ítems del MMPI (prueba de personalidad), 507 (92%) mostraron diferencias significativas según el sexo
    • Algunos ítems permiten explicar con claridad diferencias de tendencia muy marcadas, mientras que en otros las razones son complejas o imposibles de explicar
  • Como estos resultados aparecen en estudios a gran escala con muestras muy grandes, se trata de un fenómeno real y no de un error estadístico (type I error)

Correlaciones en ciencias sociales y límites de la validación teórica

  • Incluso si se combinan al azar una teoría y pares de variables, si la correlación promedio (crud factor) está alrededor de 0.30, en la práctica es posible encontrar una diferencia significativa aproximadamente una de cada tres veces
    • Esto ocurre con mucha más frecuencia que el nivel de significancia (0.05) que normalmente se considera relevante en ciencias sociales
  • Como las correlaciones aparecen con facilidad incluso entre pares de variables que el investigador no predijo teóricamente, la significancia estadística por sí sola difícilmente respalda una relación causal sustantiva
  • Las causas complejas (genes/ambiente) y la riqueza de los datos observacionales generan estas correlaciones en muchas direcciones

Conclusión práctica

  • Al interpretar datos de ciencias sociales y validar teorías, es necesario tener siempre presente el “crud factor” como “correlaciones ordinarias pero realmente existentes”
  • En lugar de confiar ciegamente en estadísticas de significancia (por ej., p<0.05), hace falta un enfoque más centrado en la causalidad sustantiva entre variables y en la interpretación de patrones
  • Como en el aforismo de Thorndike, “todas las cosas buenas tienden a venir juntas”, en el mundo real demasiadas cosas están entrelazadas entre sí

1 comentarios

 
GN⁺ 2025-08-24
Opinión en Hacker News
  • Habla de una de las cosas que más me molestan
    La gente malinterpreta la expresión "estadísticamente significativo (statistically significant)" como si quisiera decir "notable / con significado"
    Encuentran una diferencia medida y asumen que la estadística dice que es 'importante', pero esa es una forma equivocada de verlo
    En realidad, una prueba de significancia solo te dice la probabilidad de que la diferencia observada sea una 'buena medición'
    Es decir, con cierto nivel de confianza puedes decir que "la diferencia realmente existe"
    Si la diferencia medida también es 'significativa' en un sentido de juicio de valor, eso hay que evaluarlo por separado, y normalmente se juzga según el tamaño de la diferencia medida
    Parece demasiado obvio, pero es un error muy común en la industria y en muchos campos científicos
    Por ejemplo: "esta medida cambió el [indicador] con p<0.001, ¡qué significativo! El tamaño del cambio es 0.000001%"
    En esos casos, hay que volver a pensar si de verdad es 'significativo'

    • Como señalas, significativo no quiere decir automáticamente 'con sentido' o 'relevante'
      Aun así, quisiera agregar algo sobre el ejemplo
      Un p-value muy pequeño no siempre implica un efecto 'importante', pero tampoco es independiente del tamaño del efecto
      El p-value en sí sale de (tamaño del efecto)/(ruido/raíz cuadrada del tamaño de muestra)
      Es decir, un estadístico de prueba mayor implica un p-value menor
      Un p-value muy pequeño suele venir de un efecto grande o de un tamaño de muestra (n) enormemente grande
      Por eso solo con una N extremadamente grande un efecto minúsculo puede dar p<0.001
      Pero en la investigación real, si sale p<0.001, por las limitaciones de tamaño de muestra también es bastante probable que el efecto sea realmente grande
    • Using Effect Size—or Why the P Value Is Not Enough
      Dice que la significancia estadística es la parte menos interesante de los resultados y enfatiza que los resultados deben explicarse con tamaño del efecto
      No se trata solo de si el tratamiento tiene efecto, sino de cuánto efecto tiene
      – Gene V. Glass
    • Totalmente de acuerdo
      Pero más que llamarlo una simple 'pet peeve', lo veo como una mala interpretación patológica de la estadística
      Este malentendido puede llevar a conclusiones erróneas, especialmente en medios populares de salud y wellness
      Muchos estudios de salud y nutrición se reportan como estadísticamente significativos, pero el efecto real suele ser mínimo
      Y aun así la gente confía en esos resultados y cambia mucho su vida y sus hábitos, cuando en realidad no hay base para hacerlo
    • Si subes lo suficiente la N (tamaño de muestra), puedes encontrar en cualquier parte este tipo de 'buenas mediciones' o 'diferencias estadísticamente significativas'
      Peor todavía es cuando no defines una hipótesis para validar de antemano y en cambio escarbas datos pasados hasta encontrar correlaciones 'estadísticamente significativas'
    • Me gusta mucho este video de 3blue1brown
      Ahí propone pensar la significancia como una forma de actualizar probabilidades
      La idea es que una sola prueba (o estudio) actualiza la probabilidad en X%, así que para un juicio 'significativo' normalmente hacen falta más experimentos
  • Es un texto muy típico del estilo "rationalist"
    Junto a observaciones correctas sobre fenómenos estadísticos, también mete formulaciones políticas raras como condimento
    Ejemplo de frase: "las consideraciones teóricas y empíricas suscitan dudas sobre la inferencia causal acerca de 'sesgo algorítmico' o 'grupos protegidos': puede que no sea deseable excluirlos, y quizá sea imposible o no tenga sentido"
    Es una frase demasiado rara, aparece de golpe sin explicar el contexto
    Parece estar argumentando que, como una variable latente oculta determina la criminalidad, está bien usar is_black en una black box (modelo de libertad condicional), y me parece absurdo
    En realidad, el interés por cómo funciona un modelo es un problema más profundo que la interpretación estadística
    Si en el proceso de selección del modelo hay demasiados grados de libertad, puedes diseñarlo para que produzca cualquier resultado
    Por ejemplo, si en un modelo de libertad condicional entra una variable como likes_hiphop, habría que revisar por qué está ahí y si realmente era el 'modelo óptimo'
    Al final, el hecho de que en los fenómenos sociales haya tantas correlaciones entre variables nos recuerda que cualquier modelo puede ser, al menos en parte, un producto político

    • La frase que te pareció rara no se siente tan fuera de lugar en contexto
      La expresión "consideraciones teóricas y empíricas" se refiere a la discusión anterior
      O sea: como todo está correlacionado con todo, ver una correlación no te permite asegurar que tenga un significado esencial
      Los científicos sociales construyen modelos complejos y observan muchas variables, buscando correlaciones que respalden sus hipótesis, pero se señala que esas correlaciones pueden aparecer en cualquier parte, así que como evidencia real son débiles
      Y tampoco puede afirmarse que el modelo realmente usó una variable como is_black
      El simple hecho de que alguna black box produzca resultados desfavorables para personas negras no significa que realmente contenga una variable is_black
    • Me parece que los "rationalists" tienden a obsesionarse con jerarquizar personas o grupos
      Especialmente en temas como genética e IQ, a menudo se les ve sacar conclusiones con estudios y datos de base débil
    • Sobre esa cita
      Creo que el modelado en ciencias sociales necesariamente necesita un marco teórico, pero me pregunto si el TFA (artículo original) mantendría la misma postura en temas políticos específicos
      Por ejemplo, me pregunto si diría exactamente lo mismo en el caso de usar una variable is_white en contrataciones de organizaciones para grupos minoritarios
    • Creo que la descripción de gwern le queda perfecta
      Tiene ese estilo de proyectar que es muy inteligente mientras lanza especulaciones sin fundamento como si fueran hechos
      También me llama la atención cuánto gusta gwern, en particular, en la comunidad de scaling/AI
  • Me da pena que el texto no mencione la cita de The Hitchhiker's Guide to the Galaxy
    Me recuerda el mensaje de que "como toda la materia del universo afecta de alguna manera a toda la demás, en teoría bastaría mirar un pedazo de pastel de hadas para inferir el universo entero, el sol, los planetas, sus órbitas y hasta la historia social y económica"

    • Para que esa lógica funcione, ¿no haría falta la configuración T_zero (estado inicial) del universo?
      Distintas configuraciones T_zero se conectan con T_current (estado actual), y aun con la misma configuración física, el estado previo "universo-pastel" podría ser diferente
      Además, eso asume un sistema completamente determinista
    • En el budismo existe el concepto de 'origen dependiente (Pratītyasamutpāda)'
      Enlace con explicación relacionada
    • Las partículas no sufren de fatalismo
  • Antes se descubría la verdad del mundo incluso sin estadística
    Es cierto que, después de surgir, la estadística se volvió una herramienta útil, pero al abusarse también aumentó el problema de disfrazar la estupidez como si fuera inteligencia
    Así que esta observación sobre el 'ruido de correlación' también vale la pena cuestionarla
    Ante todo van primero la lógica y el conocimiento básico del dominio
    Creo que limitarse a contar números puede llevar a malentendidos

    • Sobre eso de que "antes vivíamos sin estadística", quisiera señalar que en ese tiempo todo era mucho peor
      Solo con lógica no puedes aprender conocimiento nuevo
      La lógica solo vuelve a explicar lo que ya sabes, y el conocimiento básico requiere experiencia o experimentación
      Como la observación del mundo real nunca es perfecta, la interpretación estadística es indispensable
      Antes de la estadística era: (a) los ricos se sentaban a pensar profundamente sobre el mundo, (b) una figura carismática predicaba según su propia voluntad, o (c) una persona inteligente acertaba de vez en cuando
      Con la llegada de la estadística, cualquiera pudo saber qué está bien o mal con base en resultados, y dejó de ser territorio exclusivo de las élites
      Claro, una de las ventajas de la inferencia estadística es la 'intercomparación (intercomparison)', en el sentido de que puedes sacar conclusiones a partir de diferencias sin entender por completo el proceso en sí
      Pero precisamente por eso también se vuelve más fácil manipular o malinterpretar resultados
    • George Lucas dijo una vez que, cuando algo nuevo entra en la sociedad, la gente siempre termina abusándolo en exceso
      Video relacionado
  • No tiene que ver con el tema, pero este blog me parece realmente hermoso
    El drop cap, los comentarios en línea que se ven a la derecha de la pantalla, la barra de progreso y demás hacen sentir el cariño puesto en el proyecto

    • Creo que te podría parecer interesante este texto de gwern sobre drop caps
  • Este texto es realmente enorme
    Me dan ganas de poder escribir yo también algo tan completo
    Si ves otros textos del autor, parece que produce sin parar como una máquina

    • Si no recuerdo mal, dicen que Gwern vive de forma muy austera en un lugar remoto, y por eso puede dedicar mucho tiempo a investigación personal
    • Mucho tiempo, repetición, obsesión por preguntas difíciles, experiencia en investigación y en Haskell son el secreto del autor
      Claro, también ayudaría bastante que alguien le diera apoyo financiero
    • Yo me conformaría con poder leer textos así
    • De verdad creo que gwern es impresionante
  • Este debate existe desde hace décadas
    Es importante no perder una mirada crítica
    Pero personalmente, cuanto más me toca lidiar con esta lógica en el trabajo, más siento que en realidad no es tan útil y está algo vacía
    El 'crud' existe dentro de los patrones como una especie de radiación cósmica de fondo estadística, y en vez de descartarlo como algo sin significado, a veces puede ser importante
    A veces hay asociaciones entre variables que no se explican fácilmente, y otras veces son clave para entender potenciales variables de confusión que hay que controlar
    No siempre hay correlación; también existen casos en que la asociación real es cero
    Definir un 'tamaño de efecto no nulo y significativo' también es algo muy arbitrario y subjetivo
    Siento que debe haber un marco más productivo para mirar este fenómeno

  • Correlated. ¿Otro caso más?<i>Everything Is Correlated</i> - discusión anterior

    • Correlated, ¿correcto?
  • Por eso la ciencia experimental es distinta de los estudios observacionales
    El análisis estadístico solo te da una razón para confiar más en una hipótesis, y debe reforzarse con un enfoque verdaderamente experimental
    Los ejemplos del blog son sobre todo casos de medicina, ciencias sociales y del comportamiento, etc., donde es difícil hacer experimentos bien controlados o donde por falta de tamaño de muestra cuesta aclarar la causalidad

    • La microeconomía evolucionó desde grandes estudios observacionales hacia diseños experimentales y cuasiexperimentales
      Claro, un fallo de diseño no se arregla con análisis (You can’t fix by analysis what you bungled by design - fuente), pero aun así va en la dirección de reducir sesgos
  • Sobre la cita del texto: “Esto vuelve ambiguo el significado de las pruebas de significancia; no es más que calcular con mucha precisión la probabilidad de los datos en un escenario que sabemos a priori que es falso”
    Creo que es común llegar a resultados útiles aceptando y calculando con modelos simplificados que, en sentido estricto, sabemos que son falsos
    Por ejemplo, las leyes de Newton o el análisis de circuitos eléctricos también son posibles gracias a simplificaciones, y hasta en la banca se ha calculado el año como de 360 días
    Si en la práctica funciona bien, me pregunto qué es lo que se me está escapando

    • El problema es que, si tienes suficiente dinero (es decir, si consigues una N muy grande), siempre puedes producir resultados 'significativos'
      Visto como una búsqueda de la verdad, eso es un dilema serio para la investigación
    • Hace tiempo, cuando hice una calculadora de amortización, solo para el método de 'day count' había 47 variantes
      (incluyendo cómo calcular pagos en periodos menores a 1 mes)
    • El error máximo que surge por esas simplificaciones siempre se conoce
      Dicho de otro modo, Einstein es una versión refinada de Newton
      Así como la relatividad especial converge al movimiento newtoniano en el límite de bajas velocidades
      En estadística, en realidad no existe lo 'falso'; hay que interpretarlo como "no es cierto con probabilidad x%"
      Si quieres bajar x, tienes que 'hacer más estadística', y la forma más segura es aumentar el tamaño de muestra (N)
      Lo que el texto hace completamente mal es asumir que, con una N suficientemente grande, puedes tratar verdad/falsedad de forma absoluta
      Porque llegas a niveles de probabilidad del tipo 'aunque el universo se recreara un millón de veces, quizá saldría una sola vez'
      Pero en la realidad, la mayoría de trabajos en ciencias sociales, medicina, economía, etc. operan con N muy pequeñas, así que los problemas estadísticos son inevitablemente grandes
      Por eso intentan 'hacer más estadística', pero en la práctica no pueden aumentar N y terminan manipulando cifras o aumentándola apenas un poco y diciendo que el problema quedó resuelto
    • En última instancia, la clave es cuál es realmente la magnitud cuantitativa del error producido por la simplificación