3 puntos por GN⁺ 2024-03-13 | 1 comentarios | Compartir por WhatsApp
  • La paradoja de Simpson es un fenómeno de probabilidad y estadística en el que una tendencia visible en subgrupos desaparece o se invierte al combinar los datos, por lo que basarse solo en datos agregados puede distorsionar gravemente una conclusión
  • Si los datos de frecuencia se interpretan de inmediato como causalidad, es fácil pasar por alto variables de confusión, lo que resulta especialmente problemático en estadísticas de ciencias sociales y medicina
  • Los casos de admisión de posgrado en UC Berkeley, tratamiento de cálculos renales y promedio de bateo en el béisbol profesional muestran que comparar subgrupos y comparar el total agregado pueden llevar a conclusiones distintas
  • La inversión de proporciones también puede explicarse desde una perspectiva vectorial, y la limitación clave es que no es fácil decidir solo mirando una tabla si los datos deben dividirse o combinarse
  • Para una interpretación correcta se necesitan modelos causales como el back-door criterion de Pearl y el do-calculus; más importante que la simple agregación es entender cómo se generaron los datos

Fenómeno y nombre

  • La paradoja de Simpson es un fenómeno en el que una tendencia que aparece en varios grupos de datos desaparece o cambia en sentido contrario cuando los grupos se combinan
  • Es especialmente peligrosa cuando se da una interpretación causal excesiva a datos de frecuencia, y exige tratar adecuadamente las variables de confusión y las relaciones causales en el modelado estadístico
  • Se usa como un caso representativo de cómo el mal uso de la estadística puede producir conclusiones erróneas
  • Edward H. Simpson describió este fenómeno en un artículo técnico de 1951; Karl Pearson ya había mencionado un efecto similar en 1899 y Udny Yule en 1903
  • El nombre Simpson's paradox fue introducido por Colin R. Blyth en 1972
  • También se le conoce como Simpson's reversal, Yule–Simpson effect, amalgamation paradox y reversal paradox

Caso de admisión de posgrado en UC Berkeley

  • En los datos de admisión de posgrado de otoño de 1973 de la University of California, Berkeley, al sumar todo el conjunto los hombres parecían tener una probabilidad de admisión más alta que las mujeres, y la diferencia era lo bastante grande como para no atribuirla al azar
    • Entre los 12,763 solicitantes totales, la tasa de admisión fue de 41%
    • Entre 8,442 hombres, la tasa de admisión fue de 44%
    • Entre 4,321 mujeres, la tasa de admisión fue de 35%
  • Al incorporar la información por departamento, aparece un patrón distinto al de la suma total
    • Las mujeres tendían a postular más a departamentos más competitivos con tasas de admisión más bajas
    • Los hombres tendían a postular más a departamentos menos competitivos con tasas de admisión más altas
  • Los datos agregados y los datos ajustados mostraron un sesgo pequeño pero estadísticamente significativo a favor de las mujeres
  • De los 85 departamentos en total, 4 mostraron un sesgo significativo desfavorable para las mujeres y 6 mostraron un sesgo significativo desfavorable para los hombres
  • La conclusión no se basó en la cantidad de departamentos sesgados en sí, sino en los resultados de admisión por sexo de todos los departamentos ponderados por la tasa de rechazo de cada departamento respecto del total de solicitantes

Caso del tratamiento de cálculos renales

  • En investigaciones médicas reales aparece la paradoja de Simpson al comparar las tasas de éxito de los tratamientos A y B para cálculos renales
    • Treatment A incluye un procedimiento de cirugía abierta
    • Treatment B incluye un procedimiento de cirugía cerrada
  • Si se observan los datos por tamaño del cálculo, Treatment A tiene una tasa de éxito más alta
    • Cálculos pequeños: A tiene 93% (81/87), B tiene 87% (234/270)
    • Cálculos grandes: A tiene 73% (192/263), B tiene 69% (55/80)
  • Al combinar los tamaños de cálculo, Treatment B muestra una tasa de éxito más alta
    • Total: A tiene 78% (273/350), B tiene 83% (289/350)
  • La inversión ocurre porque interactúan tanto la elección del tratamiento como la dificultad del caso
    • Los médicos tendían a aplicar más el mejor Treatment A en cálculos grandes y el relativamente inferior Treatment B en cálculos pequeños
    • Como el tamaño del cálculo influye mucho en la tasa de éxito, la gravedad del caso pesa más en la proporción total que la elección del tratamiento
  • La razón por la que el menos efectivo Treatment B parecía más eficaz es que se aplicó con mayor frecuencia a los casos más fáciles de cálculos pequeños
  • Jaynes consideró que Treatment A era claramente mejor que Treatment B, pero que el tamaño del cálculo renal era una variable más importante

Caso del promedio de bateo en el béisbol profesional

  • La paradoja de Simpson también puede aparecer en el promedio de bateo de jugadores de béisbol profesional
  • Un jugador puede tener un promedio de bateo más alto que otro en cada uno de varios años, pero un promedio más bajo al combinar todos los años
  • Ken Ross lo mostró con los promedios de bateo de Derek Jeter y David Justice en 1995 y 1996
    • 1995: Jeter tuvo 12/48, .250; Justice tuvo 104/411, .253
    • 1996: Jeter tuvo 183/582, .314; Justice tuvo 45/140, .321
    • Total combinado: Jeter tuvo 195/630, .310; Justice tuvo 149/551, .270
  • Justice tuvo un promedio de bateo más alto que Jeter en cada uno de los dos años, pero al combinar ambas temporadas Jeter registró un promedio más alto
  • Según Ross, entre pares posibles de jugadores este fenómeno puede observarse aproximadamente una vez por año

Inversión de proporciones vista con vectores

  • La paradoja de Simpson también puede explicarse mediante un espacio vectorial bidimensional
  • La tasa de éxito p/q, es decir, éxitos/intentos, puede representarse como un vector con pendiente p/q
  • Al combinar dos proporciones, esto puede expresarse como una suma vectorial según la regla del paralelogramo, y la pendiente de esa suma es la tasa de éxito combinada
  • Aunque en comparaciones individuales la pendiente de un vector sea menor que la de otro, la pendiente del resultado de sumar ambos vectores puede terminar siendo mayor en sentido contrario
  • Para que ocurra esta inversión, una parte de un vector debe tener una pendiente mayor que una parte del otro, y esos vectores suelen ser más largos, por lo que dominan la comparación total

Correlación e interpretación causal

  • La inversión de Simpson también puede darse en la correlación
  • Dos variables pueden mostrar una correlación positiva en el conjunto total, pero tener en realidad una correlación negativa cuando se incorpora una variable de confusión oculta
  • En un ejemplo de economía, al mirar solo los datos agregados parecía que la demanda tenía correlación positiva con el precio, pero al incorporar la variable tiempo aparecía la correlación negativa esperada en varios períodos
  • Si se ignora el efecto del tiempo y solo se grafican demanda y precio, la correlación se invierte y resulta positiva
  • La paradoja de Simpson muestra que la intuición de que una inversión de signo es imposible no se deriva solo de la lógica clásica ni del cálculo de probabilidades
  • Una forma limitada del sure-thing principle de Savage puede derivarse del do-calculus de Pearl
    • Si una acción A aumenta la probabilidad del evento B en cada subgrupo, entonces esa acción también debería aumentar la probabilidad de B en el grupo total, siempre que no cambie la distribución de los subgrupos
  • Pavlides y Perlman presentaron una demostración de que la paradoja de Simpson ocurre con probabilidad exacta de 1/60 en tablas aleatorias 2 × 2 × 2 con distribución uniforme
  • En un estudio de Kock, la probabilidad de que la paradoja de Simpson ocurra al azar en un modelo de trayectorias con dos variables predictoras y una variable criterio fue de aproximadamente 12.8%, es decir, un poco más de una vez por cada 8 modelos de trayectorias

La segunda paradoja de Simpson y los grafos causales

  • El artículo de 1951 de Simpson también incluye una segunda paradoja menos conocida
  • En este caso, a diferencia del ejemplo de cálculos renales, no siempre existe una interpretación razonable para los datos separados, y puede ser que los datos combinados sean la interpretación correcta
  • Decidir si deben usarse los datos divididos o los datos combinados depende del proceso que generó los datos
  • Por lo tanto, no siempre es posible determinar la interpretación correcta solo observando una tabla
  • Judea Pearl mostró que, para que los datos divididos representen la relación causal correcta entre las variables X y Y, la variable de partición debe satisfacer una condición gráfica llamada back-door criterion
    • Debe bloquear todos los caminos espurios entre X y Y
    • Ninguna variable de partición debe estar afectada por X
  • Este criterio ofrece una solución algorítmica a la segunda paradoja de Simpson y explica que distintos grafos compatibles con los mismos datos pueden requerir distintos back-door criterion
  • Si el conjunto de covariables Z satisface el back-door criterion, la fórmula de ajuste proporciona el efecto causal correcto de X sobre Y
  • Si no existe tal conjunto, el do-calculus de Pearl puede usarse para encontrar otras formas de estimar el efecto causal
  • La completitud del do-calculus puede considerarse una solución completa a la paradoja de Simpson

Críticas e implicaciones prácticas

  • Una crítica es que la paradoja de Simpson, más que una paradoja real, es el resultado de no reflejar correctamente las variables de confusión o de no considerar las relaciones causales entre variables
  • Enfocarse demasiado en la paradoja puede desviar la atención de problemas estadísticos más importantes
  • Otra crítica es que una aparente paradoja de Simpson puede ser simplemente el resultado de cómo se estratifican o agrupan los datos
  • Si se estratifican de otra manera o se consideran otras variables de confusión, el fenómeno puede desaparecer o invertirse nuevamente
  • El ejemplo de Simpson resalta el fenómeno de noncollapsibility, donde proporciones altas en subgrupos no se convierten en un promedio simple al combinarse
  • Aun así, la paradoja de Simpson sigue siendo un tema de estudio y debate en estadística y análisis de datos, y permanece como un caso que muestra las trampas de una interpretación demasiado simple de los datos

1 comentarios

 
GN⁺ 2024-03-13
Opiniones de Hacker News
  • Me pasó de verdad hace mucho, cuando trabajaba como analista de datos en The Hut Group.
    El equipo de marketing decía que, durante todo el año, la proporción de costos de marketing sobre ventas había bajado en todas las líneas de productos, pero al cierre del año la dirección se sorprendió al ver que el costo total sobre ventas casi se había duplicado, de 10% a casi 20%.
    A pedido del equipo de finanzas lo revisé y los números de marketing eran correctos: la proporción de costos de marketing en las líneas de juegos, belleza y nutrición había bajado en todos los casos, aproximadamente de 15%→10%, 30%→25% y 50%→30%, respectivamente.
    El problema fue que la mezcla de productos cambió mucho: nutrición pasó de representar alrededor del 10% de las ventas totales a casi el 50%, y como creció la categoría con la proporción de costos más alta, la proporción total de costos de marketing subió.
    Al final, la eficiencia de ventas de cada categoría había mejorado, pero el indicador global empeoró, y me tocó la divertida tarea de explicarles a los contadores la paradoja de Yule-Simpson.

    • Casi todos los datasets que manejo como SRE están llenos de este tipo de paradojas.
      Hay un caso famoso de Google: un ingeniero de redes fue a un lugar como Indonesia, vio que el servicio era lento y, al preguntar, todos respondieron que “siempre había sido así”.
      Las redes móviles locales eran lentas y las conexiones de fibra hacia fuera de las islas estaban saturadas, así que al volver a la oficina central hizo una optimización para reducir el tamaño del payload; redujo a la mitad el tamaño de descarga y lo desplegó, pero la latencia promedio y p95 aumentaron.
      ¿Por qué un cambio objetivamente bueno se veía peor? Porque los usuarios para los que el servicio mejoró mucho empezaron a usarlo muchísimo más.
      Aunque la carga de ancho de banda bajó, la latencia de red hasta el centro de datos seguía siendo mayor que para los usuarios de EE. UU.; al usar más un servicio que se había vuelto “menos terrible”, empujaron hacia arriba las métricas globales.
      Hay muchos casos en los que se llega a conclusiones equivocadas por mirar solo un fragmento específico de la telemetría de solicitudes, por no modelar suficientemente el sistema completo o por controlar variables incorrectas.
      Lo peor es el traspaso circular de responsabilidades que genera la paradoja de Simpson: los desarrolladores de la app culpan a una regresión del servidor y el equipo de servidores culpa al equipo de la app; a veces ocurre porque los calendarios de releases de servidor y app coinciden casualmente demasiado bien.
    • En realidad es bastante común.
      Incluso se puede ver en datasets de juguete “clásicos” como Iris: https://github.com/DataForScience/Causality/blob/master/1.2%...
    • Cada vez que escucho un caso real de la paradoja de Simpson, no tengo claro qué lección debería sacar.
      ¿Significa que el equipo de marketing sobreoptimizó y redujo la demanda de productos que no eran de nutrición? ¿Que si se quitara nutrición de la línea de productos mejorarían tanto la eficiencia de cada producto como la global? ¿O que esas métricas son insuficientes y habría que mirar el cambio total en lugar de las proporciones? No me queda claro.
    • Pensé que era bastante común aplicar modelos lineales mixtos/jerárquicos.
      No estudié estadística, pero en áreas donde se modelan efectos biológicos suelen abordar este tipo de problemas así.
      Ej.: https://www.pymc.io/projects/examples/en/latest/generalized_...
    • Me sorprende que en las diapositivas del reporte no apareciera el cambio en la mezcla de productos.
      Dicho eso, marketing suele elegir la positividad por encima de la objetividad, y tiende a escoger solo los hechos que respaldan lo que hizo.
  • Me encanta la cita de Jordan Ellenberg.

    El matemático Jordan Ellenberg considera que el nombre “paradoja de Simpson” es desacertado. Dice que “no hay una contradicción, sino dos maneras distintas de pensar los mismos datos”, y que la lección no es “decirnos qué punto de vista elegir, sino exigirnos que tengamos presentes al mismo tiempo las partes y el todo”.
    Gracias a esa actitud de mantener varias posibilidades en mente a la vez, los epicúreos llegaron a ideas como la supervivencia del más apto, la herencia de rasgos de ambos padres, que la luz está compuesta por unidades discretas extremadamente ligeras y muy veloces, y que para que exista el libre albedrío los cuantos que componen la materia deben poder producir varios resultados posibles bajo las mismas leyes y condiciones físicas.
    Eso ocurrió miles de años antes de que el método científico descubriera de forma independiente los mismos resultados, y también es un excelente método de análisis para el análisis de datos del que se habla aquí.

    • Creo que quizá hay un pequeño malentendido sobre el significado de la palabra “paradoja”.
      Se la llama paradoja porque va contra la intuición inicial y parece una contradicción, no porque necesariamente tenga que ser una contradicción real.
      De hecho, es probable que la mayoría de las paradojas con nombre terminen resultando no ser contradicciones reales, porque algo que parece falso y además es realmente falso difícilmente sea lo bastante interesante como para recibir un nombre.
    • La expresión de que, para que exista el libre albedrío, los cuantos que componen la materia deben poder producir varios resultados posibles bajo las mismas leyes y condiciones físicas suena rara y fuera de contexto.
      Parece referirse a la mecánica cuántica, pero no parece representar correctamente ni la mecánica cuántica ni el libre albedrío, y tampoco es posible que los epicúreos conocieran la mecánica cuántica.
    • No entiendo bien la conexión entre la paradoja de Simpson y los epicúreos.
    • La lista de teorías epicúreas es interesante.
      Me gustaría tener algún buen material introductorio que las trate en conjunto y muestre cómo se relacionan con el pensamiento de múltiples posibilidades.
    • Puede sonar quisquilloso, pero la frase “la luz está compuesta por unidades discretas extremadamente ligeras y muy veloces” no es precisa.
      Para empezar, la luz tiene exactamente masa cero, y solo las partículas sin masa pueden moverse exactamente a la velocidad de la luz, y únicamente a esa velocidad.
      En segundo lugar, omite la dualidad onda-partícula de la luz, que también se parece a la explicación de la paradoja de Simpson como “dos maneras distintas de pensar los mismos datos”; sin ella no se puede entender por completo el comportamiento de la luz ni el del sistema estadístico que se está observando.
  • Hace mucho tiempo, cuando enseñaba estadística introductoria, usaba los precios de vivienda como un buen ejemplo de la paradoja de Simpson
    Hacía que los estudiantes investigaran datos reales en ejercicios de cálculo, y los datos de entonces eran de compraventas de viviendas en EE. UU. de 2008, así que hoy ya tienen unos 15 años
    En aquel momento, el precio promedio de venta de las casas unifamiliares sin aire acondicionado central era más alto que el de las casas que sí lo tenían
    Pero al desglosarlo por estado, la relación se invertía en todos los estados: las casas con aire acondicionado central eran más caras que las que no lo tenían
    La razón principal por la que en el promedio nacional las casas sin aire acondicionado central salían más caras era que entre las viviendas costosas de California había muchas sin aire acondicionado central

    • Este resultado puede leerse como lo contrario de los ejemplos anteriores, o como un problema de elegir la estadística correcta según el objetivo
      En este caso, el promedio nacional no importa mucho; lo que importa es mi casa, mi calle, mi zona
      En cambio, en algo como marketing, la primera estadística importante es la utilidad neta total, y luego se profundiza en los factores, mirando la proporción del negocio antes que el gasto en marketing
      En el ejemplo de redes, el objetivo no es la velocidad ni la latencia, sino el uso/throughput
      Si eliges la estadística equivocada desde el principio, llegarás a una conclusión equivocada
  • También vale la pena conocer https://en.wikipedia.org/wiki/Berkson%27s_paradox
    Hay muchas formas en que el error se cuela cuando la población se construye de manera sesgada
    Estos dos efectos explican una buena parte de las decisiones tontas que salen de procesos “basados en datos”
    Es común que los datos sugieran exactamente lo contrario de la verdad

    • Creo que la mejor lección de estos fenómenos es que no se puede conocer la verdad solo con correr estadísticas sobre un dataset
      Si no entiendes los factores causales que realmente operan, tu conocimiento será muy limitado, por muchos datos que tengas y por muchas formas en que los dividas estadísticamente
      Por ejemplo, en el caso de UC Berkeley mencionado en el artículo sobre la paradoja de Simpson, los datos dicen muy poco útil sobre el “sesgo” que la gente tendría que abordar de otra manera para hacer más justo el proceso de admisión
      Sin contexto —como si el proceso de admisión se controla principalmente a nivel de departamento o a nivel de toda la universidad— ni siquiera se sabe dónde buscar posibles sesgos
    • Si eres empirista, basta con señalar https://en.wikipedia.org/wiki/Goodhart%27s_law
    • Como dice el dicho: mentiras, malditas mentiras y estadísticas
  • La breve animación de la página de Wikipedia es un excelente ejemplo de que una imagen vale más que mil palabras
    [https://en.wikipedia.org/wiki/File:Simpsons_paradox_-_animat...](https://en.wikipedia.org/wiki/File:Simpsons_paradox_-_animation.gif)

  • La paradoja de Lord está estrechamente relacionada con la paradoja de Simpson y, visualmente, es un poco más fácil de entender: https://repository-images.githubusercontent.com/597130499/46...
    Puedes imaginar que el eje horizontal es la dosis de un fármaco y el eje vertical una respuesta, como las horas de sueño
    Si miras la respuesta de Lisa, está claro que al aumentar la dosis disminuye el sueño, y lo mismo ocurre con Bart
    Pero si haces una regresión lineal con todos los datos, sale que al aumentar la dosis aumenta el sueño, como la línea roja, lo cual es una conclusión equivocada

  • Hasta hace poco no sabía que la paradoja de Simpson era una lección de inferencia causal
    Si se aplica el paradigma correcto, la paradoja desaparece
    Aquí hay un mejor artículo: https://plato.stanford.edu/entries/paradox-simpson/

  • Cuando lo vi por primera vez, pensé que se trataba del episodio de The Simpsons en el que Mr. Burns tiene “una variedad tan enorme de enfermedades que se contrarrestan entre sí”
    La explicación está aquí: https://simpsons.fandom.com/wiki/Three_Stooges_Syndrome
    La similitud es sorprendente, pero considerando la genialidad del equipo de guionistas de The Simpsons a finales de los 90, es muy probable que haya sido intencional

  • Mientras leía el ejemplo de que parecía haber un sesgo de género en las admisiones de UC Berkeley, vi esto: “Las mujeres tendían a postularse a departamentos más competitivos con tasas de admisión más bajas, y eso también ocurría entre postulantes calificados. Por ejemplo, el departamento de Inglés. En cambio, los hombres tendían a postularse a departamentos menos competitivos con tasas de admisión más altas; por ejemplo, Ingeniería”. Me sorprendió porque era lo contrario de lo que esperaba. Pensaba que entrar a Inglés y a las artes en general sería mucho más fácil que a STEM; en Australia se siente así. Aquí, “entrar” se refiere a la admisión universitaria, no a la industria.

    • Parece que nadie ha dado todavía la respuesta obvia. Estos datos son de postulaciones a programas de posgrado. En ingeniería hay mucho más financiamiento, y una parte considerable de los estudiantes que hacen un doctorado en ingeniería no paga la matrícula de su propio bolsillo. En humanidades hay muy poco financiamiento, y como la mayoría de los estudiantes no quiere pagar mucho dinero por un doctorado en humanidades, los departamentos limitan estrictamente los cupos de admisión. Por eso, si eres lo bastante competente, suele ser más fácil entrar a un doctorado en ingeniería. Un amigo con quien estudiaba ingeniería se desilusionó y quiso pasarse al periodismo, así que postuló para transferirse al programa de Communications de la universidad, pero era tan competitivo que aceptaban a menos de 10 personas al año, y al final lo rechazaron.
    • En Australia solemos pensar la competitividad de una carrera de grado según el ranking ATAR mínimo de los admitidos del año anterior. Pero también se puede ver la competitividad como una tasa de admisión: número de admitidos / número de postulantes. Si en una carrera muy popular la proporción de postulantes con ATAR alto es desproporcionadamente baja, creo que esos dos indicadores pueden coexistir.
    • Yo también me sorprendí al leerlo. Creo que la respuesta es que lo que se ve aquí es la tasa de admisión = número de admitidos / número de postulantes, y no es lo mismo que la dificultad general en un sentido conceptual. Quienes postulan a un posgrado en Matemáticas son solo personas que obtuvieron buenas notas en una licenciatura en Matemáticas o que cursaron una cantidad considerable de materias de matemática teórica en otra carrera STEM. Las artes atraen postulantes de trayectorias más amplias, y también parece mucho más común que alguien pase de STEM a otro campo que al revés. Es fácil convencerse de que tu cuento es excelente aunque otros no estén de acuerdo, pero es más difícil convencerse de que una demostración matemática objetivamente incorrecta está bien. Por eso hay menos autoselección del lado de los postulantes y la tasa de admisión baja.
    • La competitividad es una forma de medir la dificultad, pero hay otras. Ingeniería tiende a ser más difícil de ingresar en términos cualitativos, y humanidades en términos cuantitativos.
  • Esa visualización era tan efectiva que no hizo falta leer la wiki. Con verla, lo entendí de inmediato.