1 puntos por GN⁺ 2024-07-28 | 1 comentarios | Compartir por WhatsApp
  • El debate sobre la estadística bayesiana no se reduce a un solo problema de la distribución previa, sino que lleva a diferencias en cómo los enfoques bayesiano subjetivo, objetivo y pragmático ven el modelo y el proceso de revisión
  • El bayesianismo subjetivo es el enfoque tradicional: primero asume una distribución generadora de datos y luego codifica las creencias previas sobre los parámetros como una distribución previa para avanzar hacia la inferencia posterior
  • El bayesianismo objetivo sostiene que la inferencia debe depender solo del modelo supuesto y de los datos, y que la distribución previa debe ser la menos informativa posible en un sentido de teoría de la información
  • El bayesianismo pragmático construye un modelo probabilístico conjunto de todas las cantidades observadas y no observadas, condiciona en los datos y luego revisa el ajuste del modelo y las conclusiones, repitiendo si hace falta
  • Este proceso iterativo se parece más al diseño iterativo de la ingeniería y a la forma habitual de trabajo en machine learning, por lo que ve el análisis bayesiano menos como una filosofía fija y más como un workflow real de modelado

Distinción entre tres culturas bayesianas

  • El bayesianismo subjetivo primero asume la distribución generadora de datos, es decir, la likelihood vista como función de los parámetros
  • Bajo esa suposición, expresa las creencias previas sobre los parámetros como una distribución previa
  • Luego realiza la inferencia posterior y se acerca a una práctica en la que ya no se vuelve atrás
  • No está claro si realmente hubo personas que siguieran esta filosofía de manera estricta, ni si hoy alguien se registraría a sí mismo como bayesiano subjetivo

Motivación del bayesianismo objetivo y la reference prior

  • El bayesianismo objetivo puede verse como una filosofía surgida de la combinación entre el deseo de usar pruebas de hipótesis, en especial mediante Bayes factor, y el “Bayesian cringe”
  • El artículo de 2009 sobre reference priors de Berger, Bernardo y Sun explica que el reference analysis produce una inferencia bayesiana objetiva
    • Las proposiciones inferenciales deben depender solo del modelo supuesto y de los datos disponibles
    • La distribución previa utilizada debe ser la menos informativa en un determinado sentido de teoría de la información
  • Esta corriente sigue vigente a través de conferencias y libros con el título “objective Bayes”
  • Las priors amplias gamma(epsilon, epsilon) y normal(0, 10_000) usadas en ejemplos de BUGS también están, en cierta medida, detrás de esta corriente

Bayes pragmático y las tres etapas de BDA

  • El enfoque de Andrew Gelman puede llamarse Bayes pragmático
  • La primera edición de Bayesian Data Analysis de Gelman, Carlin, Stern y Rubin idealiza el proceso de análisis de datos bayesiano en tres etapas
    • Se establece un modelo probabilístico completo de todas las cantidades observadas y no observadas, es decir, una distribución de probabilidad conjunta
    • Se condiciona en los datos observados para calcular e interpretar la distribución posterior de las cantidades no observadas de interés
    • Se evalúan el ajuste del modelo, la validez de las conclusiones implicadas por la distribución posterior y la sensibilidad a los supuestos de modelado
  • Si hay problemas, se cambia o amplía el modelo y luego se repiten las mismas tres etapas
  • Aquí el modelo probabilístico es un modelo conjunto que incluye tanto la distribución previa como la likelihood
  • La entrada se expresa más como “knowledge” que como “belief”
  • El proceso de evaluar qué tan bien se ajusta el modelo a los datos y los resultados predictivos, y volver a intentarlo si hay problemas, después pasó a llamarse “workflow”

Diseño iterativo familiar en ingeniería y machine learning

  • Este enfoque es igual al procedimiento operativo estándar que en ingeniería se llama diseño iterativo (iterative design)
  • Casi todo el machine learning se hace de esta manera
  • Desde una formación en ciencias de la computación y machine learning, sorprende que los estadísticos no siempre hayan pensado así

La estrategia de BDA y cómo evita la disputa filosófica

  • Al escribir la primera edición de BDA, Andrew Gelman optó por enfocarse en “hacer” ciencia en la práctica en vez de extenderse en filosofía
  • Gelman y Rubin no le dieron un nombre separado a su proceso de diseño iterativo
  • Como es difícil definir con precisión las creencias filosóficas de otros y aún más difícil cambiarlas mediante debate, esta elección parece sensata
  • Más cercano a “show, don’t tell”, es un enfoque que muestra la metodología mediante el modelado real y la práctica científica, en vez de centrarse en discusiones filosóficas

La distribución previa y la likelihood deben tratarse juntas

  • Parte de la discusión trata sobre la distribución previa, pero elegir una distribución previa no es más ni menos subjetivo que elegir una likelihood
  • El texto de Andrew Gelman “Straining on the gnat of the prior distribution while swallowing the camel that is the likelihood” resume esta postura
  • En lo filosófico, se prefiere tratar la distribución previa y la likelihood con la expresión epistemológica de knowledge más que de “belief”
  • Este encuadre fue ofrecido primero por Laplace, explorado con mayor profundidad por John Stuart Mill y seguido también por Gelman y otros en BDA

Genealogía del título y las dos culturas de Breiman

  • En 1959, C.P. Snow escribió “The two cultures”, sobre el contraste entre arte y ciencia
  • En 2001, L. Breiman escribió el influyente texto “Statistical modeling: the two cultures”
  • El contraste de Breiman trata sobre la diferencia entre modelar explícitamente el proceso generador y usar modelos muy flexibles que, en términos de machine learning, corresponden a modelos de alta capacidad
  • En su propia investigación, Breiman apoyó los decision forests, y en competencias de Kaggle donde no hay suficientes datos para ajustar redes neuronales modernas, este enfoque todavía gana
  • El texto cierra con la pregunta de si los decision forests y las neural networks corresponden al caso que Andrew llamó “unfolding flower”

1 comentarios

 
GN⁺ 2024-07-28
Opiniones de Hacker News
  • El autor parece dividir a los bayesianos en dos ejes: (1) qué tan informativa se define la distribución previa a partir del conocimiento o las creencias sobre el mundo, y (2) si se corrige iterativamente la forma funcional del modelo observando el ajuste y la validez/utilidad de la salida.
    De esas combinaciones, llama a tres informativa+iterativa=pragmática, informativa+no iterativa=subjetiva, no informativa+no iterativa=objetiva; pero lo más difícil de aceptar es que la casilla no informativa+iterativa quede vacía.
    Creo que la mayoría de las personas en la industria que se llaman a sí mismas bayesianas caen en esa casilla. La forma funcional del modelo, es decir, el proceso generador de datos asumido, obviamente conviene y hace falta mejorarlo de forma iterativa; y como muchas veces los datos son lo bastante grandes como para dominar a la distribución previa, la previa suele ser no informativa o débilmente informativa.
    Por eso toda la columna no iterativa se siente como un hombre de paja, aunque el autor aclara explícitamente que él también lo creía así y que “se sorprendió al enterarse de que los estadísticos no pensaban de esa manera”.

    • Lo no iterativo sí existe, y no necesariamente por malas razones. Mejorar iterativamente un modelo busca hacerlo mejor según algún criterio, pero en la investigación científica operan con fuerza incentivos distorsionados alrededor de los criterios de significancia y los resultados positivos.
      Situaciones como el “jardín de senderos que se bifurcan”, donde el análisis cambia según los datos, parecen ser una causa directa de la crisis estadística y epistemológica de la ciencia actual. La iteración en sí no es mala, pero muchas veces la función objetivo que se optimiza no coincide con lo que científicamente se desea.
      Para un investigador científico real, ajustar iterativamente un modelo puede sentirse como una conducta un poco deshonesta, y parece estar profundamente relacionado con la epistemología defectuosa hacia la que han convergido muchos campos: el marco de que si p<0.05 es verdadero, y si no, es falso.
      Dicho de otra forma, la cantidad de grados de libertad que controla el analista puede ser el núcleo de la incomodidad. En un contexto bayesiano, si se elige una distribución previa a partir de creencias o datos pasados, el analista obtiene un control enorme sobre cómo saldrán los resultados.
      Por eso creo que muchas disciplinas se inclinaron por un conjunto de pruebas “estándar” en vez de construir buenos modelos estadísticos. Esas pruebas quitan de las manos del analista la mayoría de las perillas de ajuste y, en general, operan de forma más conservadora.
    • No conozco demasiado el lado bayesiano, pero me pregunto si los métodos bayesianos no paramétricos entran en el enfoque “no informativo + iterativo”.
      Tal vez esté mirando en una dirección completamente equivocada, pero no sé dónde se desvía mi idea o mi comprensión.
    • Curiosamente, según mi experiencia, casi todo el aprendizaje automático moderno funciona como bayesianismo pragmático. Se busca el ELBO, se elige la moda más reciente de variables latentes que mejor modele el dominio del problema y, hoy en día, por lo general se usa un Transformer y se empiezan a correr experimentos.
  • Extraño los tiempos de la universidad en que mis profesores discutían sin parar sobre bayesianos vs. frecuentistas.
    El texto es muy conciso y, aun así, explica por qué incluso entre profesores bayesianos los enfoques de investigación y análisis eran distintos. No conocía el tercer bando, el de los bayesianos pragmáticos, pero sin duda encaja con el trabajo de un profesor que era muy meticuloso con el ajuste probabilístico y hacía muchas iteraciones para acertar bien la distribución previa y la función de densidad de probabilidad conjunta.
    También recomiendo mucho a los científicos de datos la charla de Andrew Gelman “Andrew Gelman - Bayes, statistics, and reproducibility (Rutgers, Foundations of Probability)”.

    • Enlace de la charla: https://youtu.be/xgUBdi2wcDI
    • Para decirlo de forma un poco provocadora sobre el debate entre frecuentistas y bayesianos, estas tres culturas se ven así:
      El bayesiano subjetivo es el hombre de paja que al mundo académico frecuentista le gusta atacar; el bayesiano objetivo es la autoimagen ingenua que tienen muchos académicos bayesianos; y el bayesiano pragmático es el enfoque que adoptan los profesionales que aplican la estadística a algo real o, en términos de Gelman, quienes hacen ciencia.
    • Últimamente también escuché que la estadística fiducial (Fiducial Statistics) es un tercer bando. El episodio 581 del pódcast Super Data Science, con el editor de Harvard Business Review, fue bastante interesante.
    • En el país de donde vengo, el enfoque frecuentista es en general dominante, pero prácticamente no hay pelea con los bayesianos, así que siempre me resulta curioso. Al final no es más que un conjunto de teorías y herramientas matemáticas; se usa lo que sirve.
      Todavía pienso que la tendencia de los estadounidenses a rechazar la perspectiva frecuentista se debe a que exige una base matemática más sólida.
  • Siempre me molestó esa atmósfera de tener que decidir a qué “club” perteneces o de qué “lado” estás. Tampoco me convence la idea de que los problemas que vemos hoy en la ciencia puedan reducirse a qué filosofía de inferencia se adopte.
    En muchos sentidos, estoy más cerca de una orientación informacional, y si tuviera que decirlo quizá sería un bayesiano objetivo, pero en realidad no soy ni frecuentista ni bayesiano.
    Esta división de las “tres culturas” parece un poco un juego de manos. La cultura “pragmática” no es excluyente con los bayesianos subjetivos u objetivos, así que dice poco sobre cómo se deben especificar o interpretar las distribuciones previas.
    Gelman tal vez diría que un mejor término sería algo como “flexibilidad”, pero entonces queda pendiente cuándo ir por lo objetivo, cuándo por lo subjetivo y por qué. Formalizar eso parece mejor que dejarlo como una cortina de humo.
    Además, haciendo de abogado del diablo, la cultura “pragmática” también muestra por qué lo bayesiano puede verse con escepticismo. El flujo de “elegir una distribución previa”, “ver qué tan bien ajusta” y luego “iterar” puede parecer ajuste fino del modelo o p-hacking.
    Sé que esa no es la intención, y también sé que no se puede modelar sin ajustar, pero si se aborda así, la distribución previa parece otro grado de libertad para empujar un poco el resultado y salir de pesca.
    He escrito y editado artículos de inferencia bayesiana, y el problema nunca estuvo en la teoría sólida. Está en cómo la gente la usa y la abusa en la práctica.

  • Si quieres obtener una perspectiva adecuada sobre los métodos frecuentistas modernos, recomiendo “In All Likelihood”, de Yudi Pawitawn.
    En los primeros capítulos explica con bastante elegancia la diferencia entre los paradigmas frecuentista y bayesiano, en particular el poder de un modelo frecuentista bien diseñado o basado en verosimilitud.
    Salvo algunas excepciones, si los bayesianos usan en la práctica distribuciones previas no informativas, el mismo analista debería obtener la misma respuesta ya sea que use un modelo bayesiano o uno frecuentista. En el campo en el que trabajo, también se dice que el 99% de los investigadores que usan métodos bayesianos emplean distribuciones previas no informativas, así que a veces me pregunto si no usan lo bayesiano solo para verse más sofisticados y pasar más fácilmente la revisión por pares.
    En modelos complejos, por ejemplo con cientos o miles de parámetros, puede ser extremadamente difícil saber si una distribución previa es realmente no informativa en el contexto de un conjunto de datos específico. Hay que esperar a que el modelo corra, y si se modifican sistemáticamente las distribuciones previas, puede tomar muchísimo tiempo incluso usando recursos de cómputo de alto rendimiento.
    Además, en un entorno bayesiano es fácil terminar “pegando” por casualidad, con una o varias distribuciones previas, un modelo que en un enfoque frecuentista habría explotado con un Hessiano que no es definido positivo, dando el diagnóstico de que “el modelo probablemente es basura o es demasiado complejo para el conjunto de datos”.
    Uno podría burlarse de modelos con ese nivel de complejidad, pero en muchos contextos aplicados son la realidad. Por ejemplo, los modelos espaciotemporales que enfrentan problemas de “n grande”, o los modelos integrados de evaluación pesquera que proporcionan información sobre el estado de los recursos y la sostenibilidad.
    Por eso, aunque enseño inferencia bayesiana a nivel de posgrado, mi principal queja sobre la estadística bayesiana es que puede ser mal utilizada con demasiada facilidad por no estadísticos y principiantes. Más aún ahora que hay software muy flexible disponible incluso para no estadísticos, como biólogos.
    En general, el argumento de Gelman de que ambos paradigmas son subjetivos y de que, hasta el fondo, hay tortugas —es decir, subjetividad— es correcto y lo comparto mucho.

    • Estoy de acuerdo con la recomendación de “In All Likelihood”, pero también hay que decir que ese libro describe un tercer enfoque que no se apoya ni en la probabilidad subjetiva ni en la probabilidad objetiva.
    • Si el problema es que los no estadísticos y los principiantes pueden hacer mal uso fácilmente de la estadística bayesiana, ¿acaso no pasa lo mismo con la estadística frecuentista? :-)
  • En mi opinión, la probabilidad no está bien definida y es un concepto imposible de refutar. Aun así, empíricamente parece modelar bastante bien algunos aspectos del mundo. Pero ¿no podría estar guiándonos mal?
    ¿Qué significa realmente la afirmación p(X)=0.5, es decir, que la probabilidad del evento X es 0.5? ¿Es una proposición? Si lo es, ¿es refutable y cómo?
    Si no es una proposición, ¿qué significa? Agradecería que alguien con una base teórica más sólida lo explicara. Tengo más que decir, pero primero quisiera escuchar respuestas de personas con un trasfondo riguroso.

    • Como teoría matemática, la probabilidad está bien definida. La probabilidad es una aplicación de un tema más amplio, la teoría de la medida, que también proporciona los fundamentos teóricos del cálculo.
      Toda probabilidad se define mediante tres cosas: un conjunto, un conjunto de subconjuntos de ese conjunto —en términos simples, una forma de agrupar cosas—, y una función que envía esos subconjuntos a números entre 0 y 1. Para ser válido, el conjunto de subconjuntos, también llamados eventos, debe cumplir reglas adicionales.
      El ejemplo p(X)=0.5 solo significa que cierta función asigna el valor 0.5 a cierto subconjunto llamado X.
      La razón por la que esto parece bueno para modelar el mundo real se encuentra en los orígenes de la teoría. No surgió de la nada; se creó porque se quería formalizar eventos del mundo real que parecían aleatorios.
    • Personalmente llegué a la conclusión de que la probabilidad solo es un concepto bien definido y comprobable en situaciones donde se puede argumentar a partir de cierta simetría exacta.
      Lanzamientos de moneda, juegos de azar y muchos problemas de física estadística entran en esta categoría. En cambio, en la inferencia, la predicción y la estimación del mundo real, la probabilidad es subjetiva y mucho menos cuantificable de lo que creen los estadísticos, incluidos los bayesianos.
      ¿Puede la probabilidad guiarnos mal? Creo que sí. Cada vez tengo más la impresión de que toda ciencia que depende de las pruebas de hipótesis estadísticas como principal método empírico es, en lo fundamental, un enorme basurero, y que la crisis de reproducibilidad es solo la punta del iceberg. Esto incluye economía, psicología social, grandes partes de la medicina, ciencia de datos, etc.
      Creo que una afirmación como p(X)=0.5 es, en la mayoría de los casos, una proposición imposible de refutar. Incluso en algo como lanzar una moneda, donde se pueden hacer muchos experimentos baratos, hay que lanzarla un millón de veces solo para “confirmar” la probabilidad calculada con una precisión de alrededor del 1%. Para los estándares de las ciencias exactas es pésimo, y empeora cuando los supuestos son menos sólidos, el espacio muestral es más complejo o el costo de reproducir aumenta.
    • La probabilidad no es un solo concepto, sino una familia de conceptos relacionados. La probabilidad epistémica en el bayesianismo subjetivo es un concepto distinto de la probabilidad frecuentista, aunque por supuesto están relacionados en algunos aspectos.
      No sorprende que, si se mezclan definiciones mutuamente incompatibles, parezca un “concepto de definición poco clara e imposible de refutar”.
      Desde el punto de vista bayesiano subjetivo, p(X) es un valor que mide el grado de confianza que yo, o alguna persona específica, tiene en que una proposición sea verdadera; su juicio sobre el peso de la evidencia a favor o en contra; o el grado de mi conocimiento sobre si es verdadera o falsa.
      0.5 significa que no hay confianza hacia ninguno de los lados, que no hay evidencia hacia ninguno de los lados o que la evidencia de ambos lados se cancela por completo, y que no se tiene ningún conocimiento sobre si la proposición es verdadera.
      Esto es una proposición en el mismo sentido en que “el papa cree que Dios existe” es una proposición. Independientemente de si Dios existe realmente o no, es muy plausible que sea verdad que el papa lo cree.
      Por lo tanto, una afirmación sobre mis creencias puede refutarse fácilmente mediante mi introspección; y una afirmación sobre las creencias de otra persona también puede refutarse si se le pregunta, está dispuesta a responder y se asume que no tiene razón para mentir.
    • Es cierto que una afirmación específica como p(X=x)=a por lo general no puede refutarse. Pero las funciones p completas sí pueden compararse entre sí, y se puede decir cuál se ajusta mejor a los datos.
      Por ejemplo, supongamos que Nate Silver y Andrew Gelman publican cada uno probabilidades para los resultados de todas las contiendas de las elecciones de noviembre. Una vez que salen los resultados, no se puede decir si una probabilidad individual estuvo bien o mal, pero sí se puede decir quién fue más preciso.
    • Si en 1000 lanzamientos de una moneda el resultado es 99% cara y 1% cruz, estás seguro de que se usó el mismo proceso para todos los lanzamientos y tienes la oportunidad de apostar a cruz con una cuota de 50%, ¿apostarías?
      Esa es una respuesta práctica para rechazar P(X)=0.5. Y uno puede intentar entender esa decisión práctica mediante alguna teoría. Además, como que sea exactamente 0.5 es casi imposible, tiene más sentido comprobar si está en un intervalo como (0.49, 0.51).
      El teorema central del límite dice que, si se realizan ensayos independientes, se puede obtener la probabilidad de X y, en el límite, el número promedio de veces que ocurre X se acerca a p(X).
      Pero “límite” significa una cantidad infinita de ensayos, así que ninguna secuencia inicial determina ese límite. Hay que elegir un N grande como referencia y promediar.
      ¿Pero esto es exclusivo de la probabilidad? Si hay una afirmación sobre el mundo como “hay un árbol en la posición G”, y un procedimiento para verificarla, por ejemplo “ir a G y buscar un árbol”, ¿se puede decir que ese procedimiento siempre determina si la afirmación es verdadera o falsa? Siempre hay obstáculos, por ejemplo “una ilusión que parece un árbol”. Para descartar todos esos obstáculos, hay que suponer un proceso de observación idealizado.
      La idealización que funciona en la verificación de probabilidades son las observaciones independientes infinitas, y eso da p(X).
      No intento defender el frecuentismo; quiero decir que la necesidad de un ideal del proceso de observación no debería considerarse un obstáculo abrumador. Por supuesto, si hay obstáculos de principio, como la observación simultánea de posición y momento en la mecánica cuántica, se podría abandonar el concepto de probabilidad.
  • Hay que recordar que el polémico texto de Breiman trataba sobre métodos generativos vs. métodos discriminativos. Es decir, sostenía que el análisis no debía empezar por cómo se puede modelar la generación de los datos, sino por la predicción.
    De esa corriente surgieron métodos de caja negra no generativos como los árboles con boosting, bagging, random forests y XGBoost.
    Aún hoy, la mayoría de las herramientas clásicas de machine learning no son generativas.

  • Lo bueno de la estadística bayesiana es que es subjetiva. Ni siquiera hace falta pertenecer a la escuela subjetivista; uno puede elegir la interpretación según su propio juicio subjetivo.
    Yo considero que esto es una fortaleza del bayesianismo. En cualquier trabajo estadístico se filtra el juicio subjetivo de individuos concretos. No evitar este hecho inmutable es, más bien, lo más objetivo.

    • Que cada enfoque sea apropiado depende mucho de qué se esté modelando y de las consecuencias de los errores correspondientes.
  • Hacking bayesiano: encontrar la iteración que le da la mayor significancia al propio estudio

  • ¿Dónde encaja el deep learning?

    • La creencia implícita que comparten los profesionales mencionados por el autor es que intentan construir un modelo que corresponda a algún “proceso de generación de datos” subyacente.
      Un profesional de machine learning puede usar modelos parecidos a los de un estadístico bayesiano, incluso los mismos modelos, pero tiende a evaluar el modelo centrándose en su desempeño predictivo, o exclusivamente en eso, más que en una intuición sobre por qué los datos toman esos valores.
      Véase el artículo clásico de Breiman “Two Cultures”, al que hace referencia el título de este texto: https://projecteuclid.org/journals/statistical-science/volum...
    • La mayoría de los modelos se derivan de principios de machine learning, que mezclan teoría clásica de la probabilidad, estadística frecuentista y bayesiana, y muchos fundamentos de ciencias de la computación.
      Aun así, también ha habido avances en inferencia bayesiana y deep learning bayesiano, así que conviene mirar el trabajo en frameworks como Pyro, construido sobre PyTorch.
    • A alto nivel, la estadística bayesiana y el deep learning comparten el mismo objetivo: ajustar los parámetros del modelo.
      En particular, la inferencia variacional es una familia de técnicas para volver computables este tipo de problemas. Aparece por todas partes, desde autoencoders variacionales hasta modelado de espacios de estado en series temporales y aprendizaje por refuerzo.
      Si quieres aprender más, recomiendo el libro de machine learning de Murphy: https://probml.github.io/pml-book/book2.html
    • Una red neuronal profunda no es más que un modelo de datos muy complejo, y lo que determina si es bayesiana o frecuentista es cómo se abordan la estimación de sus parámetros y la predicción de datos nuevos.
      Un bayesiano asigna una distribución a los parámetros y luego condiciona con los datos para obtener una distribución posterior; con base en ella obtiene la distribución predictiva posterior para datos nuevos.
      En cambio, un frecuentista ve los parámetros como cantidades fijas y los estima solo con la verosimilitud. Por ejemplo, usa máxima verosimilitud y también puede usar trucos como la regularización; a estos también se les puede dar una interpretación bayesiana.
    • https://en.wikipedia.org/wiki/Statistical_learning_theory