1 puntos por GN⁺ 2024-08-01 | 1 comentarios | Compartir por WhatsApp
  • Basado en las notas del curso Carnegie Mellon 36-401 Modern Regression de otoño de 2015, este es un manuscrito de aprendizaje para quienes aprenden o enseñan regresión lineal
  • No deja la regresión lineal atada a los supuestos al estilo de 1960 y reduce el peso de la teoría que depende del ruido gaussiano (Gaussian noise) y de un modelo lineal correctamente especificado
  • Da prioridad a las técnicas robustas, aunque sean más intensivas en cómputo, y aclara que el propio manuscrito quizá no haya avanzado lo suficiente en esa dirección
  • Se superpone en parte con el segundo capítulo de Advanced Data Analysis from an Elementary Point of View, pero también incluye mucho material nuevo y de nivel más básico
  • El índice abarca ampliamente desde predicción óptima, mínimos cuadrados, máxima verosimilitud, diagnóstico, inferencia, multicolinealidad, selección de modelos, mínimos cuadrados ponderados y generalizados, selección de variables, árboles y bootstrap

Naturaleza y enfoque del manuscrito

  • Este manuscrito reúne las notas del curso 36-401, Modern Regression, in fall 2015
  • Aunque reconoce que ya existe mucho material sobre regresión lineal, se publica al considerar que podría ser útil para quienes aprenden o enseñan el tema
  • Desde la perspectiva de que la estadística ha avanzado desde 1960, pone menos énfasis en la teoría apoyada en modelos lineales correctamente especificados y en el ruido gaussiano
  • Está organizado con preferencia por técnicas robustas, aunque sean más intensivas en cómputo, y el autor añade que quizá no llegó lo suficientemente lejos en esa dirección
  • Se superpone parcialmente con Advanced Data Analysis from an Elementary Point of View, en particular con el segundo capítulo, “The Truth About Linear Regression”
  • Al mismo tiempo, incluye mucho material nuevo y de nivel más básico, y se agradecen opiniones y correcciones, especialmente la corrección de errores

Alcance y actualizaciones

  • El índice actual va desde el modelado básico de la regresión lineal hasta el diagnóstico, la inferencia y técnicas extendidas
  • Modelado básico y regresión simple

    • Optimal Prediction
    • Introducing Statistical Modeling
    • Simple Linear Regression Models, with Hints at Their Estimation
    • The Method of Least Squares for Simple Linear Regression
    • The Method of Maximum Likelihood for Simple Linear Regression
    • Diagnostics and Modifications for Simple Regression
    • Inference on Parameters
    • Predictive Inference for the Simple Linear Model
    • Interpreting Parameters after Transformation
    • F-Tests, R^2, and Other Distractions
    • Simple Linear Regression in Matrix Format
  • Regresión múltiple y temas ampliados

    • Multiple Linear Regression
    • Diagnostics and Inference for Multiple Linear Regression
    • Polynomial and Categorical Regression
    • Multicollinearity
    • Tests and Confidence Sets
    • Interactions
    • Outliers and Influential Points
    • Model Selection
    • Review
    • Weighted and Generalized Least Squares
    • Variable Selection
    • Trees
    • The Bootstrap I
    • The Bootstrap II
    • En el futuro, el material sobre linear spatio-temporal estimation and prediction del curso Data Over Space and Time podría incorporarse al manuscrito
    • Se mencionan como ejemplos Wiener filter y kriging
    • La última actualización del texto fue volver a ejecutar el código tras una actualización de R y corregir erratas, con fecha de 20 de octubre de 2025

1 comentarios

 
GN⁺ 2024-08-01
Opiniones de Hacker News
  • La regresión lineal suele estar subestimada

    1. Todas las pruebas estadísticas comunes son modelos lineales: https://lindeloev.github.io/tests-as-linear/
    2. Un modelo lineal significa que es lineal respecto de los parámetros, no respecto de la respuesta. Por ejemplo, y = a*sin(x)+bx^2 también es un modelo lineal
    3. Si se elige una base de splines adecuada, muchas relaciones no lineales entre los predictores y la respuesta también pueden modelarse con un modelo lineal
    4. Aun si le falta flexibilidad, según el teorema de Taylor, una relación lineal suele ser una buena aproximación de una relación no lineal
    • Estoy totalmente de acuerdo con estos puntos, y los modelos lineales deberían recibir mucho más reconocimiento
      Otro punto importante es que a los humanos, especialmente en grupos, racionalmente nos resulta difícil tomar decisiones que no sean lineales
      En una reunión para definir el rumbo de una empresa, no queda otra que hablar en términos como “aumentemos el gasto en publicidad y reduzcamos otros costos de adquisición, como cupones de descuento”. Encontrar el equilibrio entre “aumentar la publicidad” y “reducir otros costos” es un modelo lineal simple
      Aunque tengas un gran modelo no lineal, lo clave no es tanto la “interpretabilidad” como la posibilidad de llevarlo a la práctica. Si llevas resultados de regresión a una reunión, puedes modelar varias estrategias rápidamente y dar una confianza razonable sobre la dirección a seguir
      Me costaba comunicar hacia arriba insights accionables, pero después de entender bien la regresión, se volvió sorprendentemente fácil abrir y entender rápido incluso procesos de negocio bastante complejos
    • En relación con el punto 3, tanto en investigación académica como en la mayor parte del trabajo en la industria he usado modelos aditivos generalizados con bastante éxito técnico. Es decir, ajustaban bien a los datos
      Aun así, rara vez los stakeholders los entendían bien o reconocían su valor. En general creo que era por pereza y costumbre
    • Me interesaría conocer referencias útiles sobre el punto 3
      Un problema que veo a menudo en la literatura es que los autores sobreinterpretan la pendiente de un modelo con término cuadrático, por ejemplo Y = age + age^2, en los rangos de edad más bajos y más altos. Si uno mira solo la línea del gráfico y no el intervalo de confianza, parece que disminuye en las edades más altas, pero en realidad podría ser una pendiente negativa aparente causada porque el modelo cuadrático no puede representar una asíntota. Ej.: https://www.researchgate.net/figure/Scatter-plot-of-the-quad...)
      Cuando no había una opción teóricamente definida, usaba polinomios fraccionarios. Por ejemplo, con x^s y s = {−2, −1, −0.5, 0, 0.5, 1, 2, 3}, seguía una estrategia de elegir el polinomio que mejor ajustara evitando el sobreajuste: https://journal.r-project.org/articles/RN-2005-017/RN-2005-0...
      No es una mala técnica, y también probé otros métodos como regresión polinómica por tramos o puntos de nudo, pero, por ejemplo, no estaba seguro de cómo probar una interacción entre grupos entre dos splines con nudos. Con los modelos aditivos pasaba lo mismo: https://bookdown.org/ssjackson300/Machine-Learning-Lecture-N...
    • Si se mira desde la perspectiva adecuada, una SVM también es un modelo puramente lineal, y, de forma muy reduccionista, se puede decir que una red neuronal ReLU es lineal por tramos
      Pero una explicación así quizá oculte más de lo que ayuda. Elegir la transformación adecuada para un caso específico es un problema muy difícil. Queda la pregunta de por qué tendrían que ser sin(x) y x^2, y no tanh(x) y x^(1/2)
    • Como casi no sé matemáticas, el punto 2 me sorprende. Busqué rápido y veo que dicen que un modelo lineal debería verse como una línea recta al graficarlo, pero la fórmula del ejemplo no es una línea recta
      Siento que me estoy perdiendo algo básico
  • La técnica más importante en una regresión es reconocer el intercepto. Suena trivial, y en la práctica también lo es, pero cambia cuando empiezas a incluir interacciones entre términos. He visto a muchísimos estudiantes jóvenes de posgrado equivocarse con esto.
    Pensemos en un modelo lineal simple que usa puntaje de prueba, edad (7 a 16 años) y una variable categórica binaria de diagnóstico de autismo (0=grupo control, 1=autismo): score = age + diagnosis + age:diagnosis, es decir, score = (X1)age + (X2)diagnosis + (X3)age:diagnosis.
    Si X2 es significativo, un estudiante ingenuo diría “¡hay una diferencia entre grupos!”, pero se le escapa que eso es la diferencia de grupo predicha cuando el participante tiene 0 años. La edad debería centrarse en la media, la mediana o, mejor aún, en la edad de interés. Cuando una interacción entra en la ecuación, todas las estimaciones de parámetros de “orden inferior” se interpretan con respecto al intercepto.
    También podrías ver que el efecto de la edad es significativo y pensar que se aplica a ambos grupos, pero X1 solo indica la pendiente predicha para el grupo de referencia, el grupo control. La interacción prueba si las pendientes por edad difieren entre los dos grupos. Además, aunque la interacción no sea significativa, el efecto de la edad en el grupo con autismo podría no ser significativamente distinto de 0. Si los datos están en una zona ambigua, hay que tener cuidado al interpretarlos.
    Para algunos esto parecerá obvio, pero entender correctamente el espacio condicional de los parámetros cuando hay términos de interacción requiere esfuerzo. Aquí dejé de lado por ahora la forma de codificar los grupos, por ejemplo si es respecto de la media general o tomando un grupo como referencia, pero la lección se mantiene. Hay que entender qué significa el intercepto y a quién/qué apunta.

    • Los modelos con términos de interacción siempre me resultaron poco intuitivos. Por lo general, escribir qué términos del modelo entran para cada clase de respuesta ayuda a interpretarlos.
      También existe ExploreModelMatrix para ayudar con esto: https://www.bioconductor.org/packages/release/bioc/html/Expl...
    • Si dije algo raro arriba, agradecería que me lo señalaran. Sigo aprendiendo.
      Si eres un bayesiano fuerte que odia los valores p, también está bien. Pero he visto que incluso estudiantes inteligentes tienen dificultades para interpretar de forma natural modelos con términos de interacción, y quería apuntar en la dirección correcta.
    • No es correcto decir que “X1 solo indica la pendiente predicha para el grupo de referencia, el grupo control”. Tal como está escrita la ecuación, X1 es el valor para todo el grupo. No creaste variables dummy adecuadas.
      X1*age*isControl+X2*isControl+X3*isAutism+X4*isAutism*age+X5*age
      Así puedes separar el efecto de la edad en los dos grupos y el efecto de la edad común a ambos.
    • Creo que esta interpretación es correcta.
      Una carga significativa de la variable de diagnóstico X2 no te dice el efecto del diagnóstico a una edad específica. Salvo que sí lo hace a los 0 años de edad.
      Hay que volver a centrar el modelo respecto de la edad de interés.
  • Hace 10 años tomé 36-401 y 36-402 en CMU, y en ese entonces Shalizi los impartía; ambos fueron muy buenos cursos de estadística. Para bien o para mal, te obligaban a aprender base R.
    Una gran debilidad de la regresión lineal era que las suposiciones académicas necesarias para interpretar válidamente los coeficientes son fáciles de hacer en pequeños datasets didácticos, pero casi nunca aplican a datos reales desordenados; lo aprendí por las malas.

    • Depende del caso. La suposición más importante es la independencia de las observaciones.
      Si no la tienes, hay que reflejar las respuestas correlacionadas con un modelo de efectos mixtos, o bien agregar las respuestas promediándolas. Calcular promedios reduce la varianza, pero también reduce la cantidad de puntos de datos, y en el cálculo del estadístico t de la prueba de Wald esos dos efectos se cancelan entre sí.
      En cuanto a otras suposiciones, como la normalidad de los residuos, los modelos lineales a menudo toleran cierto grado de violación. Aun así, siempre conviene entender qué efecto tienen esas violaciones, por ejemplo corriendo simulaciones o mirando el histograma de valores p de datos nulos.
    • A la inversa, con datos reales desordenados muchas veces basta con tener un modelo suficientemente bueno, en vez de obsesionarse con si el valor p dice tal o cual cosa.
  • Me gusta que la regresión ridge se presente en el contexto de la multicolinealidad.
    Hoy en día parece que casi todos la aprenden como una técnica de regularización para evitar el sobreajuste, pero uno de sus usos fundamentales, y quizá su origen, es repartir los pesos de manera equilibrada entre predictores fuertemente correlacionados o casi linealmente dependientes. Incluso con suficientes datos, ese tipo de predictores puede causar grandes problemas.

  • Me gustaría ver a alguien como un investigador cuantitativo de Citadel enseñando regresión lineal. Me da curiosidad cómo la usan, en particular qué cosas les preocupan, y si hay resultados teóricos que cambien de manera significativa su forma de ver los problemas.

    • Tengo algo de experiencia relacionada. Las variantes regularizadas son indispensables. Hay muy pocas muestras y demasiado ruido por muestra.
      En el problema relacionado de estimar matrices de covarianza, las variantes con shrinkage son populares. La más simple es el Linear Shrinkage de Ledoit-Wolf.
      Dejando de lado las redes neuronales, creo que la mayoría de quienes hacen regresión usan regresión lineal con este tipo de ajustes adaptados al dominio.
      En finanzas en particular, es demasiado fácil engañarse con modelos más complejos.
    • La regresión lineal, incluso la regresión con un solo predictor, es una herramienta principal. Es como si el producto cruzado x'*y no bastara, dividir por el producto interno x'*x quedara justo (regresión), y dividir una vez más por otro producto interno y'*y, incluyendo además una raíz cuadrada, ya se sintiera excesivo porque da el coeficiente de correlación.
      Lamentablemente no hay un gran secreto ni una revelación espectacular. Como dijo Jim Simons en la entrevista con Numberphile, se trata de ir acumulando señales débiles lenta y dolorosamente, y de construir y mejorar muchas cajas del sistema. Mientras tanto, las interfaces son en general conocidas.
      Dentro del panorama completo, el método de ajuste en sí no aporta una ganancia enorme. Al menos basta con no arruinarlo.
      No estuve en Citadel, pero he trabajado en I+D cuantitativa y trading durante los últimos 20 años.
  • En la licenciatura tuve que volver a aprender regresión lineal una y otra vez en varias materias. Por supuesto, bajo el supuesto de que se cumplen las condiciones, me parece interesante que su optimalidad pueda demostrarse con teoría estadística y de probabilidades.
    En el doctorado en ciencias de la computación vi sobre todo problemas de regresión que usaban modelos de deep learning. No los trabajé directamente, pero sería bastante interesante si hubiera una forma de trasladar las demostraciones y teoremas rigurosos de los modelos lineales clásicos a modelos de regresión profunda.

  • “Data Analysis from an Elementary Point of View”, de Shalizi, también es un buen material introductorio: https://www.stat.cmu.edu/~cshalizi/ADAfaEPoV/
    Le da mucho peso a los modelos lineales, los modelos aditivos y la simulación, y ese es el rumbo correcto. El 90% del libro no sirve sin una computadora, pero esa es la realidad moderna

  • No parece estar en este artículo, pero en la regresión lineal también aparece el fenómeno de doble descenso, que se ve a menudo en el deep learning
    Para verlo hay que incorporar algún tipo de regularización. Estaría bueno que se agregara esa discusión

    • Me pregunto si se refiere a algún paper en particular. ¿El segundo descenso ocurre después de que el modelo queda sobrerparametrizado, como en las redes neuronales? También me pregunto qué tipo de regularización sería
  • Como alguien que este mes está enseñando regresión con XGBoost, es un artículo muy bueno para leer. A diferencia de muchos textos académicos, está muy bien escrito y es accesible
    Me gustó especialmente el capítulo 6, sobre diagnóstico visual. Está muy bien hecho

  • Parece interesante; me pregunto si alguien sabe cómo convertir este PDF a un formato optimizado para móviles