La verdad sobre la regresión lineal en 2015
(stat.cmu.edu)- Basado en las notas del curso Carnegie Mellon 36-401 Modern Regression de otoño de 2015, este es un manuscrito de aprendizaje para quienes aprenden o enseñan regresión lineal
- No deja la regresión lineal atada a los supuestos al estilo de 1960 y reduce el peso de la teoría que depende del ruido gaussiano (Gaussian noise) y de un modelo lineal correctamente especificado
- Da prioridad a las técnicas robustas, aunque sean más intensivas en cómputo, y aclara que el propio manuscrito quizá no haya avanzado lo suficiente en esa dirección
- Se superpone en parte con el segundo capítulo de Advanced Data Analysis from an Elementary Point of View, pero también incluye mucho material nuevo y de nivel más básico
- El índice abarca ampliamente desde predicción óptima, mínimos cuadrados, máxima verosimilitud, diagnóstico, inferencia, multicolinealidad, selección de modelos, mínimos cuadrados ponderados y generalizados, selección de variables, árboles y bootstrap
Naturaleza y enfoque del manuscrito
- Este manuscrito reúne las notas del curso 36-401, Modern Regression, in fall 2015
- Aunque reconoce que ya existe mucho material sobre regresión lineal, se publica al considerar que podría ser útil para quienes aprenden o enseñan el tema
- Desde la perspectiva de que la estadística ha avanzado desde 1960, pone menos énfasis en la teoría apoyada en modelos lineales correctamente especificados y en el ruido gaussiano
- Está organizado con preferencia por técnicas robustas, aunque sean más intensivas en cómputo, y el autor añade que quizá no llegó lo suficientemente lejos en esa dirección
- Se superpone parcialmente con Advanced Data Analysis from an Elementary Point of View, en particular con el segundo capítulo, “The Truth About Linear Regression”
- Al mismo tiempo, incluye mucho material nuevo y de nivel más básico, y se agradecen opiniones y correcciones, especialmente la corrección de errores
Alcance y actualizaciones
- El índice actual va desde el modelado básico de la regresión lineal hasta el diagnóstico, la inferencia y técnicas extendidas
-
Modelado básico y regresión simple
- Optimal Prediction
- Introducing Statistical Modeling
- Simple Linear Regression Models, with Hints at Their Estimation
- The Method of Least Squares for Simple Linear Regression
- The Method of Maximum Likelihood for Simple Linear Regression
- Diagnostics and Modifications for Simple Regression
- Inference on Parameters
- Predictive Inference for the Simple Linear Model
- Interpreting Parameters after Transformation
- F-Tests, R^2, and Other Distractions
- Simple Linear Regression in Matrix Format
-
Regresión múltiple y temas ampliados
- Multiple Linear Regression
- Diagnostics and Inference for Multiple Linear Regression
- Polynomial and Categorical Regression
- Multicollinearity
- Tests and Confidence Sets
- Interactions
- Outliers and Influential Points
- Model Selection
- Review
- Weighted and Generalized Least Squares
- Variable Selection
- Trees
- The Bootstrap I
- The Bootstrap II
- En el futuro, el material sobre linear spatio-temporal estimation and prediction del curso Data Over Space and Time podría incorporarse al manuscrito
- Se mencionan como ejemplos Wiener filter y kriging
- La última actualización del texto fue volver a ejecutar el código tras una actualización de R y corregir erratas, con fecha de 20 de octubre de 2025
1 comentarios
Opiniones de Hacker News
La regresión lineal suele estar subestimada
y = a*sin(x)+bx^2también es un modelo linealOtro punto importante es que a los humanos, especialmente en grupos, racionalmente nos resulta difícil tomar decisiones que no sean lineales
En una reunión para definir el rumbo de una empresa, no queda otra que hablar en términos como “aumentemos el gasto en publicidad y reduzcamos otros costos de adquisición, como cupones de descuento”. Encontrar el equilibrio entre “aumentar la publicidad” y “reducir otros costos” es un modelo lineal simple
Aunque tengas un gran modelo no lineal, lo clave no es tanto la “interpretabilidad” como la posibilidad de llevarlo a la práctica. Si llevas resultados de regresión a una reunión, puedes modelar varias estrategias rápidamente y dar una confianza razonable sobre la dirección a seguir
Me costaba comunicar hacia arriba insights accionables, pero después de entender bien la regresión, se volvió sorprendentemente fácil abrir y entender rápido incluso procesos de negocio bastante complejos
Aun así, rara vez los stakeholders los entendían bien o reconocían su valor. En general creo que era por pereza y costumbre
Un problema que veo a menudo en la literatura es que los autores sobreinterpretan la pendiente de un modelo con término cuadrático, por ejemplo
Y = age + age^2, en los rangos de edad más bajos y más altos. Si uno mira solo la línea del gráfico y no el intervalo de confianza, parece que disminuye en las edades más altas, pero en realidad podría ser una pendiente negativa aparente causada porque el modelo cuadrático no puede representar una asíntota. Ej.: https://www.researchgate.net/figure/Scatter-plot-of-the-quad...)Cuando no había una opción teóricamente definida, usaba polinomios fraccionarios. Por ejemplo, con
x^sys = {−2, −1, −0.5, 0, 0.5, 1, 2, 3}, seguía una estrategia de elegir el polinomio que mejor ajustara evitando el sobreajuste: https://journal.r-project.org/articles/RN-2005-017/RN-2005-0...No es una mala técnica, y también probé otros métodos como regresión polinómica por tramos o puntos de nudo, pero, por ejemplo, no estaba seguro de cómo probar una interacción entre grupos entre dos splines con nudos. Con los modelos aditivos pasaba lo mismo: https://bookdown.org/ssjackson300/Machine-Learning-Lecture-N...
Pero una explicación así quizá oculte más de lo que ayuda. Elegir la transformación adecuada para un caso específico es un problema muy difícil. Queda la pregunta de por qué tendrían que ser
sin(x)yx^2, y notanh(x)yx^(1/2)Siento que me estoy perdiendo algo básico
La técnica más importante en una regresión es reconocer el intercepto. Suena trivial, y en la práctica también lo es, pero cambia cuando empiezas a incluir interacciones entre términos. He visto a muchísimos estudiantes jóvenes de posgrado equivocarse con esto.
Pensemos en un modelo lineal simple que usa puntaje de prueba, edad (7 a 16 años) y una variable categórica binaria de diagnóstico de autismo (0=grupo control, 1=autismo):
score = age + diagnosis + age:diagnosis, es decir,score = (X1)age + (X2)diagnosis + (X3)age:diagnosis.Si
X2es significativo, un estudiante ingenuo diría “¡hay una diferencia entre grupos!”, pero se le escapa que eso es la diferencia de grupo predicha cuando el participante tiene 0 años. La edad debería centrarse en la media, la mediana o, mejor aún, en la edad de interés. Cuando una interacción entra en la ecuación, todas las estimaciones de parámetros de “orden inferior” se interpretan con respecto al intercepto.También podrías ver que el efecto de la edad es significativo y pensar que se aplica a ambos grupos, pero
X1solo indica la pendiente predicha para el grupo de referencia, el grupo control. La interacción prueba si las pendientes por edad difieren entre los dos grupos. Además, aunque la interacción no sea significativa, el efecto de la edad en el grupo con autismo podría no ser significativamente distinto de 0. Si los datos están en una zona ambigua, hay que tener cuidado al interpretarlos.Para algunos esto parecerá obvio, pero entender correctamente el espacio condicional de los parámetros cuando hay términos de interacción requiere esfuerzo. Aquí dejé de lado por ahora la forma de codificar los grupos, por ejemplo si es respecto de la media general o tomando un grupo como referencia, pero la lección se mantiene. Hay que entender qué significa el intercepto y a quién/qué apunta.
También existe ExploreModelMatrix para ayudar con esto: https://www.bioconductor.org/packages/release/bioc/html/Expl...
Si eres un bayesiano fuerte que odia los valores p, también está bien. Pero he visto que incluso estudiantes inteligentes tienen dificultades para interpretar de forma natural modelos con términos de interacción, y quería apuntar en la dirección correcta.
X1solo indica la pendiente predicha para el grupo de referencia, el grupo control”. Tal como está escrita la ecuación,X1es el valor para todo el grupo. No creaste variables dummy adecuadas.X1*age*isControl+X2*isControl+X3*isAutism+X4*isAutism*age+X5*ageAsí puedes separar el efecto de la edad en los dos grupos y el efecto de la edad común a ambos.
Una carga significativa de la variable de diagnóstico
X2no te dice el efecto del diagnóstico a una edad específica. Salvo que sí lo hace a los 0 años de edad.Hay que volver a centrar el modelo respecto de la edad de interés.
Hace 10 años tomé 36-401 y 36-402 en CMU, y en ese entonces Shalizi los impartía; ambos fueron muy buenos cursos de estadística. Para bien o para mal, te obligaban a aprender base R.
Una gran debilidad de la regresión lineal era que las suposiciones académicas necesarias para interpretar válidamente los coeficientes son fáciles de hacer en pequeños datasets didácticos, pero casi nunca aplican a datos reales desordenados; lo aprendí por las malas.
Si no la tienes, hay que reflejar las respuestas correlacionadas con un modelo de efectos mixtos, o bien agregar las respuestas promediándolas. Calcular promedios reduce la varianza, pero también reduce la cantidad de puntos de datos, y en el cálculo del estadístico t de la prueba de Wald esos dos efectos se cancelan entre sí.
En cuanto a otras suposiciones, como la normalidad de los residuos, los modelos lineales a menudo toleran cierto grado de violación. Aun así, siempre conviene entender qué efecto tienen esas violaciones, por ejemplo corriendo simulaciones o mirando el histograma de valores p de datos nulos.
Me gusta que la regresión ridge se presente en el contexto de la multicolinealidad.
Hoy en día parece que casi todos la aprenden como una técnica de regularización para evitar el sobreajuste, pero uno de sus usos fundamentales, y quizá su origen, es repartir los pesos de manera equilibrada entre predictores fuertemente correlacionados o casi linealmente dependientes. Incluso con suficientes datos, ese tipo de predictores puede causar grandes problemas.
Me gustaría ver a alguien como un investigador cuantitativo de Citadel enseñando regresión lineal. Me da curiosidad cómo la usan, en particular qué cosas les preocupan, y si hay resultados teóricos que cambien de manera significativa su forma de ver los problemas.
En el problema relacionado de estimar matrices de covarianza, las variantes con shrinkage son populares. La más simple es el Linear Shrinkage de Ledoit-Wolf.
Dejando de lado las redes neuronales, creo que la mayoría de quienes hacen regresión usan regresión lineal con este tipo de ajustes adaptados al dominio.
En finanzas en particular, es demasiado fácil engañarse con modelos más complejos.
x'*yno bastara, dividir por el producto internox'*xquedara justo (regresión), y dividir una vez más por otro producto internoy'*y, incluyendo además una raíz cuadrada, ya se sintiera excesivo porque da el coeficiente de correlación.Lamentablemente no hay un gran secreto ni una revelación espectacular. Como dijo Jim Simons en la entrevista con Numberphile, se trata de ir acumulando señales débiles lenta y dolorosamente, y de construir y mejorar muchas cajas del sistema. Mientras tanto, las interfaces son en general conocidas.
Dentro del panorama completo, el método de ajuste en sí no aporta una ganancia enorme. Al menos basta con no arruinarlo.
No estuve en Citadel, pero he trabajado en I+D cuantitativa y trading durante los últimos 20 años.
En la licenciatura tuve que volver a aprender regresión lineal una y otra vez en varias materias. Por supuesto, bajo el supuesto de que se cumplen las condiciones, me parece interesante que su optimalidad pueda demostrarse con teoría estadística y de probabilidades.
En el doctorado en ciencias de la computación vi sobre todo problemas de regresión que usaban modelos de deep learning. No los trabajé directamente, pero sería bastante interesante si hubiera una forma de trasladar las demostraciones y teoremas rigurosos de los modelos lineales clásicos a modelos de regresión profunda.
“Data Analysis from an Elementary Point of View”, de Shalizi, también es un buen material introductorio: https://www.stat.cmu.edu/~cshalizi/ADAfaEPoV/
Le da mucho peso a los modelos lineales, los modelos aditivos y la simulación, y ese es el rumbo correcto. El 90% del libro no sirve sin una computadora, pero esa es la realidad moderna
No parece estar en este artículo, pero en la regresión lineal también aparece el fenómeno de doble descenso, que se ve a menudo en el deep learning
Para verlo hay que incorporar algún tipo de regularización. Estaría bueno que se agregara esa discusión
Como alguien que este mes está enseñando regresión con XGBoost, es un artículo muy bueno para leer. A diferencia de muchos textos académicos, está muy bien escrito y es accesible
Me gustó especialmente el capítulo 6, sobre diagnóstico visual. Está muy bien hecho
Parece interesante; me pregunto si alguien sabe cómo convertir este PDF a un formato optimizado para móviles