Regresión lineal simple#
Una empresa de tecnología quiere saber si vale la pena invertir más en publicidad digital. Tiene datos de 140 campañas pasadas: cuánto gastó en publicidad (en miles de dólares) y cuánto generó en ingresos (también en miles de dólares). La pregunta es simple: ¿más presupuesto implica más ingresos? Y si es así, ¿cuánto?
La regresión lineal simple es la herramienta estadística que permite responder esa pregunta de forma rigurosa. En esta sección vamos a construir el modelo paso a paso, empezando por la intuición visual y llegando a las fórmulas.
El modelo de regresión lineal#
Hasta aquí hemos propuesto caracterizar la relación entre nuestra variable de interés explicativa \(X\) y el resultado \(Y\) a través de una función desconocida \(F\):
La ecuación del modelo de regresión lineal simple no es más que una forma compacta de escribir esa historia.
Un supuesto simplificador para poder estimar la forma de \(F\) es suponer que su forma es lineal.
La escribiremos así:
Lejos de ser una expresión abstracta, cada término cumple un papel concreto e intuitivo.
Y — Variable explicada#
La letra \(Y\), variable explicada, representa aquello que queremos comprender, describir o anticipar.
Es la variable cuyo comportamiento observamos y tratamos de resumir. En nuestro ejemplo, \(Y\) son los ingresos generados por una campaña publicitaria (en miles de USD). Más generalmente:
el salario de un empleado en la industria tecnológica
los ingresos generados por una campaña publicitaria digital
la tasa de retención de usuarios de una aplicación
En el modelo, \(Y\) no es un número fijo, sino una variable que cambia entre observaciones.
X — Variable explicativa#
La letra \(X\), variable explicativa, representa la variable con la que asociamos el comportamiento de \(Y\). En nuestro ejemplo, \(X\) es el presupuesto invertido en publicidad (en miles de USD). Puede ser:
años de experiencia en la industria (asociado con el salario)
presupuesto invertido en publicidad (asociado con los ingresos)
horas de uso semanal de la aplicación (asociado con la retención)
Llamaremos regresión simple a la que se limita a una sola variable explicativa. En el próximo capítulo lo extenderemos al modelo con múltiples variables. En este caso, un modelo reducido nos permitirá entender paso a paso la lógica del modelo.
De acuerdo con lo desarrollado en el capítulo introductorio, \(X\) es una variable aleatoria. Cada observación \((X_i, Y_i)\) es una realización de una distribución conjunta, y el modelo describe cómo la distribución de \(Y\) cambia en función del valor que toma \(X\).
\(\beta_0\) — Intercepto#
El parámetro \(\beta_0\), intercepto, indica el valor promedio de \(Y\) cuando \(X\) es igual a cero.
Puede pensarse como un punto de partida. En algunos contextos tiene una interpretación clara, como el costo fijo de un servicio. En otros, es simplemente un elemento técnico necesario para que la recta se ubique correctamente. Lo importante no es siempre su significado literal, sino su función: anclar la recta en el plano.
\(\beta_1\) — Pendiente#
El parámetro \(\beta_1\) mide cómo cambia \(Y\) cuando \(X\) aumenta en una unidad, en promedio. Es la formalización de la pregunta que nos interesa: ¿Qué suele pasar con \(Y\) si \(X\) aumenta un poco?
Si \(\beta_1\) es positivo, \(Y\) tiende a aumentar cuando \(X\) aumenta. Si es negativo, ocurre lo contrario. Si es cercano a cero, la asociación es débil o inexistente. Bajo ciertas condiciones adicionales que serán más claras cuando incorporemos un modelo de causalidad, podremos interpretar que \(\beta_1\) no solo mide una asociación sino también el efecto causal de interés.
\(\varepsilon\) — Error#
Si la recta describiera exactamente todas las observaciones, no necesitaríamos econometría. La realidad, sin embargo, es más compleja.
El término \(\varepsilon\) recoge todo aquello que afecta a \(Y\) y no está incluido en \(X\):
diferencias individuales
factores no observados
mediciones imperfectas
simple azar
En lugar de ver el error como un fracaso del modelo, conviene entenderlo como un reconocimiento explícito de que el mundo no es determinista.
La necesidad de un criterio de estimación#
El modelo está planteado. Conocemos su estructura: \(Y = \beta_0 + \beta_1 X + \varepsilon\). Pero \(\beta_0\) y \(\beta_1\) son desconocidos. Para estimarlos necesitamos datos y un criterio que nos diga qué recta es la «mejor» dada la muestra.
La idea más natural es exigir que la recta cometa los menores errores posibles en el conjunto de observaciones. Para cada candidato \((\beta_0, \beta_1)\), la recta genera predicciones \(\hat{Y}_i = \beta_0 + \beta_1 X_i\) y residuos muestrales:
Una medida natural del error total es la suma de cuadrados de los residuos (RSS, por residual sum of squares):
¿Por qué elevar al cuadrado? Por dos razones prácticas: primero, los errores positivos y negativos no se cancelan —si no se elevara al cuadrado, una recta que sobreestima tanto como subestima parecería perfecta—; segundo, el cuadrado penaliza los errores grandes de forma desproporcionada.
El RSS es el costo agregado de los errores que comete la recta sobre la muestra. El criterio que adoptaremos consiste en elegir los parámetros \((\beta_0, \beta_1)\) que lo minimizan. Antes de ver la solución analítica, vale la pena sentir el problema de forma interactiva.
Exploración interactiva: encontrá la mejor recta#
Antes de ver la fórmula, conviene sentir el problema. El dashboard a continuación muestra las 140 campañas publicitarias: cada punto es una observación \((X_i, Y_i)\). Vos controlás los dos parámetros de la recta, \(\beta_0\) y \(\beta_1\), y podés ver cómo cambia el RSS a medida que la movés.
Tarea: intentá encontrar los valores de \(\beta_0\) y \(\beta_1\) que minimizan el RSS. Después usá el botón «Mostrar solución MCO» para ver si te acercaste.
¿Qué observamos?#
El intercepto y la pendiente actúan de forma distinta. Mover \(\beta_0\) desplaza la recta verticalmente sin cambiar su inclinación; mover \(\beta_1\) la rota alrededor de un punto. Ambos afectan el RSS, pero de maneras distintas.
El RSS mide el «costo total» de los errores. Una recta que se aleja poco de la nube en muchos puntos puede tener un RSS mayor que una que se aleja mucho en pocos puntos, porque el cuadrado penaliza los errores grandes de forma desproporcionada.
La solución MCO no «pasa por todos los puntos». La recta óptima es la que minimiza la distancia cuadrática total, no la que toca la mayor cantidad de puntos.
La superficie del RSS (opcional)#
El dashboard anterior permitía explorar el RSS para un par \((\beta_0, \beta_1)\) a la vez. Pero deja sin responder una pregunta importante: ¿cómo se ve el RSS a medida que variamos sistemáticamente todos los pares posibles?
La búsqueda del mínimo del RSS tiene propiedades valiosas: existe un único mínimo global —no hay dos rectas que empaten— y ese mínimo puede identificarse analíticamente sin necesidad de explorar la superficie punto por punto. El siguiente dashboard visualiza exactamente eso: el RSS para todos los pares \((\beta_0, \beta_1)\) posibles simultáneamente, como un mapa de calor en el espacio de parámetros.
Cada punto del mapa corresponde a una recta diferente. El color indica el valor del RSS: más oscuro = más error. La estrella dorada marca el mínimo global, que es exactamente la solución MCO.
Insight clave: La forma de cuenco de la superficie confirma visualmente lo que la derivación analítica garantiza: hay un único punto donde el RSS es mínimo, y MCO lo encuentra directamente.
Estimación del modelo#
Mínimos Cuadrados Ordinarios (MCO)#
Tenemos \(n\) observaciones \((X_1, Y_1), \ldots, (X_n, Y_n)\). El criterio MCO elige los valores de \(\beta_0\) y \(\beta_1\) que minimizan la suma de cuadrados de los residuos:
Derivando el RSS respecto a cada parámetro e igualando a cero se obtiene la solución cerrada:
La derivación completa —incluyendo las condiciones de primer orden y la verificación de que se trata de un mínimo— se presenta en el Apéndice: Demostración de TSS = ESS + RSS.
Una segunda motivación: el Método de los Momentos#
Los mismos estimadores pueden derivarse desde una perspectiva completamente diferente, que parte de las condiciones que el modelo impone sobre el error en la población.
Supuesto central: \(E[\varepsilon \mid X] = 0\)
Esto significa que, en promedio, el error no depende del valor que tome \(X\). Intuitivamente, los factores omitidos en \(\varepsilon\) no deben estar sistemáticamente relacionados con \(X\).
En nuestro ejemplo: el presupuesto publicitario no debería estar correlacionado con factores no observados que también afecten los ingresos —como la estacionalidad o la calidad del producto—. Si lo estuviera, el supuesto se violaría.
De este supuesto se derivan dos condiciones de momentos:
Condición 1: \(E[\varepsilon] = 0\) — en promedio, el modelo no sobreestima ni subestima sistemáticamente.
Condición 2: \(E[\varepsilon X] = 0\) — el error y la variable explicativa no están correlacionados.
Una nota sobre causalidad. La estimación del modelo por sí sola no garantiza una interpretación causal de \(\hat{\beta}_1\). Si una variable relevante afecta a \(Y\) y está correlacionada con \(X\), queda dentro de \(\varepsilon\), lo que viola la Condición 2. Las condiciones bajo las cuales \(\hat{\beta}_1\) puede interpretarse causalmente se estudiarán en el capítulo sobre sesgo por variable omitida.
La idea del Método de los Momentos (MoM) es reemplazar las esperanzas poblacionales por sus análogos muestrales. A partir de las dos condiciones anteriores obtenemos un sistema de dos ecuaciones con dos incógnitas.
Condición 1: \(E[\varepsilon] = 0 \Rightarrow E[Y - \beta_0 - \beta_1 X] = 0\)
Condición 2: \(E[\varepsilon X] = 0 \Rightarrow E[(Y - \beta_0 - \beta_1 X)X] = 0\)
Restando \(E[X] \times (1)\) de \((2)\):
De \((1)\): \(\beta_0 = E[Y] - \beta_1 E[X]\)
Reemplazando las esperanzas poblacionales por sus análogos muestrales obtenemos los estimadores de MoM, que resultan ser idénticos a los de MCO. Esto no es una coincidencia: bajo el supuesto \(E[\varepsilon \mid X] = 0\), ambas vías llevan al mismo resultado.
Interpretación de los estimadores#
La expresión de \(\hat{\beta}_1\) puede escribirse como:
Es decir, la pendiente estimada compara cuánto varían \(X\) y \(Y\) juntas con cuánto varía \(X\) por sí sola. Si \(X\) y \(Y\) tienden a moverse en el mismo sentido, el numerador es positivo y la pendiente también lo será. Si no existe asociación sistemática, el numerador es cercano a cero.
La pendiente estimada es, por lo tanto, una medida resumida de cómo se mueven juntas \(X\) y \(Y\).
Una vez determinada la pendiente, el intercepto se elige de manera que la recta pase por el punto promedio de los datos: cuando \(X\) toma su valor medio, la predicción coincide con el valor medio de \(Y\).
Bondad del ajuste#
Hasta ahora, hemos aprendido a trazar la «mejor» relación lineal posible dada la muestra de datos a nuestro alcance. Hemos minimizado las distancias para obtener una recta que, matemáticamente, es la más eficiente. Sin embargo, en econometría, ser «el mejor» no siempre significa ser «suficiente» para explicar un fenómeno. Esto nos lleva a una pregunta fundamental:
¿Cuánto del comportamiento de \(Y\) puede explicar nuestro modelo?
Llamaremos bondad de ajuste del modelo a una medida de qué tanto capturamos del comportamiento de la variable a explicar con el modelo ofrecido.
Evaluar la calidad del ajuste no consiste en verificar si la recta es «correcta» —en ciencias sociales, ninguna recta lo es perfectamente—, sino en cuantificar qué tan informativa resulta. En términos técnicos, estamos descomponiendo el fenómeno en dos partes:
La parte explicada: El movimiento de los datos que nuestra teoría predice con éxito.
El residuo: El misterio, el azar o todos los factores que no incluimos en nuestro modelo.
Suma de cuadrados total (TSS)#
Antes de introducir la recta, nuestra mejor predicción para cualquier observación de \(Y\) es su promedio \(\bar{Y}\). La dispersión de los datos alrededor de ese promedio representa todo lo que «hay para explicar»: es la variabilidad total de \(Y\).
La medimos con la Suma de Cuadrados Total (TSS, por sus siglas en inglés):
Una TSS grande indica que \(Y\) es muy variable y que el promedio es una descripción pobre de los datos. Una TSS pequeña indica lo contrario. El objetivo del modelo es reducir esa incertidumbre inicial usando la información de \(X\).
Descomposición de la suma de cuadrados#
Para cada observación, al introducir la recta estimada \(\hat{Y}_i = \hat{\beta}_0 + \hat{\beta}_1 X_i\), podemos escribir la identidad algebraica:
La desviación total de cada punto respecto al promedio se descompone en dos partes: lo que la recta explica y lo que no.
Al elevar al cuadrado y sumar sobre todas las observaciones obtenemos tres cantidades:
Suma de Cuadrados Total (TSS):
La variación total de \(Y\); el punto de partida.
Suma de Cuadrados Explicada (ESS):
La parte de la variación que el modelo logra capturar.
Suma de Cuadrados Residual (RSS):
La parte que el modelo no pudo explicar.
La identidad fundamental es que estas tres cantidades se relacionan exactamente así:
Esta igualdad se cumple siempre que el modelo incluya un intercepto. Se puede demostrar algebraicamente a partir de las propiedades del estimador MCO (ver Apéndice: Demostración de TSS = ESS + RSS).
El Coeficiente de Determinación (\(R^2\))#
A partir de la identidad fundamental surge la medida de ajuste más utilizada en econometría: el \(R^2\) (R-cuadrado). Mide qué proporción de la variación total de \(Y\) es explicada por el modelo:
El valor de \(R^2\) siempre oscila entre 0 y 1:
\(R^2 = 0\): El modelo no tiene poder explicativo. La recta es horizontal y la información de \(X\) no aporta nada.
\(R^2 = 1\): Ajuste perfecto; todos los puntos caen exactamente sobre la recta. En ciencias sociales esto es prácticamente imposible y, si ocurre, suele indicar un error de especificación.
Por ejemplo, un \(R^2 = 0.60\) significa que el modelo explica el 60% de la variación muestral de \(Y\); el 40% restante queda en el residuo.
Advertencias sobre el \(R^2\)#
Ajuste no es causalidad. Un \(R^2\) alto indica que \(X\) y \(Y\) se mueven juntas de forma predecible, no que una cause a la otra. Las ventas de helados y los incendios forestales pueden tener un \(R^2\) elevado porque ambas crecen en verano; eso no implica causalidad.
Un \(R^2\) bajo no invalida un modelo. En ciencias sociales, un \(R^2\) de 0.20 o 0.30 puede ser un resultado sólido si el interés está en el efecto marginal \(\hat{\beta}_1\) y este es estadísticamente significativo. El \(R^2\) mide ajuste, no la relevancia de los coeficientes.
El \(R^2\) crece mecánicamente con el rango de \(X\). Si ampliamos el rango de la variable independiente, el \(R^2\) tiende a subir aunque la relación subyacente no haya cambiado.
Con las definiciones formales establecidas, el siguiente dashboard te invita a explorar cómo cambia el \(R^2\) cuando modificás el nivel de ruido (\(\sigma\)), el tamaño del efecto (\(\beta_1\)) y el tamaño de muestra (\(n\)) en el modelo de generación de datos. Podés definir distintos modelos poblacionales verdaderos y observar qué \(R^2\) obtendría un estimador MCO en esa situación.
¿Qué observamos?#
El ruido domina el \(R^2\). Con \(\sigma\) alto y \(\beta_1\) bajo, el \(R^2\) colapsa hacia cero aunque el efecto sea real. El modelo lineal sigue siendo el mejor disponible, pero la señal se pierde en el ruido.
Un \(R^2\) alto no implica un efecto grande. Con \(\beta_1 = 0\) y \(\sigma\) bajo (poco ruido), el \(R^2\) puede ser alto porque los datos varían muy poco y la recta los «sigue» de cerca. Eso no es evidencia de una relación fuerte.
El tamaño de muestra casi no afecta el \(R^2\). A diferencia de la precisión de los estimadores, el \(R^2\) mide el ajuste del modelo y no depende mayormente de cuántas observaciones tenemos.
TSS = ESS + RSS siempre. La barra apilada lo ilustra visualmente: lo que el modelo explica (ESS, en azul) más lo que no explica (RSS, en naranja) siempre suma la variación total (TSS).
Apéndice: Demostración de \(TSS = ESS + RSS\)#
Propiedades del estimador MCO#
El estimador MCO se obtiene minimizando \(RSS = \sum_{i=1}^n (Y_i - \beta_0 - \beta_1 X_i)^2\). Las condiciones de primer orden generan dos propiedades algebraicas que son clave para la demostración.
Propiedad 1 (P1): \(\displaystyle\sum_{i=1}^n \hat{\varepsilon}_i = 0\)
Derivando el RSS respecto a \(\beta_0\) e igualando a cero:
En promedio, los residuos son exactamente cero. La recta no sobreestima ni subestima sistemáticamente.
Propiedad 2 (P2): \(\displaystyle\sum_{i=1}^n X_i\,\hat{\varepsilon}_i = 0\)
Derivando el RSS respecto a \(\beta_1\) e igualando a cero:
Los residuos son ortogonales a la variable explicativa.
Propiedad 3 (P3, derivada de P1 y P2): \(\displaystyle\sum_{i=1}^n \hat{Y}_i\,\hat{\varepsilon}_i = 0\)
Como \(\hat{Y}_i = \hat{\beta}_0 + \hat{\beta}_1 X_i\), es una combinación lineal de las dos cantidades que ya sabemos que son ortogonales a \(\hat{\varepsilon}_i\):
Demostración#
Punto de partida. Por definición del residuo, \(\hat{\varepsilon}_i = Y_i - \hat{Y}_i\), de modo que:
Paso 1: elevar al cuadrado y sumar.
Expandiendo el cuadrado del binomio:
Paso 2: mostrar que el término cruzado es cero.
Paso 3: concluir.
La igualdad \(TSS = ESS + RSS\) descansa enteramente en las propiedades algebraicas del estimador MCO: el hecho de que los residuos sumen cero (P1) y sean ortogonales a los valores ajustados (P3). Ambas propiedades son consecuencia directa de minimizar la suma de cuadrados e incluir un intercepto en el modelo.