Propiedades Estadísticas de los Coeficientes Estimados#
El objetivo de esta sección es explorar las propiedades estadísticas de un modelo de regresión simple. En particular, nos ocuparemos de una situación en donde se asume que la relación entre una variable a explicar \(Y\) y una variable explicativa \(X\) está dada por
donde \(\beta_0\) y \(\beta_1\) son los parámetros poblacionales de interés, y \(\varepsilon_i\) es un término de error aleatorio. Consideraremos una muestra de \(n\) observaciones, indexadas por \(i=1,...,n\).
Asumiremos también que, a partir de la muestra de datos, estimamos el modelo mediante el método de Mínimos Cuadrados Ordinarios, obteniendo valores para los estimadores \(\hat{\beta}_0\) y \(\hat{\beta}_1\). La pregunta estadística que nos ocupa es:
¿Qué podemos decir sobre la precisión de los estimadores \(\hat{\beta}_0\) y \(\hat{\beta}_1\)? ¿Qué tan cerca (o lejos) esperamos que se encuentren de los verdaderos valores de \(\beta_0\) y \(\beta_1\)?
1. Objetivos#
Al terminar esta sección, el lector comprenderá tres propiedades fundamentales de los estimadores MCO:
Si los estimadores están centrados en los verdaderos valores poblacionales (insesgadez), o si en promedio sobreestiman o subestiman.
Qué factores determinan cuán dispersas son las estimaciones alrededor del valor verdadero (varianza del estimador).
Cómo estimar esa dispersión a partir de los datos, herramienta esencial para la inferencia estadística.
2. Exploración con simulaciones#
La manera más directa de entender estas propiedades es ponernos en el lugar de alguien que conoce la verdad: asumimos que sabemos el modelo poblacional real y observamos qué ocurre cuando lo estimamos en distintas muestras de datos. Notá que este ejercicio de simulación no es lo que ocurre en la práctica: en la estimación real, típicamente disponés de una única muestra de datos a partir de la cual estimás los parámetros del modelo. Sin embargo, la simulación es poderosa porque permite entender las propiedades de los estimadores: podemos aprender qué valores esperar en promedio, la variabilidad y hasta la distribución de las estimaciones.
Para fijar ideas, imaginemos que el modelo describe las ventas mensuales de campañas publicitarias en función del presupuesto invertido: cada mil dólares adicionales de publicidad generan en promedio 3 miles de dólares en ventas, con una base de 10 y ruido aleatorio \(\varepsilon\). Los parámetros verdaderos — que en la práctica desconoceríamos — los asumimos conocidos en la simulación.
Supongamos que la relación verdadera es \(Y = 10 + 3X + \varepsilon\), con \(\beta_0 = 10\) y \(\beta_1 = 3\) conocidos por nosotros. Generamos 500 muestras independientes de 250 observaciones cada una, estimamos MCO en cada muestra, y guardamos los 500 pares \((\hat{\beta}_0, \hat{\beta}_1)\) resultantes. Luego estudiamos la distribución de esas estimaciones: ¿dónde se concentran? ¿cuánto varían?
La simulación a continuación reproduce este experimento y permite variar los parámetros del modelo poblacional. Al explorarla, prestá atención a:
¿Dónde está centrado el histograma de \(\hat{\beta}_1\)? ¿Se ubica cerca del valor verdadero \(\beta_1 = 3\)?
¿Qué ocurre con la dispersión de las distribuciones cuando aumentás la desviación estándar del error \(\sigma_\varepsilon\)?
¿Qué pasa cuando aumentás la desviación estándar de \(X\) (\(\sigma_X\))? ¿Más variación en \(X\) hace las estimaciones más o menos precisas?
¿Se comportan \(\hat{\beta}_0\) y \(\hat{\beta}_1\) de manera similar, o uno varía más que el otro?
3. ¿Qué observamos?#
Insesgadez. En todas las combinaciones de parámetros, los histogramas de \(\hat{\beta}_0\) y \(\hat{\beta}_1\) están centrados sobre los valores verdaderos (10 y 3, respectivamente). La tabla de estadísticas confirma que la media de las 500 estimaciones es prácticamente idéntica al valor poblacional, independientemente del nivel de ruido o de la dispersión de \(X\). Las estimaciones individuales se alejan del valor verdadero, pero no sistemáticamente en ninguna dirección.
Varianza y ruido del modelo. Al aumentar \(\sigma_\varepsilon\), ambas distribuciones se ensanchan notablemente. Un modelo con más ruido produce estimaciones más dispersas: aunque siguen siendo insesgadas en promedio, cada estimación individual puede estar bastante lejos del valor verdadero.
Varianza y dispersión de \(X\). El efecto de \(\sigma_X\) actúa en sentido contrario: mayor dispersión en \(X\) estrecha la distribución de \(\hat{\beta}_1\). Intuitivamente, un rango más amplio de valores de \(X\) provee más información para identificar la pendiente, reduciendo la incertidumbre sobre \(\beta_1\).
Estos patrones no son coincidencia ni un resultado particular de esta simulación. La teoría estadística los predice con exactitud, como vemos a continuación.
4. Resultados formales#
Insesgadez#
La simulación mostró que las distribuciones de \(\hat{\beta}_0\) y \(\hat{\beta}_1\) están centradas en los valores verdaderos. El resultado formal confirma que esto no es una coincidencia: bajo el supuesto \(E[\varepsilon_i \mid X] = 0\), los estimadores MCO son exactamente insesgados.
Resultado formal:
Estas ecuaciones dicen que, en expectativa, las estimaciones son iguales a los verdaderos valores. En otras palabras: el sesgo es exactamente cero. En muestras repetidas, MCO no sobreestima ni subestima el verdadero parámetro. La demostración formal se encuentra en el apéndice.
Varianza de los estimadores#
La simulación también mostró que mayor \(\sigma_\varepsilon\) amplía las distribuciones y mayor \(\sigma_X\) las estrecha. La fórmula de varianza captura exactamente esta relación:
Resultado formal:
donde \(\sigma^2 = \text{Var}(\varepsilon_i \mid X)\) es la varianza del error. Un mayor error del modelo (\(\sigma^2\) grande) aumenta la varianza del estimador; mayor variabilidad en \(X\) (\(SST_x\) grande) la reduce. La derivación formal se encuentra en el apéndice.
En la práctica, \(\sigma^2\) es desconocido y debe estimarse. Esto se desarrolla a continuación.
5. Estimación de la Varianza de \(\hat{\beta}_1\)#
La fórmula \(\text{Var}(\hat{\beta}_1 \mid X) = \sigma^2 / SST_x\) es exacta pero no aplicable directamente, ya que \(\sigma^2 = \text{Var}(\varepsilon_i \mid X)\) es un parámetro poblacional desconocido. Para realizar inferencia debemos estimarlo a partir de los datos.
Estimación de \(\sigma^2\): Una vez estimado el modelo, observamos los residuos MCO \(\hat{\varepsilon}_i = Y_i - \hat{Y}_i\). Un estimador natural de la varianza del error es el promedio de los residuos al cuadrado, corregido por el número de parámetros estimados:
El divisor es \(n-2\) y no \(n\) porque MCO estima dos parámetros — \(\hat{\beta}_0\) y \(\hat{\beta}_1\) — lo que impone dos restricciones lineales sobre los residuos (su suma es cero y son ortogonales a \(X\)). Dividir por \(n-2\) corrige esto y hace que \(\hat{\sigma}^2\) sea un estimador insesgado de \(\sigma^2\): \(E[\hat{\sigma}^2] = \sigma^2\). La demostración formal se encuentra en el apéndice de la sección siguiente.
Varianza estimada y error estándar: Reemplazando \(\sigma^2\) por \(\hat{\sigma}^2\) obtenemos la varianza estimada de \(\hat{\beta}_1\):
La cantidad \(SE(\hat{\beta}_1)\) — el error estándar del estimador — cumple un papel central en la inferencia. A pesar del nombre, no se refiere a los residuos del modelo; mide la desviación estándar estimada de \(\hat{\beta}_1\) a lo largo de muestras repetidas. Con el error estándar en mano podemos evaluar no solo dónde cae nuestra estimación, sino cuán lejos se encuentra de cualquier valor hipotético en relación con su propia precisión — lo cual es exactamente la lógica del test de hipótesis, desarrollada en la sección siguiente.
Apéndice: Demostraciones formales#
A.1 Insesgadez de \(\hat{\beta}_1\)#
Paso 1 — Reescribir \(\hat{\beta}_1\) en función del error poblacional.
Partimos de la expresión del estimador MCO:
Sustituimos \(Y_i = \beta_0 + \beta_1 x_i + \varepsilon_i\):
Usando que \(\sum_{i=1}^n (x_i - \bar{x}) = 0\) y \(\sum_{i=1}^n (x_i - \bar{x})\,x_i = SST_x\), los términos en \(\beta_0\) desaparecen y el término en \(\beta_1\) se simplifica:
Paso 2 — Tomar la esperanza condicional en \(X\).
La última igualdad sigue del supuesto \(E[\varepsilon_i \mid X] = 0\). Como la esperanza condicional es \(\beta_1\) para cualquier realización de \(X\), se concluye también que \(E[\hat{\beta}_1] = \beta_1\).
Para \(\hat{\beta}_0\), el resultado sigue de manera análoga: dado que \(\hat{\beta}_0 = \bar{Y} - \hat{\beta}_1\bar{x}\), tomando esperanzas y usando \(E[\hat{\beta}_1] = \beta_1\) y \(E[\varepsilon_i \mid X] = 0\) se obtiene \(E[\hat{\beta}_0] = \beta_0\).
A.2 Varianza de \(\hat{\beta}_1\)#
Del Paso 1 anterior sabemos que:
Tomamos la varianza condicional en \(X\). Bajo el supuesto de homocedasticidad, \(\text{Var}(\varepsilon_i \mid X) = \sigma^2\) para todo \(i\), y los errores son independientes entre sí:
La expresión confirma que la precisión del estimador mejora (varianza menor) cuando el error del modelo es pequeño o cuando los datos de \(X\) están más dispersos.