Heterocedasticidad: Consecuencias, Diagnóstico e Inferencia Robusta#

En nuestra discusión sobre las propiedades estadísticas de los estimadores MCO mostramos que la varianza de \(\hat{\beta}_1\) depende de la varianza del término de error: \(\text{Var}(\hat{\beta}_1 \mid X) = \sigma^2 / SST_x\). Este resultado, y los errores estándar que de él se derivan, resultó esencial para realizar tests de hipótesis e intervalos de confianza.

Sin embargo, al derivar esa fórmula recurrimos a un supuesto que, aunque conveniente, puede resultar poco realista en la práctica: que la varianza del error es la misma para todas las observaciones. Los econometristas llaman a esto homocedasticidad.

En muchas aplicaciones empíricas este supuesto es difícil de sostener. La varianza del término de error suele estar vinculada al nivel de las variables explicativas, al tamaño de las unidades analizadas o al grupo al que pertenece cada observación. Algunos ejemplos:

  • Gasto e ingreso: Los hogares con mayor ingreso gastan más en promedio, pero también exhiben mayor variabilidad en sus decisiones de consumo. Un hogar que gana $5.000 mensuales puede gastar entre $3.000 y $7.000; uno que gana $50.000 tiene un rango de gasto plausible mucho más amplio.

  • Salarios y tamaño de empresa: Las empresas pequeñas exhiben menor dispersión salarial que las grandes multinacionales, donde los salarios varían enormemente según el rol y la antigüedad.

  • Datos entre países: Las tasas de crecimiento de economías grandes y diversificadas tienden a ser más estables que las de economías pequeñas y dependientes de materias primas.

En todos estos casos, la varianza del error no es constante: varía sistemáticamente con los regresores. ¿Cómo afecta esta imagen más realista a nuestras estimaciones? ¿Importa para la inferencia? ¿Y qué podemos hacer al respecto?

En esta sección exploramos la heterocedasticidad: el caso en que la varianza del error difiere entre observaciones. Veremos que las estimaciones puntuales de MCO siguen siendo insesgadas, pero que la eficiencia y la inferencia se ven afectadas, y aprenderemos a detectar el problema y a restaurar inferencia válida.


1. Objetivos#

Al terminar esta sección, el lector comprenderá:

  • Qué es la heterocedasticidad y por qué surge naturalmente en datos económicos.

  • Qué le ocurre a los estimadores MCO cuando la varianza del error no es constante: qué se preserva y qué se rompe.

  • Cómo detectar heterocedasticidad mediante inspección visual y tests formales.

  • Cómo corregir el problema usando errores estándar robustos (HC) y Mínimos Cuadrados Ponderados (MCP).


2. ¿Qué es la heterocedasticidad?#

El modelo de regresión lineal estándar supone que la varianza del error es la misma para todas las observaciones:

\[\text{Var}(\varepsilon_i \mid X_i) = \sigma^2 \quad \text{para todo } i\]

Este supuesto se llama homocedasticidad. La heterocedasticidad es su violación:

\[\text{Var}(\varepsilon_i \mid X_i) = \sigma_i^2\]

donde \(\sigma_i^2\) varía entre observaciones. En la práctica, los patrones más comunes son:

  • Varianza proporcional a \(X_i\): hogares con mayor ingreso tienen gasto más variable.

  • Varianza proporcional a \(X_i^2\): la dispersión crece cuadráticamente con la variable explicativa.

  • Varianza diferente por grupos: hombres y mujeres, países desarrollados y en desarrollo, empresas grandes y pequeñas.

Si bien la heterocedasticidad puede adoptar muchas formas, uno de los ejemplos más comunes es precisamente el gráfico de residuos en forma de embudo: a medida que aumentan los valores ajustados (o los valores de \(X\)), la dispersión de los residuos también aumenta. Bajo homocedasticidad, esa banda vertical sería constante. El siguiente dashboard te permite explorar visualmente este patrón antes de adentrarte en sus consecuencias formales:

  • Alternará entre la estructura homocedástica y la heterocedástica y observará cómo cambia la forma del gráfico de residuos contra valores ajustados.

  • Bajo heterocedasticidad, notará cómo el embudo se abre hacia la derecha: la dispersión de los residuos crece con \(X\).

  • Bajo homocedasticidad, la dispersión vertical permanece aproximadamente constante en todos los valores ajustados.


3. Explorando las consecuencias con simulaciones#

La forma más directa de entender qué hace la heterocedasticidad es ponernos en el lugar de alguien que conoce la verdad. La siguiente simulación genera datos bajo dos estructuras de error —homocedástica y heterocedástica— y estima el modelo en 500 muestras repetidas. Antes de leer los resultados formales, explorá la simulación prestando atención a cuatro preguntas:

  1. Alternará entre estructura homocedástica y heterocedástica. ¿Qué cambia en el gráfico de dispersión y en los gráficos de residuos?

  2. Mirá el histograma de la distribución muestral de \(\hat{\beta}_1\). ¿Cambia el centro? ¿Cambia la dispersión?

  3. Mirá el histograma de la distribución muestral de \(\widehat{\text{Var}(\hat{\beta}_1)}\). ¿El centro coincide con la varianza de las estimaciones observadas a lo largo de las simulaciones?

  4. Observá los intervalos de confianza que surgen de las simulaciones: ¿con qué frecuencia contienen el verdadero valor de \(\beta_1\)?

¿Qué observamos?#

La estimación puntual no se ve afectada. El histograma de \(\hat{\beta}_1\) permanece centrado en el valor verdadero \(\beta_1 = 3\) tanto bajo homocedasticidad como bajo heterocedasticidad. Estimar mal la varianza no introduce sesgo en el estimador de la pendiente.

La distribución se ensancha. Bajo heterocedasticidad, la distribución de \(\hat{\beta}_1\) es más dispersa. MCO sigue siendo insesgado, pero pierde precisión: cada estimación individual puede estar más lejos del valor verdadero.

La varianza estimada es sesgada. El centro del histograma de \(\widehat{\text{Var}(\hat{\beta}_1)}\) no coincide con la varianza real de la distribución muestral. La fórmula convencional sobreestima o subestima la verdadera incertidumbre según el patrón específico de heterocedasticidad.

La cobertura cae por debajo del 95%. Como consecuencia directa, los intervalos de confianza construidos con la fórmula estándar ya no cubren el valor verdadero el 95% de las veces. El error estándar convencional es incorrecto, lo que invalida los tests de hipótesis, los intervalos de confianza y los p-valores.


4. Resultados formales: por qué MCO falla (pero solo en parte)#

4.1 La insesgadez se preserva#

La demostración de insesgadez de MCO solo requiere \(E[\varepsilon_i \mid X] = 0\), no varianza constante. Por lo tanto:

\[E[\hat{\beta}_1 \mid X] = \beta_1\]

independientemente de si los errores son homocedásticos o heterocedásticos. Esto explica por qué el histograma de \(\hat{\beta}_1\) en la simulación no se desplaza. La derivación formal, que hace explícito que el supuesto de homocedasticidad no juega ningún papel, se encuentra en el apéndice.

4.2 Los errores estándar son incorrectos#

La fórmula convencional \(\widehat{\text{Var}}(\hat{\beta}_1) = \hat{\sigma}^2/SST_x\) supone que todas las observaciones comparten la misma varianza \(\sigma^2\). Cuando \(\sigma_i^2\) varía entre observaciones, la varianza correcta de \(\hat{\beta}_1\) en el caso de regresión simple es:

\[\text{Var}(\hat{\beta}_1 \mid \mathbf{X}) = \frac{\sum_{i=1}^n (x_i - \bar{x})^2 \, \sigma_i^2}{SST_X^2}\]

La derivación se encuentra en el apéndice. Esta expresión no se simplifica a \(\sigma^2/SST_X\) porque el numerador pondera cada desviación al cuadrado \((x_i - \bar{x})^2\) por la varianza específica de la observación \(\sigma_i^2\). El resultado depende de cómo se alinee la estructura de varianza con la distribución de \(X\), algo que la fórmula convencional ignora por completo.

Para el caso de regresión múltiple, la varianza correcta adopta la forma matricial conocida como el estimador sándwich:

\[\text{Var}(\hat{\boldsymbol{\beta}} \mid \mathbf{X}) = (\mathbf{X}'\mathbf{X})^{-1} \left(\sum_{i=1}^n \sigma_i^2 \mathbf{x}_i \mathbf{x}_i'\right) (\mathbf{X}'\mathbf{X})^{-1}\]

El «relleno» del sándwich —la suma ponderada por \(\sigma_i^2\)— no se simplifica a \(\sigma^2 (\mathbf{X}'\mathbf{X})\) salvo que la varianza sea constante. La dirección del sesgo en la fórmula convencional depende del patrón específico de heterocedasticidad y no es predecible sin información adicional.

La consecuencia práctica es directa: los estadísticos \(t\), los estadísticos \(F\), los p-valores y los intervalos de confianza calculados con la fórmula estándar son todos incorrectos cuando hay heterocedasticidad.

4.3 La eficiencia se pierde#

Bajo homocedasticidad, el Teorema de Gauss-Markov garantiza que MCO es el Mejor Estimador Lineal Insesgado (MELI): tiene la menor varianza entre todos los estimadores lineales insesgados. Ese resultado depende crucialmente del supuesto de varianza constante.

Bajo heterocedasticidad, MCO sigue siendo lineal e insesgado, pero ya no es el más eficiente. Existe un estimador —Mínimos Cuadrados Ponderados— con menor varianza. Volvemos sobre esto en la sección 6.


5. Diagnóstico de la heterocedasticidad#

5.1 Gráficos de residuos#

El gráfico de residuos contra valores ajustados (o contra \(X\)) es la herramienta de diagnóstico visual principal. Un patrón de embudo —dispersión que crece con los valores ajustados— señala heterocedasticidad. También es útil el gráfico de \(|\hat{\varepsilon}_i|\) o \(\hat{\varepsilon}_i^2\) contra los valores ajustados.

Esta es una herramienta de tamizado: el ojo puede engañarse, especialmente en muestras pequeñas. Un patrón aparente puede ser ruido aleatorio; una heterocedasticidad moderada puede no ser visible. Los tests formales complementan la inspección visual.

5.2 Tests formales#

Ambos tests a continuación tienen la misma hipótesis nula: homocedasticidad (\(\sigma_i^2 = \sigma^2\) para todo \(i\)).

Test

Regresión auxiliar

Estadístico

Distribución bajo \(H_0\)

Mejor para

Breusch-Pagan

\(\hat{\varepsilon}_i^2\) sobre los regresores

\(n \cdot R^2_{\text{aux}}\)

\(\chi^2(k)\)

Patrones lineales de heterocedasticidad

White

\(\hat{\varepsilon}_i^2\) sobre regresores, sus cuadrados y productos cruzados

\(n \cdot R^2_{\text{aux}}\)

\(\chi^2(p)\) con más \(p\)

Patrones generales (lineales y no lineales)

Procedimiento común a ambos:

  1. Estimar MCO y obtener los residuos \(\hat{\varepsilon}_i\).

  2. Calcular \(\hat{\varepsilon}_i^2\) para cada observación.

  3. Regresar \(\hat{\varepsilon}_i^2\) sobre las variables indicadas en la tabla.

  4. Calcular \(n \cdot R^2\) de esa regresión auxiliar y compararlo con la distribución \(\chi^2\).

Rechazar la nula confirma que hay heterocedasticidad; no nos dice su forma. Esa asimetría importa para la elección del remedio, como vemos a continuación.

El siguiente dashboard ejecuta ambos tests sobre una sola muestra y muestra el patrón de residuos junto con los estadísticos y p-valores. Usalo para ver cómo se comportan los tests bajo ambas estructuras de error:

  • Seleccioná la estructura Heterocedástica y observá los p-valores de Breusch-Pagan y White: ¿ambos tests rechazan al 5%?

  • Cambiá a errores Homocedásticos: ¿los resultados son ahora consistentes con la hipótesis nula de homocedasticidad?

  • Notá cómo el gráfico de \(\hat{\varepsilon}_i^2\) vs \(X\) hace visible el patrón subyacente: la tendencia creciente en los residuos al cuadrado es exactamente lo que ambos tests están diseñados para detectar.


6. La solución: errores estándar robustos y MCO ponderado#

Dos herramientas principales han sido propuestas para corregir la heterocedasticidad: los errores estándar robustos a la heterocedasticidad (HC) y los Mínimos Cuadrados Ponderados (MCP). Presentamos cada estimador antes de explorar sus propiedades con la simulación.

6.1 Errores estándar robustos a la heterocedasticidad (HC)#

La idea central, debida a White [1980], es estimar la varianza sándwich directamente a partir de los residuos, sin imponer varianza constante. Como \(\sigma_i^2\) es desconocida, se reemplaza por el residuo MCO al cuadrado \(\hat{\varepsilon}_i^2\). El estimador resultante, llamado HC0, es:

\[\widehat{\text{Var}}_{\text{HC0}}(\hat{\boldsymbol{\beta}}) = (\mathbf{X}'\mathbf{X})^{-1} \left(\sum_{i=1}^n \hat{\varepsilon}_i^2 \mathbf{x}_i \mathbf{x}_i'\right) (\mathbf{X}'\mathbf{X})^{-1}\]

Este estimador es consistente para la varianza sándwich real bajo heterocedasticidad general. No modifica las estimaciones puntuales: \(\hat{\boldsymbol{\beta}}\) es exactamente el mismo estimador MCO de siempre; solo se recalculan los errores estándar.

Existen varias correcciones de muestra finita que mejoran HC0. La más habitual en economía aplicada es HC1, que multiplica por \(n/(n-k)\) para aplicar una corrección de grados de libertad análoga a la que se usa en el estimador de varianza ordinario:

\[\widehat{\text{Var}}_{\text{HC1}}(\hat{\boldsymbol{\beta}}) = \frac{n}{n-k}(\mathbf{X}'\mathbf{X})^{-1} \left(\sum_{i=1}^n \hat{\varepsilon}_i^2 \mathbf{x}_i \mathbf{x}_i'\right) (\mathbf{X}'\mathbf{X})^{-1}\]

HC2 va más lejos: divide cada residuo al cuadrado por \((1 - h_{ii})\), donde \(h_{ii}\) es el leverage de la observación \(i\). Las observaciones de alto leverage tienen \(h_{ii}\) grande y tienden a presentar residuos sistemáticamente más pequeños, por lo que HC2 corrige al alza ese sesgo a la baja en \(\hat{\varepsilon}_i^2\). HC3 usa \((1 - h_{ii})^2\) en el denominador, aplicando una corrección aún más agresiva que es generalmente más conservadora pero tiende a comportarse mejor en muestras pequeñas.

En economía aplicada, HC1 es el estándar. HC3 se prefiere cuando las muestras son pequeñas o el leverage varía considerablemente entre observaciones.

6.2 Mínimos Cuadrados Ponderados (MCP)#

Si conocemos (o podemos estimar) la estructura de la varianza —\(\text{Var}(\varepsilon_i \mid X_i) = \sigma^2 h(X_i)\) para alguna función \(h\) conocida— podemos ir más lejos que simplemente corregir los errores estándar: podemos recuperar la eficiencia MELI.

La idea es transformar el modelo dividiendo cada observación por \(\sqrt{h(X_i)}\):

\[\frac{Y_i}{\sqrt{h(X_i)}} = \beta_0 \frac{1}{\sqrt{h(X_i)}} + \beta_1 \frac{X_i}{\sqrt{h(X_i)}} + \frac{\varepsilon_i}{\sqrt{h(X_i)}}\]

El error transformado \(\varepsilon_i / \sqrt{h(X_i)}\) tiene varianza constante \(\sigma^2\). Aplicar MCO al modelo transformado es equivalente a minimizar:

\[\sum_{i=1}^n \frac{1}{h(X_i)} (Y_i - \beta_0 - \beta_1 X_i)^2\]

asignando más peso a las observaciones con menor varianza. Al modelo transformado sí le aplica Gauss-Markov: MCP es MELI bajo la estructura de varianza especificada.

Riesgo práctico: si \(h\) está mal especificada, los pesos pueden ser peores que no ponderar. En la práctica se usa GLS factible: se estima \(h\) a partir de los residuos (por ejemplo, regresando \(\log \hat{\varepsilon}_i^2\) sobre \(X_i\)) y se usan los valores ajustados como pesos. Los resultados deben reportarse siempre junto con MCO+HC como verificación de robustez.

Explorando las propiedades con simulaciones#

La siguiente simulación permite comparar los cuatro estimadores de varianza (No Robusto, HC1, HC2, HC3) bajo distintos tamaños de muestra. Prestá atención a estas preguntas mientras explorás:

  1. Mirá el histograma del estadístico \(t\) — ¿qué estimador produce una distribución que se ajusta mejor a la distribución \(t\) teórica? ¿Cuál queda demasiado ancha o demasiado estrecha?

  2. Comparará la cobertura de los intervalos de confianza entre estimadores — ¿cuál logra una cobertura más cercana al 95% bajo heterocedasticidad?

  3. Probará distintos tamaños de muestra — ¿las diferencias entre HC1, HC2 y HC3 importan más en muestras pequeñas o en muestras grandes?

¿Qué observamos?#

Los errores estándar HC restauran la cobertura correcta. Bajo heterocedasticidad, MCO con errores HC1 recupera la cobertura del 95% sin modificar las estimaciones puntuales. El costo es prácticamente nulo.

HC2 y HC3 mejoran la cobertura en muestras pequeñas. Con \(n\) reducido, HC1 puede aún quedar por debajo del nivel nominal. HC2 y HC3 aplican correcciones más amplias que acercan la cobertura al 95% cuando el leverage varía entre observaciones.

El MCP con pesos correctos es más eficiente. Cuando los pesos reflejan la estructura real de la varianza, el MCP produce intervalos más angostos que MCO+HC, además de cobertura correcta.

Bajo homocedasticidad, los métodos convergen. Si los errores son en realidad homocedásticos, todos los estimadores producen inferencias prácticamente idénticas. No hay penalización por usar errores robustos cuando no son necesarios.


7. Resumen y guía de decisión#

La heterocedasticidad no invalida la regresión MCO; la complica solo en un aspecto específico. El siguiente árbol de decisión resume la práctica recomendada:

  1. Siempre inspeccionar los gráficos de residuos como tamizado inicial.

  2. Correr los tests de Breusch-Pagan y White para confirmación estadística.

  3. Si hay heterocedasticidad (o si existe duda razonable): usar errores estándar HC1 por defecto. Esta es la práctica mínima en economía aplicada y tiene costo casi nulo.

  4. Si la estructura de varianza es estimable: considerar MCP para ganar eficiencia, pero reportar siempre MCO+HC como verificación de robustez.

  5. Las estimaciones puntuales de MCO nunca se descartan por heterocedasticidad: el estimador sigue siendo insesgado. Solo cambia la cuantificación de la incertidumbre.

En la econometría aplicada contemporánea, reportar errores estándar robustos es el estándar, no la excepción. La pregunta ya no es «¿debo usar errores robustos?» sino «¿cuándo vale la pena también usar MCP?»


Apéndice: Demostraciones Formales#

A.1 La insesgadez de MCO no requiere homocedasticidad#

Queremos demostrar que \(E[\hat{\beta}_1 \mid X] = \beta_1\) sin invocar varianza constante.

Paso 1 — Escribimos \(\hat{\beta}_1\) en términos del verdadero \(\beta_1\) y los errores. Partiendo de \(\hat{\beta}_1 = \frac{\sum_i (x_i - \bar{x}) y_i}{SST_X}\) y sustituyendo \(y_i = \beta_0 + \beta_1 x_i + \varepsilon_i\):

\[\hat{\beta}_1 = \beta_1 + \frac{\sum_{i=1}^n (x_i - \bar{x})\varepsilon_i}{SST_X}\]

Paso 2 — Tomamos la esperanza condicional:

\[E[\hat{\beta}_1 \mid X] = \beta_1 + \frac{\sum_{i=1}^n (x_i - \bar{x}) E[\varepsilon_i \mid X]}{SST_X}\]

Paso 3 — Aplicamos el supuesto de media condicional cero \(E[\varepsilon_i \mid X] = 0\) para todo \(i\). El segundo término se anula y obtenemos \(E[\hat{\beta}_1 \mid X] = \beta_1\).

Nótese que ningún paso requirió \(\text{Var}(\varepsilon_i \mid X) = \sigma^2\). La insesgadez se sostiene bajo cualquier estructura de varianza siempre que \(E[\varepsilon_i \mid X] = 0\).

A.2 Varianza de \(\hat{\beta}_1\) bajo heterocedasticidad#

Queremos derivar \(\text{Var}(\hat{\beta}_1 \mid X)\) sin suponer varianza constante.

Paso 1 — Usamos la expresión de A.1:

\[\hat{\beta}_1 - \beta_1 = \frac{\sum_{i=1}^n (x_i - \bar{x})\varepsilon_i}{SST_X}\]

Paso 2 — Calculamos la varianza condicional. Como \(X\) se trata como fijo y los \(\varepsilon_i\) son independientes entre observaciones:

\[\text{Var}(\hat{\beta}_1 \mid X) = \frac{\text{Var}\!\left(\sum_{i=1}^n (x_i - \bar{x})\varepsilon_i \,\middle|\, X\right)}{SST_X^2} = \frac{\sum_{i=1}^n (x_i - \bar{x})^2 \, \text{Var}(\varepsilon_i \mid X)}{SST_X^2}\]

Paso 3 — Sustituimos \(\text{Var}(\varepsilon_i \mid X) = \sigma_i^2\):

\[\text{Var}(\hat{\beta}_1 \mid X) = \frac{\sum_{i=1}^n (x_i - \bar{x})^2 \, \sigma_i^2}{SST_X^2}\]

Bajo homocedasticidad (\(\sigma_i^2 = \sigma^2\) para todo \(i\)), esta expresión se reduce a \(\sigma^2 SST_X / SST_X^2 = \sigma^2 / SST_X\), confirmando la fórmula habitual. Bajo heterocedasticidad, el numerador es una suma ponderada de \(\sigma_i^2\) con pesos \((x_i - \bar{x})^2\), y la expresión no simplifica más.


Poné a prueba lo que aprendiste#

Referencias#

[Whi80]

Halbert White. A heteroskedasticity-consistent covariance matrix estimator and a direct test for heteroskedasticity. Econometrica, 48(4):817–838, 1980.