Variables Instrumentales: 2SLS e Instrumentos Débiles#

En la sección anterior derivamos el estimador LATE como cociente de forma reducida y primera etapa, usando un instrumento binario. Esa lógica se generaliza de forma natural a situaciones donde el instrumento y el tratamiento son continuos, y donde puede haber variables de control adicionales. El método estándar para implementar esta generalización es mínimos cuadrados en dos etapas (2MCM) — conocido por su sigla en inglés 2SLS, Two-Stage Least Squares.

Esta sección presenta el procedimiento de estimación, explica por qué el manejo incorrecto de los errores estándar produce inferencia equivocada, introduce el uso de múltiples instrumentos, y analiza el problema de los instrumentos débiles — instrumentos con una primera etapa insuficientemente fuerte para identificar el efecto causal con precisión.


1. Objetivos#

Al terminar esta sección, el lector podrá:

  • Implementar el estimador 2MCM en dos pasos y entender por qué los valores predichos de la primera etapa son «limpios».

  • Identificar por qué los errores estándar de un 2MCM manual son incorrectos y cómo corregirlos.

  • Incorporar múltiples instrumentos a la primera etapa y evaluar la ganancia en precisión.

  • Describir los dos daños que produce un instrumento débil: sesgo hacia MCO y sobre-rechazo de la hipótesis nula.

  • Interpretar el estadístico F de la primera etapa como una medida continua de fortaleza del instrumento, sin anclar a umbrales discretos.


2. De la Lógica Binaria al Caso General: El Método 2MCM#

La sección anterior usó un instrumento binario \(Z \in \{0, 1\}\) y derivó el LATE como diferencia de medias condicionales. En la práctica, los instrumentos y los tratamientos suelen ser continuos, y los modelos incluyen covariables de control. El método 2MCM generaliza el estimador de Wald a este caso.

El nuevo ejemplo de Uber: La plataforma quiere estimar cómo las horas trabajadas en la plataforma (\(T\) = horas semanales activas) afectan los ingresos semanales de los conductores (\(Y\)). El confundidor inobservable \(U\) es la motivación del conductor: los conductores más motivados trabajan más horas y obtienen más ingresos por hora (mejores rutas, mayor tasa de aceptación de viajes), de modo que una regresión de ingresos sobre horas de trabajo sobreestima el efecto causal de las horas.

El instrumento es la intensidad de notificaciones (\(Z_1\) = número de notificaciones push enviadas por la plataforma al conductor durante la semana). Más notificaciones incentivan a los conductores a conectarse — primera etapa: \(Z_1 \rightarrow T\). La cantidad de notificaciones la determina el algoritmo de la plataforma en función de la demanda agregada de viajes, no de la calidad individual del conductor — exogeneidad: \(Z_1 \perp U\). La notificación no contiene información sobre el valor del servicio por hora ni sobre estrategias de conducción — restricción de exclusión: \(Z_1 \not\rightarrow Y\) directamente.

El DAG del instrumento continuo tiene la misma estructura que el caso binario:

DAG de 2MCM: Z₁ → T → Y, U confunde T e Y

Leyenda: \(Z_1\) — Intensidad de notificaciones · \(T\) — Horas en la plataforma · \(Y\) — Ingresos semanales · \(U\) — Motivación del conductor (inobs.)

2.1 Cómo funciona el estimador 2MCM#

El método 2MCM permite recuperar el LATE usando dos regresiones MCO consecutivas. Se define de la siguiente manera:

Primera etapa: Regresá el tratamiento \(T\) sobre el instrumento \(Z_1\) (y cualquier covariable de control \(X\)):

\[T_i = \gamma_0 + \gamma_1 Z_{1i} + X_i'\pi + e_i\]

Guardá los valores predichos:

\[\hat{T}_i = \hat{\gamma}_0 + \hat{\gamma}_1 Z_{1i} + X_i'\hat{\pi}\]

Segunda etapa: Regresá el resultado \(Y\) sobre los valores predichos \(\hat{T}\) (y las mismas covariables \(X\)):

\[Y_i = \alpha + \beta \hat{T}_i + X_i'\delta + \varepsilon_i\]

El coeficiente \(\hat{\beta}\) de la segunda etapa es el estimador 2MCM del efecto causal.

2.2 Por qué \(\hat{T}\) es «limpio»#

La lógica del método es la misma que en el caso binario: los valores predichos \(\hat{T}_i\) capturan únicamente la variación en \(T\) que proviene del instrumento \(Z_1\) — la componente exógena. La componente endógena — la parte de \(T\) correlacionada con \(U\) — vive en el residuo de la primera etapa \(\hat{e}_i = T_i - \hat{T}_i\), que queda excluido de la segunda etapa.

Al regresionar \(Y\) sobre \(\hat{T}\) en lugar de sobre \(T\), la segunda etapa ya no puede captar el efecto de \(U\) sobre \(Y\) a través de su correlación con \(T\): ese canal fue eliminado al proyectar \(T\) sobre los instrumentos.

2.3 Conexión con el estimador LATE#

Cuando \(Z_1\) es binaria y no hay controles, el estimador 2MCM se reduce exactamente al cociente de Wald:

\[\hat{\beta}_{2MCM} = \frac{\hat{\gamma}_{RF}}{\hat{\gamma}_{FS}} = \frac{\mathbb{E}[Y \mid Z=1] - \mathbb{E}[Y \mid Z=0]}{\mathbb{E}[T \mid Z=1] - \mathbb{E}[T \mid Z=0]} = \hat{\beta}_{\text{LATE}}\]

En el caso continuo con controles, el coeficiente de la segunda etapa sigue teniendo la interpretación de un efecto causal local — la variación que identifica es exactamente la que el instrumento genera en \(T\).


3. El Problema con los Errores Estándar Manuales#

Correr las dos etapas manualmente — como dos regresiones OLS consecutivas — da la estimación puntual correcta pero errores estándar incorrectos.

El problema está en los residuos de la segunda etapa. Si la segunda etapa se estima como OLS sobre \(\hat{T}\), sus residuos son:

\[\hat{v}_i = Y_i - \hat{\beta} \hat{T}_i\]

Pero \(\hat{T}_i\) es más «suave» que \(T_i\): no incluye el ruido de la primera etapa (\(\hat{e}_i\)). Esto hace que los residuos \(\hat{v}_i\) sobreabsorban varianza, lo que infla la estimación manual del error estándar respecto al valor correcto. En este tipo de DGP (endogeneidad por confusión), el error estándar del 2MCM manual es demasiado amplio, no demasiado estrecho.

La fórmula correcta utiliza residuos calculados sobre el tratamiento original \(T_i\), no sobre \(\hat{T}_i\):

\[\hat{u}_i = Y_i - \hat{\beta} T_i\]

Este ajuste — y otras correcciones relacionadas con la estructura de las dos etapas — es lo que implementan automáticamente los paquetes de software especializados (linearmodels.IV2SLS en Python, ivreg en R). Nunca reportes errores estándar de un 2MCM construido manualmente.


4. Múltiples Instrumentos#

Cuando existe más de un instrumento válido, es posible usarlos todos en la primera etapa para extraer más variación exógena de \(T\). Consideremos el siguiente ejemplo.

Un segundo instrumento para Uber: Además de la intensidad de notificaciones (\(Z_1\)), la plataforma realizó una campaña paralela enviando aleatoriamente por correo artículos de marca para conductores a un subconjunto de conductores (\(Z_2 = 1\) si el conductor recibió el paquete — elementos como soporte para celular, ambientador y accesorios con la marca de la empresa). Recibir el paquete aumenta la motivación para usar la plataforma, incentivando a los conductores a conectarse más horas — primera etapa: \(Z_2 \rightarrow T\). La lista de envío se generó de forma independiente de la calidad individual del conductor — exogeneidad: \(Z_2 \perp U\). Los artículos del paquete en sí mismos no cambian los ingresos por hora ni la estructura de las tarifas — su único camino para afectar los ingresos es a través de las horas adicionales manejadas en la plataforma — restricción de exclusión, razonable bajo este diseño.

La primera etapa con dos instrumentos:

\[T_i = \gamma_0 + \gamma_1 Z_{1i} + \gamma_2 Z_{2i} + X_i'\pi + e_i\]

Más instrumentos válidos implican más variación exógena en \(T\) disponible para la segunda etapa, lo que se traduce en un F-estadístico de primera etapa más alto y un intervalo de confianza más estrecho sobre \(\beta\).


5. Consolidación con Simulación: Escenario A#

Con el mecanismo de 2MCM formalizado, la simulación permite recorrer los dos pasos visualmente y ver la consecuencia concreta del problema de los errores estándar.

Antes de explorar, predecí:

  • En la vista LATE, ¿qué relación deberías ver entre la pendiente de la forma reducida, la pendiente de la primera etapa y el cociente LATE?

  • En la vista 2MCM, ¿qué parte de la variación en \(T\) aparece sobre el eje \(x\) del gráfico de segunda etapa?

  • ¿Por qué el error estándar del 2MCM manual aparece en ámbar? ¿Es más ancho o más estrecho que el correcto?

  • Al aumentar \(\gamma_1\) de 0.2 a 1.5, ¿qué le pasa al F de primera etapa y al intervalo de confianza de \(\beta\)?

El panel izquierdo muestra el gráfico de la primera etapa (\(T\) sobre \(Z_1\)); la pendiente estimada es \(\hat{\gamma}_1\). En la vista 2MCM, la superposición de marcadores dorados muestra los valores \(\hat{T}_i\) — exactamente los puntos que pasan a la segunda etapa. El gráfico derecho muestra entonces la segunda etapa (\(Y\) sobre \(\hat{T}\)), cuya pendiente es \(\hat{\beta}\).

La tabla de coeficientes al pie compara MCO, 2MCM manual (error estándar marcado en ámbar — incorrecto, demasiado amplio) y 2MCM de software (correcto). El coeficiente puntual es idéntico en los dos últimos; la diferencia está únicamente en los errores estándar. En la vista LATE, la tabla de cómputo muestra numéricamente que LATE = \(\hat{\gamma}_{RF}/\hat{\gamma}_{FS}\) coincide con el coeficiente 2MCM.


6. Instrumentos Débiles#

Un instrumento débil es aquel cuya primera etapa es pequeña en relación al ruido muestral. La consecuencia no es un error de especificación sino una degradación continua de las propiedades del estimador 2MCM.

6.1 Los dos daños de un instrumento débil#

1. Sesgo hacia MCO en muestras finitas. Cuando \(\gamma_1\) es pequeño, \(Z_1\) apenas mueve \(T\). La variación exógena que extrae el instrumento es diminuta; la segunda etapa queda dominada por ruido de estimación. En el límite (\(\gamma_1 \rightarrow 0\)), el 2MCM converge al estimador MCO: si el instrumento no dice nada sobre \(T\), la estimación es equivalente a regresionar \(Y\) directamente sobre \(T\), con todo el sesgo de selección que eso implica.

2. Sobre-rechazo de la hipótesis nula. Las aproximaciones asintóticas que justifican la inferencia estándar del 2MCM suponen que el instrumento tiene un efecto de primer orden sobre \(T\). Cuando ese efecto es débil, las aproximaciones se deterioran: los intervalos de confianza sub-cubren el valor verdadero y los tests de hipótesis rechazan demasiado frecuentemente.

6.2 La fortaleza del instrumento es continua, no binaria#

La debilidad del instrumento no es una condición discreta. A medida que el F-estadístico de la primera etapa se acerca a 1, el sesgo de VI converge monotónicamente al sesgo de MCO y los intervalos de confianza estándar sub-cubren cada vez más. No existe un umbral único que separe un instrumento «bueno» de uno «malo». La pregunta relevante no es «¿supera el F cierto valor?» sino «¿cuánto sesgo adicional estoy dispuesto a aceptar, y cuánto coste en términos de varianza?»

La convención más citada — propuesta por Staiger and Stock [1997] — reporta el F de primera etapa como indicador y señala que valores alrededor de 10 garantizan que el sesgo de VI sea menor al 10% del sesgo de MCO en ciertas condiciones. Ese umbral de referencia vale la pena conocer, pero tiene una limitación evidente: está expresado en relación al sesgo de MCO, no en términos absolutos. Si el sesgo de MCO es pequeño, un F modesto puede ser suficiente; si el sesgo de MCO es grande, incluso un F holgadamente superior a 10 puede dejar un sesgo de VI apreciable. Tratar el F = 10 como un corte binario entre «bueno» y «malo» oscurece esta gradualidad.

6.3 Guía práctica#

  • Siempre reportar el F de primera etapa (y el \(R^2\) de la primera etapa) para que el lector pueda evaluar la fortaleza del instrumento.

  • Un instrumento fuerte que viola la restricción de exclusión sigue siendo inconsistente. La fortaleza no compensa la invalidez.


7. Consolidación con Simulación: Escenario B#

Con la noción de debilidad del instrumento clara, el segundo escenario de la simulación permite observar directamente la degradación continua del estimador VI a medida que el instrumento se debilita, y el beneficio de contar con un segundo instrumento válido.

Antes de explorar, predecí:

  • ¿Qué le pasa a la distribución muestral del estimador VI cuando bajás \(\gamma_1\) de 1.50 a 0.05?

  • ¿El sesgo del VI se mueve de forma discreta (un «quiebre») o continua?

  • Al activar dos instrumentos y fijar ambos en \(\gamma_1 = \gamma_2 = 0.40\), ¿cómo cambia el F conjunto respecto a un solo instrumento con \(\gamma_1 = 0.40\)?

  • ¿Qué diferencia hay entre reducir el sesgo del VI usando un instrumento más fuerte versus usando dos instrumentos moderados?

El indicador de F en la parte superior del panel derecho cambia de color de forma continua — de rojo (F cercano a 1) pasando por ámbar hasta llegar a verde azulado (F grande) — sin zonas discretas ni cortes marcados. Esa continuidad visual es intencional: refleja que la degradación del estimador es gradual, no un salto en algún umbral. Las curvas de densidad debajo muestran las distribuciones muestrales de MCO (rojo) y VI (azul) sobre 500 realizaciones de Monte Carlo: a medida que \(\gamma_1\) disminuye, la curva azul se ensancha y su centro se desplaza continuamente hacia el sesgo de MCO. Al activar el segundo instrumento (\(Z_2\)), el F conjunto sube y la curva azul se estrecha — más variación exógena disponible, mejor estimación.

La tabla de estadísticos al pie resume media, desvío estándar y tasa de cobertura de ambos estimadores para los parámetros actuales.


Poné a prueba lo que aprendiste#

Referencias#

El dashboard interactivo de esta sección también se apoya en Angrist and Pischke [2009], Stock and Watson [2020] y Andrews et al. [2019], además de Staiger and Stock [1997].

[ASS19]

Isaiah Andrews, James H Stock, and Liyang Sun. Weak instruments in instrumental variables regression: theory and practice. Annual Review of Economics, 11:727–753, 2019.

[AP09]

Joshua D Angrist and Jörn-Steffen Pischke. Mostly harmless econometrics: An empiricist's companion. Princeton university press, 2009.

[SS97] (1,2)

Douglas Staiger and James H Stock. Instrumental variables regression with weak instruments. Econometrica, 65(3):557–586, 1997.

[SW20]

James H Stock and Mark W Watson. Introduction to Econometrics. Pearson, 4th edition, 2020.