Variables Instrumentales: Identificación y LATE#
Uber quiere medir el efecto causal de su programa de bonos para conductores (\(T\)) sobre los ingresos semanales (\(Y\)). El problema es inmediato: los conductores más motivados y calificados tienden a inscribirse voluntariamente en el programa — no porque el bono los empuje a trabajar más, sino porque ya trabajan más de todos modos. Una variable no observable como la calidad del conductor (\(U\)) determina tanto la inscripción como los ingresos, con independencia del bono. Regresionar ingresos sobre participación en el bono mezcla el efecto causal con esa selección, y no hay ningún control observable que pueda cerrar esa fuente de confusión.
En esta sección presentamos la estrategia de variables instrumentales (VI) como respuesta a este problema. El instrumento — una tercera variable que mueve el tratamiento pero no tiene efecto directo sobre el resultado — permite recuperar el efecto causal incluso cuando el confundidor es inobservable. Derivamos el estimador de efecto local promedio del tratamiento (LATE), mostramos qué población identifica, y exploramos las implicaciones de los distintos tipos de respuesta al instrumento.
1. Objetivos#
Al terminar esta sección, el lector podrá:
Identificar cuándo el criterio de la puerta trasera falla porque el confundidor es inobservable.
Formular las dos condiciones que debe cumplir una variable instrumental válida.
Derivar el estimador LATE como cociente de forma reducida y primera etapa.
Interpretar qué subpoblación identifica el LATE y por qué puede diferir del efecto promedio del tratamiento sobre los tratados (TOT).
Reconocer el rol del supuesto de monotonicidad y las consecuencias de su violación.
2. El Problema: Confundidores No Observables#
El DAG del problema de Uber tiene tres nodos: el tratamiento \(T\) (inscripción en el bono), el resultado \(Y\) (ingresos semanales) y el confundidor inobservable \(U\) (calidad del conductor).

El confundidor \(U\) genera dos caminos entre \(T\) e \(Y\): el causal (\(T \rightarrow Y\)) y el de puerta trasera (\(T \leftarrow U \rightarrow Y\)). Como vimos en la sección de DAGs, para identificar el efecto causal de \(T\) necesitamos bloquear todos los caminos de puerta trasera condicionando sobre un conjunto de variables \(S\) que satisfaga el criterio de la puerta trasera.
Aquí el problema es que \(U\) es inobservable: no podemos incluirlo como control en la regresión. El criterio de la puerta trasera no puede satisfacerse. Este es precisamente un caso de sesgo por variable omitida: cuando \(U\) es excluido de la regresión, el estimador MCO está sesgado en expectativa:
donde \(\delta\) es el efecto de \(U\) sobre \(Y\). El segundo término es el sesgo de selección: los conductores que se inscriben en el bono (\(T=1\)) tienen, en promedio, mayor calidad (\(U\) más alto), lo que infla su ingreso observado por encima del efecto causal del bono. Necesitamos una estrategia diferente.
3. La Estrategia de Identificación: El Instrumento#
Un instrumento \(Z\) es una variable que cumple dos condiciones.
Primera condición — Relevancia (primera etapa): \(Z\) tiene un efecto no nulo sobre \(T\). Si \(Z\) no mueve \(T\), no proporciona información útil sobre la variación exógena en el tratamiento.
Segunda condición — Exogeneidad e independencia: \(Z\) afecta a \(Y\) únicamente a través de \(T\), y es independiente del confundidor \(U\). Esto implica dos restricciones:
Exogeneidad: \(Z \perp U\) — el instrumento no está correlacionado con el confundidor.
Restricción de exclusión: no existe un efecto directo \(Z \rightarrow Y\) — la única razón por la que \(Z\) podría cambiar \(Y\) es que primero cambia \(T\).
El DAG completo con el instrumento representa estas condiciones de forma directa:

Observá qué está ausente en el DAG: no hay arista entre \(Z\) y \(U\), y no hay arista directa entre \(Z\) e \(Y\). Esas ausencias son el contenido de los supuestos. Las aristas presentes — \(Z \rightarrow T \rightarrow Y\) — marcan el único canal causal a través del cual \(Z\) puede afectar a \(Y\).
Exogeneidad (\(Z \perp U\)): \(Z\) no está correlacionado con la calidad inobservable del conductor. Cuando \(Z\) proviene de un diseño cuasi-experimental — como una asignación algorítmica aleatoria — puede apoyarse con una tabla de balance: los grupos \(Z=1\) y \(Z=0\) son similares en características observables previas al tratamiento. Sin embargo, la ausencia de correlación con inobservables es un supuesto estructural que los datos nunca pueden refutar directamente; debe argumentarse con la lógica del diseño.
Restricción de exclusión (\(Z \not\rightarrow Y\) directamente): \(Z\) no tiene ningún efecto directo sobre \(Y\). Es decir, la única razón por la que \(Z\) podría cambiar \(Y\) es que primero cambia \(T\). Este supuesto es completamente no testeable con datos — debe argumentarse con la lógica económica y el diseño del instrumento.
El instrumento en el ejemplo de Uber: Supongamos que Uber envía aleatoriamente una notificación digital ofreciendo el bono (\(Z = 1\) si el conductor recibió la notificación, \(Z = 0\) si no). La probabilidad de recibir la notificación es independiente de la calidad del conductor — la asigna un algoritmo de plataforma que no observa \(U\) (exogeneidad). La notificación en sí misma no contiene información sobre estrategias de conducción ni sobre la tarifa por hora — su único efecto posible sobre los ingresos es inducir la inscripción en el programa de bonos (restricción de exclusión, razonable en la medida en que la notificación no revelea el valor del bono ni da consejos de productividad).
Nota: La Primera Condición (relevancia) es testeable con los datos — podemos estimar la primera etapa y evaluar si \(Z\) tiene un efecto significativo sobre \(T\). La Segunda Condición (exogeneidad y restricción de exclusión), en cambio, está formada por supuestos teóricos que no pueden verificarse directamente con los datos. La confianza en ellos descansa enteramente en nuestra comprensión del contexto institucional y la lógica del diseño.
4. El Estimador LATE: Tres Cantidades Observables#
El instrumento \(Z\) permite recuperar el efecto causal de \(T\) sobre \(Y\) aunque \(U\) nunca sea observado. La clave es que, bajo los dos supuestos del instrumento, tres cantidades son estimables sin sesgo a partir de los datos.
4.1 Primera etapa#
La primera etapa mide cuánto mueve \(Z\) al tratamiento \(T\):
Este estimador es insesgado porque \(Z \perp U\): los grupos \(Z=1\) y \(Z=0\) tienen la misma distribución del confundidor \(U\) en expectativa, de modo que la diferencia en \(T\) entre grupos solo refleja el efecto causal de \(Z\) sobre \(T\).
4.2 Forma reducida#
La forma reducida mide cuánto mueve \(Z\) al resultado \(Y\):
Este estimador también es insesgado. Por \(Z \perp U\), los grupos \(Z=1\) y \(Z=0\) son comparables en \(U\). Y por la restricción de exclusión, el único canal por el que \(Z\) afecta a \(Y\) es el causal \(Z \rightarrow T \rightarrow Y\). En consecuencia, \(\hat{\gamma}\) captura exactamente el efecto total de \(Z\) sobre \(Y\) a través del tratamiento.
4.3 El LATE como cociente#
El efecto local promedio del tratamiento (LATE, Local Average Treatment Effect) es:
¿Por qué funciona este cociente? La forma reducida captura el efecto de \(Z\) sobre \(Y\) a través del canal \(Z \rightarrow T \rightarrow Y\). Ese efecto es el producto de dos componentes: la fracción de unidades que cambia su tratamiento en respuesta a \(Z\) (la primera etapa \(\alpha\)) multiplicada por el efecto del tratamiento sobre esas unidades (\(\beta\)). Formalmente:
Dividir por \(\hat{\alpha}\) cancela la primera etapa y recupera \(\beta\) para la subpoblación que responde al instrumento:
Resultado formal:
Bajo exogeneidad (\(Z \perp U\)), restricción de exclusión (no hay \(Z \rightarrow Y\) directo), relevancia (\(\alpha \neq 0\)) y monotonicidad (ver sección 5), el LATE es un estimador consistente del efecto causal promedio para la subpoblación de cumplidores — unidades cuyo tratamiento es determinado por el instrumento. La derivación formal aparece en el apéndice.
En el ejemplo de Uber: si los conductores que reciben la notificación son 30 puntos porcentuales más propensos a inscribirse en el bono (primera etapa = 0.30), y sus ingresos semanales son $45 más altos en promedio (forma reducida = 45), entonces el LATE es:
5. Consolidación con Simulación: Escenario A#
Con la lógica de identificación y la derivación formal del LATE en mente, la primera simulación permite observar los tres pasos del estimador de Wald en acción, con datos generados exactamente según el DAG que acabamos de analizar.
Antes de explorar el dashboard, predecí:
¿Qué le pasa al sesgo de MCO cuando aumentás la intensidad del confundidor (\(\delta\))?
¿El LATE se mueve con \(\delta\)? ¿Por qué no debería?
¿Qué ocurre cuando \(\delta = 0\)? ¿En ese caso el instrumento es necesario?
Al cambiar \(\beta\), ¿los tres estimadores (primera etapa, forma reducida, LATE) responden como predice la teoría?
La tabla de medias en el panel derecho muestra exactamente el cómputo de Wald: la primera fila calcula \(\hat{\alpha}\) como diferencia de medias de \(T\) entre grupos \(Z=1\) y \(Z=0\); la segunda fila calcula \(\hat{\gamma}\) como diferencia de medias de \(Y\). Las tres fichas debajo sintetizan el resultado: primera etapa, forma reducida y LATE = \(\hat{\gamma}/\hat{\alpha}\). El gráfico de barras a la derecha compara MCO y LATE contra el valor verdadero de \(\beta\): a medida que aumentás \(\delta\), la barra roja (MCO) se aleja del valor verdadero mientras la barra azul (LATE) permanece centrada en él.
6. ¿A Quién Identifica el LATE? Tipos de Cumplidores#
El LATE no identifica el efecto promedio para toda la población, ni siquiera para los tratados. Identifica el efecto para una subpoblación específica: los cumplidores — unidades cuyo estado de tratamiento cambia en respuesta al instrumento.
Para entender esto, es útil clasificar a todos los individuos según cómo responderían al instrumento bajo ambos valores posibles de \(Z\).
6.1 La taxonomía de respuesta al instrumento#
En el contexto de Uber, donde \(Z\) es recibir la notificación de bono y \(T\) es inscribirse en el programa. Imaginemos cuatro tipos de individuos — siguiendo la taxonomía de Angrist and Pischke [2015]:
No inscripto si Z = 0 |
Inscripto si Z = 0 |
|
|---|---|---|
Inscripto si Z = 1 |
Camila — Cumplidor |
Alvaro — Adoptante siempre |
No inscripto si Z = 1 |
Normando — No cumplidor |
Diego — Desertor |
Camila — Cumplidores (\(\pi_C\)): Se inscriben si y solo si reciben la notificación. Son exactamente los conductores cuya decisión de inscripción es movida por \(Z\). Son la subpoblación identificada por el LATE.
Alvaro — Adoptantes siempre (\(\pi_A\)): Se inscriben independientemente de si reciben la notificación — son conductores tan motivados que participarían en cualquier caso. Su tratamiento no responde a \(Z\), por lo que no contribuyen a la primera etapa.
Normando — No cumplidores (\(\pi_N\)): No se inscriben sin importar si reciben la notificación. Tampoco responden al instrumento ni contribuyen a la primera etapa.
Diego — Desertores (\(\pi_D\)): Hacen lo opuesto de lo que prescribe \(Z\): se inscriben cuando no reciben la notificación y no se inscriben cuando sí la reciben. Su existencia viola el supuesto de monotonicidad que discutimos a continuación.
6.2 LATE vs. Efecto sobre los Tratados (TOT)#
El efecto promedio del tratamiento sobre los tratados (TOT) es el efecto causal promedio para todos los que efectivamente participan en el bono. Suponiendo que cada tipo de individuo tiene su propio efecto del tratamiento, se obtiene:
Los tratados son cumplidores (\(\pi_C\)) y adoptantes siempre (\(\pi_A\)). Como el LATE estima un efecto sobre la base de la respuesta al instrumento, solo promedia sobre los cumplidores:
¿Cuándo divergen? Cuando los adoptantes siempre tienen un efecto del tratamiento diferente al de los cumplidores (\(\beta_A \neq \beta_C\)). Por ejemplo, si los adoptantes siempre se inscriben voluntariamente porque se benefician más (\(\beta_A > \beta_C\)), entonces TOT > LATE: el instrumento identifica el efecto para los conductores «en el margen» — los que el incentivo mueve — no para los que se habrían inscripto de todas formas y quizás son los que más ganan.
¿Cuándo coinciden? Cuando no hay adoptantes siempre (\(\pi_A = 0\)) o cuando todos los tipos tienen el mismo efecto del tratamiento (\(\beta_A = \beta_C\)). En el caso de una asignación aleatoria perfectamente obligatoria — un RCT con cumplimiento perfecto — todos son cumplidores y LATE = TOT = ATE.
6.3 El Supuesto de Monotonicidad#
Para que el LATE tenga interpretación causal, necesitamos un supuesto adicional que descarte a los desertores:
Monotonicidad: \(T_i(Z=1) \geq T_i(Z=0)\) para todo \(i\).
En palabras: recibir el instrumento nunca puede reducir la probabilidad de tomar el tratamiento. En el ejemplo de Uber: ningún conductor se desanima a inscribirse en el bono por recibir la notificación.
¿Por qué importa? Sin monotonicidad, el denominador de la primera etapa mezcla cumplidores y desertores:
Y el estimador VI converge a:
Cuando \(\pi_D > 0\), este cociente no coincide con \(\beta_C\) (el LATE para cumplidores) ni con ningún promedio ponderado con pesos positivos sobre tipos de individuos. El estimador pierde interpretación causal.
La monotonicidad no es testeable directamente — los tipos de cumplimiento individuales son contrafácticos. Debe argumentarse con la lógica del diseño y el contexto económico.
7. Consolidación con Simulación: Escenario B#
Con la taxonomía de tipos de cumplimiento clara, el segundo escenario de la simulación permite explorar cómo cambian el LATE, el TOT y el estimador VI cuando variamos la composición de la población.
Antes de usar los controles, predecí:
¿Qué le pasa al LATE cuando aumentás \(\beta_A\) por encima de \(\beta_C\) (haciendo el efecto de los adoptantes siempre mayor que el de los cumplidores)?
Si \(\beta_A = \beta_C\), ¿importa cuántos adoptantes siempre haya en la población?
¿Qué ocurre con el estimador VI cuando introducís desertores (\(\pi_D > 0\))? ¿En qué dirección se mueve?
Si \(\pi_D\) se acerca a \(\pi_C\), ¿qué le pasa al denominador de la primera etapa?
El panel derecho muestra tres barras: TOT (violeta), LATE verdadero (azul) y la estimación VI (verde/rojo). Cuando \(\pi_D = 0\), la estimación VI coincide con el LATE. A medida que aumentás \(\pi_D\), la barra verde se convierte en roja y se aleja de ambos targets — y aparece el banner de advertencia sobre la violación de monotonicidad. El texto dinámico debajo del gráfico explica en cada configuración qué está pasando con la estimación.
La monotonicidad es el supuesto que da al denominador de VI su interpretación: la primera etapa mide la fracción de cumplidores, no una combinación arbitraria de tipos. Cuando esa interpretación falla, el instrumento deja de identificar un efecto causal con sentido.
Apéndice: Consistencia del Estimador LATE#
Mostramos que, bajo los cuatro supuestos del instrumento, el estimador \(\hat{\beta}_{\text{LATE}} = \hat{\gamma}/\hat{\alpha}\) converge en probabilidad a \(\beta_C\), el efecto causal promedio para los cumplidores.
Supuestos:
Relevancia: \(\alpha = \mathbb{E}[T \mid Z=1] - \mathbb{E}[T \mid Z=0] \neq 0\).
Exogeneidad: \(Z \perp U\) (el instrumento es independiente del confundidor).
Restricción de exclusión: \(Y_i(z, t) = Y_i(t)\) para todo \(z\) — el resultado potencial no depende de \(Z\) directamente, solo de \(T\).
Monotonicidad: \(T_i(Z=1) \geq T_i(Z=0)\) para todo \(i\) (no hay desertores).
Paso 1 — Descomponer la primera etapa:
Bajo monotonicidad, \(T_i(Z=1) - T_i(Z=0) \in \{0, 1\}\): la diferencia es 1 para cumplidores y 0 para adoptantes siempre y no cumplidores (los desertores están descartados por el supuesto). Por lo tanto:
La primera etapa identifica sin sesgo la fracción de cumplidores.
Paso 2 — Descomponer la forma reducida:
Por la restricción de exclusión y exogeneidad:
Para adoptantes siempre: \(T_i(1) = T_i(0) = 1\), por lo que \(Y_i(T_i(1)) - Y_i(T_i(0)) = 0\).
Para no cumplidores: \(T_i(1) = T_i(0) = 0\), igual, diferencia = 0.
Solo los cumplidores contribuyen (\(T_i(1) = 1, T_i(0) = 0\)):
Paso 3 — El cociente:
Los estimadores \(\hat{\alpha}\) y \(\hat{\gamma}\) son diferencias de medias muestrales que convergen a sus valores poblacionales por la Ley de Grandes Números. Por el método delta, su cociente converge a \(\beta_C\).
Poné a prueba lo que aprendiste#
Referencias#
El dashboard interactivo de esta sección también se apoya en Angrist and Pischke [2009], Imbens and Angrist [1994] y Staiger and Stock [1997], además de Angrist and Pischke [2015].
Joshua D Angrist and Jörn-Steffen Pischke. Mostly harmless econometrics: An empiricist's companion. Princeton university press, 2009.
Joshua D Angrist and Jörn-Steffen Pischke. Mastering 'Metrics: The Path from Cause to Effect. Princeton University Press, 2015.
Guido W Imbens and Joshua D Angrist. Identification and estimation of local average treatment effects. Econometrica, 62(2):467–475, 1994.
Douglas Staiger and James H Stock. Instrumental variables regression with weak instruments. Econometrica, 65(3):557–586, 1997.