(synthetic-control-es)=
# El Método de Control Sintético

Uber quiere saber si un nuevo programa de incentivos para conductores —una garantía de ingresos semanales— aumenta los viajes completados. Pero el programa no se puede probar como un experimento aleatorizado a nivel de conductor dentro de una ciudad: los conductores compiten por los mismos viajes en el mismo mercado, así que incentivar a un subconjunto cambia los tiempos de espera y la tasa de finalización de viajes para *todos*, tratados o no. La plataforma termina lanzando el programa en una sola ciudad completa — Austin. ¿Cuál es el contrafáctico de "Austin sin el programa"?

Esta sección presenta el **método de control sintético**, la herramienta estándar para inferencia causal cuando el tratamiento golpea una (o unas pocas) unidades agregadas grandes y la aleatorización individual es inviable o inválida. Construiremos, paso a paso y con el mismo escenario de Uber en Austin, un contrafáctico creíble a partir de una combinación ponderada de otras ciudades; formalizaremos las condiciones bajo las cuales ese contrafáctico tiene un sesgo acotado; y desarrollaremos una forma de inferencia estadística que no depende de una muestra aleatoria grande.

---

## 1. Objetivos

Al terminar esta sección, el lector podrá:

- Explicar por qué el tratamiento a nivel de unidades agregadas grandes, combinado con interferencia de mercado, exige un contrafáctico construido a partir de múltiples unidades de comparación en lugar de una sola.
- Construir un control sintético: definir el panel de donantes, la matriz de predictores y el vector de pesos $W$, sujeto a sus restricciones de no negatividad y suma unitaria.
- Evaluar el ajuste pre-tratamiento (RMSPE y dispersión de los pesos) como el diagnóstico central antes de interpretar cualquier brecha post-tratamiento como efecto causal.
- Enunciar el límite de sesgo bajo un modelo de factores y explicar por qué depende, de forma condicional, del ajuste pre-tratamiento — no solo del número de períodos $T_0$.
- Realizar inferencia por permutación: calcular $r_j$ para cada unidad, derivar un p-valor basado en ranking, y explicar por qué las unidades con mal ajuste pre-tratamiento deben excluirse de la comparación.

---

## 2. El Problema: Pocas Unidades Agregadas y la Interferencia de Mercado

El obstáculo no es solo que Uber decidió lanzar el programa en una sola ciudad — es que **no podía haber hecho otra cosa**. En una plataforma de dos lados, incentivar a algunos conductores de Austin a conectarse más horas cambia la oferta disponible para *todos* los pasajeros de Austin, y por lo tanto los resultados de los conductores no incentivados también se ven afectados. Esto es exactamente la violación de **no interferencia** (SUTVA) que discutimos al estudiar experimentos aleatorizados: el resultado potencial de una unidad no puede depender de la asignación de tratamiento de otra. Randomizar dentro de Austin, a nivel de conductor, invalidaría el experimento por *spillovers* de mercado.

Entonces el tratamiento tiene que aplicarse a la ciudad entera. Y con eso, el problema deja de ser "¿cómo randomizamos?" y pasa a ser "¿con qué comparamos una sola ciudad tratada?" La respuesta ingenua es elegir otra ciudad de Uber que se parezca a Austin y usarla como comparación — pero, como ya vimos con diferencias en diferencias, encontrar una sola unidad de comparación que sea genuinamente parecida suele ser difícil, cuando no imposible. El Dashboard 1 muestra, de entrada, por qué esa respuesta casi nunca alcanza.

Antes de ver el resultado, definamos qué buscamos: una "Austin sin el programa" creíble es una que reproduzca de cerca la trayectoria *pre-tratamiento* de Austin en viajes completados. Si el candidato a contrafáctico ni siquiera logra igualar lo que ya sabemos que pasó antes del tratamiento, no hay razón para confiar en lo que dice sobre lo que habría pasado después.

**Dashboard 1** fija el resto del problema para que puedas concentrarte en esta sola decisión: el panel de donantes son las mismas 18 ciudades de tamaño medio en la red de Uber, y los predictores usados para comparar ciudades son siempre los mismos (población, ingreso, conductores activos, participación de mercado de Lyft, y viajes pre-tratamiento en cuatro semanas de referencia). Lo único que cambia es **cómo combinás** esas 18 ciudades para construir el contrafáctico. Antes de explorar:

- Empezá en modo **"Ciudad única"**. Acá el dashboard elige automáticamente la ciudad con la tendencia más parecida a Austin como contrafáctico, usando el RMSPE (el error cuadrático medio entre Austin y la comparación, en las 20 semanas previas al lanzamiento) — la tabla de datos arriba de los controles te muestra qué ciudad fue elegida y por qué se parece a Austin en el papel.
- Pasá a **"Promedio simple"** (todas las ciudades donantes pesan $1/18$) y compará el ajuste. ¿Mejora o empeora respecto a la ciudad única?
- Pasá a **"Sintético optimizado"** y observá dos cosas a la vez: el ajuste pre-tratamiento mejora, y el gráfico de pesos deja de estar disperso uniformemente — se concentra en un puñado de ciudades donantes.

<div style="position: relative; padding-bottom: 56.25%; height: 0; overflow: hidden;">
  <iframe src="https://simuecon.com/synthetic_control_weights/?lang=es" style="position: absolute; top: 0; left: 0; width: 100%; height: 100%; border: 0;" allowfullscreen></iframe>
</div>

**¿Qué observamos?** La ciudad única mejor emparejada — la que minimiza el RMSPE pre-tratamiento entre las 18 candidatas — igual deja una brecha visible en varias de las 20 semanas previas al lanzamiento. El promedio simple es, casi siempre, todavía peor: promediar *todas* las ciudades del panel diluye el parecido con Austin, incorporando ciudades que no se le parecen en nada. El sintético optimizado, en cambio, logra un ajuste pre-tratamiento casi exacto — y lo hace apoyándose en solo 3 o 4 ciudades donantes, no en las 18. La tabla de balance (Austin vs. promedio simple vs. sintético ponderado, para cada predictor) hace visible por qué: la columna ponderada del sintético queda mucho más cerca de la columna de Austin que la columna del promedio simple, fila por fila.

Esto sugiere una idea central del método, que formalizamos a continuación: **el ajuste pre-tratamiento no es un detalle estético — es la evidencia de que el contrafáctico es creíble**, y se logra dejando que los pesos se concentren donde el parecido es real, no forzándolos a repartirse por igual.

---

## 3. Construcción del Control Sintético: Pesos y Predictores

Formalicemos lo que el Dashboard 1 acaba de mostrar.

**Unidades y datos.** Tenemos $J+1$ unidades — en nuestro ejemplo, Austin más 18 ciudades donantes ($J=18$) — observadas durante $T$ períodos, de los cuales los primeros $T_0=20$ son pre-tratamiento (en el dashboard, $T=32$: 20 semanas previas más 12 posteriores al lanzamiento). La unidad $j=1$ (Austin) recibe el tratamiento; el **panel de donantes** $j=2,\dots,J+1$ no. Cada unidad tiene un vector de $k$ **predictores** $X_j$ — en el dashboard, 8 en total: 4 variables demográficas (población, ingreso, conductores activos, participación de Lyft) más 4 observaciones de viajes rezagadas (semanas 5, 10, 15 y 20). Apilamos los predictores del panel de donantes en la matriz $X_0$ ($k\times J$) y los de Austin en el vector $X_1$ ($k\times 1$).

**Resultados potenciales y el estimador.** Sea $Y_{jt}^N$ el resultado que observaríamos sin el programa, y $Y_{1t}^I$ el resultado de Austin bajo el programa, para $t>T_0$. El control sintético define un vector de pesos $W=(w_2,\dots,w_{J+1})'$ y estima el contrafáctico no observado de Austin como una combinación ponderada de los donantes:

$$\hat{Y}_{1t}^N = \sum_{j=2}^{J+1} w_j\, Y_{jt}$$

y el efecto causal estimado en cada período post-tratamiento como

$$\hat{\tau}_{1t} = Y_{1t} - \hat{Y}_{1t}^N, \qquad t = T_0+1,\dots,T$$

**La restricción que distingue al método.** Los pesos están restringidos a ser no negativos y a sumar uno: $w_j \geq 0$, $\sum_j w_j = 1$. Esta restricción es lo que hace que el "sintético" del método sea, literalmente, un promedio ponderado de ciudades reales — nunca una extrapolación fuera del rango de los datos observados. Contrastá esto con una regresión sin restricciones, donde los coeficientes pueden tomar cualquier signo y magnitud: una regresión podría "inventar" una Austin sintética con más conductores que la ciudad más grande del panel de donantes, simplemente extrapolando. El control sintético no puede hacer eso — su contrafáctico siempre vive dentro de la envolvente convexa de las ciudades donantes.

**Cómo se eligen los pesos.** $W^*$ se elige para minimizar la distancia entre los predictores de Austin y los del panel de donantes ponderado:

$$\min_{W}\ \|X_1 - X_0 W\|_V = \left(\sum_{h=1}^{k} v_h\, (X_{h1} - X_{h0}'W)^2\right)^{1/2} \quad \text{sujeto a } w_j\geq0,\ \textstyle\sum_j w_j=1$$

donde $v_h \geq 0$ pondera la importancia relativa de cada predictor $h$ en la distancia. El Dashboard 1 usa el **"selector simple"**: fija $v_h$ como el inverso de la varianza muestral del predictor $h$ a través de las 19 ciudades — equivalente a estandarizar cada predictor antes de medir distancias, para que ningún predictor domine solo por estar en una escala más grande (población en millones vs. participación de mercado en porcentaje, por ejemplo). Un enfoque más riguroso, implementado en paquetes como `scpi`, elige $V$ minimizando el error de predicción fuera de muestra: se separan los períodos pre-tratamiento en un tramo de entrenamiento y uno de validación, se calculan los pesos usando solo el tramo de entrenamiento, y se elige el $V$ que minimiza el error cuadrático de predicción en el tramo de validación. Este procedimiento de validación cruzada tiene una ventaja adicional — también sirve para comparar conjuntos de predictores entre sí — pero requiere suficientes períodos pre-tratamiento para dividir en dos tramos con sentido.

Con $W^*$ resuelto, el gráfico de pesos del Dashboard 1 es la cara visual de esta optimización: bajo "ciudad única", todo el peso cae en una sola barra; bajo "promedio simple", las 18 barras tienen la misma altura ($1/18$); bajo "sintético optimizado", unas pocas barras se elevan claramente por encima del resto — la **dispersión (sparsity)** de los pesos no es un efecto secundario, es la firma de que el algoritmo encontró un subconjunto de ciudades genuinamente parecidas a Austin, en lugar de promediar indiscriminadamente.

<div class="jupyterlite-embed-wrapper" data-paid-gated="false"
     data-lite-url="_jupyterlite/notebooks/index.html?path=6_synthetic_control_notebook.ipynb"
     data-button-label="💻 Cómo estimar en Código"></div>

---

## 4. Un Estudio de Caso Clásico: Proposition 99 en California

El escenario de Uber y Austin nos acompaña en toda esta sección porque es el hilo conductor que venimos construyendo desde ECR y variables instrumentales. Pero vale la pena detenerse un momento en el estudio que introdujo el método en la literatura: {cite:t}`abadie2010synthetic`, sobre **Proposition 99**, la ley de control de tabaco de California de 1988 que aumentó el impuesto al cigarrillo en 25 centavos por paquete.

Los autores construyen un control sintético para California a partir de un panel de otros 38 estados que no adoptaron controles de tabaco comparables, usando como predictores el consumo de cigarrillos rezagado y variables demográficas y de precios. El resultado reproduce, con estos datos reales, exactamente el patrón que vimos en el Dashboard 1: el ajuste pre-tratamiento es cercano y los pesos son dispersos.

```{image} images/prop99_fit.png
:alt: Proposition 99: California vs. control sintético
:width: 60%
:align: center
```

*El control sintético (línea punteada) sigue de cerca el consumo real de California (línea sólida) durante las 19 años previos a 1988, y luego las trayectorias se separan marcadamente tras la ley.*

*Datos y figura recreados a partir de Abadie, Diamond y Hainmueller (2010).*

El control sintético de California recibe casi todo su peso de solo seis estados donantes: Utah (0.39), Montana (0.27), Nevada (0.19), Connecticut (0.08), New Hampshire (0.05) y Colorado (0.03) — el resto del peso es esencialmente cero. El RMSPE pre-tratamiento es 1.70 paquetes per cápita, y para el año 2000 la brecha entre California y su control sintético alcanza casi 27 paquetes per cápita menos — consistente con el efecto de la ley.

Una figura adicional del propio paper de {cite:t}`abadie2010synthetic` ilustra algo que retomamos formalmente en la Sección 5: al aplicar el mismo procedimiento de estimación a *cada* estado del panel de donantes, como si cada uno hubiera recibido el tratamiento, algunos estados producen brechas post-tratamiento igual de grandes que la de California — pero solo porque el control sintético nunca logró un buen ajuste pre-tratamiento para esos estados en primer lugar.

```{image} images/prop99_permutation.png
:alt: Distribución de placebos: California vs. 38 estados donantes
:width: 60%
:align: center
```

*Cada línea gris es la brecha (real − sintético) de un estado donante bajo el mismo procedimiento aplicado a California (línea morada). Varios estados producen brechas grandes en el período post-tratamiento — la Sección 5 formaliza por qué no todas cuentan igual.*

*Datos y figura recreados a partir de Abadie, Diamond y Hainmueller (2010).*

Este es un anclaje histórico, no un nuevo ejemplo a seguir: el hilo conductor de esta sección sigue siendo Uber y Austin. Pero conviene señalar, con honestidad, un matiz que el cuaderno de código explora en detalle: a diferencia de la versión simulada del Dashboard 3 —donde excluir donantes de mal ajuste sí agudiza el p-valor— en los datos reales de Proposition 99 los dos estados con peor ranking que California (Missouri y Virginia) tienen, de hecho, *mejor* ajuste pre-tratamiento que la propia California. Ningún punto de corte por calidad de ajuste los excluye, así que el p-valor de permutación queda alrededor de 0.08–0.10 en lugar de acercarse al ~0.026 que reporta el paper original bajo otros criterios de exclusión. Los datos reales no siempre se comportan tan limpiamente como una simulación diseñada para ilustrar un mecanismo — y es una buena lección en sí misma.

---

## 5. El Límite de Sesgo Bajo un Modelo de Factores

Un ajuste pre-tratamiento cercano es necesario, pero **no es automáticamente suficiente**. Un control sintético puede parecerse mucho a Austin en el período pre-tratamiento y aun así producir una estimación sesgada del efecto — si ese parecido se logró por casualidad, o si captura las variables equivocadas. Esta sección formaliza cuándo un buen ajuste sí implica bajo sesgo, y cuándo no.

**Dashboard 2** aísla exactamente esta pregunta. A diferencia del Dashboard 1 —donde la calidad del panel de donantes era enteramente observable en los datos demográficos— aquí introducimos por primera vez un **factor no observado** $\mu_j$ que también determina el resultado de cada ciudad. Esto nos permite separar dos nociones que suelen confundirse: "el ajuste visible se ve bien" y "el sesgo es realmente bajo". Antes de explorar:

- Fijá `fit_quality` en **"Buen ajuste"** y recorré $T_0$ de 5 a 50 semanas: el sesgo medio (en valor absoluto) se achica a medida que $T_0$ crece.
- Cambiá a **"Mal ajuste"** y repetí el recorrido de $T_0$: la curva de sesgo medio se mantiene **plana y elevada**, sin importar cuántos períodos pre-tratamiento agregues.
- Compará el caso peor (ruido transitorio alto + $T_0=5$) contra el caso mejor (ruido bajo + buen ajuste + $T_0=50$) para ver el rango completo.

<div style="position: relative; padding-bottom: 56.25%; height: 0; overflow: hidden;">
  <iframe src="https://simuecon.com/synthetic_control_bias/?lang=es" style="position: absolute; top: 0; left: 0; width: 100%; height: 100%; border: 0;" allowfullscreen></iframe>
</div>

**¿Qué observamos?** El panel superior ("Una Realización") ya deja ver la diferencia a simple vista: bajo mal ajuste, las trayectorias de Austin y su sintético divergen incluso *antes* del tratamiento, mientras que las 18 ciudades donantes en gris de fondo muestran que el problema no es falta de datos — es que ninguna combinación de esas ciudades puede replicar a Austin. El histograma de sesgo y, sobre todo, el gráfico central de sesgo medio vs. $T_0$ confirman el patrón: bajo buen ajuste, más períodos pre-tratamiento sí reducen el sesgo, porque cada período adicional es una oportunidad más para que un ajuste "afortunado" se revele como tal. Bajo mal ajuste, agregar períodos no ayuda en absoluto — el sesgo no proviene de ruido muestral que se promedia con más datos, proviene de que el contrafáctico está mal especificado desde el principio.

**Resultado formal.** Consideremos el modelo de factores propuesto por {cite:t}`abadie2010synthetic`:

$$Y_{jt}^N = \delta_t + \theta_t Z_j + \lambda_t \mu_j + \varepsilon_{jt}$$

donde $\delta_t$ es un factor temporal común, $\theta_t$ son coeficientes variables en el tiempo sobre predictores observados $Z_j$, $\lambda_t$ es un vector de factores no observados con cargas específicas por unidad $\mu_j$, y $\varepsilon_{jt}$ es ruido transitorio idiosincrático. (Si $\lambda_t$ fuera constante en el tiempo, este modelo colapsa a DiD con tendencias paralelas; al permitir que $\lambda_t$ varíe, el modelo de factores es estrictamente más general.)

Bajo la condición de que el control sintético reproduce exactamente los predictores observados de Austin, $X_1 = X_0 W^*$:

> **Resultado formal:** el sesgo de $\hat\tau_{1t}$ está acotado por una expresión que depende de la razón entre la escala del ruido transitorio $\varepsilon_{jt}$ y el número de períodos pre-tratamiento $T_0$.

La intuición: si $X_1=X_0W^*$, el control sintético empareja la parte observada $Z_1$, pero no puede emparejar directamente $\mu_1$, que es inobservable. Un control sintético que ajusta $Z_1$ pero no $\mu_1$ solo puede lograr un buen ajuste pre-tratamiento si el ruido transitorio $\varepsilon_{jt}$ compensa por casualidad el desajuste en $\mu_j$ — simultáneamente, en cada uno de los $T_0$ períodos. Cuantos más períodos deban "alinearse por suerte" para sostener ese ajuste, menos plausible es que sea pura casualidad — de ahí que el límite del sesgo dependa inversamente de $T_0$. La demostración formal se encuentra en el [apéndice](#apendice-sc).

**La advertencia crucial.** {cite:t}`abadie2010synthetic` son explícitos sobre no sobre-interpretar este resultado a medida que $T_0\to\infty$: el sesgo puede persistir sin importar cuántos períodos pre-tratamiento agreguemos, *a menos que* la calidad del ajuste $X_1 - X_0 W^*$ sea realmente buena. El límite se deriva **condicional** en lograr ese ajuste — no garantiza que el ajuste mejore, ni que exista, solo porque $T_0$ es grande. Esto es exactamente lo que el Dashboard 2 hace visible: la curva de "mal ajuste" nunca converge a cero, sin importar cuán grande sea $T_0$.

---

## 6. Inferencia por Permutación

Incluso una estimación con buen ajuste y sesgo acotado necesita una respuesta a la pregunta: ¿es esta brecha post-tratamiento grande en comparación con lo que veríamos por variación idiosincrática entre ciudades, sin ningún efecto real? Con $J+1$ unidades agregadas —no una muestra grande de individuos— no existe una distribución muestral natural sobre la cual apoyar un error estándar convencional. El control sintético resuelve esto con **inferencia por permutación**.

**Dashboard 3** implementa el procedimiento completo: reasigna el "tratamiento" a cada una de las 18 ciudades donantes por turno, recalculando el control sintético para cada una como si fuera la tratada, y compara el resultado de Austin contra esta distribución de resultados "placebo". Antes de explorar:

- Poné el filtro de ajuste (`fit_cutoff`) en **"Mantener todas"** y observá cómo los placebos de mal ajuste — con brechas grandes y poco informativas — diluyen el ranking.
- Ajustá el filtro a **"3×"** o **"5×"** y mirá la tabla de ciudades excluidas: el p-valor se agudiza a medida que se filtran los donantes que nunca ajustaron bien en el período pre-tratamiento.
- Alterná `true_effect` entre **0%** (para chequear calibración: el estadístico de Austin debería verse anodino dentro de la distribución placebo) y **15%** (para chequear potencia: el estadístico de Austin debería ubicarse cerca del extremo).

<div style="position: relative; padding-bottom: 56.25%; height: 0; overflow: hidden;">
  <iframe src="https://simuecon.com/synthetic_control_inference/?lang=es" style="position: absolute; top: 0; left: 0; width: 100%; height: 100%; border: 0;" allowfullscreen></iframe>
</div>

**¿Qué observamos?** El gráfico de líneas superior muestra las 19 trayectorias de brecha (real − sintético): Austin resaltada, los donantes excluidos por el filtro actual en gris tenue, y los donantes retenidos en gris más marcado. Con el filtro en "mantener todas", varias ciudades donantes nunca lograron un buen ajuste pre-tratamiento — su "brecha placebo" es grande simplemente porque su control sintético nunca las representó bien, no porque haya un efecto real. Incluirlas en la comparación diluye la significatividad del resultado de Austin. A medida que el filtro se ajusta, esas ciudades desaparecen de la comparación y el p-valor se mueve — hacia valores más bajos cuando `true_effect` es positivo, permaneciendo cerca de lo esperado bajo el azar cuando `true_effect` es cero.

**Formalización.** Para cada unidad $j$ (Austin y cada donante, tratado como placebo), definimos:

$$r_j = \frac{\text{RMSPE}_{\text{post},j}}{\text{RMSPE}_{\text{pre},j}}$$

el cociente entre el error de ajuste post-tratamiento y el error de ajuste pre-tratamiento. Este es el estadístico correcto — no la brecha post-tratamiento cruda — precisamente porque normaliza por la calidad del ajuste de cada unidad: una unidad cuyo control sintético nunca ajustó bien *pre*-tratamiento tendrá un RMSPE pre-tratamiento ya grande, así que su $r_j$ no se dispara aunque su brecha post-tratamiento también sea grande por la misma razón estructural. El **p-valor de permutación**, basado en el ranking, es

$$p = \frac{1}{J'+1}\sum_{j} \mathbb{1}[r_j \geq r_1]$$

la proporción de unidades (Austin incluida) cuyo $r_j$ es al menos tan grande como el de Austin, entre las $J'+1$ unidades que sobreviven el filtro de calidad de ajuste. Esta es exactamente la lógica que el control de `fit_cutoff` del Dashboard 3 pone en tus manos: decidir qué tan estricto es el criterio de "esta unidad podría razonablemente haberse comparado con Austin" antes de construir el ranking.

```{admonition} 💻 Cómo estimar en Código
:class: dropdown

El dashboard de arriba corre la inferencia por permutación sobre el escenario simulado de Austin. El mismo cuaderno de código de la sección anterior también implementa este procedimiento de permutación *leave-one-out* — el mismo cálculo de $r_j$ y el mismo p-valor basado en ranking — primero sobre el escenario de Austin, y después sobre los datos reales de Proposition 99, reproduciendo la distribución de placebos clásica de {cite:t}`abadie2010synthetic`. También muestra, como contraste explícito y no como reemplazo, la inferencia por intervalos de predicción de `scpi_pkg` — un enfoque simulación/conformal materialmente distinto al p-valor de permutación clásico.
```

---

## 7. Resumen y Árbol de Decisión

Antes de reportar un resultado de control sintético, conviene recorrer las siguientes preguntas en orden:

1. **¿El tratamiento golpea una (o pocas) unidades agregadas grandes, con muchos comparadores potenciales no tratados?** Si en cambio tenés muchas unidades tratadas en momentos distintos, DiD escalonado suele ser la herramienta más natural; si tenés variación exógena en el tratamiento a nivel individual, pensá en variables instrumentales.
2. **¿Existe un panel de donantes capaz de lograr un buen ajuste pre-tratamiento?** Si ningún subconjunto de donantes se acerca razonablemente a los predictores de la unidad tratada, {cite:t}`abadie2010synthetic` son explícitos: no uses control sintético en ese caso — el riesgo de sesgo sustancial es demasiado alto.
3. **¿Hay suficientes períodos pre-tratamiento en relación al ruido idiosincrático esperado?** Esto determina cuánto podés confiar en que el límite de sesgo efectivamente se achica con $T_0$, en lugar de quedarse plano como en el caso de mal ajuste del Dashboard 2.
4. **¿El p-valor de permutación sobrevive un filtro razonable de calidad de ajuste entre los placebos?** Un p-valor calculado incluyendo donantes que nunca ajustaron bien pre-tratamiento no es comparable con uno que sí los excluye — como vimos en el Dashboard 3 y, con matices, en el propio caso de Proposition 99.

Más allá de estas cuatro preguntas, la práctica estándar incluye dos controles de robustez adicionales que no tienen todavía su propio dashboard en esta sección, pero que vale la pena mencionar como buena práctica: un **placebo en el tiempo** (adelantar artificialmente la fecha de intervención y verificar que no aparezca un "efecto" espurio antes del lanzamiento real) y un ejercicio de **leave-one-out** (quitar cada donante de a uno y recalcular, para verificar que el resultado no dependa desproporcionadamente de una sola ciudad). Un placebo en el tiempo que sí muestra efecto sugiere que el modelo está capturando algo distinto al tratamiento — quizás anticipación, quizás un shock omitido. Un leave-one-out inestable sugiere que un solo donante está cargando con una porción desproporcionada de la identificación.

El control sintético completa el conjunto de herramientas cuasi-experimentales de este capítulo. Frente a DiD, que promedia sobre muchas unidades tratadas y de control para estimar un efecto agregado, el control sintético está diseñado para el caso opuesto: una (o pocas) unidades tratadas, y todo el trabajo de identificación puesto en construir un contrafáctico creíble a partir de las unidades no tratadas disponibles. Frente a variables instrumentales, que explota variación exógena a nivel individual cuando existe un instrumento válido, el control sintético no necesita ningún instrumento — pero exige, a cambio, un panel de donantes con el que se pueda lograr un ajuste pre-tratamiento genuinamente bueno. Elegir entre estas herramientas es, ante todo, elegir cuál describe mejor la estructura de asignación del tratamiento que tenés enfrente.

---

(apendice-sc)=
## Apéndice: Derivaciones Formales

### A.1 El problema de selección de pesos como mínimos cuadrados restringidos

**Setup.** Buscamos $W=(w_2,\dots,w_{J+1})'$ que resuelva

$$\min_{W}\ (X_1 - X_0W)'\,\text{diag}(v_1,\dots,v_k)\,(X_1-X_0W) \qquad \text{sujeto a } w_j\geq0,\ \textstyle\sum_j w_j=1$$

Esto es un problema de mínimos cuadrados generalizados con dos restricciones lineales adicionales sobre $W$.

**Paso 1 — Sin restricciones, esto sería una regresión.** Si eliminamos ambas restricciones ($w_j\geq0$ y $\sum w_j=1$), el problema se reduce a una regresión lineal de $X_1$ sobre las columnas de $X_0$, ponderada por $V=\text{diag}(v_1,\dots,v_k)$: la solución de mínimos cuadrados generalizados $W_{\text{MCG}} = (X_0'VX_0)^{-1}X_0'VX_1$. Nada impide que algún $w_j$ sea negativo o mayor a uno — la regresión puede "extrapolar": construir una combinación con más población, o menos ingreso, que cualquier donante individual, siempre que eso minimice la distancia ponderada.

**Paso 2 — La restricción $\sum_j w_j=1$ ancla la escala.** Esta restricción asegura que si $X_1$ y todas las columnas de $X_0$ se desplazan por una constante aditiva común, la solución no cambia arbitrariamente — el control sintético hereda el nivel de los predictores promedio de los donantes, ponderados, en lugar de un nivel arbitrario que dependa del origen de medición elegido.

**Paso 3 — La restricción $w_j\geq0$ ancla la combinación dentro de la envolvente convexa.** Combinada con $\sum_j w_j=1$, esta restricción implica que $X_0W$ es siempre un promedio ponderado de las columnas de $X_0$ — geométricamente, un punto dentro de la envolvente convexa de los donantes en el espacio de predictores. Ningún $\hat{Y}_{1t}^N$ puede caer fuera del rango de valores observados en el panel de donantes. Esta es la diferencia estructural clave frente a una regresión sin restringir, que si puede extrapolar fuera de ese rango.

**Conclusión.** El problema de selección de pesos del control sintético es una regresión con restricciones adicionales de no negatividad y suma unitaria; estas dos restricciones son, precisamente, las que convierten al "sintético" en un promedio ponderado interpolado — nunca extrapolado — de unidades donantes reales.

---

### A.2 Bosquejo del límite de sesgo bajo el modelo de factores

**Setup.** Bajo el modelo de factores $Y_{jt}^N = \delta_t + \theta_t Z_j + \lambda_t \mu_j + \varepsilon_{jt}$, y suponiendo que el control sintético reproduce exactamente los predictores observados de la unidad tratada, $X_1 = X_0W^*$ (donde $X_1, X_0$ incluyen $Z_j$ y, típicamente, resultados pre-tratamiento).

**Paso 1 — Descomponer el sesgo.** El sesgo de $\hat\tau_{1t} = Y_{1t} - \sum_j w_j^* Y_{jt}$ respecto al efecto verdadero puede escribirse, sustituyendo el modelo de factores, como una función de tres piezas: la diferencia en el factor temporal común $\delta_t$ (que se cancela porque es común a todas las unidades y $\sum_j w_j^*=1$), la diferencia en el componente observado $\theta_t(Z_1 - Z_0W^*)$ (que se anula bajo $X_1=X_0W^*$, en la parte de $X$ correspondiente a $Z$), y dos términos que no se cancelan automáticamente: $\lambda_t(\mu_1 - \mu_0'W^*)$ — el desajuste en el factor no observado — y $\varepsilon_{1t} - \varepsilon_0'W^*$ — el ruido transitorio.

**Paso 2 — Por qué $\varepsilon$ y $T_0$ entran en el límite.** El desajuste en el factor no observado, $\mu_1 - \mu_0'W^*$, no puede eliminarse eligiendo $W^*$ porque $\mu_j$ no es observable — no entra en $X_1, X_0$. Pero si el ajuste pre-tratamiento $X_1\approx X_0W^*$ se logró exactamente, eso solo pudo suceder porque, en cada uno de los $T_0$ períodos pre-tratamiento, el ruido transitorio $\varepsilon_{jt}$ compensó por casualidad ese desajuste en $\mu_j$ lo suficiente como para que los predictores observados coincidieran. La probabilidad de que $\varepsilon_{jt}$ compense el mismo desajuste estructural en $\mu_j$ de forma consistente a través de más y más períodos ($T_0$ creciente) decae — de ahí que la cota del sesgo dependa de la razón entre la escala de $\varepsilon_{jt}$ y $T_0$.

**Paso 3 — Por qué la cota es condicional, no incondicional.** Todo el argumento del Paso 2 parte de asumir $X_1=X_0W^*$ exactamente. Si esa condición no se cumple —si el panel de donantes simplemente no puede replicar los predictores observados de la unidad tratada—, el término $\lambda_t(\mu_1-\mu_0'W^*)$ no tiene por qué achicarse con $T_0$, y el sesgo puede permanecer grande sin importar cuántos períodos pre-tratamiento se agreguen. Esto es exactamente lo que {cite:t}`abadie2010synthetic` advierten: la cota se deriva *condicional* en lograr un buen ajuste; no es una garantía de que ese ajuste exista o mejore a medida que $T_0\to\infty$.

**Conclusión.** El sesgo del control sintético, bajo el modelo de factores y condicional en un ajuste pre-tratamiento exacto, está controlado por la razón entre la escala del ruido transitorio y $T_0$ — pero esa condicionalidad es la advertencia central del resultado, no una nota al pie: sin buen ajuste, agregar períodos pre-tratamiento no repara el sesgo.

---

## Poné a prueba lo que aprendiste

<div class="quiz-widget" data-quiz-slug="ch4-synthetic-control"></div>

## Referencias

Los dashboards interactivos de esta sección también se apoyan en {cite:t}`abadie2021using`, además de {cite:t}`abadie2010synthetic`.

```{bibliography}
:filter: docname in docnames
```
