Diferencias en Diferencias#

Una empresa de software B2B despliega un asistente de inteligencia artificial para sus representantes de ventas. El lanzamiento no fue simultáneo: algunas regiones lo recibieron en el primer trimestre, otras en el tercero, y algunas nunca lo adoptaron. La dirección quiere saber si la herramienta mejoró la productividad. ¿Cómo lo estimamos cuando la asignación del tratamiento no fue aleatoria?

Esta sección presenta el estimador de diferencias en diferencias (DiD), el método cuasi-experimental más utilizado en economía aplicada y en análisis de datos de empresas tecnológicas. Partiremos de la intuición visual, formalizaremos el estimador, discutiremos el supuesto que lo sostiene, y concluiremos con la versión moderna para diseños escalonados.


1. La Lógica de DiD: El Contrafáctico del Grupo de Control#

Tras el lanzamiento del asistente de IA, los representantes de las regiones que lo recibieron venden, en promedio, 25 % más que los de las regiones que nunca lo adoptaron. ¿Podemos atribuir esta diferencia al asistente?

No directamente. Antes del lanzamiento, las regiones que recibirían el asistente ya vendían alrededor de 10 % más que las otras — una diferencia preexistente atribuible al tamaño del mercado, la antigüedad del equipo y otros factores difíciles de medir. Comparar los dos grupos después del lanzamiento confunde el efecto del programa con esa ventaja preexistente.

¿Y si miráramos el cambio en las ventas dentro de las regiones tratadas — comparando cada región consigo misma, antes y después? Eso evita el problema de diferencias de nivel, pero crea uno nuevo: las ventas crecen cada trimestre por expansión del mercado, factores estacionales y crecimiento del equipo. Una estimación de antes-después solo para el grupo tratado recoge esas tendencias temporales además del efecto del programa, inflando la estimación.

Necesitamos un contrafáctico: ¿qué le habría pasado a las ventas en las regiones tratadas si no hubieran recibido el asistente? Las regiones que nunca lo adoptaron nos dan exactamente esa referencia — siempre que asumamos que, de no haber habido tratamiento, ambos grupos habrían seguido la misma tendencia. La diferencia en la variación de las ventas (cambio tratados menos cambio controles) cancela tanto la brecha de nivel preexistente como la tendencia temporal común, y deja solo el efecto del tratamiento.

Eso es DiD en una oración: la variación temporal del grupo de control es el contrafáctico de la variación temporal del grupo tratado.

Exploración: el estimador DiD en acción#

Usaremos ahora datos simulados para ilustrar la estrategia DiD. La simulación genera datos para dos grupos de regiones (tratadas y de control) a lo largo de dos períodos (antes y después del lanzamiento). El parámetro clave es τ — el efecto verdadero del asistente sobre las ventas. Los parámetros de fondo (brecha inicial α = 10, tendencia común λ = 5) están fijos.

Explora la simulación en modo «2×2»:

  • Observa el gráfico de líneas. Identifica el grupo tratado y el de control. Nota que los dos grupos arrancan en niveles distintos — hay una brecha preexistente. ¿Dónde usa la estrategia DiD la trayectoria del grupo de control?

  • Mira la tabla 2×2 debajo del gráfico. La celda inferior derecha («DiD») muestra la diferencia de cambios. Compárala con el coeficiente Treat×Post en la tabla de regresión.

  • Cambia τ a distintos valores (por ejemplo, 5, 10, 30). Observa cómo el valor DiD en la tabla y el coeficiente de regresión siguen a τ con exactitud — independientemente de la brecha inicial o la tendencia común.

¿Qué observamos?#

El estimador DiD recupera τ con precisión, sin importar cuán grande sea la brecha inicial α entre los grupos ni cuán pronunciada sea la tendencia temporal λ. Ambas se cancelan en la diferencia de diferencias: el cambio del grupo de control (Δλ) se resta del cambio del grupo tratado (Δλ + τ), y lo que queda es exactamente τ. La tabla 2×2 y el coeficiente de regresión reportan el mismo número — y ese número es igual al efecto verdadero que establecimos.


2. El Estimador DiD: Doble Diferencia y Regresión#

Cuándo funciona DiD: un caso intuitivo#

Presentaremos el supuesto clave formalmente en la sección siguiente, pero primero entendamos el caso intuitivo en el que DiD recupera el efecto con exactitud. Supongamos que, en ausencia de tratamiento, el resultado de la unidad \(i\) en el período \(t\) sigue:

\[Y_{it}(0) = \alpha_i + \lambda_t + \varepsilon_{it}\]

donde \(\alpha_i\) es una constante específica de cada unidad, invariante en el tiempo — el nivel base de ventas de cada región, determinado por su tamaño de mercado, calidad del equipo y otras características estables — y \(\lambda_t\) es un efecto temporal común a todas las regiones. Tanto el grupo tratado como el de control comparten el mismo \(\lambda_t\): ningún grupo crece más rápido que el otro por sí solo. Con el tratamiento, el resultado potencial es:

\[Y_{it}(1) = Y_{it}(0) + \tau\]

de modo que el resultado observado para una unidad tratada después del lanzamiento es \(\alpha_i + \lambda_t + \tau + \varepsilon_{it}\).

La tabla 2×2 y la doble diferencia#

Tomando promedios de grupo, sean \(\bar{\alpha}_C\) y \(\bar{\alpha}_T\) los efectos unitarios promedio para control y tratados, y \(\Delta\lambda = \lambda_{\text{post}} - \lambda_{\text{pre}}\) la tendencia temporal común:

Antes

Después

Cambio

Control

\(\bar{\alpha}_C + \lambda_{\text{pre}}\)

\(\bar{\alpha}_C + \lambda_{\text{post}}\)

\(\Delta\lambda\)

Tratadas

\(\bar{\alpha}_T + \lambda_{\text{pre}}\)

\(\bar{\alpha}_T + \lambda_{\text{post}} + \tau\)

\(\Delta\lambda + \tau\)

DiD

\(\boldsymbol{\tau}\)

La brecha de nivel \((\bar{\alpha}_T - \bar{\alpha}_C)\) se cancela porque está presente en ambos períodos. La tendencia común \(\Delta\lambda\) se cancela porque ambos grupos la comparten. Lo que queda es exactamente \(\tau\).

El estimador de diferencias en diferencias es la diferencia de cambios:

\[\widehat{\tau}_{DiD} = \bigl(\bar{Y}_{T,\text{post}} - \bar{Y}_{T,\text{pre}}\bigr) - \bigl(\bar{Y}_{C,\text{post}} - \bar{Y}_{C,\text{pre}}\bigr)\]

La derivación algebraica para el caso general se encuentra en el apéndice. El resultado clave: cuando ambos grupos comparten la misma tendencia temporal, la brecha de nivel y la tendencia común se cancelan, y el estimador recupera exactamente \(\tau\).

Equivalencia con regresión#

La misma estimación se obtiene corriendo MCO sobre:

\[Y_{it} = \beta_0 + \beta_1 G_i + \beta_2 \text{Post}_t + \hat{\tau}\,(G_i \times \text{Post}_t) + \varepsilon_{it}\]

El coeficiente \(\hat{\tau}\) en la interacción \(G_i \times \text{Post}_t\) es algebraicamente idéntico a la doble diferencia de medias. La demostración formal se encuentra en el apéndice. La formulación en regresión es conveniente porque produce errores estándar directamente, permite agregar controles adicionales, y se generaliza a múltiples períodos y múltiples grupos. La tabla OLS en el panel de la simulación muestra exactamente ese coeficiente — obsérvalo seguir a τ mientras cambias el tamaño del efecto.


3. El Supuesto de Tendencias Paralelas#

Cuándo falla DiD: tendencias diferenciales#

Es fácil construir un caso en que el DiD 2×2 falla. Vuelve a la simulación y cambia al modo «Pre-trends Inspection». Esto revela un nuevo parámetro, δ, que captura si las regiones tratadas ya venían creciendo a una tasa distinta que las de control antes del lanzamiento.

  • Fija δ = 0. La estimación DiD coincide con τ exactamente — los dos grupos corren paralelos antes del lanzamiento.

  • Ahora sube δ a 10 o bájalo a −10. Observa que la estimación DiD se aleja de τ. La tendencia del grupo tratado ya era distinta de la del grupo de control antes del tratamiento, y esa divergencia preexistente es absorbida por el estimador como un efecto espurio.

Para entender por qué, extendemos el modelo. Sea \(G_i \in \{0,1\}\) si la región \(i\) pertenece al grupo tratado, y \(\text{Post}_t \in \{0,1\}\) si el período \(t\) es posterior al lanzamiento. Supongamos que el resultado potencial sin tratamiento es:

\[Y_{it}(0) = \mu + \alpha G_i + \lambda \,\text{Post}_t + \delta\, G_i \cdot \text{Post}_t + \varepsilon_{it}\]

Esto extiende el modelo de la Sección 2 añadiendo \(\delta\): una tendencia diferencial del grupo tratado que existiría incluso sin el tratamiento. La tabla 2×2 ahora se convierte en:

Antes (\(\text{Post}=0\))

Después (\(\text{Post}=1\))

Cambio

Control (\(G=0\))

\(\mu\)

\(\mu + \lambda\)

\(\lambda\)

Tratadas (\(G=1\))

\(\mu + \alpha\)

\(\mu + \alpha + \lambda + \delta + \tau\)

\(\lambda + \delta + \tau\)

DiD

\(\tau + \delta\)

Cuando δ ≠ 0, el estimador devuelve \(\tau + \delta\) en lugar de \(\tau\). El sesgo es exactamente δ — visible en la simulación como la brecha entre el τ verdadero y el coeficiente Treat×Post. La derivación algebraica se encuentra en el apéndice.

Supuesto de tendencias paralelas: Para que \(\widehat{\tau}_{DiD} = \tau\) se necesita δ = 0, es decir:

\[\mathbb{E}[Y_{it}(0) \mid G=1, \text{Post}=1] - \mathbb{E}[Y_{it}(0) \mid G=1, \text{Post}=0] = \mathbb{E}[Y_{it}(0) \mid G=0, \text{Post}=1] - \mathbb{E}[Y_{it}(0) \mid G=0, \text{Post}=0]\]

En palabras: el cambio contrafáctico de las regiones tratadas (lo que les habría ocurrido sin el asistente) debe ser igual al cambio observado en las regiones de control.

Examinando las tendencias con la simulación#

En el modo «Pre-trends Inspection», la simulación genera tres períodos (pre, antes, después), trazando la trayectoria completa de ambos grupos incluyendo un período anterior a cualquier tratamiento. Esta es la herramienta diagnóstica clave para evaluar el supuesto de tendencias paralelas en la práctica.

  • Con δ = 0, las dos líneas son paralelas en el período previo — la pendiente es la misma en ambos grupos antes del lanzamiento. El coeficiente pre-tratamiento en el gráfico de estudio de eventos es cercano a cero.

  • Con δ ≠ 0, las líneas divergen antes del tratamiento. En datos reales, ese patrón sería evidencia en contra del supuesto de tendencias paralelas — y una señal de alarma para el análisis.

Este tipo de gráfico — verificar que no hay tendencias diferenciales pre-tratamiento — es la práctica estándar en cualquier análisis DiD. Si las regiones tratadas venían creciendo más rápido que las de control desde antes del lanzamiento, la comparación post-tratamiento mezcla el efecto del asistente con esa dinámica preexistente.


4. DiD Escalonado: Cohortes y la Descomposición de Goodman-Bacon#

El diseño escalonado#

El escenario de la empresa SaaS tiene un detalle que complica el análisis: el asistente no llegó a todas las regiones tratadas al mismo tiempo. Algunas lo recibieron en Q4 (cohorte temprana), otras en Q7 (cohorte tardía), y un grupo nunca lo recibió. Este diseño escalonado es la regla más que la excepción en implementaciones corporativas — los recursos de soporte, la logística de capacitación y la disponibilidad del equipo técnico hacen que los lanzamientos secuenciales sean la norma. La simulación captura exactamente este escenario: 10 trimestres, dos cohortes tratadas y un grupo nunca tratado.

Exploración: tres escenarios escalonados#

Usa el dashboard para comparar qué ocurre bajo tres supuestos distintos sobre cómo se comporta el efecto del tratamiento:

  • Efectos homogéneos — cada región gana las mismas τ = 20 unidades de ventas sin importar cuándo adoptó el asistente. Observa el Panel A: ambas cohortes saltan la misma cantidad en sus respectivos trimestres de lanzamiento. El Panel D muestra TWFE y Callaway & Sant’Anna (C&S) siguiendo trayectorias muy cercanas.

  • Efectos heterogéneos — la cohorte temprana gana más (τ = 30) que la tardía (τ = 15). El Panel D comienza a mostrar una brecha entre TWFE y C&S. ¿Por qué? Lo explicaremos a continuación.

  • Efectos dinámicos — el efecto del tratamiento crece con el tiempo transcurrido desde la adopción: τ(e) = min(5(e+1), 20). El Panel A ahora muestra una aceleración gradual después del lanzamiento de cada cohorte. El coeficiente TWFE en el Panel D diverge más en este escenario. El Panel C (descomposición de Goodman-Bacon) revelará el motivo.

TWFE y la Descomposición de Goodman-Bacon#

La extensión natural del DiD 2×2 a un panel con múltiples períodos y múltiples cohortes es el estimador de efectos fijos de doble vía (TWFE):

\[Y_{it} = \mu_i + \lambda_t + \hat{\tau}\, D_{it} + \varepsilon_{it}\]

donde \(\mu_i\) absorbe las diferencias de nivel entre regiones, \(\lambda_t\) absorbe la tendencia temporal común, y \(D_{it} = 1\) cuando la región \(i\) está bajo tratamiento en el período \(t\). El atractivo es evidente: parece una generalización directa de la equivalencia con regresión que establecimos en la Sección 2.

La dificultad es que no es inmediatamente claro qué está comparando esta regresión. El teorema de Goodman-Bacon (Goodman-Bacon, 2021) da la respuesta: el coeficiente TWFE es un promedio ponderado por varianza de todos los DiD 2×2 que pueden construirse a partir de los datos. En nuestro diseño de dos cohortes, hay cuatro comparaciones implícitas:

  1. Cohorte temprana vs. nunca tratados — las regiones que adoptaron temprano se comparan con las que nunca adoptaron, usando los períodos anteriores a Q4 como pre-período. Comparación limpia.

  2. Cohorte tardía vs. nunca tratados — las regiones de adopción tardía se comparan con las nunca tratadas, usando los períodos anteriores a Q7 como pre-período. Comparación limpia.

  3. Cohorte temprana usa la tardía como control (ventana intermedia) — las regiones de adopción temprana son el grupo «tratado»; las de adopción tardía sirven como control durante una ventana que ocurre después del lanzamiento temprano pero antes del lanzamiento tardío. Comparación limpia: la cohorte tardía aún no ha sido tratada.

  4. Cohorte tardía usa la temprana como control (ventana posterior) — las regiones de adopción tardía son el grupo «tratado», pero el control son las regiones de la cohorte temprana, que ya llevan varios trimestres bajo tratamiento. Esta es la comparación problemática.

La comparación 4 es la riesgosa. Si el efecto del tratamiento es dinámico — crece con el tiempo — entonces las regiones de la cohorte temprana usadas como «control» no tienen un efecto del tratamiento igual a cero: su efecto ha venido acumulándose desde Q4. Usarlas como contrafáctico de la cohorte tardía resta un efecto positivo grande de la estimación, sesgando \(\hat{\tau}_{TWFE}\) hacia abajo. En casos extremos, esto puede invertir el signo del coeficiente.

Explora esto en el dashboard: cambia a efectos dinámicos y examina el Panel C (descomposición de Goodman-Bacon). Los puntos rojos marcan la comparación 4 — la ventana posterior tardía vs. temprana. Observa cómo el peso de esas comparaciones rojas, combinado con el efecto inflado de la cohorte temprana, aleja \(\hat{\tau}_{TWFE}\) del ATT verdadero. Con efectos homogéneos, las cuatro comparaciones son válidas, los puntos rojos no generan contaminación, y TWFE es insesgado.

El Estimador de Callaway & Sant’Anna#

El estimador de Callaway & Sant’Anna (C&S) parte de un principio simple: nunca usar un grupo ya tratado como control para la comparación 2×2 de otro grupo. El bloque básico es \(ATT(g,t)\) — el efecto promedio del tratamiento sobre los tratados de la cohorte \(g\) en el período \(t\):

\[\widehat{ATT}(g,t) = \bigl[\bar{Y}_{g,t} - \bar{Y}_{g,\,g-1}\bigr] - \bigl[\bar{Y}_{C,t} - \bar{Y}_{C,\,g-1}\bigr]\]

donde \(C\) es un grupo de comparación limpio — ya sea nunca tratado o aún no tratado en el período \(t\) — y \(g-1\) es el período inmediatamente anterior al lanzamiento de la cohorte \(g\). Cada \(ATT(g,t)\) es un DiD 2×2 independiente que nunca involucra un control contaminado. Esto es precisamente lo que evita la comparación prohibida del caso 4.

Agregación. Una vez estimados todos los \(ATT(g,t)\), C&S los agrega. La agregación dinámica usada en el Panel D promedia los valores \(ATT(g,t)\) por tiempo relativo al tratamiento (\(e = t - g\)), produciendo un coeficiente por cada período relativo:

\[\widehat{ATT} = \sum_{g} \sum_{t \geq g} \omega_{g,t} \cdot \widehat{ATT}(g,t)\]

Inspecciona el mapa de calor de ATT(g,t) de C&S en el Panel B del dashboard. Cada celda \((g, t)\) es una estimación 2×2 independiente. Las celdas pre-tratamiento (gris) se fijan en cero por construcción. Con efectos homogéneos, todas las celdas post-tratamiento lucen similares. Con efectos heterogéneos o dinámicos, el mapa revela el patrón: las celdas de la cohorte temprana difieren de las de la cohorte tardía, y las celdas más alejadas del lanzamiento reflejan la dinámica acumulada del efecto. Esta granularidad es lo que TWFE colapsa en un único número.

Alterna entre los grupos de comparación «nunca tratados» y «aún no tratados»: las estimaciones ATT(g,t) cambian levemente. El grupo nunca tratado es el control más limpio; el grupo aún no tratado ofrece más datos pero introduce un pequeño riesgo de contaminación si los efectos se anticipan antes de la fecha formal de adopción.


5. Gráficos de Estudio de Eventos#

Un gráfico de estudio de eventos presenta las estimaciones DiD para cada período relativo al lanzamiento — desde varios períodos antes de la adopción hasta varios después. El eje horizontal muestra el tiempo relativo (\(e = t - g\), donde \(e = 0\) es el período de lanzamiento); el eje vertical muestra el coeficiente estimado. El Panel D de la simulación es el ejemplo canónico.

Estimaciones post-tratamiento: dinámica del efecto#

Cada coeficiente post-tratamiento (\(e \geq 0\)) apunta a \(ATT(g, t)\) — el efecto promedio sobre la cohorte tratada \(g\) en el período calendario \(t = g + e\). El conjunto de estas estimaciones traza la dinámica del efecto del tratamiento. Un perfil plano después de la adopción sugiere un efecto constante. Un perfil con pendiente ascendente (como en el escenario dinámico) sugiere que el efecto se acumula a medida que las regiones se vuelven más hábiles con el asistente. Los gráficos de estudio de eventos en la ventana post-tratamiento responden la pregunta: ¿el efecto llega de inmediato o crece con el tiempo?

En el Panel D, los coeficientes de C&S (por cohorte, luego agregados por tiempo relativo) apuntan directamente a estos \(ATT(g,t)\). La línea TWFE del estudio de eventos se obtiene reemplazando el indicador de tratamiento \(D_{it}\) por un conjunto completo de interacciones con el tiempo relativo, omitiendo \(e = -1\) como período base:

\[Y_{it} = \theta_t + \eta_i + \sum_{e \neq -1} \beta_e \cdot \mathbf{1}\{t - G_i = e\} + \varepsilon_{it}\]

Esto produce estimaciones idénticas a C&S cuando los efectos son homogéneos, pero diverge cuando difieren entre cohortes — por la misma razón que el TWFE escalar: algunas interacciones post-tratamiento comparan implícitamente cohortes con distintos niveles de efecto.

Estimaciones pre-tratamiento: test de falsificación#

Cada coeficiente pre-tratamiento (\(e < 0\)) estima:

\[\tau_{-k} = \mathbb{E}[Y_{t=g-k}(0) - Y_{t=g-1}(0) \mid D=1] - \mathbb{E}[Y_{t=g-k} - Y_{t=g-1} \mid D=0]\]

Esto es una estimación de tendencia diferencial o pre-tendencia: mide si los grupos tratado y de control seguían trayectorias paralelas en la ventana pre-tratamiento. Bajo no-anticipación y tendencias paralelas, todos los \(\tau_{-k}\) deberían ser iguales a cero.

Tres lecciones prácticas de la literatura reciente (Baker et al. [2026]; Roth [2022]; Rambachan and Roth [2023]):

  1. Las pre-tendencias testean un supuesto relacionado pero distinto. El supuesto de tendencias paralelas exige igualdad en las tendencias en cada período post-tratamiento. Las estimaciones pre-tratamiento miden diferencias en períodos pre-tratamiento — la ventana «incorrecta». Pre-tendencias pequeñas dan alguna tranquilidad, pero no constituyen un test directo del supuesto que rige la inferencia post-tratamiento (Baker et al. [2026], §5.1.2).

  2. Los tests de pre-tendencias tienen baja potencia. Con pocos períodos pre-tratamiento o cohortes pequeñas, los tests estadísticos de \(\tau_{-k} = 0\) tienen poca potencia para detectar violaciones reales. No rechazar pre-tendencias planas dice poco sobre la magnitud de las violaciones que sesgarían materialmente las estimaciones post-tratamiento.

  3. Considerar explícitamente el tamaño de las violaciones plausibles. En lugar de preguntar únicamente «¿son los coeficientes pre-período cercanos a cero?», la pregunta más informativa es «¿qué tan grande tendría que ser una violación de tendencias paralelas para sesgar seriamente las estimaciones de ATT?» Rambachan and Roth [2023] proveen herramientas para acotar el ATT bajo violaciones de magnitud especificada — una alternativa rigurosa al test visual informal.

En la simulación, explora el panel de estudio de eventos bajo cada uno de los tres tipos de efecto. Con efectos homogéneos, las pre-tendencias son planas y TWFE coincide con C&S en toda la muestra. Con efectos dinámicos, la línea TWFE post-tratamiento cae por debajo de la línea C&S — reflejo de la contaminación por la comparación prohibida de Goodman-Bacon — mientras la ventana pre-tratamiento se mantiene plana. La lección: pre-tendencias planas son necesarias pero no suficientes para una estimación TWFE limpia en diseños escalonados.


6. Resumen y Árbol de Decisión#

Diferencias en diferencias identifica efectos causales comparando la variación temporal entre grupos tratados y de control. Su supuesto clave — tendencias paralelas — es más débil que la condición de independencia condicional: solo pide que las tendencias serían iguales en ausencia del tratamiento, no que los niveles lo sean. Cuando el diseño es escalonado, TWFE puede fallar si los efectos son heterogéneos entre cohortes; el estimador de Callaway & Sant’Anna resuelve este problema restringiendo cada comparación 2×2 a grupos de control no contaminados.

Árbol de decisión para el análisis DiD:

  1. ¿El tratamiento es simultáneo para todos los tratados? Si sí → DiD 2×2 estándar o TWFE con dos períodos. Si no → continúa.

  2. ¿Los efectos son homogéneos entre cohortes y constantes en el tiempo? Si sí → TWFE puede ser suficiente. Si no (o si no sabes) → usa Callaway & Sant’Anna.

  3. ¿Hay un grupo de «nunca tratados»? Si sí → úsalos como grupo de comparación principal. Si no → los «aún no tratados» son la alternativa, con mayor riesgo de contaminación.

  4. ¿Tienes períodos pre-tratamiento suficientes? Si sí → grafica el estudio de eventos y evalúa las pre-tendencias. Si no → el supuesto de tendencias paralelas es más difícil de justificar y debes apoyarte en argumentos institucionales.

  5. ¿Reportas solo TWFE? Si el diseño es escalonado y los efectos podrían ser heterogéneos, reporta C&S junto con TWFE y discute las discrepancias.


Apéndice: Derivaciones Formales#

A.1 Álgebra del estimador de doble diferencia#

Setup. Sea el DGP:

\[Y_{it}(0) = \mu + \alpha G_i + \lambda \,\text{Post}_t + \delta\, G_i \cdot \text{Post}_t + \varepsilon_{it}, \qquad \mathbb{E}[\varepsilon_{it}] = 0\]
\[Y_{it} = Y_{it}(0) + \tau\, G_i \cdot \text{Post}_t\]

Las cuatro celdas de la tabla 2×2, en esperanza:

\[\mathbb{E}[Y \mid G=0, \text{Post}=0] = \mu\]
\[\mathbb{E}[Y \mid G=0, \text{Post}=1] = \mu + \lambda\]
\[\mathbb{E}[Y \mid G=1, \text{Post}=0] = \mu + \alpha\]
\[\mathbb{E}[Y \mid G=1, \text{Post}=1] = \mu + \alpha + \lambda + \delta + \tau\]

Paso 1 — Cambio temporal en el grupo de control:

\[\Delta_C \equiv \mathbb{E}[Y \mid G=0, \text{Post}=1] - \mathbb{E}[Y \mid G=0, \text{Post}=0] = \lambda\]

Paso 2 — Cambio temporal en el grupo tratado:

\[\Delta_T \equiv \mathbb{E}[Y \mid G=1, \text{Post}=1] - \mathbb{E}[Y \mid G=1, \text{Post}=0] = \lambda + \delta + \tau\]

Paso 3 — Doble diferencia:

\[\widehat{\tau}_{DiD} = \Delta_T - \Delta_C = (\lambda + \delta + \tau) - \lambda = \tau + \delta\]

Conclusión. Cuando \(\delta = 0\) (tendencias paralelas), \(\widehat{\tau}_{DiD} = \tau\). El estimador cancela \(\alpha\) (brecha de nivel) y \(\lambda\) (tendencia común). Cuando \(\delta \neq 0\), el sesgo es exactamente \(\delta\).


A.2 Equivalencia con regresión MCO#

Setup. Considere la regresión:

\[Y_{it} = \beta_0 + \beta_1 G_i + \beta_2 \text{Post}_t + \beta_3\, (G_i \times \text{Post}_t) + \varepsilon_{it}\]

Las cuatro celdas de la tabla 2×2 en términos de los coeficientes:

\[\mathbb{E}[Y \mid G=0, \text{Post}=0] = \beta_0\]
\[\mathbb{E}[Y \mid G=0, \text{Post}=1] = \beta_0 + \beta_2\]
\[\mathbb{E}[Y \mid G=1, \text{Post}=0] = \beta_0 + \beta_1\]
\[\mathbb{E}[Y \mid G=1, \text{Post}=1] = \beta_0 + \beta_1 + \beta_2 + \beta_3\]

Paso 1 — Igualando con el DGP:

\[\beta_0 = \mu, \qquad \beta_1 = \alpha, \qquad \beta_2 = \lambda, \qquad \beta_3 = \delta + \tau\]

Paso 2 — Aplicando MCO exactamente (con las cuatro medias de celda como estadísticos suficientes), \(\hat{\beta}_3\) satisface:

\[\hat{\beta}_3 = (\bar{Y}_{G=1,\,\text{Post}=1} - \bar{Y}_{G=1,\,\text{Post}=0}) - (\bar{Y}_{G=0,\,\text{Post}=1} - \bar{Y}_{G=0,\,\text{Post}=0}) = \widehat{\tau}_{DiD}\]

Conclusión. El coeficiente OLS en la interacción \(G_i \times \text{Post}_t\) es algebraicamente idéntico al estimador de doble diferencia. La formulación en regresión agrega el cálculo automático de errores estándar y permite extender el modelo con controles adicionales \(X_{it}\) sin alterar la interpretación de \(\hat{\beta}_3\) como el estimador DiD.


Poné a prueba lo que aprendiste#

Referencias#

Los dashboards interactivos de esta sección también se apoyan en Angrist and Pischke [2009], Card and Krueger [1994], Roth et al. [2023], Callaway and Sant'Anna [2021], Goodman-Bacon [2021] y Callaway et al. [2024].

[AP09]

Joshua D Angrist and Jörn-Steffen Pischke. Mostly harmless econometrics: An empiricist's companion. Princeton university press, 2009.

[BCC+26] (1,2)

Andrew Baker, Brantly Callaway, Scott Cunningham, Andrew Goodman-Bacon, and Pedro H C Sant'Anna. Difference-in-differences designs: a practitioner's guide. Journal of Economic Literature, 64(2):498–557, 2026.

[CSantAnna21]

Brantly Callaway and Pedro H C Sant'Anna. Difference-in-differences with multiple time periods. Journal of Econometrics, 225(2):200–230, 2021.

[CSantAnnaQG24]

Brantly Callaway, Pedro H C Sant'Anna, Alexander Quispe, and Carlos Guevara. Csdid: difference-in-differences with multiple time periods in python. 2024. Available at: d2cml-ai/csdid.

[CK94]

David Card and Alan B Krueger. Minimum wages and employment: a case study of the fast-food industry in new jersey and pennsylvania. American Economic Review, 84(4):772–793, 1994.

[GB21]

Andrew Goodman-Bacon. Difference-in-differences with variation in treatment timing. Journal of Econometrics, 225(2):254–277, 2021.

[RR23] (1,2)

Ashesh Rambachan and Jonathan Roth. A more credible approach to parallel trends. The Review of Economic Studies, 90(5):2555–2591, 2023.

[Rot22]

Jonathan Roth. Pretest with caution: event-study estimates after testing for parallel trends. American Economic Review: Insights, 4(3):305–322, 2022.

[RSantAnnaBP23]

Jonathan Roth, Pedro H C Sant'Anna, Alyssa Bilinski, and John Poe. What's trending in difference-in-differences? a synthesis of the recent econometrics literature. Journal of Econometrics, 235(2):2218–2244, 2023.