Potencia Estadística y Tamaño de Muestra#

Supongamos que el equipo de producto de una empresa tecnológica quiere saber si una nueva función de onboarding mejora la retención de usuarios al día 7 en dos puntos porcentuales. Diseñan un experimento, recolectan datos sobre el comportamiento de los usuarios y corren la regresión — y el resultado no es estadísticamente significativo. ¿Concluyen que la nueva función no funciona? No necesariamente. El problema puede ser que el experimento era demasiado pequeño para detectar ese efecto. Esto no es un fracaso del producto; es un fracaso del diseño.

Esta sección introduce el análisis de potencia: la herramienta para responder la pregunta de diseño antes de recolectar datos. ¿Qué tan grande debe ser la muestra para detectar el efecto que te interesa, con una probabilidad razonable de éxito?


1. La Conexión con el Test T#

En la sección anterior vimos que el estadístico T tiene una interpretación natural como razón señal-ruido:

\[\hat{T} = \frac{\hat{\beta}_1}{SE(\hat{\beta}_1)} = \frac{\hat{\beta}_1}{\hat{\sigma}/\sqrt{SST_x}}\]

Rechazamos \(H_0: \beta_1 = 0\) cuando \(|\hat{T}|\) supera el valor crítico \(t_{n-2,\, \alpha/2}\). La potencia del test es la probabilidad de que esto ocurra cuando el efecto verdadero no es cero:

\[\text{Potencia} = P\!\left(|\hat{T}| > t_{n-2,\, \alpha/2} \;\Big|\; \beta_1 \neq 0\right)\]

Cuando \(\beta_1 \neq 0\), \(\hat{T}\) no sigue la distribución T centrada en cero — sigue una distribución T no central desplazada por el parámetro de no centralidad \(\lambda = \beta_1 / SE(\hat{\beta}_1)\). Cuanto mayor sea \(|\lambda|\), más desplazada estará la distribución y mayor será la probabilidad de rechazar \(H_0\).

La potencia depende de cuatro ingredientes que se contraponen entre sí:

Ingrediente

Dirección

Intuición

Efecto verdadero $

\beta_1

$ mayor

Desvío del error \(\sigma\) menor

↑ potencia

Datos más limpios, menos ruido

Tamaño de muestra \(n\) mayor

↑ potencia

Más información, \(SE(\hat{\beta}_1)\) cae como \(1/\sqrt{n}\)

Nivel de significancia \(\alpha\) mayor

↑ potencia

Umbral más bajo, pero más errores tipo I


2. Simulación Interactiva#

La simulación genera miles de muestras del modelo \(Y_i = \beta_0 + \beta_1 X_i + \varepsilon_i\), corre una regresión en cada una y registra el estadístico T resultante. El histograma muestra la distribución empírica de esos estadísticos; la línea negra es la distribución T teórica. La tabla reporta la proporción de simulaciones en que \(H_0\) fue rechazada — eso es la potencia empírica.

Antes de explorar, forma una predicción: si duplicas el tamaño de muestra, ¿cómo esperas que cambie la distribución de T? ¿Y la potencia?

Cosas concretas para observar:

  • Efecto \(\beta_1 = 0\): los estadísticos T siguen casi perfectamente la distribución teórica centrada en cero. La potencia al 5% ronda el 5% — eso es exactamente la tasa de error tipo I.

  • Aumenta \(\beta_1\): la distribución se desplaza hacia la derecha. Las barras rojas (región de rechazo) capturan una fracción mayor — la potencia sube.

  • Aumenta el tamaño de muestra \(n\): la distribución se concentra (menos dispersión) y se desplaza más lejos del cero. Con \(n = 500\) y \(\beta_1 = 1\), la potencia puede superar el 90%.

  • Aumenta el desvío del error \(\sigma\): la distribución se aplana y se acerca al cero. Necesitas un efecto mayor o una muestra más grande para compensar.

  • Aumenta la dispersión de \(X\) (\(\sigma_X\)): esto aumenta \(SST_x\), reduce \(SE(\hat{\beta}_1)\) y sube la potencia — igual que aumentar \(n\).


3. La Fórmula del Tamaño de Muestra#

Explorar la simulación da intuición. Ahora queremos una fórmula que permita calcular el tamaño de muestra necesario antes de recolectar datos.

El parámetro de no centralidad del test T es:

\[\lambda = \frac{\beta_1}{\sigma / \sqrt{n \cdot \sigma_X^2}} = \frac{\beta_1 \sqrt{n} \, \sigma_X}{\sigma}\]

Para una potencia objetivo \(1 - \phi\) (por ejemplo, 0,80) y un nivel de significancia \(\alpha\) (por ejemplo, 0,05), necesitamos que la distribución T no central con parámetro \(\lambda\) tenga al menos probabilidad \(1 - \phi\) de superar el valor crítico \(z_{\alpha/2}\). Aproximando con la distribución normal estándar, la condición se reduce a:

\[\lambda \geq z_{\alpha/2} + z_{\phi}\]

donde \(z_p\) es el percentil \(p\) de la normal estándar. Despejando \(n\):

\[n \geq \left(\frac{(z_{\alpha/2} + z_{\phi}) \cdot \sigma}{\beta_1 \cdot \sigma_X}\right)^2\]

Ejemplo numérico. Un equipo estima que cada mil dólares adicionales de presupuesto publicitario genera en promedio \(\beta_1 = 1\) mil dólares de ingresos adicionales, con una desviación estándar del error de \(\sigma = 20\) y una desviación estándar de los presupuestos de campaña de \(\sigma_X = 10\). Queremos 80% de potencia (\(z_{0{,}20} \approx 0{,}84\)) al nivel 5% (\(z_{0{,}025} \approx 1{,}96\)):

\[n \geq \left(\frac{(1{,}96 + 0{,}84) \times 20}{1 \times 10}\right)^2 = \left(\frac{56}{10}\right)^2 = 31{,}36 \approx 32\]

Con \(n = 32\) y estos parámetros, la potencia es aproximadamente 80%. Puedes verificarlo en la simulación fijando esos valores.

El costo de mayor precisión#

La fórmula revela una asimetría importante: para pasar de 80% a 90% de potencia (subir \(z_\phi\) de 0,84 a 1,28), el tamaño de muestra sube aproximadamente un 33%. Para ir de 90% a 95%, sube otro 20%. La potencia del 90% cuesta más que la del 80%, y la del 95% más que la del 90%:

\[n_{90\%} \approx 1{,}33 \times n_{80\%}, \qquad n_{95\%} \approx 1{,}56 \times n_{80\%}\]

Esto explica por qué 80% es la convención dominante en ciencias sociales — es el punto donde el costo marginal de más potencia empieza a crecer rápidamente.


4. Errores Tipo I y Tipo II#

Todo test de hipótesis puede cometer dos tipos de error. La potencia es la probabilidad de evitar el segundo.

\(H_0\) verdadera

\(H_0\) falsa

No rechazar \(H_0\)

Decisión correcta

Error tipo II (prob. \(\phi\))

Rechazar \(H_0\)

Error tipo I (prob. \(\alpha\))

Decisión correcta (potencia = \(1-\phi\))

  • El error tipo I — rechazar cuando \(H_0\) es verdadera — está controlado por \(\alpha\). Fijamos \(\alpha = 0{,}05\) y el test garantiza que, si \(\beta_1 = 0\), la probabilidad de rechazar es exactamente 5%.

  • El error tipo II — no rechazar cuando \(H_0\) es falsa — es la potencia complementada: \(\phi = 1 - \text{potencia}\). Este error no está garantizado automáticamente; depende del diseño del estudio.

La trampa frecuente es concluir que un resultado insignificante implica ausencia de efecto. Un estudio con potencia del 30% y resultado insignificante no aporta evidencia de que \(\beta_1 = 0\); simplemente no tenía instrumentos suficientemente sensibles para detectarlo.


Apéndice: Derivación del Tamaño de Muestra#

A.1 Distribución T No Central y Tamaño de Muestra#

Cuando el verdadero valor es \(\beta_1 \neq 0\), el estadístico estandarizado bajo \(H_0\) sigue una distribución T no central:

\[\hat{T} = \frac{\hat{\beta}_1}{SE(\hat{\beta}_1)} \sim t_{n-2}(\lambda), \qquad \lambda = \frac{\beta_1}{SE(\hat{\beta}_1)} = \frac{\beta_1 \sqrt{SST_x}}{\sigma}\]

La potencia es:

\[1 - \phi = P\!\left(|\hat{T}| > t_{n-2,\, \alpha/2} \;\Big|\; \lambda\right) = 1 - F_{t_{n-2}(\lambda)}\!\left(t_{n-2,\,\alpha/2}\right) + F_{t_{n-2}(\lambda)}\!\left(-t_{n-2,\,\alpha/2}\right)\]

donde \(F_{t_\nu(\lambda)}\) es la CDF de la distribución T no central con \(\nu\) grados de libertad y parámetro de no centralidad \(\lambda\).

Aproximación normal. Para muestras grandes, \(t_{n-2} \approx N(0,1)\) y \(t_{n-2}(\lambda) \approx N(\lambda, 1)\). La condición de potencia \(1-\phi\) se simplifica a:

\[P\!\left(|Z + \lambda| > z_{\alpha/2}\right) \approx 1 - \phi\]

Para \(\lambda > 0\) y \(\phi\) pequeño, el término de la cola izquierda es despreciable y la condición se reduce a:

\[P\!\left(Z > z_{\alpha/2} - \lambda\right) = 1 - \phi \implies z_{\alpha/2} - \lambda = -z_\phi \implies \lambda = z_{\alpha/2} + z_\phi\]

Paso 1 — Expresar \(\lambda\) en función de \(n\).

Asumiendo \(X \sim N(\mu_X, \sigma_X^2)\) con \(n\) observaciones, en promedio \(SST_x = (n-1)\sigma_X^2 \approx n\sigma_X^2\), por lo que:

\[\lambda = \frac{\beta_1 \sqrt{n \sigma_X^2}}{\sigma} = \frac{\beta_1 \sigma_X \sqrt{n}}{\sigma}\]

Paso 2 — Despejar \(n\).

Imponiendo \(\lambda = z_{\alpha/2} + z_\phi\):

\[\frac{\beta_1 \sigma_X \sqrt{n}}{\sigma} = z_{\alpha/2} + z_\phi \implies n = \left(\frac{(z_{\alpha/2} + z_\phi)\,\sigma}{\beta_1\,\sigma_X}\right)^2\]

Este es el tamaño de muestra mínimo para alcanzar potencia \(1-\phi\) al nivel \(\alpha\).


Poné a prueba lo que aprendiste#

Referencias#

El dashboard interactivo de esta sección también se apoya en Gelman et al. [2021], además de Wooldridge [2020].

[GHV21]

Andrew Gelman, Jennifer Hill, and Aki Vehtari. Regression and other stories. Cambridge University Press, 2021.

[Woo20]

Jeffrey M Wooldridge. Introductory Econometrics: A Modern Approach 7rd ed. Cengage learning, 2020.