Motivación: Aplicaciones de la Regresión en la Investigación

Motivación: Aplicaciones de la Regresión en la Investigación#

El análisis de regresión es una poderosa herramienta estadística utilizada en varios campos de investigación para comprender la relación entre variables y realizar predicciones. El análisis de regresión es también la herramienta fundamental de la Econometría, la disciplina en economía que estudia herramientas estadísticas específicas para estudiar fenómenos económicos.

El análisis de regresión es una herramienta poderosa que permite una serie de aplicaciones interesantes en la investigación cuantitativa. En esta sección introductoria revisaremos algunas, incluyendo la extrapolación de datos, la inferencia de relaciones causales y la construcción de modelos predictivos.

Usos de Regresión#

1. Extrapolación y Predicción de Datos:

Una primera aplicación de la regresión es la extrapolación de datos. Permíteme comenzar ilustrando este uso con un caso de estudio que me gusta mucho: cómo se utilizaron los datos de juegos de Xbox para predecir el resultado de las elecciones presidenciales de Estados Unidos de 2012 [Wang et al., 2015].

Como es posible que sepas, los métodos tradicionales de encuestas, que típicamente se basan en encuestas telefónicas, se fueron volviendo cada vez menos efectivos debido a las tasas de respuesta decrecientes y muestras sesgadas. Las encuestas pueden estar fácilmente sesgadas hacia demografías específicas. Reconociendo este desafío, los investigadores propusieron un enfoque novedoso: aprovechar la vasta base de usuarios de la consola Xbox para lanzar una encuesta y crear un conjunto de datos que reflejara las características demográficas de la población votante real. A primera vista, esto podría sonar extraño: se espera que los usuarios de Xbox también estén sesgados en relación con la población, específicamente hacia personas más jóvenes!

Sin embargo, los investigadores en este caso utilizaron una estrategia ingeniosa para resolver el sesgo. Aprovechando las miles de respuestas que podían obtener de usuarios de la x-box, crearon una cuadrícula de diferentes perfiles demográficos (e.g. grupos de edad, género, etc) para estimar las tendencias de votación de cada grupo basándose en sus características. Cuando los datos para combinaciones específicas de características no estaban disponibles o eran muy pocos, los investigadores utilizaron interpolación, basándose en los resultados de grupos demográficos similares. La regresión jugó un papel crucial en este proceso de interpolación, permitiendo a los investigadores hacer predicciones incluso para los grupos con menos datos. Una vez completa la cuadrícula con las tendencias de votación de cada grupo, los investigadores ponderaron a cada grupo según la participación que tiene cada uno en la población de votantes (este proceso es comúnmente denominado post-estratificación). Como resultado, pudieron obtener predicciones bastante cercanas a las que finalmente ocurrieron.

2. Inferencia de Relaciones Causales:

Más allá de la predicción, la regresión juega un papel crucial en la inferencia de relaciones causales entre variables. Tomemos como ejemplo cómo empresas de tecnología como Netflix evalúan el impacto causal de sus decisiones de producto.

Supongamos que el equipo de producto de Netflix quiere saber si una nueva función de recomendaciones personalizadas aumenta la retención de suscriptores. Una primera idea sería comparar la retención de los usuarios que utilizan esa función con la de los que no la utilizan. Pero, como veremos cuando estudiemos inferencia causal, este tipo de comparación puede ser engañosa: los usuarios que activamente eligen usar una nueva función son probablemente más comprometidos con el servicio en primer lugar. Comparar «peras con manzanas» —usuarios que adoptan la función versus los que no— mezclaría el efecto de la función con las diferencias preexistentes entre grupos.

Para resolver este problema, Netflix asigna aleatoriamente algunos usuarios al grupo que recibe la nueva función (grupo de tratamiento) y otros al grupo que no la recibe (grupo de control). Esta asignación aleatoria garantiza que ambos grupos sean comparables antes del experimento. Utilizando modelos de regresión, los investigadores estiman el efecto causal de la función sobre la retención, controlando por las pequeñas diferencias que pueden existir entre grupos incluso en un experimento bien diseñado. Este enfoque —los llamados experimentos controlados aleatorizados o A/B tests— es hoy el estándar en la industria tecnológica para tomar decisiones de producto basadas en evidencia causal.

Veremos que la regresión no solo sirve para analizar experimentos aleatorizados. También es la herramienta central para extraer inferencia causal de datos observacionales —donde la asignación aleatoria es imposible— a través de técnicas como variables instrumentales, diferencias en diferencias y diseños de regresión discontinua.

3. Construcción de Modelos Predictivos:

Como tercer caso de uso de los métodos de regresión, podemos mencionar que la regresión se utiliza ampliamente para construir modelos predictivos, permitiendo estimar el valor de una variable «dependiente» basándose en los valores de variables «independientes». Consideren, por ejemplo, cómo las grandes empresas tecnológicas determinan los salarios de sus empleados.

Empresas como Google, Meta o Amazon gestionan miles de empleados con roles muy distintos. Para fijar salarios de manera consistente y equitativa, construyen modelos de regresión que predicen el salario esperado de un empleado en función de sus características observables: años de experiencia, especialización técnica, nivel de seniority, ubicación geográfica y resultados de evaluaciones de desempeño. Este tipo de modelo —conocido internamente como «modelo de compensación»— funciona de manera similar al modelo de precios hedónicos en economía: descompone el salario en las contribuciones individuales de cada característica del empleado. Al aplicar la regresión, las empresas pueden estimar cuánto «vale» cada año adicional de experiencia, cuánto se paga de más por trabajar en San Francisco versus Buenos Aires, o cuánto impacta una evaluación de desempeño excepcional. Esta información luego se utiliza para proyectar el salario de nuevas contrataciones y verificar que las compensaciones internas sean consistentes con el mercado.

Si bien los modelos de regresión típicamente asumen relaciones lineales entre variables, la regresión puede utilizarse para modelar relaciones no lineales también. Al aplicar transformaciones a las variables —como el logaritmo del salario o de los años de experiencia— los investigadores pueden capturar relaciones más complejas entre características y compensación, mejorando la precisión del modelo.

Estos ejemplos muestran la versatilidad del análisis de regresión. Desde predecir resultados electorales hasta inferir relaciones causales en experimentos de producto y construir modelos predictivos para la gestión de compensaciones, la regresión proporciona un marco robusto para comprender fenómenos complejos y extraer insights valiosos de los datos.


Referencias#

[WRGG15]

Wei Wang, David Rothschild, Sharad Goel, and Andrew Gelman. Forecasting elections with non-representative polls. International Journal of Forecasting, 31(3):980–991, 2015.