# De la Teoría a la Evidencia: Traduciendo Hipótesis en Especificaciones de Regresión

La regresión es una herramienta útil para explorar preguntas de investigación. En la sección anterior revisamos varios usos que tiene el análisis de regresión en la práctica — extrapolación, inferencia causal, modelos predictivos. En esta sección nos concentramos en un paso previo a todos ellos: cómo se llega, a partir de una teoría o una pregunta de investigación, a una especificación de regresión concreta. Empezamos con un ejemplo que desarrollamos paso a paso, y cerramos mostrando que el mismo proceso se repite, con las mismas piezas, en investigación de negocios en general.

---

## 1. De la Teoría a la Hipótesis

Una forma habitual de pensar el proceso de investigación cuantitativa es la siguiente secuencia:

$$\text{Teoría} \;\Rightarrow\; \text{Proposiciones} \;\Rightarrow\; \text{Hipótesis}$$

Una **teoría** es un conjunto coherente de ideas o afirmaciones destinado a explicar un fenómeno o comportamiento. Una teoría en marketing, por ejemplo, podría proponer que la confianza genera lealtad. Una **proposición** es exactamente eso: una afirmación específica que conecta conceptos que, en principio, podríamos observar. Una **hipótesis** va un paso más allá: propone una relación entre variables medibles que, dado un conjunto de datos, se puede poner a prueba. El resto de esta sección recorre estos tres pasos con un ejemplo concreto, y termina mostrando cómo la hipótesis se convierte, a su vez, en una ecuación de regresión.

## 2. Un Ejemplo: Confianza y Lealtad del Cliente

### La teoría

Consideremos una plataforma de suscripción — pensemos en algo del estilo de Netflix o Airbnb — que quiere entender qué explica la lealtad de sus clientes. La teoría, en su forma más simple, sostiene que una mejor calidad de servicio genera confianza en los clientes, y que esa confianza, a su vez, genera lealtad.

"Calidad de Servicio", "Confianza" y "Lealtad" son **constructos**: conceptos teóricos que no existen como columnas en ninguna base de datos. Además de esta cadena, es razonable pensar que hay factores que afectan la lealtad sin pasar por la confianza: la antigüedad del cliente (los meses transcurridos desde que se registró) y el plan que contrató (por ejemplo, Básico o Premium). A estos los llamamos **controles**.

### El diagrama

Antes de escribir cualquier ecuación, conviene representar esta teoría como un diagrama: constructos y flechas, todavía sin variables.

```{image} images/dag_confianza_lealtad.png
:alt: Diagrama causal: Calidad de Servicio apunta a Confianza, que apunta a Lealtad; Controles apunta directamente a Lealtad
:width: 70%
:align: center
```

Cada flecha del diagrama es una relación que la teoría propone. Ninguna está todavía expresada en términos de variables medibles — ese es el paso siguiente.

### Las proposiciones

El diagrama anterior implica dos proposiciones concretas:

**P1:** la calidad de servicio incrementa la confianza del cliente.

**P2:** la confianza del cliente incrementa su lealtad.

### De las proposiciones a las hipótesis

Ninguno de los tres constructos es observable directamente. Para ponerlos a prueba necesitamos asumir que podemos medirlos con variables concretas — sus **proxies**. Supongamos que medimos la Calidad de Servicio con el tiempo de respuesta del soporte técnico y el porcentaje de tiempo de actividad de la plataforma (*uptime*); que medimos la Confianza con la calificación promedio de satisfacción que el cliente reporta luego de cada interacción con soporte (en una escala de 1 a 5); y que medimos la Lealtad con un indicador de renovación del cliente en el trimestre.

Con estas variables, las proposiciones anteriores se convierten en hipótesis testeables:

**H1:** un menor tiempo de respuesta y un mayor *uptime* se asocian con una calificación de satisfacción más alta.

**H2:** una calificación de satisfacción más alta se asocia con una mayor probabilidad de renovación.

Vale la pena notar que ningún proxy es perfecto — la calificación que un cliente deja luego de una interacción puntual no *es* su confianza en la empresa, es un número sujeto a todo tipo de ruido (el estado de ánimo del día, cuán reciente fue el problema resuelto). Esta distinción entre constructo y proxy es la que más frecuentemente se pierde cuando alguien pasa directamente de una teoría a una regresión sin pasar por este paso intermedio.

## 3. De los Datos a la Ecuación

Como vimos con el modelo de compensación de Google, Meta o Amazon en la sección anterior, cualquier hipótesis expresada en variables medibles puede pensarse, en su forma más general, como una función matemática todavía desconocida que conecta esas variables. Tomemos H2 para ver cómo se traduce esta idea en una ecuación — el mismo procedimiento aplicaría a H1.

H2 sugiere que existe una función $f$ que conecta la calificación de satisfacción del cliente, su antigüedad y su plan con su probabilidad de renovar:

$$\text{Renovación}_i = f(\text{Calificación}_i, \text{Antigüedad}_i, \text{Plan}_i)$$

Todavía no sabemos qué forma tiene $f$ — solo que, si H2 es correcta, esta función existe. Escribir un modelo de regresión con el que podamos trabajar consiste, en el fondo, en elegir una forma concreta para $f$. La más simple, y el punto de partida de este libro, es asumir que $f$ es lineal — como veremos en la próxima sección, esta no es la única opción posible, pero sí la más directa para empezar:

$$\text{Renovación}_i = \beta_0 + \beta_1\,\text{Calificación}_i + \beta_2\,\text{Antigüedad}_i + \beta_3\,\text{Plan}_i + \varepsilon_i$$

donde $i$ indexa al cliente, y $\varepsilon_i$ recoge todo lo demás que afecta a la renovación y no está del lado derecho de la ecuación: otros determinantes omitidos, y también el ruido propio de usar un proxy imperfecto en lugar del constructo verdadero.

```{admonition} Nota: la unidad de análisis
:class: dropdown

Antes de fijar esta ecuación, hay una decisión que se toma casi sin darse cuenta: ¿qué es "una observación"? Arriba, la respuesta natural es el cliente — cada fila de la base de datos es un cliente, con su propia calificación de satisfacción y su propio historial de renovaciones. Pero no es la única opción posible. Podríamos, en cambio, definir la observación como un trimestre-cliente (si queremos capturar cómo cambia la lealtad en el tiempo), o incluso el mercado (si preguntamos, por ejemplo, si los mercados con mayor confianza promedio en la marca retienen más clientes en conjunto). Cada elección de **unidad de análisis** implica una base de datos distinta y, muchas veces, una pregunta de investigación ligeramente distinta. Fijarla — y hacerlo de manera consciente, no por *default* — es parte de traducir la teoría en un diseño de investigación concreto. En nuestro ejemplo la unidad de análisis es el cliente: cada observación $i$ es un cliente individual.
```

Esta ecuación —y la pregunta de cómo estimarla, cómo interpretar $\beta_1$, y bajo qué condiciones ese número refleja algo parecido a una relación causal— es exactamente lo que el resto del libro enseña a resolver. Empezaremos preguntándonos cuál es, formalmente, la mejor versión posible de una función como $f$ — la función de esperanza condicional — y luego, en Mecánica de la Regresión I y II, volveremos sobre la decisión que tomamos arriba de asumir que $f$ es lineal, primero con una variable explicativa y luego con varias.

## 4. El Patrón se Repite en Toda la Empresa

El proceso que acabamos de recorrer — teoría, diagrama, proposiciones, hipótesis, ecuación — es, en esencia, el objeto de estudio de la **investigación en negocios** (*business research*). Aparece, con las mismas piezas, en prácticamente cualquier área de una empresa que use datos para tomar decisiones. Elegí un área para ver un caso concreto: en cada una vas a poder identificar los constructos, sus proxies, y la unidad de análisis implícita, igual que hicimos arriba.

<div class="case-browser">
<div class="case-browser-tabs">
<button class="case-browser-tab active" data-target="marketing" type="button">Marketing</button>
<button class="case-browser-tab" data-target="finanzas" type="button">Finanzas</button>
<button class="case-browser-tab" data-target="rrhh" type="button">RR.HH.</button>
<button class="case-browser-tab" data-target="operaciones" type="button">Operaciones</button>
<button class="case-browser-tab" data-target="estrategia" type="button">Estrategia</button>
</div>

<div class="case-browser-panel" data-panel="marketing">
<p class="case-browser-panel-title">Marketing: Elasticidad Precio–Demanda</p>
<div class="case-browser-diagram"><div class="math notranslate nohighlight">\[ \text{Precio} \rightarrow \text{Demanda} \qquad\qquad \text{Promoción, Publicidad} \rightarrow \text{Demanda} \]</div></div>
<div class="case-browser-model"><div class="math notranslate nohighlight">\[ \log(Q_i) = \beta_0 + \beta_1 \log(P_i) + \beta_2 X_i + \varepsilon_i \]</div></div>
<p class="case-browser-objective"><strong>Objetivo:</strong> la elasticidad precio-demanda es una de las regresiones más usadas en marketing aplicado: estima cuánto se mueve la cantidad vendida ante un cambio en el precio, controlando por promoción y publicidad. La especificación log-log le da a <span class="math notranslate nohighlight">\(\beta_1\)</span> una interpretación directa como elasticidad — clave para fijar precios y planificar promociones.</p>
<p class="case-browser-ref"><strong>Referencia:</strong> Hanssens, Parsons y Schultz (2001), <em>Market Response Models</em>.</p>
</div>

<div class="case-browser-panel" data-panel="finanzas" hidden>
<p class="case-browser-panel-title">Finanzas: CAPM y Retorno Esperado</p>
<div class="case-browser-diagram"><div class="math notranslate nohighlight">\[ \text{Riesgo de Mercado (Beta)} \rightarrow \text{Retorno Esperado del Activo} \]</div></div>
<div class="case-browser-model"><div class="math notranslate nohighlight">\[ R_{it} - R_{ft} = \alpha_i + \beta_i (R_{mt} - R_{ft}) + \varepsilon_{it} \]</div></div>
<p class="case-browser-objective"><strong>Objetivo:</strong> el CAPM (<em>Capital Asset Pricing Model</em>) es central en la teoría financiera: propone que el retorno esperado en exceso de un activo tiene una relación lineal con el retorno esperado en exceso del portafolio de mercado, donde <span class="math notranslate nohighlight">\(\beta_i\)</span> mide la exposición del activo al riesgo de mercado. Es la base de la evaluación de desempeño y las decisiones de inversión.</p>
<p class="case-browser-ref"><strong>Referencia:</strong> Sharpe (1964); extendido a un modelo multifactorial por Fama y French (1993).</p>
</div>

<div class="case-browser-panel" data-panel="rrhh" hidden>
<p class="case-browser-panel-title">Recursos Humanos: Brecha Salarial de Género</p>
<div class="case-browser-diagram"><div class="math notranslate nohighlight">\[ \text{Género} \rightarrow \text{Salario} \qquad\qquad \text{Educación, Experiencia} \rightarrow \text{Salario} \]</div></div>
<div class="case-browser-model"><div class="math notranslate nohighlight">\[ \log(\text{Salario}_i) = \beta_0 + \beta_1\,\text{Mujer}_i + \beta_2\,\text{Educación}_i + \beta_3\,\text{Experiencia}_i + \varepsilon_i \]</div></div>
<p class="case-browser-objective"><strong>Objetivo:</strong> la descomposición de Oaxaca-Blinder divide una brecha observada — aquí, la brecha salarial de género — en una parte explicada por diferencias en características observables (educación, experiencia) y un residuo no explicado, frecuentemente atribuido a discriminación. Sigue siendo una de las herramientas estándar que usan los equipos de analítica de compensaciones para auditar la equidad salarial.</p>
<p class="case-browser-ref"><strong>Referencia:</strong> Oaxaca (1973).</p>
</div>

<div class="case-browser-panel" data-panel="operaciones" hidden>
<p class="case-browser-panel-title">Operaciones: Tiempo de Espera y Satisfacción</p>
<div class="case-browser-diagram"><div class="math notranslate nohighlight">\[ \text{Tiempo de Espera} \rightarrow \text{Satisfacción} \qquad\qquad \text{Problema Resuelto} \rightarrow \text{Satisfacción} \]</div></div>
<div class="case-browser-model"><div class="math notranslate nohighlight">\[ \text{Satisfacción}_i = \beta_0 + \beta_1\,\text{Espera}_i + \beta_2\,\text{Resuelto}_i + \varepsilon_i \]</div></div>
<p class="case-browser-objective"><strong>Objetivo:</strong> mide cómo el tiempo de espera de soporte afecta la satisfacción del cliente, neto de si el problema efectivamente se resolvió — el tipo de modelo que corre un equipo de soporte técnico de una empresa de software (SaaS) para decidir si conviene invertir en tiempos de respuesta más cortos o en una mejor resolución en el primer contacto.</p>
<p class="case-browser-ref"><strong>Referencia:</strong> sin cita específica en la fuente original de este ejemplo.</p>
</div>

<div class="case-browser-panel" data-panel="estrategia" hidden>
<p class="case-browser-panel-title">Estrategia: Determinantes del Desempeño Empresarial</p>
<div class="case-browser-diagram"><div class="math notranslate nohighlight">\[ \text{I\&D, Participación de Mercado, Industria} \rightarrow \text{Desempeño} \]</div></div>
<div class="case-browser-model"><div class="math notranslate nohighlight">\[ \text{Desempeño}_i = \beta_0 + \beta_1\,\text{I\&D}_i + \beta_2\,\text{Participación}_i + \beta_3\,\text{Industria}_i + \varepsilon_i \]</div></div>
<p class="case-browser-objective"><strong>Objetivo:</strong> el enfoque de descomposición de varianza de Rumelt pregunta cuánto de la dispersión en la rentabilidad entre empresas se explica por la industria en la que compiten, frente a factores propios de cada empresa — informando si la estrategia de una empresa debería enfocarse en elegir la industria correcta o en construir capacidades propias dentro de ella.</p>
<p class="case-browser-ref"><strong>Referencia:</strong> Rumelt (1991).</p>
</div>

</div>

<style>
.case-browser {
  border: 1px solid var(--pst-color-border, #d1d5db);
  border-radius: 10px;
  padding: 1.25rem 1.5rem 1.5rem;
  margin: 1.5rem 0;
  background: var(--pst-color-surface, #f8f9fa);
}
.case-browser-tabs {
  display: flex;
  flex-wrap: wrap;
  gap: 0.4rem;
  margin-bottom: 1.1rem;
}
.case-browser-tab {
  font: inherit;
  font-size: 0.9rem;
  font-weight: 600;
  padding: 0.45rem 0.9rem;
  border-radius: 999px;
  border: 1px solid var(--pst-color-border, #d1d5db);
  background: var(--pst-color-background, #fff);
  color: var(--pst-color-text-base, #333);
  cursor: pointer;
  transition: background-color 0.15s, color 0.15s, border-color 0.15s;
}
.case-browser-tab:hover {
  border-color: var(--pst-color-primary, #0d6efd);
}
.case-browser-tab.active {
  background: var(--pst-color-primary, #0d6efd);
  border-color: var(--pst-color-primary, #0d6efd);
  color: #fff;
}
.case-browser-panel-title {
  font-size: 1rem;
  font-weight: 700;
  margin: 0 0 0.6rem;
}
.case-browser-diagram {
  font-size: 0.95rem;
  padding: 0.6rem 0.8rem;
  margin-bottom: 0.8rem;
  background: var(--pst-color-background, #fff);
  border-left: 4px solid var(--pst-color-primary, #0d6efd);
  border-radius: 4px;
  overflow-x: auto;
}
.case-browser-model {
  margin-bottom: 0.8rem;
  overflow-x: auto;
}
.case-browser-objective,
.case-browser-ref {
  font-size: 0.92rem;
  margin: 0.35rem 0;
}
.case-browser-ref {
  color: var(--pst-color-text-muted, #6b7280);
  font-style: italic;
}
</style>

<script>
(function () {
  document.querySelectorAll(".case-browser").forEach(function (browser) {
    var tabs = browser.querySelectorAll(".case-browser-tab");
    var panels = browser.querySelectorAll(".case-browser-panel");
    tabs.forEach(function (tab) {
      tab.addEventListener("click", function () {
        var target = tab.getAttribute("data-target");
        tabs.forEach(function (t) { t.classList.remove("active"); });
        panels.forEach(function (p) { p.hidden = true; });
        tab.classList.add("active");
        var panel = browser.querySelector('.case-browser-panel[data-panel="' + target + '"]');
        if (panel) { panel.hidden = false; }
      });
    });
  });
})();
</script>

Las referencias completas de estos cinco modelos figuran en la sección de Referencias al pie de esta página: {cite:p}`hanssens2001market`, {cite:p}`sharpe1964capital`, {cite:p}`famafrench1993common`, {cite:p}`oaxaca1973malefemale`, {cite:p}`rumelt1991industry`.

Con este recorrido — de la teoría al diagrama, del diagrama a la proposición, de la proposición a la hipótesis, y de la hipótesis a la ecuación — estás en condiciones de reconocer una especificación de regresión la próxima vez que la veas, en este libro o en cualquier otro lugar. El siguiente paso es empezar a ver cómo, exactamente, se estima esa ecuación.

---

## Referencias

```{bibliography}
:filter: docname in docnames
```
