# La Función de Esperanza Condicional: De Promedios a un Modelo

Preguntale a un analista de RR.HH. cuánto gana, en promedio, un empleado del track técnico con 8 años de experiencia, y te va a dar un número. Ese número ya es un modelo — aunque nadie lo llame así. Sirve para predecir cuánto ganaría un nuevo empleado con ese perfil, pero también podría servirnos de base para **explicar** las diferencias de salario asociadas a la experiencia: ¿por qué gana más quien lleva más años en el puesto? ¿Qué es exactamente ese promedio, formalmente, y qué tan bien cumple cada uno de esos dos roles?

Esta sección responde esa pregunta. Vamos a partir de una idea muy simple — promediar $Y$ para cada valor de $X$ — y vamos a ver, jugando con datos, qué ventajas y qué límites tiene esa idea: qué relaciones no lineales y qué diferencias sistemáticas entre grupos es capaz de revelar, y por qué estimarla bien no es tan simple como definirla. De ahí va a salir el objeto central de esta sección, la **Función de Esperanza Condicional (CEF)**, y una primera razón, muy concreta, de por qué el resto del libro se dedica a estimarla con un modelo de regresión en lugar de promediar grupo por grupo.

---

## 1. Objetivos

Al terminar esta sección vas a poder:

1. Definir la Función de Esperanza Condicional, $m(x) = E[Y \mid X=x]$, y reconocer su estimación como la generalización natural de «promedio por grupo» a cualquier variable $X$.
2. Estimarla empíricamente — promediando $Y$ entre las observaciones que comparten un valor de $X$ — y explicar por qué esa estimación se vuelve ruidosa cuando pocas observaciones comparten el mismo valor.
3. Explicar por qué un modelo de regresión puede aproximar la CEF con menos datos que promediar valor por valor, y qué se gana y qué se pierde al hacerlo.
4. Ubicar la ecuación $Y = \beta_0 + \beta_1 X + \varepsilon$ de la próxima sección como un caso particular — lineal — de esta idea más general.

## 2. Una primera mirada a los datos

A lo largo de esta sección vamos a trabajar con un ejemplo: una empresa de tecnología, y una muestra de sus empleados con dos datos por persona — el salario anual (en miles de USD) y los años de experiencia — más una tercera variable, el *track* de carrera: **Técnico** o **Gerencial**.

Así se ven, sin ningún ajuste ni resumen, 200 empleados de esta empresa:

![Dispersión de salario contra años de experiencia, por track](images/cef_scatter.png)

La nube es genuinamente ruidosa. Aun así, algo se intuye a simple vista: los puntos naranjas (Gerencial) parecen sistemáticamente más altos que los azules (Técnico), y dentro de cada color el salario parece subir con la experiencia, aunque no de manera perfectamente prolija. La pregunta que guía el resto de la sección es: ¿cuál es la mejor manera de resumir esta nube con **un número por cada nivel de experiencia**, en lugar de un solo número para todo el mundo?

## 3. Estimando un promedio, un valor de experiencia a la vez

Acá la experiencia está medida en años enteros — así que la respuesta más directa es: para cada valor de experiencia, promediá el salario de todos los empleados que tienen exactamente esa cantidad de años. Probalo vos mismo.

En el dashboard de abajo vas a controlar el tamaño de la muestra y dos overlays. Antes de leer la interpretación en la próxima subsección, fijate en:

- Con muestras chicas (n=50), ¿qué tan parejos son los puntos de la CEF empírica entre un valor de experiencia y el siguiente? ¿Hay valores donde el punto se aleja mucho de sus vecinos?
- La barra de conteo debajo del gráfico — ¿los puntos más erráticos de la CEF están parados sobre barras altas o bajas?
- Activá "Separar por track" y desactivalo — ¿qué le pasa a la CEF agrupada respecto a las dos CEFs separadas?
- Con `n=5000`, ¿los puntos se ven más prolijos que con `n=50`? ¿Qué cambió — los datos, o el estimador?

<div style="position: relative; padding-bottom: 56.25%; height: 0; overflow: hidden;">
  <iframe src="https://simuecon.com/cef_bins/?lang=es" style="position: absolute; top: 0; left: 0; width: 100%; height: 100%; border: 0;" allowfullscreen></iframe>
</div>

## 4. Ponerle nombre a lo que acabás de construir: la CEF

Lo que acabás de construir a mano en el dashboard — agrupar por valor de $X$ y promediar $Y$ dentro de cada grupo — es una **estimación** del objeto que le da nombre a esta sección, la **Función de Esperanza Condicional (CEF)**:

$$m(x) = E[Y \mid X=x]$$

Conviene ser precisos acá, porque es fácil mezclar las dos cosas. La CEF, $m(x)$, es un objeto **poblacional**: el valor esperado de $Y$ en la subpoblación donde $X=x$, una propiedad fija de la distribución conjunta de $(X,Y)$ que no depende de ninguna muestra en particular. Lo que hiciste en el dashboard — agrupar las observaciones de tu muestra por valor de $X$ y promediar $Y$ dentro de cada grupo — es cómo se **estima** ese objeto, no el objeto en sí. Y es precisamente *estimarla de esa manera* lo que es la generalización natural de «promedio por grupo» a cualquier variable $X$, no solo a una categoría: si $X$ fuera una variable categórica (por ejemplo, el track), estimar $m(x)$ sería simplemente promediar $Y$ dentro de cada categoría de la muestra — algo que probablemente ya sabías hacer. Cuando $X$ es un número, como la experiencia, la misma idea aplica: agrupá por cada valor posible y promediá.

Ese estimador — el promedio muestral en cada valor de $X$ — es insesgado para $m(x)$; la demostración está en el [apéndice](#prueba-cef-insesgadez) al final de la sección.

Esto conecta directamente con algo que quedó pendiente antes: hasta ahora caracterizamos la relación entre $X$ e $Y$ a través de una función desconocida $F$, de la forma $Y = F(X) + \varepsilon$. Bajo condiciones bastante generales, esa $F$ que mejor describe la relación **es** la CEF: $F(x) = m(x) = E[Y \mid X=x]$. Es, en un sentido preciso, la mejor respuesta posible a «¿qué valor de $Y$ espero, dado que conozco $X$?».

<div class="jupyterlite-embed-wrapper" data-paid-gated="false"
     data-lite-url="_jupyterlite/notebooks/index.html?path=cef_notebook.ipynb"
     data-button-label="💻 Cómo estimar en Código"></div>

## 5. Por qué estimar la CEF es, en el fondo, un problema de datos

El dashboard anterior mostró algo que vale la pena formalizar: a medida que hay más celdas (más valores distintos de $X$) en relación con el tamaño de la muestra, cada celda recibe menos observaciones, y el promedio dentro de esa celda se vuelve más variable. Con pocas observaciones, un promedio puede terminar dominado por dos o tres empleados con salarios inusuales — pura mala suerte de muestreo, no un error del modelo.

Esto no es una falla de la CEF como concepto: la CEF poblacional, $m(x)$, es un objeto fijo y bien definido, y su estimador — el promedio muestral en cada valor de $X$ — es insesgado (ver la [demostración](#prueba-cef-insesgadez) en el apéndice). El problema es de **precisión**, no de sesgo: cuantas más celdas hay que llenar con la misma cantidad de datos, más se estira la muestra, y más ruidosa se vuelve cada estimación individual. Es un trade-off genuino entre granularidad (cuántos valores distintos de $X$ distinguís) y precisión (qué tan confiable es el promedio en cada uno) — no un defecto que se pueda "arreglar" sin más datos o sin cambiar de estrategia.

````{dropdown} Dos propiedades de la CEF que conviene conocer
Dos resultados adicionales sobre la CEF, útiles para lo que viene más adelante en el libro, aunque no imprescindibles para seguir esta sección:

**(a) El error de la CEF tiene media condicional cero.** Si definimos el error como $\varepsilon = Y - m(X)$, entonces $E[\varepsilon \mid X=x] = 0$ para todo $x$. Esto es casi una consecuencia directa de la definición: $m(x)$ es, por construcción, el valor esperado de $Y$ en ese valor de $X$, así que el valor esperado de las desviaciones respecto a ese valor tiene que ser cero. La demostración está en el [apéndice](#prueba-cef-error-media-cero).

**(b) La CEF es el mejor predictor posible de $Y$ dado $X$, en el sentido de menor error cuadrático medio.** Entre todas las funciones posibles $g(X)$ que podrías usar para predecir $Y$ a partir de $X$, la que minimiza $E[(Y - g(X))^2]$ es exactamente $g(x) = m(x)$. Ninguna otra función de $X$ predice mejor, en promedio, que la CEF. La demostración está en el [apéndice](#prueba-cef-mse).
````

## 6. Una forma más eficiente de aproximar la CEF

El dashboard anterior deja un problema abierto: promediar por cada valor de experiencia reparte la muestra en compartimentos cada vez más chicos a medida que hay más valores distintos de $X$ — se gana resolución, pero se pierde precisión. ¿Hay una forma de tener las dos cosas a la vez?

La intuición es la siguiente: en lugar de estimar un promedio independiente para cada valor de $X$, un **modelo paramétrico** — por ejemplo, una recta, o una recta con un quiebre — impone una forma funcional específica a $m(x)$, y esa forma se estima usando **toda** la muestra a la vez, no una fracción de ella por cada valor de $X$. El modelo "pide prestada" información de las observaciones vecinas en lugar de tratar cada valor de $X$ como un problema aislado. Esa es, en esencia, la apuesta de un modelo de regresión — y es lo que vas a comparar, cara a cara con la CEF empírica, en el próximo dashboard.

## 7. Comparando la CEF empírica con la regresión, cara a cara

Elegí un modelo en el panel de la izquierda y mirá cómo se ajusta a la misma muestra. Antes de leer la interpretación:

- Con `n=50`, comparé la RECM (raíz del error cuadrático medio, respecto a la CEF poblacional verdadera) de "Regresión + dummy y quiebre" contra la de "CEF por bins". ¿Cuál es más baja?
- Ahora subí a `n=5000` y mirá qué le pasa a la RECM de "Regresión agrupada" (que ignora track y quiebre). ¿Mejoró mucho?
- Compará esa misma transición (`n=50` → `n=5000`) para "CEF por bins" y para "Regresión + dummy y quiebre". ¿Cuál de los dos mejoró más al agregar datos?
- ¿Qué tienen en común los modelos que *no* mejoran mucho con más datos?

<div style="position: relative; padding-bottom: 56.25%; height: 0; overflow: hidden;">
  <iframe src="https://simuecon.com/cef_regression/?lang=es" style="position: absolute; top: 0; left: 0; width: 100%; height: 100%; border: 0;" allowfullscreen></iframe>
</div>

## 8. La regresión como una CEF paramétrica

Lo que viste en el dashboard se puede formalizar así: un modelo de regresión no es más que una manera de imponerle una forma funcional específica a $m(x)$, a cambio de necesitar mucha menos información en cada punto individual.

Cuando esa forma funcional es la correcta — en el dashboard, una recta con un quiebre en el umbral de promoción más una diferencia constante de nivel entre tracks — el modelo estimado se acerca a la CEF verdadera más que la CEF empírica, incluso con muestras chicas: no reparte los datos en compartimentos, los usa todos juntos para estimar unos pocos parámetros. Cuando la forma funcional es incorrecta — como la regresión agrupada, que ignora el track y el quiebre — el modelo queda **sesgado**: sistemáticamente equivocado en ciertas zonas, un error que ninguna cantidad de datos adicionales corrige, a diferencia del ruido de la CEF empírica, que sí se reduce con más muestra.

Este trade-off — comprometerse con una forma funcional a cambio de ganar eficiencia — es, en una frase, de lo que tratan los próximos capítulos del libro: un modelo como el que ganó en el dashboard, con una pendiente que cambia en un punto y un desplazamiento constante entre grupos, es algo que vas a aprender a construir con precisión a partir de la próxima sección.

## 9. Cierre: qué sigue, y una simplificación honesta

Con esto, ya podés retomar la notación que quedó pendiente: veníamos escribiendo la relación entre $X$ e $Y$ como $Y = F(X) + \varepsilon$, sin decir mucho sobre $F$. Ahora sabemos que la mejor candidata para $F$, en el sentido de menor error cuadrático medio, es la CEF: $F(x) = m(x) = E[Y \mid X=x]$. La próxima sección da el siguiente paso natural: asumir que esa $F$ tiene una forma lineal, y mostrar cómo se estima.

Una aclaración antes de seguir. El ejemplo de esta sección usó dos variables explicativas — experiencia y track — para poder mostrar tanto una no linealidad (el quiebre) como una diferencia sistemática entre grupos. **Mecánica de la Regresión I** va a dar un paso atrás deliberado y trabajar con una sola variable explicativa, para construir la mecánica de la regresión con la mayor claridad posible. No es un retroceso: **Mecánica de la Regresión II** retoma varias variables explicativas — incluyendo variables categóricas como el track — ya con las herramientas necesarias para tratarlas correctamente.

---

## Apéndice: Demostraciones formales

(prueba-cef-insesgadez)=
### A.1 El promedio muestral condicional es un estimador insesgado de la CEF

Fijate en un valor particular $x$, y llamá $n_x$ a la cantidad de observaciones de la muestra con $X_i = x$. El estimador que usaste en el dashboard es:

$$\hat m(x) = \frac{1}{n_x}\sum_{i \,:\, X_i = x} Y_i$$

Cada $Y_i$ entre esas $n_x$ observaciones es, por construcción, una extracción de la distribución de $Y$ condicional en $X=x$ — así que, por definición de la CEF, $E[Y_i \mid X_i = x] = m(x)$ para cada una de ellas. Tomando esperanza condicional en la composición de esa celda:

$$E\big[\hat m(x) \mid X_i = x \text{ para las } n_x \text{ observaciones de la celda}\big] = \frac{1}{n_x}\sum_{i \,:\, X_i = x} E[Y_i \mid X_i = x] = \frac{1}{n_x}\sum_{i \,:\, X_i = x} m(x) = m(x)$$

El promedio muestral en cada valor de $X$ es, entonces, exactamente insesgado para $m(x)$ — no "en principio", sino como consecuencia directa de la definición de la CEF. Lo que varía con $n_x$ no es el sesgo, sino la **precisión**: la varianza de $\hat m(x)$ es $\text{Var}(Y \mid X=x)/n_x$, que se achica con $\sqrt{n_x}$, igual que la de cualquier promedio muestral.

(prueba-cef-error-media-cero)=
### A.2 El error de la CEF tiene media condicional cero

Definí $\varepsilon = Y - m(X)$. Condicional en $X=x$, $m(X)$ es una constante (igual a $m(x)$), así que:

$$E[\varepsilon \mid X=x] = E[Y - m(X) \mid X=x] = E[Y \mid X=x] - m(x) = m(x) - m(x) = 0$$

La última igualdad usa la propia definición de la CEF, $E[Y \mid X=x] = m(x)$. El resultado vale para cualquier $x$, así que $E[\varepsilon \mid X] = 0$.

(prueba-cef-mse)=
### A.3 La CEF minimiza el error cuadrático medio de predicción

Para cualquier función $g(X)$, sumá y restá $m(X)$ dentro del error de predicción:

$$E[(Y-g(X))^2] = E\big[\big((Y-m(X)) + (m(X)-g(X))\big)^2\big] = E[(Y-m(X))^2] + 2\,E[(Y-m(X))(m(X)-g(X))] + E[(m(X)-g(X))^2]$$

El término cruzado se anula por la ley de esperanzas iteradas y el resultado A.2:

$$E[(Y-m(X))(m(X)-g(X))] = E\Big[\big(m(X)-g(X)\big)\,\underbrace{E[Y-m(X)\mid X]}_{=\,0 \text{ por A.2}}\Big] = 0$$

Entonces:

$$E[(Y-g(X))^2] = E[(Y-m(X))^2] + E[(m(X)-g(X))^2] \;\ge\; E[(Y-m(X))^2]$$

porque el segundo término es un cuadrado y no puede ser negativo. La igualdad se alcanza únicamente cuando $g(X) = m(X)$ (con probabilidad 1) — es decir, $g=m$ es la única función que minimiza el error cuadrático medio. Ninguna otra función de $X$, lineal o no, puede predecir mejor a $Y$, en este sentido, que la CEF.

---

## Poné a prueba lo que aprendiste

<div class="quiz-widget" data-quiz-slug="cef-conditional-expectation"></div>
