Inferencia estadística: el p-valor bajo la lupa
Disparador: González y Mamone (2011),
distribución federal de obra pública en Argentina
Seminario de doctorado
26/08/2026
Objetivo de la clase
- Entender qué es y qué no es un
p-valor
- Distinguir significancia estadística de relevancia sustantiva
- Ver por qué la robustez (múltiples especificaciones, corrección de
errores estándar) es parte de la inferencia, no un anexo técnico
- Todo anclado en un paper real de ciencia política/economía
¿Por qué este paper?
González y Mamone (2011) preguntan si la obra pública federal en
Argentina (1993–2009) se reparte por:
- Criterio programático: necesidad, eficiencia
- Criterio discrecional: conveniencia política del
presidente
Corren 18 modelos distintos (Tablas 2 a 7): mismo
argumento, coeficientes que a veces son significativos y a veces no.
El armado del estudio
- OLS simple (Tablas 2–5)
- GLS de efectos fijos (Tabla 6)
- OLS con errores estándar corregidos por panel — PCSE (Tabla 7)
Nota al pie del propio paper: la variable “sobrerrepresentación” es
significativa en 7 de 18 modelos y no significativa en
los otros 11.
¿Qué es un p-valor?
Probabilidad de observar un estadístico tan extremo o
más que el observado, si \(H_0\) fuera verdadera:
\[p = P(|T| \geq |t_{obs}| \mid H_0 \text{
verdadera})\]
Es una afirmación sobre los datos bajo un supuesto,
no una afirmación sobre la hipótesis.
¿Qué NO es un p-valor?
- ❌ La probabilidad de que \(H_0\)
sea verdadera dado los datos
- ❌ La probabilidad de que el resultado sea “producto del azar”
- ❌ Una medida del tamaño o la importancia del efecto
- ❌ La probabilidad de que el hallazgo se replique
Ejemplo 1: “Coalición Central” (Tabla 3)
| Coalición Central |
.185 |
(.050) |
*** (p<.01) |
Cálculo en el pizarrón:
\[t = \frac{.185}{.050} = 3.7\]
Con ~165 casos, ese t cae muy lejos en la cola → consistente con
p<.01.
Ejemplo 2: “Sobrerrepresentación” (Tabla 5)
| Sobrerrepresentación |
.056 |
(.026) |
sin asterisco |
\[t = \frac{.056}{.026} =
2.15\]
Pregunta trampa: ¿por qué no es “significativo” si
el t no es tan bajo? (n chico → menos grados de libertad; revisar
umbral exacto que usan los autores)
El punto pedagógico central
Los propios autores escriben:
“no encontramos evidencia empírica suficiente para concluir con
claridad cuál es el rol de la sobrerrepresentación”
Noten la formulación: ausencia de evidencia, no
evidencia de ausencia.
Es uno de los errores de interpretación más comunes en ciencias
sociales.
Significancia estadística ≠ relevancia sustantiva
El paper traduce el coeficiente a magnitud real:
“las provincias centrales… reciben, en promedio, $185 per cápita más…
que las no aliadas”
Comparado con la Tabla 1: distritos centrales reciben en promedio
$1.627 per cápita; opositores, $753.
¿$185 es mucho o poco sobre esa base? —
discutir.
La robustez como parte de la inferencia
Mismo coeficiente (“Coalición Central”, variable ONP) según el
método:
| OLS (Tabla 3) |
.185 |
(.050) |
| GLS efectos fijos (Tabla 6) |
.073 |
(.051) — ya no significativo |
| PCSE (Tabla 7) |
.185 |
(.035) |
¿“Corrí una regresión y me dio ***” es una frase completa?
Preguntas disparadoras (1/2)
- Si el 5% de las variables irrelevantes “sale significativa” solo por
azar, y hay 18 modelos, ¿cómo distinguir señal de ruido?
- Los autores no corrigen por comparaciones múltiples pese a 18
especificaciones. ¿Problema de rigor o práctica aceptable?
- Los resultados cambian de significancia entre Tabla 3, 6 y 7 pero
mantienen el signo. ¿Alcanza el signo como criterio de robustez?
Preguntas disparadoras (2/2)
- ¿Qué diferencia hay entre “no rechazamos \(H_0\)” y “aceptamos \(H_0\)”? Busquen un pasaje del paper donde
esta distinción importa.
- Si tuvieran que pre-registrar un modelo “principal” antes de ver los
datos, ¿cuál elegirían? ¿Cambia esto cómo leemos el resto como
“robustness checks”?
Cierre: vamos a RStudio
En el script ejercicios_rstudio_seminario.R vamos a
simular (Monte Carlo) para ver en vivo:
- La tasa de falsos positivos de un p-valor bajo \(H_0\) verdadera
- Cómo cambia la potencia estadística con el tamaño de muestra
- Qué pasa al correr 18 variables irrelevantes contra la misma
dependiente
- Por qué el error estándar cambia entre OLS, efectos fijos y
PCSE