Inferencia estadística: el p-valor bajo la lupa

Disparador: González y Mamone (2011), distribución federal de obra pública en Argentina

Seminario de doctorado

26/08/2026

Objetivo de la clase

¿Por qué este paper?

González y Mamone (2011) preguntan si la obra pública federal en Argentina (1993–2009) se reparte por:

Corren 18 modelos distintos (Tablas 2 a 7): mismo argumento, coeficientes que a veces son significativos y a veces no.

El armado del estudio

Nota al pie del propio paper: la variable “sobrerrepresentación” es significativa en 7 de 18 modelos y no significativa en los otros 11.

¿Qué es un p-valor?

Probabilidad de observar un estadístico tan extremo o más que el observado, si \(H_0\) fuera verdadera:

\[p = P(|T| \geq |t_{obs}| \mid H_0 \text{ verdadera})\]

Es una afirmación sobre los datos bajo un supuesto, no una afirmación sobre la hipótesis.

¿Qué NO es un p-valor?

Ejemplo 1: “Coalición Central” (Tabla 3)

Variable Coef. Error Est. Sig.
Coalición Central .185 (.050) *** (p<.01)

Cálculo en el pizarrón:

\[t = \frac{.185}{.050} = 3.7\]

Con ~165 casos, ese t cae muy lejos en la cola → consistente con p<.01.

Ejemplo 2: “Sobrerrepresentación” (Tabla 5)

Variable Coef. Error Est. Sig.
Sobrerrepresentación .056 (.026) sin asterisco

\[t = \frac{.056}{.026} = 2.15\]

Pregunta trampa: ¿por qué no es “significativo” si el t no es tan bajo? (n chico → menos grados de libertad; revisar umbral exacto que usan los autores)

El punto pedagógico central

Los propios autores escriben:

“no encontramos evidencia empírica suficiente para concluir con claridad cuál es el rol de la sobrerrepresentación”

Noten la formulación: ausencia de evidencia, no evidencia de ausencia.

Es uno de los errores de interpretación más comunes en ciencias sociales.

Significancia estadística ≠ relevancia sustantiva

El paper traduce el coeficiente a magnitud real:

“las provincias centrales… reciben, en promedio, $185 per cápita más… que las no aliadas”

Comparado con la Tabla 1: distritos centrales reciben en promedio $1.627 per cápita; opositores, $753.

¿$185 es mucho o poco sobre esa base? — discutir.

La robustez como parte de la inferencia

Mismo coeficiente (“Coalición Central”, variable ONP) según el método:

Modelo Coeficiente Error Est.
OLS (Tabla 3) .185 (.050)
GLS efectos fijos (Tabla 6) .073 (.051) — ya no significativo
PCSE (Tabla 7) .185 (.035)

¿“Corrí una regresión y me dio ***” es una frase completa?

Preguntas disparadoras (1/2)

  1. Si el 5% de las variables irrelevantes “sale significativa” solo por azar, y hay 18 modelos, ¿cómo distinguir señal de ruido?
  2. Los autores no corrigen por comparaciones múltiples pese a 18 especificaciones. ¿Problema de rigor o práctica aceptable?
  3. Los resultados cambian de significancia entre Tabla 3, 6 y 7 pero mantienen el signo. ¿Alcanza el signo como criterio de robustez?

Preguntas disparadoras (2/2)

  1. ¿Qué diferencia hay entre “no rechazamos \(H_0\)” y “aceptamos \(H_0\)”? Busquen un pasaje del paper donde esta distinción importa.
  2. Si tuvieran que pre-registrar un modelo “principal” antes de ver los datos, ¿cuál elegirían? ¿Cambia esto cómo leemos el resto como “robustness checks”?

Cierre: vamos a RStudio

En el script ejercicios_rstudio_seminario.R vamos a simular (Monte Carlo) para ver en vivo: