Estadística Inferencial: Métodos y Aplicaciones

Author

Yanarico Huanca Flor Melany

Published

April 4, 2025

1 Introducción a la Estadística Inferencial

La estadística inferencial comprende los métodos que permiten hacer generalizaciones o inferencias sobre una población a partir de una muestra. Estos métodos son fundamentales para la investigación científica y la toma de decisiones basadas en datos.

1.1 Importancia en el análisis de datos

La estadística inferencial nos permite:

  • Estimar parámetros poblacionales
  • Contrastar hipótesis estadísticas
  • Construir modelos predictivos
  • Cuantificar la incertidumbre de nuestras estimaciones

2 Estimación de Parámetros

Existen diferentes métodos para estimar los parámetros poblacionales a partir de estadísticos muestrales.

2.1 Estimación Puntual

La estimación puntual proporciona un único valor como mejor aproximación al parámetro desconocido.

Code
# Ejemplo de estimación puntual
set.seed(123)
muestra <- rnorm(100, mean=25, sd=5)

# Calculamos estimadores puntuales
media_muestral <- mean(muestra)
varianza_muestral <- var(muestra)
desviacion_estandar <- sd(muestra)

# Creamos una tabla con los resultados
resultados <- data.frame(
  Estadístico = c("Media", "Varianza", "Desviación Estándar"),
  Valor = c(media_muestral, varianza_muestral, desviacion_estandar)
)
knitr::kable(resultados, digits = 3)
Estadístico Valor
Media 25.452
Varianza 20.831
Desviación Estándar 4.564

2.2 Estimación por Intervalos

Los intervalos de confianza proporcionan un rango de valores que probablemente contiene el parámetro poblacional.

Code
# Cálculo de intervalo de confianza para la media
error_estandar <- sd(muestra) / sqrt(length(muestra))
margen_error <- qt(0.975, df=length(muestra)-1) * error_estandar

intervalo <- data.frame(
  Nivel_Confianza = "95%",
  Límite_Inferior = media_muestral - margen_error,
  Límite_Superior = media_muestral + margen_error
)
knitr::kable(intervalo, digits = 3)
Nivel_Confianza Límite_Inferior Límite_Superior
95% 24.546 26.358

2.3 Propiedades de los Estimadores

Un buen estimador debe cumplir ciertas propiedades:

Code
library(knitr)
propiedades <- data.frame(
  Propiedad = c("Insesgamiento", "Eficiencia", "Consistencia", "Suficiencia"),
  Descripción = c("El valor esperado del estimador es igual al parámetro",
                  "Tiene la menor varianza entre los estimadores insesgados",
                  "Converge al verdadero valor del parámetro cuando n→∞",
                  "Utiliza toda la información relevante en la muestra")
)
kable(propiedades)
Propiedad Descripción
Insesgamiento El valor esperado del estimador es igual al parámetro
Eficiencia Tiene la menor varianza entre los estimadores insesgados
Consistencia Converge al verdadero valor del parámetro cuando n→∞
Suficiencia Utiliza toda la información relevante en la muestra

3 Pruebas de Hipótesis

Las pruebas de hipótesis son procedimientos para decidir si se acepta o rechaza una afirmación sobre un parámetro.

3.1 Estructura de una Prueba de Hipótesis

Code
estructura <- data.frame(
  Elemento = c("Hipótesis nula (H₀)", "Hipótesis alternativa (H₁)", 
               "Estadístico de prueba", "Valor p", "Nivel de significancia (α)"),
  Descripción = c("Afirmación que se considera verdadera hasta demostrar lo contrario",
                  "Afirmación que se acepta si se rechaza H₀",
                  "Valor calculado a partir de los datos muestrales",
                  "Probabilidad de obtener un resultado igual o más extremo que el observado",
                  "Probabilidad máxima de rechazar H₀ cuando es verdadera")
)
kable(estructura)
Elemento Descripción
Hipótesis nula (H₀) Afirmación que se considera verdadera hasta demostrar lo contrario
Hipótesis alternativa (H₁) Afirmación que se acepta si se rechaza H₀
Estadístico de prueba Valor calculado a partir de los datos muestrales
Valor p Probabilidad de obtener un resultado igual o más extremo que el observado
Nivel de significancia (α) Probabilidad máxima de rechazar H₀ cuando es verdadera

3.2 Prueba t para una muestra

Veamos un ejemplo de prueba t para contrastar si la media poblacional es igual a un valor específico:

Code
# Prueba t para una muestra
resultado_t <- t.test(muestra, mu=24)

# Resultados de la prueba
resultados_prueba <- data.frame(
  Estadístico_t = resultado_t$statistic,
  Grados_Libertad = resultado_t$parameter,
  Valor_p = resultado_t$p.value,
  Media_Muestral = resultado_t$estimate,
  Intervalo_Inferior = resultado_t$conf.int[1],
  Intervalo_Superior = resultado_t$conf.int[2]
)
kable(resultados_prueba, digits = 4)
Estadístico_t Grados_Libertad Valor_p Media_Muestral Intervalo_Inferior Intervalo_Superior
t 3.1814 99 0.002 25.452 24.5464 26.3576

3.3 Tipos de Errores

En las pruebas de hipótesis podemos cometer dos tipos de errores:

Code
errores <- data.frame(
  Tipo = c("Error Tipo I", "Error Tipo II"),
  Descripción = c("Rechazar H₀ cuando es verdadera", "No rechazar H₀ cuando es falsa"),
  Probabilidad = c("α (nivel de significancia)", "β (depende del tamaño muestral y el efecto)")
)
kable(errores)
Tipo Descripción Probabilidad
Error Tipo I Rechazar H₀ cuando es verdadera α (nivel de significancia)
Error Tipo II No rechazar H₀ cuando es falsa β (depende del tamaño muestral y el efecto)

4 Análisis de Varianza (ANOVA)

El análisis de varianza permite comparar medias de más de dos grupos o poblaciones.

Code
# Simulación de datos para ANOVA
set.seed(456)
grupo_A <- rnorm(30, mean=15, sd=2)
grupo_B <- rnorm(30, mean=17, sd=2)
grupo_C <- rnorm(30, mean=14, sd=2)

# Creación del dataframe
datos_anova <- data.frame(
  valor = c(grupo_A, grupo_B, grupo_C),
  grupo = factor(rep(c("A", "B", "C"), each=30))
)

# Visualización de los datos
boxplot(valor ~ grupo, data=datos_anova, 
        main="Comparación de Grupos",
        col=c("lightblue", "lightgreen", "lightpink"))

Code
# Cálculo del ANOVA
resultado_anova <- aov(valor ~ grupo, data=datos_anova)
resumen_anova <- summary(resultado_anova)
print(resumen_anova)
            Df Sum Sq Mean Sq F value   Pr(>F)    
grupo        2  182.9   91.44   21.87 2.02e-08 ***
Residuals   87  363.7    4.18                     
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

5 Regresión Lineal

La regresión lineal permite modelar la relación entre una variable dependiente y una o más variables independientes.

5.1 Regresión Lineal Simple

Code
# Simulación de datos para regresión
set.seed(789)
x <- rnorm(100, mean=50, sd=10)
y <- 20 + 0.5*x + rnorm(100, mean=0, sd=5)
datos_regresion <- data.frame(x, y)

# Visualización de los datos
plot(x, y, pch=16, col="blue", 
     main="Diagrama de Dispersión",
     xlab="Variable Independiente", ylab="Variable Dependiente")

# Ajuste del modelo
modelo <- lm(y ~ x, data=datos_regresion)
abline(modelo, col="red", lwd=2)

Code
# Resumen del modelo
resumen_modelo <- summary(modelo)
print(resumen_modelo)

Call:
lm(formula = y ~ x, data = datos_regresion)

Residuals:
     Min       1Q   Median       3Q      Max 
-14.5744  -3.5508   0.2869   3.0967  15.8292 

Coefficients:
            Estimate Std. Error t value Pr(>|t|)    
(Intercept) 21.14369    2.71643   7.784 7.32e-12 ***
x            0.46974    0.05373   8.743 6.44e-14 ***
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

Residual standard error: 5.221 on 98 degrees of freedom
Multiple R-squared:  0.4382,    Adjusted R-squared:  0.4325 
F-statistic: 76.43 on 1 and 98 DF,  p-value: 6.444e-14

5.2 Coeficiente de Determinación (R²)

El coeficiente R² mide la proporción de la varianza explicada por el modelo:

Code
r_cuadrado <- data.frame(
  R_cuadrado = resumen_modelo$r.squared,
  R_cuadrado_ajustado = resumen_modelo$adj.r.squared
)
kable(r_cuadrado, digits = 4)
R_cuadrado R_cuadrado_ajustado
0.4382 0.4325

6 Métodos No Paramétricos

Los métodos no paramétricos no requieren supuestos sobre la distribución de los datos.

6.1 Prueba de Wilcoxon

Code
# Ejemplo de prueba de Wilcoxon
set.seed(101)
datos_A <- rnorm(50, mean=100, sd=15)
datos_B <- rnorm(50, mean=110, sd=15)

# Visualización
boxplot(list(Grupo_A=datos_A, Grupo_B=datos_B),
        col=c("lightblue", "lightgreen"),
        main="Comparación de Distribuciones")

Code
# Prueba de Wilcoxon
resultado_wilcoxon <- wilcox.test(datos_A, datos_B)
print(resultado_wilcoxon)

    Wilcoxon rank sum test with continuity correction

data:  datos_A and datos_B
W = 693, p-value = 0.0001248
alternative hypothesis: true location shift is not equal to 0

7 Potencia Estadística

La potencia de una prueba es la probabilidad de rechazar H₀ cuando es falsa.

Code
# Cálculo manual de la potencia para diferentes tamaños muestrales
# Sin necesidad del paquete pwr

# Parámetros
alfa <- 0.05       # Nivel de significancia
d <- 0.5           # Tamaño del efecto
ns <- seq(10, 100, by=10)  # Tamaños muestrales

# Función para calcular potencia de prueba t de dos muestras
calcular_potencia <- function(n, d, alfa) {
  # Grados de libertad
  df <- 2 * n - 2
  
  # Valor crítico
  t_critico <- qt(1 - alfa/2, df)
  
  # Parámetro de no centralidad
  ncp <- d * sqrt(n/2)
  
  # Potencia (probabilidad de rechazar H0 cuando es falsa)
  potencia <- 1 - pt(t_critico, df, ncp) + pt(-t_critico, df, ncp)
  
  return(potencia)
}

# Calcular potencia para cada tamaño muestral
potencia <- sapply(ns, function(n) calcular_potencia(n, d, alfa))

# Visualización
plot(ns, potencia, type="b", col="blue", lwd=2,
     xlab="Tamaño muestral", ylab="Potencia estadística",
     main="Curva de Potencia para Diferentes Tamaños Muestrales")
abline(h=0.8, col="red", lty=2)
text(70, 0.82, "Potencia = 0.8", col="red", pos=3)

7.1 Interpretación de la Potencia

Code
# Tabla de interpretación
interpretacion <- data.frame(
  Tamaño_Muestral = ns,
  Potencia_Estadística = round(potencia, 3)
)

kable(interpretacion, 
      caption = "Potencia Estadística para Diferentes Tamaños Muestrales (d = 0.5, α = 0.05)")
Potencia Estadística para Diferentes Tamaños Muestrales (d = 0.5, α = 0.05)
Tamaño_Muestral Potencia_Estadística
10 0.185
20 0.338
30 0.478
40 0.598
50 0.697
60 0.775
70 0.836
80 0.882
90 0.916
100 0.940

8 Conclusiones

  • La estadística inferencial proporciona herramientas para hacer generalizaciones fundamentadas a partir de datos muestrales.
  • La elección del método adecuado depende de los objetivos del estudio y las características de los datos.
  • Es fundamental comprender los supuestos de cada método para aplicarlos correctamente.
  • La interpretación de los resultados debe considerar tanto la significancia estadística como la relevancia práctica.
  • El tamaño de la muestra afecta directamente la precisión de las estimaciones y la potencia de las pruebas.

9 Referencias

  1. Martínez, R. (2023). Estadística Inferencial Aplicada. Editorial Académica.
  2. López, S. (2024). Métodos Estadísticos con R. Universidad Científica.
  3. Rojas, E. (2025). Fundamentos de Inferencia Estadística. Editorial Estadística Moderna.
  4. Johnson, R. & Wichern, D. (2024). Applied Multivariate Statistical Analysis. Pearson.