La estadística inferencial comprende los métodos que permiten hacer generalizaciones o inferencias sobre una población a partir de una muestra. Estos métodos son fundamentales para la investigación científica y la toma de decisiones basadas en datos.
1.1 Importancia en el análisis de datos
La estadística inferencial nos permite:
Estimar parámetros poblacionales
Contrastar hipótesis estadísticas
Construir modelos predictivos
Cuantificar la incertidumbre de nuestras estimaciones
2 Estimación de Parámetros
Existen diferentes métodos para estimar los parámetros poblacionales a partir de estadísticos muestrales.
2.1 Estimación Puntual
La estimación puntual proporciona un único valor como mejor aproximación al parámetro desconocido.
Code
# Ejemplo de estimación puntualset.seed(123)muestra <-rnorm(100, mean=25, sd=5)# Calculamos estimadores puntualesmedia_muestral <-mean(muestra)varianza_muestral <-var(muestra)desviacion_estandar <-sd(muestra)# Creamos una tabla con los resultadosresultados <-data.frame( Estadístico =c("Media", "Varianza", "Desviación Estándar"),Valor =c(media_muestral, varianza_muestral, desviacion_estandar))knitr::kable(resultados, digits =3)
Estadístico
Valor
Media
25.452
Varianza
20.831
Desviación Estándar
4.564
2.2 Estimación por Intervalos
Los intervalos de confianza proporcionan un rango de valores que probablemente contiene el parámetro poblacional.
Code
# Cálculo de intervalo de confianza para la mediaerror_estandar <-sd(muestra) /sqrt(length(muestra))margen_error <-qt(0.975, df=length(muestra)-1) * error_estandarintervalo <-data.frame(Nivel_Confianza ="95%", Límite_Inferior = media_muestral - margen_error, Límite_Superior = media_muestral + margen_error)knitr::kable(intervalo, digits =3)
Nivel_Confianza
Límite_Inferior
Límite_Superior
95%
24.546
26.358
2.3 Propiedades de los Estimadores
Un buen estimador debe cumplir ciertas propiedades:
Code
library(knitr)propiedades <-data.frame(Propiedad =c("Insesgamiento", "Eficiencia", "Consistencia", "Suficiencia"), Descripción =c("El valor esperado del estimador es igual al parámetro","Tiene la menor varianza entre los estimadores insesgados","Converge al verdadero valor del parámetro cuando n→∞","Utiliza toda la información relevante en la muestra"))kable(propiedades)
Propiedad
Descripción
Insesgamiento
El valor esperado del estimador es igual al parámetro
Eficiencia
Tiene la menor varianza entre los estimadores insesgados
Consistencia
Converge al verdadero valor del parámetro cuando n→∞
Suficiencia
Utiliza toda la información relevante en la muestra
3 Pruebas de Hipótesis
Las pruebas de hipótesis son procedimientos para decidir si se acepta o rechaza una afirmación sobre un parámetro.
3.1 Estructura de una Prueba de Hipótesis
Code
estructura <-data.frame(Elemento =c("Hipótesis nula (H₀)", "Hipótesis alternativa (H₁)", "Estadístico de prueba", "Valor p", "Nivel de significancia (α)"), Descripción =c("Afirmación que se considera verdadera hasta demostrar lo contrario","Afirmación que se acepta si se rechaza H₀","Valor calculado a partir de los datos muestrales","Probabilidad de obtener un resultado igual o más extremo que el observado","Probabilidad máxima de rechazar H₀ cuando es verdadera"))kable(estructura)
Elemento
Descripción
Hipótesis nula (H₀)
Afirmación que se considera verdadera hasta demostrar lo contrario
Hipótesis alternativa (H₁)
Afirmación que se acepta si se rechaza H₀
Estadístico de prueba
Valor calculado a partir de los datos muestrales
Valor p
Probabilidad de obtener un resultado igual o más extremo que el observado
Nivel de significancia (α)
Probabilidad máxima de rechazar H₀ cuando es verdadera
3.2 Prueba t para una muestra
Veamos un ejemplo de prueba t para contrastar si la media poblacional es igual a un valor específico:
Code
# Prueba t para una muestraresultado_t <-t.test(muestra, mu=24)# Resultados de la pruebaresultados_prueba <-data.frame( Estadístico_t = resultado_t$statistic,Grados_Libertad = resultado_t$parameter,Valor_p = resultado_t$p.value,Media_Muestral = resultado_t$estimate,Intervalo_Inferior = resultado_t$conf.int[1],Intervalo_Superior = resultado_t$conf.int[2])kable(resultados_prueba, digits =4)
Estadístico_t
Grados_Libertad
Valor_p
Media_Muestral
Intervalo_Inferior
Intervalo_Superior
t
3.1814
99
0.002
25.452
24.5464
26.3576
3.3 Tipos de Errores
En las pruebas de hipótesis podemos cometer dos tipos de errores:
Code
errores <-data.frame(Tipo =c("Error Tipo I", "Error Tipo II"), Descripción =c("Rechazar H₀ cuando es verdadera", "No rechazar H₀ cuando es falsa"),Probabilidad =c("α (nivel de significancia)", "β (depende del tamaño muestral y el efecto)"))kable(errores)
Tipo
Descripción
Probabilidad
Error Tipo I
Rechazar H₀ cuando es verdadera
α (nivel de significancia)
Error Tipo II
No rechazar H₀ cuando es falsa
β (depende del tamaño muestral y el efecto)
4 Análisis de Varianza (ANOVA)
El análisis de varianza permite comparar medias de más de dos grupos o poblaciones.
Code
# Simulación de datos para ANOVAset.seed(456)grupo_A <-rnorm(30, mean=15, sd=2)grupo_B <-rnorm(30, mean=17, sd=2)grupo_C <-rnorm(30, mean=14, sd=2)# Creación del dataframedatos_anova <-data.frame(valor =c(grupo_A, grupo_B, grupo_C),grupo =factor(rep(c("A", "B", "C"), each=30)))# Visualización de los datosboxplot(valor ~ grupo, data=datos_anova, main="Comparación de Grupos",col=c("lightblue", "lightgreen", "lightpink"))
Code
# Cálculo del ANOVAresultado_anova <-aov(valor ~ grupo, data=datos_anova)resumen_anova <-summary(resultado_anova)print(resumen_anova)
Df Sum Sq Mean Sq F value Pr(>F)
grupo 2 182.9 91.44 21.87 2.02e-08 ***
Residuals 87 363.7 4.18
---
Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
5 Regresión Lineal
La regresión lineal permite modelar la relación entre una variable dependiente y una o más variables independientes.
5.1 Regresión Lineal Simple
Code
# Simulación de datos para regresiónset.seed(789)x <-rnorm(100, mean=50, sd=10)y <-20+0.5*x +rnorm(100, mean=0, sd=5)datos_regresion <-data.frame(x, y)# Visualización de los datosplot(x, y, pch=16, col="blue", main="Diagrama de Dispersión",xlab="Variable Independiente", ylab="Variable Dependiente")# Ajuste del modelomodelo <-lm(y ~ x, data=datos_regresion)abline(modelo, col="red", lwd=2)
Code
# Resumen del modeloresumen_modelo <-summary(modelo)print(resumen_modelo)
Call:
lm(formula = y ~ x, data = datos_regresion)
Residuals:
Min 1Q Median 3Q Max
-14.5744 -3.5508 0.2869 3.0967 15.8292
Coefficients:
Estimate Std. Error t value Pr(>|t|)
(Intercept) 21.14369 2.71643 7.784 7.32e-12 ***
x 0.46974 0.05373 8.743 6.44e-14 ***
---
Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Residual standard error: 5.221 on 98 degrees of freedom
Multiple R-squared: 0.4382, Adjusted R-squared: 0.4325
F-statistic: 76.43 on 1 and 98 DF, p-value: 6.444e-14
5.2 Coeficiente de Determinación (R²)
El coeficiente R² mide la proporción de la varianza explicada por el modelo:
Los métodos no paramétricos no requieren supuestos sobre la distribución de los datos.
6.1 Prueba de Wilcoxon
Code
# Ejemplo de prueba de Wilcoxonset.seed(101)datos_A <-rnorm(50, mean=100, sd=15)datos_B <-rnorm(50, mean=110, sd=15)# Visualizaciónboxplot(list(Grupo_A=datos_A, Grupo_B=datos_B),col=c("lightblue", "lightgreen"),main="Comparación de Distribuciones")
Code
# Prueba de Wilcoxonresultado_wilcoxon <-wilcox.test(datos_A, datos_B)print(resultado_wilcoxon)
Wilcoxon rank sum test with continuity correction
data: datos_A and datos_B
W = 693, p-value = 0.0001248
alternative hypothesis: true location shift is not equal to 0
7 Potencia Estadística
La potencia de una prueba es la probabilidad de rechazar H₀ cuando es falsa.
Code
# Cálculo manual de la potencia para diferentes tamaños muestrales# Sin necesidad del paquete pwr# Parámetrosalfa <-0.05# Nivel de significanciad <-0.5# Tamaño del efectons <-seq(10, 100, by=10) # Tamaños muestrales# Función para calcular potencia de prueba t de dos muestrascalcular_potencia <-function(n, d, alfa) {# Grados de libertad df <-2* n -2# Valor crítico t_critico <-qt(1- alfa/2, df)# Parámetro de no centralidad ncp <- d *sqrt(n/2)# Potencia (probabilidad de rechazar H0 cuando es falsa) potencia <-1-pt(t_critico, df, ncp) +pt(-t_critico, df, ncp)return(potencia)}# Calcular potencia para cada tamaño muestralpotencia <-sapply(ns, function(n) calcular_potencia(n, d, alfa))# Visualizaciónplot(ns, potencia, type="b", col="blue", lwd=2,xlab="Tamaño muestral", ylab="Potencia estadística",main="Curva de Potencia para Diferentes Tamaños Muestrales")abline(h=0.8, col="red", lty=2)text(70, 0.82, "Potencia = 0.8", col="red", pos=3)
7.1 Interpretación de la Potencia
Code
# Tabla de interpretacióninterpretacion <-data.frame( Tamaño_Muestral = ns, Potencia_Estadística =round(potencia, 3))kable(interpretacion, caption ="Potencia Estadística para Diferentes Tamaños Muestrales (d = 0.5, α = 0.05)")
Potencia Estadística para Diferentes Tamaños Muestrales (d = 0.5, α = 0.05)
Tamaño_Muestral
Potencia_Estadística
10
0.185
20
0.338
30
0.478
40
0.598
50
0.697
60
0.775
70
0.836
80
0.882
90
0.916
100
0.940
8 Conclusiones
La estadística inferencial proporciona herramientas para hacer generalizaciones fundamentadas a partir de datos muestrales.
La elección del método adecuado depende de los objetivos del estudio y las características de los datos.
Es fundamental comprender los supuestos de cada método para aplicarlos correctamente.
La interpretación de los resultados debe considerar tanto la significancia estadística como la relevancia práctica.
El tamaño de la muestra afecta directamente la precisión de las estimaciones y la potencia de las pruebas.
9 Referencias
Martínez, R. (2023). Estadística Inferencial Aplicada. Editorial Académica.
López, S. (2024). Métodos Estadísticos con R. Universidad Científica.
Rojas, E. (2025). Fundamentos de Inferencia Estadística. Editorial Estadística Moderna.
Johnson, R. & Wichern, D. (2024). Applied Multivariate Statistical Analysis. Pearson.