Curso: Estadística Inferencial
Proyecto: Proyecto 2 — Intervalos de Confianza
Profesor: Humberto Llinás
Integrantes: Luciana Salas, Sofia Bayona, Alejandro Ortiz, Emily Lora
Fecha de entrega: 25 de septiembre de 2026
Este trabajo tiene como objetivo aplicar los procedimientos de
estimación por intervalos de confianza estudiados en el curso de
Estadística Inferencial, utilizando el conjunto de datos
survey del paquete lsm de R, desarrollado por
Llinás (2017). A partir de la base de datos original (800 observaciones,
66 variables), se construyeron dos muestras: Muestra1 (n = 120) y
Muestra2 (n = 28). Se seleccionaron dos variables cuantitativas (Weight
y Score) y dos variables dicotómicas (Law y Like) para el análisis.
Utilizando Muestra1, se construyeron intervalos de confianza para la
media poblacional de Weight y Score mediante la distribución Z, y con
Muestra2 se construyeron los intervalos correspondientes mediante la
distribución t de Student, dado que en muestras pequeñas no se conoce la
desviación estándar poblacional. También se construyeron intervalos de
confianza para las proporciones poblacionales de Law (respuesta “Agree”)
y Like (respuesta “Network”) usando Muestra1. Los resultados muestran
que, para una misma variable, el intervalo construido con la muestra más
pequeña (Muestra2) resultó considerablemente más amplio que el
construido con la muestra más grande (Muestra1), evidenciando el efecto
del tamaño de muestra sobre la precisión de la estimación. Asimismo, se
observó que los valores críticos de la distribución t fueron mayores que
los de la distribución Z, debido a la incertidumbre adicional de estimar
la desviación estándar poblacional a partir de la muestra. Se concluye
que el tamaño de muestra y el conocimiento (o desconocimiento) de la
desviación estándar poblacional son factores determinantes en la
precisión de los intervalos de confianza obtenidos.
Palabras clave: intervalo de confianza, distribución normal, distribución t de Student, proporción poblacional, estimación estadística.
En estadística, muchas veces no podemos estudiar a toda una población porque sería muy costoso o simplemente imposible, entonces trabajamos con una muestra y tratamos de hacer inferencias sobre la población completa (Mayorga Álvarez, 2004). Una de las herramientas más usadas para esto es el intervalo de confianza, que en vez de darnos un solo número como estimación, nos da un rango de valores donde probablemente esté el verdadero valor poblacional, junto con un nivel de confianza que nos dice qué tan seguros podemos estar de eso (Walpole et al., 2012).
Estos intervalos se usan muchísimo porque dan más información que solo un número: nos dejan ver qué tan precisa (o imprecisa) es nuestra estimación (Llinás, 2017). Los intervalos de confianza también pueden ser difíciles de interpretar correctamente, especialmente cuando se confunde el significado del intervalo con el comportamiento del parámetro poblacional (Greenland et al., 2016). De hecho hay estudios que muestran que este es de los conceptos que más cuesta entender bien en estadística, incluso en los libros de texto escolares (Rodríguez-Alveal & Aguerrea, 2024).
En este trabajo aplicamos lo que vimos en clase sobre intervalos de
confianza: tanto para la media poblacional (usando Z y t de Student,
dependiendo si conocemos o no la desviación estándar poblacional) como
para una proporción poblacional. Usamos la base de datos
survey del paquete lsm de R, que fue
desarrollada por nuestro profesor Humberto Llinás (Llinás, 2017). Nos
pareció importante hacer este ejercicio porque nos permite ver en la
práctica cómo cambia la precisión de una estimación según el tamaño de
la muestra que tengamos, y no solo quedarnos con la teoría.
El objetivo de este trabajo es construir e interpretar intervalos de confianza para las variables Weight, Score, Law y Like de la base de datos survey, usando dos muestras de distinto tamaño, y comparar los resultados obtenidos con los procedimientos Z y t de Student.
Estimación puntual vs. estimación por intervalo
Cuando queremos saber algo de una población (por ejemplo, el peso promedio de todos los estudiantes), lo normal es que no podamos medir a todos, entonces usamos una muestra y calculamos un estimador, como la media muestral. Ese único número es lo que se llama estimación puntual. El problema es que ese número casi nunca va a coincidir exactamente con el valor real de la población, porque depende de qué muestra nos tocó. Por eso se usa mejor un intervalo de confianza, que en vez de dar un solo número da un rango donde es probable que esté el verdadero valor poblacional, junto con un porcentaje (por ejemplo 95%) que indica qué tan confiable es ese rango.
Intervalo de confianza para la media con Z
Este procedimiento se usa cuando conocemos (o podemos aproximar con confianza) la desviación estándar de toda la población, σ. La fórmula es:
x̄ ± z(α/2) · (σ/√n)
Básicamente se toma la media de la muestra y se le suma y resta un “margen de error”, que depende de qué tan dispersos son los datos (σ), de cuántos datos tenemos (n), y de qué tan seguros queremos estar (el valor z, que para 95% de confianza es 1.96). En nuestro caso usamos este método con Muestra1 (120 datos), usando la desviación estándar muestral como aproximación de σ, ya que al ser una muestra grande esa aproximación es razonable.
Intervalo de confianza para la media con t de Student
Cuando no conocemos la desviación estándar poblacional (que es lo más común en la vida real) y además la muestra es pequeña, no podemos usar Z directamente porque estaríamos subestimando la incertidumbre. En su lugar se usa la distribución t de Student, que tiene una forma parecida a la normal pero con colas más anchas, justamente para compensar esa incertidumbre extra de estimar σ con la desviación estándar muestral s:
x̄ ± t(α/2, n−1) · (s/√n)
El valor de t depende de los grados de libertad (n−1), y entre más chica es la muestra, más grande es ese valor t comparado con z, lo que hace el intervalo más ancho. En nuestro trabajo usamos t con Muestra2 (28 datos), porque es una muestra pequeña y no conocemos la desviación estándar real de la población.
Intervalo de confianza para una proporción
Cuando la variable que nos interesa no es numérica sino de dos categorías (por ejemplo, si alguien responde “Sí” o “No”), no hablamos de una media sino de una proporción, es decir, qué porcentaje de la muestra cae en la categoría que nos interesa. La fórmula es:
p̂ ± z(α/2) · √(p̂(1−p̂)/n)
Donde p̂ es la proporción muestral (éxitos dividido entre n). Este método asume que la muestra es lo suficientemente grande para que la aproximación a la normal sea válida (usualmente se pide que n·p̂ y n·(1−p̂) sean mayores o iguales a 5). En nuestro caso lo usamos con las variables Law y Like en Muestra1.
Origen de los datos
Los datos utilizados en este trabajo provienen del conjunto
survey, incluido en el paquete lsm de R,
desarrollado por Llinás (2017). Esta base de datos corresponde a una
encuesta aplicada a estudiantes universitarios y contiene 800
observaciones y 66 variables, entre las cuales se incluyen variables
demográficas, académicas, de estilo de vida y psicométricas.
Variables analizadas
Para este trabajo se seleccionaron cuatro variables:
Estas variables se seleccionaron porque son de fácil interpretación y permiten ilustrar tanto el caso de una media poblacional como el de una proporción poblacional, cumpliendo con la condición de no repetir las variables trabajadas en clase.
Población y muestra
La población de referencia corresponde a los 800 estudiantes
encuestados en el conjunto de datos survey. A partir de
esta población se construyeron dos muestras:
Procedimientos estadísticos
Se construyeron seis intervalos de confianza, todos con un nivel de confianza del 95%:
Para cada intervalo se calcularon: la estimación puntual, el error estándar, el valor crítico, el margen de error y los límites inferior y superior.
Software
Todo el análisis se realizó en R, utilizando RStudio como entorno de
desarrollo. Se emplearon los paquetes lsm (para acceder a
la base de datos), knitr y kableExtra (para la
construcción y presentación de las tablas de resultados). Los intervalos
se calcularon mediante tres funciones desarrolladas para este propósito:
ic_media_z(), ic_media_t() e
ic_proporcion().
Justificación de las técnicas seleccionadas
Se utilizó la distribución Z para Muestra1 porque, al tratarse de una muestra grande (n = 120), la desviación estándar muestral es una aproximación razonable de la desviación estándar poblacional. En cambio, para Muestra2 (n = 28) se utilizó la distribución t de Student, ya que con muestras pequeñas la incertidumbre de estimar la desviación estándar poblacional a partir de la muestra es mayor, y la distribución t compensa esta incertidumbre con colas más anchas que la distribución normal. Para las proporciones se utilizó la aproximación normal (Z), verificando que se cumpliera la condición de muestra grande (n·p̂ ≥ 5 y n·(1−p̂) ≥ 5).
library(lsm) # Para acceder a la base de datos survey
library(knitr) # Para construir tablas
library(kableExtra) # Para mejorar la presentación de las tablas
# ============================================================
# 1. Intervalo Z para una media con sigma conocida
# ============================================================
ic_media_z <- function(media, sigma, n, conf = 0.95, digitos = 4) {
alpha <- 1 - conf
z <- qnorm(1 - alpha / 2)
error_estandar <- sigma / sqrt(n)
margen_error <- z * error_estandar
inferior <- media - margen_error
superior <- media + margen_error
resultado <- data.frame(
Medida = c("Media", "\u03c3", "Error estándar", "n", "Grado de confianza",
"Valor crítico", "Margen de error", "Extremo inferior",
"Extremo superior", "Intervalo"),
Resultado = c(round(media, digitos), round(sigma, digitos),
round(error_estandar, digitos), n, round(conf, digitos),
round(z, digitos), round(margen_error, digitos),
round(inferior, digitos), round(superior, digitos),
paste0(round(media, digitos), " ± ", round(margen_error, digitos))),
check.names = FALSE
)
knitr::kable(resultado, format = "html", col.names = c("Medida", "Valor"), align = c("l", "r"))
}
# ============================================================
# 2. Intervalo t para una media con sigma desconocida
# ============================================================
ic_media_t <- function(media, s, n, conf = 0.95, digitos = 4) {
alpha <- 1 - conf
gl <- n - 1
t_critico <- qt(1 - alpha / 2, df = gl)
error_estandar <- s / sqrt(n)
margen_error <- t_critico * error_estandar
inferior <- media - margen_error
superior <- media + margen_error
resultado <- data.frame(
Medida = c("Media", "s", "Error estándar", "n", "Grados de libertad",
"Grado de confianza", "Valor crítico", "Margen de error",
"Extremo inferior", "Extremo superior", "Intervalo"),
Resultado = c(round(media, digitos), round(s, digitos),
round(error_estandar, digitos), n, gl, round(conf, digitos),
round(t_critico, digitos), round(margen_error, digitos),
round(inferior, digitos), round(superior, digitos),
paste0(round(media, digitos), " ± ", round(margen_error, digitos))),
check.names = FALSE
)
knitr::kable(resultado, format = "html", col.names = c("Medida", "Valor"), align = c("l", "r"))
}
# ============================================================
# 3. Intervalo Z para una proporción
# ============================================================
ic_proporcion <- function(exitos, n, conf = 0.95, digitos = 4) {
if (exitos < 0 || exitos > n) stop("El número de éxitos debe estar entre 0 y n.")
alpha <- 1 - conf
z <- qnorm(1 - alpha / 2)
proporcion <- exitos / n
error_estandar <- sqrt(proporcion * (1 - proporcion) / n)
margen_error <- z * error_estandar
inferior <- max(0, proporcion - margen_error)
superior <- min(1, proporcion + margen_error)
resultado <- data.frame(
Medida = c("Éxitos", "n", "Proporción", "Error estándar", "Grado de confianza",
"Valor crítico", "Margen de error", "Extremo inferior",
"Extremo superior", "Intervalo"),
Resultado = c(exitos, n, round(proporcion, digitos), round(error_estandar, digitos),
round(conf, digitos), round(z, digitos), round(margen_error, digitos),
round(inferior, digitos), round(superior, digitos),
paste0(round(proporcion, digitos), " ± ", round(margen_error, digitos))),
check.names = FALSE
)
knitr::kable(resultado, format = "html", col.names = c("Medida", "Valor"), align = c("l", "r"))
}
datosCompleto <- lsm::survey
Responda las siguientes preguntas:
¿Cuántas observaciones tiene su nueva base de datos? 800 observaciones.
¿Cuántas variables contiene? 66 variables. Muestre los nombres de todas las variables.
names(datosCompleto)
## [1] "Observation" "ID" "Gender" "Like" "Age"
## [6] "Smoke" "Height" "Weight" "BMI" "School"
## [11] "SES" "Enrollment" "Score" "MotherHeight" "MotherAge"
## [16] "MotherCHD" "FatherHeight" "FatherAge" "FatherCHD" "Status"
## [21] "SemAcum" "Exam1" "Exam2" "Exam3" "Exam4"
## [26] "ExamAcum" "Definitive" "Expense" "Income" "Gas"
## [31] "Course" "Law" "Economic" "Race" "Region"
## [36] "EMO1" "EMO2" "EMO3" "EMO4" "EMO5"
## [41] "GOAL1" "GOAL2" "GOAL3" "Pre_STAT1" "Pre_STAT2"
## [46] "Pre_STAT3" "Pre_STAT4" "Post_STAT1" "Post_STAT2" "Post_STAT3"
## [51] "Post_STAT4" "Pre_IDARE1" "Pre_IDARE2" "Pre_IDARE3" "Pre_IDARE4"
## [56] "Pre_IDARE5" "Post_IDARE1" "Post_IDARE2" "Post_IDARE3" "Post_IDARE4"
## [61] "Post_IDARE5" "PSICO1" "PSICO2" "PSICO3" "PSICO4"
## [66] "PSICO5"
Seleccione:
Dos variables cuantitativas que utilizará para construir intervalos para la media poblacional;
Dos variables dicotómicas que utilizará para construir intervalos para una proporción poblacional.
Justifique brevemente la selección realizada.
Las cuantitativas porque son numericas y continuas, ideales para un promedio real de la gente en el estudio y ver que tanto varian estas respecto al grupo. Las dicotomicas porque son de seleccion de dos opciones, justo lo que se pide para calcular porcentajes y ver como se divide la gente en dos grupos.
Para todos los procedimientos de este trabajo se asume que las variables cuantitativas poblacionales seleccionadas (Weight y Score) siguen una distribución normal. Este supuesto es necesario porque:
Muestra1 <- datosCompleto[1:120,1:66] # A) Un nuevo data frame
Muestra1
Muestra2 <- datosCompleto[1:28,1:66] # A) Un nuevo data frame
Muestra2
Datos: variable cuantitativa Weight, tomada de Muestra1 (n = 120).
Supuestos: se asume que la población es normal (ver sección de Supuestos); se usa la desviación estándar muestral s como aproximación de σ, dado que Muestra1 es una muestra grande.
Fórmula:
x̄ ± z(α/2) · (s / √n)
Tabla 1. Intervalo de confianza (Z) para la media poblacional de Weight — Muestra1.
# Intervalo de confianza Z para la media poblacional de WEIGHT
ic_media_z(
media = mean(Muestra1$Weight),
sigma = sd(Muestra1$Weight),
n = nrow(Muestra1),
conf = 0.95
)
| Medida | Valor |
|---|---|
| Media | 74.265 |
| σ | 16.2435 |
| Error estándar | 1.4828 |
| n | 120 |
| Grado de confianza | 0.95 |
| Valor crítico | 1.96 |
| Margen de error | 2.9063 |
| Extremo inferior | 71.3587 |
| Extremo superior | 77.1713 |
| Intervalo | 74.265 ± 2.9063 |
Interpretación: Se estima la media poblacional del peso (Weight). El error estándar fue de 1.4808 y el valor crítico Z utilizado fue 1.96, lo que dio un margen de error de 2.9063. Con un 95% de confianza, la media poblacional de Weight está entre 71.3587 y 77.1713.
Datos: variable cuantitativa Score, tomada de Muestra1 (n = 120).
Supuestos: se asume que la población es normal; se usa la desviación estándar muestral s como aproximación de σ, dado que Muestra1 es una muestra grande.
Fórmula:
x̄ ± z(α/2) · (s / √n)
Tabla 2. Intervalo de confianza (Z) para la media poblacional de Score — Muestra1.
# Intervalo de confianza Z para la media poblacional de Score
ic_media_z(
media = mean(Muestra1$Score),
sigma = sd(Muestra1$Score),
n = nrow(Muestra1),
conf = 0.95
)
| Medida | Valor |
|---|---|
| Media | 30.675 |
| σ | 19.5277 |
| Error estándar | 1.7826 |
| n | 120 |
| Grado de confianza | 0.95 |
| Valor crítico | 1.96 |
| Margen de error | 3.4939 |
| Extremo inferior | 27.1811 |
| Extremo superior | 34.1689 |
| Intervalo | 30.675 ± 3.4939 |
Interpretación: Se estima la media poblacional de Score. El error estándar fue de 1.7826 y el valor crítico Z utilizado fue 1.96, lo que dio un margen de error de 3.4939. Con un 95% de confianza, la media poblacional de Score está entre 27.1811 y 34.1689.
Datos: variable cuantitativa Weight, tomada de Muestra2 (n = 28).
Supuestos: se asume que la población es normal; se usa la desviación estándar muestral s porque no conocemos la desviación estándar poblacional (obligatorio con t, más aún con una muestra pequeña).
Fórmula:
x̄ ± t(α/2, n-1) · (s / √n)
Tabla 3. Intervalo de confianza (t) para la media poblacional de Weight — Muestra2.
# Intervalo de confianza t-Student para la media poblacional de Weight
ic_media_t(
media = mean(Muestra2$Weight),
s = sd(Muestra2$Weight),
n = nrow(Muestra2),
conf = 0.95
)
| Medida | Valor |
|---|---|
| Media | 77.4071 |
| s | 16.1669 |
| Error estándar | 3.0552 |
| n | 28 |
| Grados de libertad | 27 |
| Grado de confianza | 0.95 |
| Valor crítico | 2.0518 |
| Margen de error | 6.2689 |
| Extremo inferior | 71.1383 |
| Extremo superior | 83.676 |
| Intervalo | 77.4071 ± 6.2689 |
Interpretación: Se estima la media poblacional del peso (Weight), usando Muestra2 porque no conocemos la desviación estándar poblacional. Con 27 grados de libertad, el valor crítico t fue de 2.0518 y el error estándar fue de 3.0552, dando un margen de error de 6.2689. Con un 95% de confianza, la media poblacional de Weight está entre 71.1383 y 83.6760. Nótese que este intervalo es bastante más amplio que el del inciso a (Muestra1), reflejando la mayor incertidumbre de trabajar con una muestra más pequeña.
Datos: variable cuantitativa Score, tomada de Muestra2 (n = 28).
Supuestos: se asume que la población es normal; se usa la desviación estándar muestral s porque no conocemos la desviación estándar poblacional.
Fórmula:
x̄ ± t(α/2, n-1) · (s / √n)
Tabla 4. Intervalo de confianza (t) para la media poblacional de Score — Muestra2.
# Intervalo de confianza t-Student para la media poblacional de Score
ic_media_t(
media = mean(Muestra2$Score),
s = sd(Muestra2$Score),
n = nrow(Muestra2),
conf = 0.95
)
| Medida | Valor |
|---|---|
| Media | 38.3214 |
| s | 20.3962 |
| Error estándar | 3.8545 |
| n | 28 |
| Grados de libertad | 27 |
| Grado de confianza | 0.95 |
| Valor crítico | 2.0518 |
| Margen de error | 7.9088 |
| Extremo inferior | 30.4126 |
| Extremo superior | 46.2302 |
| Intervalo | 38.3214 ± 7.9088 |
Interpretación: Se estima la media poblacional de Score, usando Muestra2. Con 27 grados de libertad, el valor crítico t fue de 2.0518 y el error estándar fue de 3.8545, dando un margen de error de 7.9088. Con un 95% de confianza, la media poblacional de Score está entre 30.4126 y 46.2302.
Datos: variable dicotómica Law, tomada de Muestra1 (n = 120). Se toma como éxito la respuesta “Agree”.
Supuestos: se cumple la condición de muestra grande (n·p̂ ≥ 5 y n·(1-p̂) ≥ 5), lo que permite usar la aproximación normal.
Fórmula:
p̂ ± z(α/2) · √(p̂(1-p̂) / n)
Tabla 5. Intervalo de confianza (Z) para la proporción poblacional de Law — Muestra1.
# Cálculo de éxitos y tamaño de muestra para Law ("Agree")
exitos_law <- sum(Muestra1$Law == "Agree", na.rm = TRUE)
n_law <- sum(!is.na(Muestra1$Law))
# Intervalo de confianza para la proporción poblacional de Law
ic_proporcion(
exitos = exitos_law,
n = n_law,
conf = 0.95
)
| Medida | Valor |
|---|---|
| Éxitos | 67 |
| n | 120 |
| Proporción | 0.5583 |
| Error estándar | 0.0453 |
| Grado de confianza | 0.95 |
| Valor crítico | 1.96 |
| Margen de error | 0.0888 |
| Extremo inferior | 0.4695 |
| Extremo superior | 0.6472 |
| Intervalo | 0.5583 ± 0.0888 |
Interpretación: Se estima la proporción poblacional de estudiantes que responden “Agree” en Law. La proporción muestral fue de 0.5583, con un error estándar de 0.0453 y un valor crítico Z de 1.96, dando un margen de error de 0.0888. Con un 95% de confianza, la proporción poblacional de “Agree” en Law está entre 0.4695 y 0.6472.
Datos: variable dicotómica Like, tomada de Muestra1 (n = 120). Se toma como éxito la respuesta “Network”.
Supuestos: se cumple la condición de muestra grande (n·p̂ ≥ 5 y n·(1-p̂) ≥ 5), lo que permite usar la aproximación normal.
Fórmula:
p̂ ± z(α/2) · √(p̂(1-p̂) / n)
Tabla 6. Intervalo de confianza (Z) para la proporción poblacional de Like — Muestra1.
# Cálculo de éxitos y tamaño de muestra para Like ("Network")
exitos_like <- sum(Muestra1$Like == "Network", na.rm = TRUE)
n_like <- sum(!is.na(Muestra1$Like))
# Intervalo de confianza para la proporción poblacional de Like
ic_proporcion(
exitos = exitos_like,
n = n_like,
conf = 0.95
)
| Medida | Valor |
|---|---|
| Éxitos | 51 |
| n | 120 |
| Proporción | 0.425 |
| Error estándar | 0.0451 |
| Grado de confianza | 0.95 |
| Valor crítico | 1.96 |
| Margen de error | 0.0884 |
| Extremo inferior | 0.3366 |
| Extremo superior | 0.5134 |
| Intervalo | 0.425 ± 0.0884 |
Interpretación: Se estima la proporción poblacional de estudiantes que responden “Network” en Like. La proporción muestral fue de 0.425, con un error estándar de 0.0451 y un valor crítico Z de 1.96, dando un margen de error de 0.0884. Con un 95% de confianza, la proporción poblacional de “Network” en Like está entre 0.3366 y 0.5134.
Usamos Z cuando ya sabemos (o podemos suponer) la desviación estándar de la población, o cuando la muestra es grande y podemos aproximarla con la muestra. En cambio usamos t cuando no sabemos esa desviación estándar poblacional y tenemos que estimarla con la muestra (s), y como eso agrega más incertidumbre, la distribución t es un poco más “ancha” que la normal, sobre todo cuando la muestra es chica.
Si comparamos los intervalos de Weight en las dos muestras, con Muestra1 (n=120, Z) nos dio de 71.3587 a 77.1713, con margen de error de 2.9063. Con Muestra2 (n=28, t) nos dio de 71.1383 a 83.6760, con margen de error de 6.2689. O sea que el intervalo de Muestra2 salió bastante más ancho (como el doble). Esto tiene sentido porque entre menos datos tengamos, menos seguros podemos estar de dónde está realmente la media, entonces el intervalo tiene que ser más amplio para “cubrirse”.
Sobre los valores críticos: el de Z fue 1.96 y el de t fue 2.0518 (con 27 grados de libertad porque Muestra2 tiene 28 datos). El de t es más grande porque, como dijimos, al no conocer la desviación estándar real y tener que estimarla, se necesita un valor más grande para compensar esa incertidumbre extra. Si la muestra fuera más grande, ese valor de t se iría acercando cada vez más al de Z.
Por último, comparando las dos proporciones: para Law, con 67 de 120 (proporción de 0.5583), el intervalo dio de 0.4695 a 0.6472, con margen de error de 0.0889. Para Like, con 51 de 120 (proporción de 0.425), el intervalo dio de 0.3366 a 0.5134, con margen de error de 0.0885. Los dos son muy parecidos, pero el de Like salió un poquito más chico, así que ese fue levemente más preciso. Esto pasa porque la proporción de Law (0.5583) está más cerca de 0.5, y cuando una proporción está cerca de 0.5 el error estándar es un poco más grande (es donde hay más variabilidad posible).
Los intervalos de confianza construidos permiten estimar, con un 95% de confianza, los rangos en los que se ubican la media poblacional de Weight, la media poblacional de Score, y las proporciones poblacionales de estudiantes que están de acuerdo con Law y que prefieren Network en Like, cumpliendo así el objetivo general del trabajo.
El tamaño de la muestra tiene un efecto directo sobre la precisión de las estimaciones: al comparar los intervalos de Weight obtenidos con Muestra1 (n=120) y Muestra2 (n=28), el intervalo construido con la muestra más pequeña resultó notablemente más ancho, lo que confirma que una muestra reducida genera mayor incertidumbre en la estimación del parámetro poblacional.
La elección entre la distribución Z y la distribución t de Student no es arbitraria, sino que depende de si se conoce o no la desviación estándar poblacional y del tamaño de la muestra disponible; en este trabajo se evidenció que el valor crítico t es mayor que el valor crítico Z, compensando así la incertidumbre adicional de estimar la desviación estándar a partir de una muestra pequeña.
Al comparar los intervalos de proporción para Law y Like, se encontró que ambos presentaron una precisión similar, con una ligera ventaja para el intervalo de Like, lo cual se relaciona con el hecho de que su proporción muestral está más alejada de 0.5, valor en el que la variabilidad de una proporción es máxima.
Los resultados obtenidos están sujetos a las limitaciones propias del diseño del estudio, en particular el supuesto de normalidad de las variables poblacionales (no verificado formalmente) y la construcción de las muestras a partir de las primeras observaciones del conjunto de datos en lugar de una selección aleatoria, por lo que las conclusiones deben interpretarse dentro de ese contexto.
| Aspecto | Información |
|---|---|
| Uso de IA | Sí |
| Herramienta utilizada | Claude (Anthropic) |
| Uso realizado | Apoyo en la estructuración del informe (organización de secciones, redacción de fórmulas e interpretaciones de los intervalos de confianza) y corrección de errores de sintaxis en el código R Markdown |
| Porcentaje estimado de utilización 20/25% |
El grupo es responsable de la veracidad, pertinencia y calidad de todo el contenido entregado, independientemente del uso de herramientas de Inteligencia Artificial.
Greenland, S., Senn, S. J., Rothman, K. J., Carlin, J. B., Poole, C., Goodman, S. N., & Altman, D. G. (2016). Statistical tests, p values, confidence intervals, and power: A guide to misinterpretations. European Journal of Epidemiology, 31(4), 337–350. https://doi.org/10.1007/s10654-016-0149-3
Llinás Solano, H. (2017). Estadística inferencial. Editorial Universidad del Norte.
Mayorga Álvarez, J. H. (2004). Inferencia estadística. Universidad Nacional de Colombia.
Rodríguez-Alveal, F., & Aguerrea, M. (2024). Inferencia estadística en los textos escolares: Una aproximación al pensamiento estadístico. Uniciencia, 38(1), 341–356. https://doi.org/10.15359/ru.38-1.19
Walpole, R. E., Myers, R. H., Myers, S. L., & Ye, K. (2012). Probabilidad y estadística para ingeniería y ciencias (9.ª ed.). Pearson Educación.