Curso: Estadística Inferencial

Proyecto: Proyecto 2 — Intervalos de Confianza

Profesor: Humberto Llinás

Integrantes: Luciana Salas, Sofia Bayona, Alejandro Ortiz, Emily Lora

Fecha de entrega: 25 de septiembre de 2026

Resumen

Este trabajo tiene como objetivo aplicar los procedimientos de estimación por intervalos de confianza estudiados en el curso de Estadística Inferencial, utilizando el conjunto de datos survey del paquete lsm de R, desarrollado por Llinás (2017). A partir de la base de datos original (800 observaciones, 66 variables), se construyeron dos muestras: Muestra1 (n = 120) y Muestra2 (n = 28). Se seleccionaron dos variables cuantitativas (Weight y Score) y dos variables dicotómicas (Law y Like) para el análisis. Utilizando Muestra1, se construyeron intervalos de confianza para la media poblacional de Weight y Score mediante la distribución Z, y con Muestra2 se construyeron los intervalos correspondientes mediante la distribución t de Student, dado que en muestras pequeñas no se conoce la desviación estándar poblacional. También se construyeron intervalos de confianza para las proporciones poblacionales de Law (respuesta “Agree”) y Like (respuesta “Network”) usando Muestra1. Los resultados muestran que, para una misma variable, el intervalo construido con la muestra más pequeña (Muestra2) resultó considerablemente más amplio que el construido con la muestra más grande (Muestra1), evidenciando el efecto del tamaño de muestra sobre la precisión de la estimación. Asimismo, se observó que los valores críticos de la distribución t fueron mayores que los de la distribución Z, debido a la incertidumbre adicional de estimar la desviación estándar poblacional a partir de la muestra. Se concluye que el tamaño de muestra y el conocimiento (o desconocimiento) de la desviación estándar poblacional son factores determinantes en la precisión de los intervalos de confianza obtenidos.

Palabras clave: intervalo de confianza, distribución normal, distribución t de Student, proporción poblacional, estimación estadística.

Introducción

En estadística, muchas veces no podemos estudiar a toda una población porque sería muy costoso o simplemente imposible, entonces trabajamos con una muestra y tratamos de hacer inferencias sobre la población completa (Mayorga Álvarez, 2004). Una de las herramientas más usadas para esto es el intervalo de confianza, que en vez de darnos un solo número como estimación, nos da un rango de valores donde probablemente esté el verdadero valor poblacional, junto con un nivel de confianza que nos dice qué tan seguros podemos estar de eso (Walpole et al., 2012).

Estos intervalos se usan muchísimo porque dan más información que solo un número: nos dejan ver qué tan precisa (o imprecisa) es nuestra estimación (Llinás, 2017). Los intervalos de confianza también pueden ser difíciles de interpretar correctamente, especialmente cuando se confunde el significado del intervalo con el comportamiento del parámetro poblacional (Greenland et al., 2016). De hecho hay estudios que muestran que este es de los conceptos que más cuesta entender bien en estadística, incluso en los libros de texto escolares (Rodríguez-Alveal & Aguerrea, 2024).

En este trabajo aplicamos lo que vimos en clase sobre intervalos de confianza: tanto para la media poblacional (usando Z y t de Student, dependiendo si conocemos o no la desviación estándar poblacional) como para una proporción poblacional. Usamos la base de datos survey del paquete lsm de R, que fue desarrollada por nuestro profesor Humberto Llinás (Llinás, 2017). Nos pareció importante hacer este ejercicio porque nos permite ver en la práctica cómo cambia la precisión de una estimación según el tamaño de la muestra que tengamos, y no solo quedarnos con la teoría.

El objetivo de este trabajo es construir e interpretar intervalos de confianza para las variables Weight, Score, Law y Like de la base de datos survey, usando dos muestras de distinto tamaño, y comparar los resultados obtenidos con los procedimientos Z y t de Student.

Marco teórico

Estimación puntual vs. estimación por intervalo

Cuando queremos saber algo de una población (por ejemplo, el peso promedio de todos los estudiantes), lo normal es que no podamos medir a todos, entonces usamos una muestra y calculamos un estimador, como la media muestral. Ese único número es lo que se llama estimación puntual. El problema es que ese número casi nunca va a coincidir exactamente con el valor real de la población, porque depende de qué muestra nos tocó. Por eso se usa mejor un intervalo de confianza, que en vez de dar un solo número da un rango donde es probable que esté el verdadero valor poblacional, junto con un porcentaje (por ejemplo 95%) que indica qué tan confiable es ese rango.

Intervalo de confianza para la media con Z

Este procedimiento se usa cuando conocemos (o podemos aproximar con confianza) la desviación estándar de toda la población, σ. La fórmula es:

x̄ ± z(α/2) · (σ/√n)

Básicamente se toma la media de la muestra y se le suma y resta un “margen de error”, que depende de qué tan dispersos son los datos (σ), de cuántos datos tenemos (n), y de qué tan seguros queremos estar (el valor z, que para 95% de confianza es 1.96). En nuestro caso usamos este método con Muestra1 (120 datos), usando la desviación estándar muestral como aproximación de σ, ya que al ser una muestra grande esa aproximación es razonable.

Intervalo de confianza para la media con t de Student

Cuando no conocemos la desviación estándar poblacional (que es lo más común en la vida real) y además la muestra es pequeña, no podemos usar Z directamente porque estaríamos subestimando la incertidumbre. En su lugar se usa la distribución t de Student, que tiene una forma parecida a la normal pero con colas más anchas, justamente para compensar esa incertidumbre extra de estimar σ con la desviación estándar muestral s:

x̄ ± t(α/2, n−1) · (s/√n)

El valor de t depende de los grados de libertad (n−1), y entre más chica es la muestra, más grande es ese valor t comparado con z, lo que hace el intervalo más ancho. En nuestro trabajo usamos t con Muestra2 (28 datos), porque es una muestra pequeña y no conocemos la desviación estándar real de la población.

Intervalo de confianza para una proporción

Cuando la variable que nos interesa no es numérica sino de dos categorías (por ejemplo, si alguien responde “Sí” o “No”), no hablamos de una media sino de una proporción, es decir, qué porcentaje de la muestra cae en la categoría que nos interesa. La fórmula es:

p̂ ± z(α/2) · √(p̂(1−p̂)/n)

Donde p̂ es la proporción muestral (éxitos dividido entre n). Este método asume que la muestra es lo suficientemente grande para que la aproximación a la normal sea válida (usualmente se pide que n·p̂ y n·(1−p̂) sean mayores o iguales a 5). En nuestro caso lo usamos con las variables Law y Like en Muestra1.

Metodología

Origen de los datos

Los datos utilizados en este trabajo provienen del conjunto survey, incluido en el paquete lsm de R, desarrollado por Llinás (2017). Esta base de datos corresponde a una encuesta aplicada a estudiantes universitarios y contiene 800 observaciones y 66 variables, entre las cuales se incluyen variables demográficas, académicas, de estilo de vida y psicométricas.

Variables analizadas

Para este trabajo se seleccionaron cuatro variables:

Estas variables se seleccionaron porque son de fácil interpretación y permiten ilustrar tanto el caso de una media poblacional como el de una proporción poblacional, cumpliendo con la condición de no repetir las variables trabajadas en clase.

Población y muestra

La población de referencia corresponde a los 800 estudiantes encuestados en el conjunto de datos survey. A partir de esta población se construyeron dos muestras:

Procedimientos estadísticos

Se construyeron seis intervalos de confianza, todos con un nivel de confianza del 95%:

Para cada intervalo se calcularon: la estimación puntual, el error estándar, el valor crítico, el margen de error y los límites inferior y superior.

Software

Todo el análisis se realizó en R, utilizando RStudio como entorno de desarrollo. Se emplearon los paquetes lsm (para acceder a la base de datos), knitr y kableExtra (para la construcción y presentación de las tablas de resultados). Los intervalos se calcularon mediante tres funciones desarrolladas para este propósito: ic_media_z(), ic_media_t() e ic_proporcion().

Justificación de las técnicas seleccionadas

Se utilizó la distribución Z para Muestra1 porque, al tratarse de una muestra grande (n = 120), la desviación estándar muestral es una aproximación razonable de la desviación estándar poblacional. En cambio, para Muestra2 (n = 28) se utilizó la distribución t de Student, ya que con muestras pequeñas la incertidumbre de estimar la desviación estándar poblacional a partir de la muestra es mayor, y la distribución t compensa esta incertidumbre con colas más anchas que la distribución normal. Para las proporciones se utilizó la aproximación normal (Z), verificando que se cumpliera la condición de muestra grande (n·p̂ ≥ 5 y n·(1−p̂) ≥ 5).

Base de datos

library(lsm)        # Para acceder a la base de datos survey
library(knitr)      # Para construir tablas
library(kableExtra) # Para mejorar la presentación de las tablas
# ============================================================
# 1. Intervalo Z para una media con sigma conocida
# ============================================================
ic_media_z <- function(media, sigma, n, conf = 0.95, digitos = 4) {
  alpha <- 1 - conf
  z <- qnorm(1 - alpha / 2)
  error_estandar <- sigma / sqrt(n)
  margen_error <- z * error_estandar
  inferior <- media - margen_error
  superior <- media + margen_error
  resultado <- data.frame(
    Medida = c("Media", "\u03c3", "Error estándar", "n", "Grado de confianza",
               "Valor crítico", "Margen de error", "Extremo inferior",
               "Extremo superior", "Intervalo"),
    Resultado = c(round(media, digitos), round(sigma, digitos),
                  round(error_estandar, digitos), n, round(conf, digitos),
                  round(z, digitos), round(margen_error, digitos),
                  round(inferior, digitos), round(superior, digitos),
                  paste0(round(media, digitos), " ± ", round(margen_error, digitos))),
    check.names = FALSE
  )
  knitr::kable(resultado, format = "html", col.names = c("Medida", "Valor"), align = c("l", "r"))
}

# ============================================================
# 2. Intervalo t para una media con sigma desconocida
# ============================================================
ic_media_t <- function(media, s, n, conf = 0.95, digitos = 4) {
  alpha <- 1 - conf
  gl <- n - 1
  t_critico <- qt(1 - alpha / 2, df = gl)
  error_estandar <- s / sqrt(n)
  margen_error <- t_critico * error_estandar
  inferior <- media - margen_error
  superior <- media + margen_error
  resultado <- data.frame(
    Medida = c("Media", "s", "Error estándar", "n", "Grados de libertad",
               "Grado de confianza", "Valor crítico", "Margen de error",
               "Extremo inferior", "Extremo superior", "Intervalo"),
    Resultado = c(round(media, digitos), round(s, digitos),
                  round(error_estandar, digitos), n, gl, round(conf, digitos),
                  round(t_critico, digitos), round(margen_error, digitos),
                  round(inferior, digitos), round(superior, digitos),
                  paste0(round(media, digitos), " ± ", round(margen_error, digitos))),
    check.names = FALSE
  )
  knitr::kable(resultado, format = "html", col.names = c("Medida", "Valor"), align = c("l", "r"))
}

# ============================================================
# 3. Intervalo Z para una proporción
# ============================================================
ic_proporcion <- function(exitos, n, conf = 0.95, digitos = 4) {
  if (exitos < 0 || exitos > n) stop("El número de éxitos debe estar entre 0 y n.")
  alpha <- 1 - conf
  z <- qnorm(1 - alpha / 2)
  proporcion <- exitos / n
  error_estandar <- sqrt(proporcion * (1 - proporcion) / n)
  margen_error <- z * error_estandar
  inferior <- max(0, proporcion - margen_error)
  superior <- min(1, proporcion + margen_error)
  resultado <- data.frame(
    Medida = c("Éxitos", "n", "Proporción", "Error estándar", "Grado de confianza",
               "Valor crítico", "Margen de error", "Extremo inferior",
               "Extremo superior", "Intervalo"),
    Resultado = c(exitos, n, round(proporcion, digitos), round(error_estandar, digitos),
                  round(conf, digitos), round(z, digitos), round(margen_error, digitos),
                  round(inferior, digitos), round(superior, digitos),
                  paste0(round(proporcion, digitos), " ± ", round(margen_error, digitos))),
    check.names = FALSE
  )
  knitr::kable(resultado, format = "html", col.names = c("Medida", "Valor"), align = c("l", "r"))
}
datosCompleto <- lsm::survey

Responda las siguientes preguntas:

¿Cuántas observaciones tiene su nueva base de datos? 800 observaciones.

¿Cuántas variables contiene? 66 variables. Muestre los nombres de todas las variables.

names(datosCompleto)
##  [1] "Observation"  "ID"           "Gender"       "Like"         "Age"         
##  [6] "Smoke"        "Height"       "Weight"       "BMI"          "School"      
## [11] "SES"          "Enrollment"   "Score"        "MotherHeight" "MotherAge"   
## [16] "MotherCHD"    "FatherHeight" "FatherAge"    "FatherCHD"    "Status"      
## [21] "SemAcum"      "Exam1"        "Exam2"        "Exam3"        "Exam4"       
## [26] "ExamAcum"     "Definitive"   "Expense"      "Income"       "Gas"         
## [31] "Course"       "Law"          "Economic"     "Race"         "Region"      
## [36] "EMO1"         "EMO2"         "EMO3"         "EMO4"         "EMO5"        
## [41] "GOAL1"        "GOAL2"        "GOAL3"        "Pre_STAT1"    "Pre_STAT2"   
## [46] "Pre_STAT3"    "Pre_STAT4"    "Post_STAT1"   "Post_STAT2"   "Post_STAT3"  
## [51] "Post_STAT4"   "Pre_IDARE1"   "Pre_IDARE2"   "Pre_IDARE3"   "Pre_IDARE4"  
## [56] "Pre_IDARE5"   "Post_IDARE1"  "Post_IDARE2"  "Post_IDARE3"  "Post_IDARE4" 
## [61] "Post_IDARE5"  "PSICO1"       "PSICO2"       "PSICO3"       "PSICO4"      
## [66] "PSICO5"

Seleccione:

Dos variables cuantitativas que utilizará para construir intervalos para la media poblacional;

  1. WEIGHT
  2. SCORE

Dos variables dicotómicas que utilizará para construir intervalos para una proporción poblacional.

  1. LAW
  2. LIKE

Justifique brevemente la selección realizada.

Las cuantitativas porque son numericas y continuas, ideales para un promedio real de la gente en el estudio y ver que tanto varian estas respecto al grupo. Las dicotomicas porque son de seleccion de dos opciones, justo lo que se pide para calcular porcentajes y ver como se divide la gente en dos grupos.

Supuestos

Para todos los procedimientos de este trabajo se asume que las variables cuantitativas poblacionales seleccionadas (Weight y Score) siguen una distribución normal. Este supuesto es necesario porque:

Seleccion de una muestra

Muestra1

Muestra1 <- datosCompleto[1:120,1:66]       # A) Un nuevo data frame 
Muestra1

Muestra2

Muestra2 <- datosCompleto[1:28,1:66]       # A) Un nuevo data frame 
Muestra2

a. Intervalo Z para la media poblacional de Weight (Muestra1)

Datos: variable cuantitativa Weight, tomada de Muestra1 (n = 120).

Supuestos: se asume que la población es normal (ver sección de Supuestos); se usa la desviación estándar muestral s como aproximación de σ, dado que Muestra1 es una muestra grande.

Fórmula:

x̄ ± z(α/2) · (s / √n)

Tabla 1. Intervalo de confianza (Z) para la media poblacional de Weight — Muestra1.

 # Intervalo de confianza Z para la media poblacional de WEIGHT

ic_media_z(
  media = mean(Muestra1$Weight),
  sigma = sd(Muestra1$Weight),
  n = nrow(Muestra1),
  conf = 0.95
)
Medida Valor
Media 74.265
σ 16.2435
Error estándar 1.4828
n 120
Grado de confianza 0.95
Valor crítico 1.96
Margen de error 2.9063
Extremo inferior 71.3587
Extremo superior 77.1713
Intervalo 74.265 ± 2.9063

Interpretación: Se estima la media poblacional del peso (Weight). El error estándar fue de 1.4808 y el valor crítico Z utilizado fue 1.96, lo que dio un margen de error de 2.9063. Con un 95% de confianza, la media poblacional de Weight está entre 71.3587 y 77.1713.

b. Intervalo Z para la media poblacional de Score (Muestra1)

Datos: variable cuantitativa Score, tomada de Muestra1 (n = 120).

Supuestos: se asume que la población es normal; se usa la desviación estándar muestral s como aproximación de σ, dado que Muestra1 es una muestra grande.

Fórmula:

x̄ ± z(α/2) · (s / √n)

Tabla 2. Intervalo de confianza (Z) para la media poblacional de Score — Muestra1.

# Intervalo de confianza Z para la media poblacional de Score

ic_media_z(
  media = mean(Muestra1$Score),
  sigma = sd(Muestra1$Score),
  n = nrow(Muestra1),
  conf = 0.95
)
Medida Valor
Media 30.675
σ 19.5277
Error estándar 1.7826
n 120
Grado de confianza 0.95
Valor crítico 1.96
Margen de error 3.4939
Extremo inferior 27.1811
Extremo superior 34.1689
Intervalo 30.675 ± 3.4939

Interpretación: Se estima la media poblacional de Score. El error estándar fue de 1.7826 y el valor crítico Z utilizado fue 1.96, lo que dio un margen de error de 3.4939. Con un 95% de confianza, la media poblacional de Score está entre 27.1811 y 34.1689.

c. Intervalo t de Student para la media poblacional de Weight (Muestra2)

Datos: variable cuantitativa Weight, tomada de Muestra2 (n = 28).

Supuestos: se asume que la población es normal; se usa la desviación estándar muestral s porque no conocemos la desviación estándar poblacional (obligatorio con t, más aún con una muestra pequeña).

Fórmula:

x̄ ± t(α/2, n-1) · (s / √n)

Tabla 3. Intervalo de confianza (t) para la media poblacional de Weight — Muestra2.

# Intervalo de confianza t-Student para la media poblacional de Weight

ic_media_t(
  media = mean(Muestra2$Weight),
  s = sd(Muestra2$Weight),
  n = nrow(Muestra2),
  conf = 0.95
)
Medida Valor
Media 77.4071
s 16.1669
Error estándar 3.0552
n 28
Grados de libertad 27
Grado de confianza 0.95
Valor crítico 2.0518
Margen de error 6.2689
Extremo inferior 71.1383
Extremo superior 83.676
Intervalo 77.4071 ± 6.2689

Interpretación: Se estima la media poblacional del peso (Weight), usando Muestra2 porque no conocemos la desviación estándar poblacional. Con 27 grados de libertad, el valor crítico t fue de 2.0518 y el error estándar fue de 3.0552, dando un margen de error de 6.2689. Con un 95% de confianza, la media poblacional de Weight está entre 71.1383 y 83.6760. Nótese que este intervalo es bastante más amplio que el del inciso a (Muestra1), reflejando la mayor incertidumbre de trabajar con una muestra más pequeña.

d. Intervalo t de Student para la media poblacional de Score (Muestra2)

Datos: variable cuantitativa Score, tomada de Muestra2 (n = 28).

Supuestos: se asume que la población es normal; se usa la desviación estándar muestral s porque no conocemos la desviación estándar poblacional.

Fórmula:

x̄ ± t(α/2, n-1) · (s / √n)

Tabla 4. Intervalo de confianza (t) para la media poblacional de Score — Muestra2.

# Intervalo de confianza t-Student para la media poblacional de Score
ic_media_t(
  media = mean(Muestra2$Score),
  s = sd(Muestra2$Score),
  n = nrow(Muestra2),
  conf = 0.95
)
Medida Valor
Media 38.3214
s 20.3962
Error estándar 3.8545
n 28
Grados de libertad 27
Grado de confianza 0.95
Valor crítico 2.0518
Margen de error 7.9088
Extremo inferior 30.4126
Extremo superior 46.2302
Intervalo 38.3214 ± 7.9088

Interpretación: Se estima la media poblacional de Score, usando Muestra2. Con 27 grados de libertad, el valor crítico t fue de 2.0518 y el error estándar fue de 3.8545, dando un margen de error de 7.9088. Con un 95% de confianza, la media poblacional de Score está entre 30.4126 y 46.2302.

e. Intervalo Z para la proporción poblacional de Law (Muestra1)

Datos: variable dicotómica Law, tomada de Muestra1 (n = 120). Se toma como éxito la respuesta “Agree”.

Supuestos: se cumple la condición de muestra grande (n·p̂ ≥ 5 y n·(1-p̂) ≥ 5), lo que permite usar la aproximación normal.

Fórmula:

p̂ ± z(α/2) · √(p̂(1-p̂) / n)

Tabla 5. Intervalo de confianza (Z) para la proporción poblacional de Law — Muestra1.

# Cálculo de éxitos y tamaño de muestra para Law ("Agree")
exitos_law <- sum(Muestra1$Law == "Agree", na.rm = TRUE)
n_law <- sum(!is.na(Muestra1$Law))

# Intervalo de confianza para la proporción poblacional de Law
ic_proporcion(
  exitos = exitos_law,
  n = n_law,
  conf = 0.95
)
Medida Valor
Éxitos 67
n 120
Proporción 0.5583
Error estándar 0.0453
Grado de confianza 0.95
Valor crítico 1.96
Margen de error 0.0888
Extremo inferior 0.4695
Extremo superior 0.6472
Intervalo 0.5583 ± 0.0888

Interpretación: Se estima la proporción poblacional de estudiantes que responden “Agree” en Law. La proporción muestral fue de 0.5583, con un error estándar de 0.0453 y un valor crítico Z de 1.96, dando un margen de error de 0.0888. Con un 95% de confianza, la proporción poblacional de “Agree” en Law está entre 0.4695 y 0.6472.

f. Intervalo Z para la proporción poblacional de Like (Muestra1)

Datos: variable dicotómica Like, tomada de Muestra1 (n = 120). Se toma como éxito la respuesta “Network”.

Supuestos: se cumple la condición de muestra grande (n·p̂ ≥ 5 y n·(1-p̂) ≥ 5), lo que permite usar la aproximación normal.

Fórmula:

p̂ ± z(α/2) · √(p̂(1-p̂) / n)

Tabla 6. Intervalo de confianza (Z) para la proporción poblacional de Like — Muestra1.

# Cálculo de éxitos y tamaño de muestra para Like ("Network")
exitos_like <- sum(Muestra1$Like == "Network", na.rm = TRUE)
n_like <- sum(!is.na(Muestra1$Like))

# Intervalo de confianza para la proporción poblacional de Like
ic_proporcion(
  exitos = exitos_like,
  n = n_like,
  conf = 0.95
)
Medida Valor
Éxitos 51
n 120
Proporción 0.425
Error estándar 0.0451
Grado de confianza 0.95
Valor crítico 1.96
Margen de error 0.0884
Extremo inferior 0.3366
Extremo superior 0.5134
Intervalo 0.425 ± 0.0884

Interpretación: Se estima la proporción poblacional de estudiantes que responden “Network” en Like. La proporción muestral fue de 0.425, con un error estándar de 0.0451 y un valor crítico Z de 1.96, dando un margen de error de 0.0884. Con un 95% de confianza, la proporción poblacional de “Network” en Like está entre 0.3366 y 0.5134.

5. Comparación de los procedimientos

Usamos Z cuando ya sabemos (o podemos suponer) la desviación estándar de la población, o cuando la muestra es grande y podemos aproximarla con la muestra. En cambio usamos t cuando no sabemos esa desviación estándar poblacional y tenemos que estimarla con la muestra (s), y como eso agrega más incertidumbre, la distribución t es un poco más “ancha” que la normal, sobre todo cuando la muestra es chica.

Si comparamos los intervalos de Weight en las dos muestras, con Muestra1 (n=120, Z) nos dio de 71.3587 a 77.1713, con margen de error de 2.9063. Con Muestra2 (n=28, t) nos dio de 71.1383 a 83.6760, con margen de error de 6.2689. O sea que el intervalo de Muestra2 salió bastante más ancho (como el doble). Esto tiene sentido porque entre menos datos tengamos, menos seguros podemos estar de dónde está realmente la media, entonces el intervalo tiene que ser más amplio para “cubrirse”.

Sobre los valores críticos: el de Z fue 1.96 y el de t fue 2.0518 (con 27 grados de libertad porque Muestra2 tiene 28 datos). El de t es más grande porque, como dijimos, al no conocer la desviación estándar real y tener que estimarla, se necesita un valor más grande para compensar esa incertidumbre extra. Si la muestra fuera más grande, ese valor de t se iría acercando cada vez más al de Z.

Por último, comparando las dos proporciones: para Law, con 67 de 120 (proporción de 0.5583), el intervalo dio de 0.4695 a 0.6472, con margen de error de 0.0889. Para Like, con 51 de 120 (proporción de 0.425), el intervalo dio de 0.3366 a 0.5134, con margen de error de 0.0885. Los dos son muy parecidos, pero el de Like salió un poquito más chico, así que ese fue levemente más preciso. Esto pasa porque la proporción de Law (0.5583) está más cerca de 0.5, y cuando una proporción está cerca de 0.5 el error estándar es un poco más grande (es donde hay más variabilidad posible).

6. Conclusiones

  1. Los intervalos de confianza construidos permiten estimar, con un 95% de confianza, los rangos en los que se ubican la media poblacional de Weight, la media poblacional de Score, y las proporciones poblacionales de estudiantes que están de acuerdo con Law y que prefieren Network en Like, cumpliendo así el objetivo general del trabajo.

  2. El tamaño de la muestra tiene un efecto directo sobre la precisión de las estimaciones: al comparar los intervalos de Weight obtenidos con Muestra1 (n=120) y Muestra2 (n=28), el intervalo construido con la muestra más pequeña resultó notablemente más ancho, lo que confirma que una muestra reducida genera mayor incertidumbre en la estimación del parámetro poblacional.

  3. La elección entre la distribución Z y la distribución t de Student no es arbitraria, sino que depende de si se conoce o no la desviación estándar poblacional y del tamaño de la muestra disponible; en este trabajo se evidenció que el valor crítico t es mayor que el valor crítico Z, compensando así la incertidumbre adicional de estimar la desviación estándar a partir de una muestra pequeña.

  4. Al comparar los intervalos de proporción para Law y Like, se encontró que ambos presentaron una precisión similar, con una ligera ventaja para el intervalo de Like, lo cual se relaciona con el hecho de que su proporción muestral está más alejada de 0.5, valor en el que la variabilidad de una proporción es máxima.

  5. Los resultados obtenidos están sujetos a las limitaciones propias del diseño del estudio, en particular el supuesto de normalidad de las variables poblacionales (no verificado formalmente) y la construcción de las muestras a partir de las primeras observaciones del conjunto de datos en lugar de una selección aleatoria, por lo que las conclusiones deben interpretarse dentro de ese contexto.

Declaración sobre el uso de Inteligencia Artificial

Aspecto Información
Uso de IA Sí
Herramienta utilizada Claude (Anthropic)
Uso realizado Apoyo en la estructuración del informe (organización de secciones, redacción de fórmulas e interpretaciones de los intervalos de confianza) y corrección de errores de sintaxis en el código R Markdown
Porcentaje estimado de utilización 20/25%

El grupo es responsable de la veracidad, pertinencia y calidad de todo el contenido entregado, independientemente del uso de herramientas de Inteligencia Artificial.

Referencias

Greenland, S., Senn, S. J., Rothman, K. J., Carlin, J. B., Poole, C., Goodman, S. N., & Altman, D. G. (2016). Statistical tests, p values, confidence intervals, and power: A guide to misinterpretations. European Journal of Epidemiology, 31(4), 337–350. https://doi.org/10.1007/s10654-016-0149-3

Llinás Solano, H. (2017). Estadística inferencial. Editorial Universidad del Norte.

Mayorga Álvarez, J. H. (2004). Inferencia estadística. Universidad Nacional de Colombia.

Rodríguez-Alveal, F., & Aguerrea, M. (2024). Inferencia estadística en los textos escolares: Una aproximación al pensamiento estadístico. Uniciencia, 38(1), 341–356. https://doi.org/10.15359/ru.38-1.19

Walpole, R. E., Myers, R. H., Myers, S. L., & Ye, K. (2012). Probabilidad y estadística para ingeniería y ciencias (9.ª ed.). Pearson Educación.