Intervalos de confianza

Author

Tu nombre

1 Introducción

En este trabajo se calculan cuatro intervalos de confianza utilizando la base de datos socialmedia, con un nivel de confianza del 95%.

Los intervalos corresponden a:

  1. Intervalo de confianza para una media.
  2. Intervalo de confianza para la diferencia entre dos medias.
  3. Intervalo de confianza para una proporción.
  4. Intervalo de confianza para la diferencia entre dos proporciones.
library(readr)
socialmedia <- read_csv("socialmedia.csv")
Rows: 5000 Columns: 13
── Column specification ────────────────────────────────────────────────────────
Delimiter: ","
chr (6): Gender, Country, Academic_Level, Most_Used_Platform, Purpose_Of_Use...
dbl (7): Age, Avg_Daily_Usage_Hours, Daily_Unlocks, Study_Hours, Physical_Ac...

ℹ Use `spec()` to retrieve the full column specification for this data.
ℹ Specify the column types or set `show_col_types = FALSE` to quiet this message.

2 1. Intervalo de confianza para una media

Se busca estimar la media de las horas promedio de uso diario de las redes sociales.

La fórmula utilizada es:

\bar{x} \pm z_{\alpha/2} \frac{s}{\sqrt{n}}

2.1 Cálculos

x_barra = mean(socialmedia$Avg_Daily_Usage_Hours)
desv = sd(socialmedia$Avg_Daily_Usage_Hours)
n = length(socialmedia$Avg_Daily_Usage_Hours)

alfa = 0.05
z = qnorm(1 - alfa/2)

limite_inferior = x_barra - z * desv/sqrt(n)
limite_superior = x_barra + z * desv/sqrt(n)

x_barra
[1] 5.07846
desv
[1] 1.653913
n
[1] 5000
z
[1] 1.959964
limite_inferior
[1] 5.032617
limite_superior
[1] 5.124303

El intervalo de confianza del 95% para la media de horas de uso diario es:

(5.0326, 5.1243)

2.2 Interpretación

Con un nivel de confianza del 95%, se estima que la media poblacional de las horas promedio de uso diario de las redes sociales se encuentra entre 5.0326 y 5.1243 horas.

3 2. Intervalo de confianza para la diferencia entre dos medias

En este caso se compara el promedio de horas de uso diario de las redes sociales entre estudiantes Undergraduate y Graduate.

La fórmula utilizada es:

(\bar{x}_1-\bar{x}_2) \pm z_{\alpha/2} \sqrt{ \frac{s_1^2}{n_1} + \frac{s_2^2}{n_2} }

3.1 Separación de los grupos

No_graduados = socialmedia[
  socialmedia$Academic_Level == "Undergraduate",
]

Graduados = socialmedia[
  socialmedia$Academic_Level == "Graduate",
]

3.2 Media de cada grupo

x_barra_nograduados = mean(
  No_graduados$Avg_Daily_Usage_Hours
)

x_barra_graduados = mean(
  Graduados$Avg_Daily_Usage_Hours
)

x_barra_nograduados
[1] 5.070182
x_barra_graduados
[1] 4.93976

3.3 Desviación estándar

desviacion_nograduados = sd(
  No_graduados$Avg_Daily_Usage_Hours
)

desviacion_graduados = sd(
  Graduados$Avg_Daily_Usage_Hours
)

desviacion_nograduados
[1] 1.566561
desviacion_graduados
[1] 1.898751

3.4 Tamaño de las muestras

n_nograduados = length(
  No_graduados$Avg_Daily_Usage_Hours
)

n_graduados = length(
  Graduados$Avg_Daily_Usage_Hours
)

n_nograduados
[1] 3632
n_graduados
[1] 918

3.5 Cálculo del intervalo

alfa = 0.05

z = qnorm(1 - alfa/2)

lim_inf = (
  x_barra_nograduados - x_barra_graduados
) -
  z * sqrt(
    desviacion_nograduados^2 / n_nograduados +
    desviacion_graduados^2 / n_graduados
  )

lim_sup = (
  x_barra_nograduados - x_barra_graduados
) +
  z * sqrt(
    desviacion_nograduados^2 / n_nograduados +
    desviacion_graduados^2 / n_graduados
  )

lim_inf
[1] -0.002552972
lim_sup
[1] 0.2633957

El intervalo de confianza del 95% para la diferencia entre las medias es:

(-0.0026, 0.2634)

3.6 Interpretación

Con un nivel de confianza del 95%, la diferencia entre la media de horas de uso diario de los estudiantes Undergraduate y Graduate se encuentra entre -0.0026 y 0.2634 horas.

La diferencia se calculó como:

\bar{x}_{Undergraduate}-\bar{x}_{Graduate}

4 3. Intervalo de confianza para una proporción

En este caso se busca estimar la proporción de estudiantes que pertenecen al nivel académico High School.

La fórmula utilizada es:

\hat{p} \pm z_{\alpha/2} \sqrt{ \frac{\hat{p}(1-\hat{p})}{n} }

4.1 Cálculo de la proporción

prop_muestral = prop.table(
  table(socialmedia$Academic_Level)
)["High School"]

n = length(socialmedia$Academic_Level)

prop_muestral
High School 
       0.09 
n
[1] 5000

4.2 Cálculo del intervalo

alfa = 0.05

z = qnorm(1 - alfa/2)

Limite_inf = prop_muestral -
  z * sqrt(
    prop_muestral *
      (1 - prop_muestral) / n
  )

Limite_sup = prop_muestral +
  z * sqrt(
    prop_muestral *
      (1 - prop_muestral) / n
  )

Limite_inf
High School 
 0.08206759 
Limite_sup
High School 
 0.09793241 

El intervalo de confianza del 95% para la proporción de estudiantes High School es:

(0.0821, 0.0979)

En porcentaje:

(8.21%, 9.79%)

4.3 Interpretación

Con un nivel de confianza del 95%, se estima que la proporción poblacional de estudiantes que pertenecen al nivel académico High School se encuentra entre 8.21% y 9.79%.

5 4. Intervalo de confianza para la diferencia entre dos proporciones

En este caso se compara la proporción de estudiantes que presentan un nivel de estrés Very High entre los grupos Graduate y High School.

La fórmula utilizada es:

(\hat{p}_1-\hat{p}_2) \pm z_{\alpha/2} \sqrt{ \frac{\hat{p}_1(1-\hat{p}_1)}{n_1} + \frac{\hat{p}_2(1-\hat{p}_2)}{n_2} }

Donde:

  • \hat{p}_1 corresponde a Graduate.
  • \hat{p}_2 corresponde a High School.
  • n_1 corresponde al número de estudiantes Graduate.
  • n_2 corresponde al número de estudiantes High School.

5.1 Obtención de las proporciones

tabla_proporciones = prop.table(
  table(
    socialmedia$Stress_Level,
    socialmedia$Academic_Level
  ),
  margin = 2
)

tabla_proporciones
           
             Graduate High School Undergraduate
  High      0.2298475   0.2377778     0.3089207
  Low       0.1677560   0.1133333     0.1208700
  Medium    0.2647059   0.1688889     0.2687225
  Very High 0.3376906   0.4800000     0.3014868
prop_graduados = tabla_proporciones[
  "Very High",
  "Graduate"
]

prop_HS = tabla_proporciones[
  "Very High",
  "High School"
]

prop_graduados
[1] 0.3376906
prop_HS
[1] 0.48

5.2 Tamaño de las muestras

n_graduados = length(
  socialmedia[
    socialmedia$Academic_Level == "Graduate",
  ]$Academic_Level
)

n_HS = length(
  socialmedia[
    socialmedia$Academic_Level == "High School",
  ]$Academic_Level
)

n_graduados
[1] 918
n_HS
[1] 450

5.3 Cálculo del intervalo

alpha = 0.05

z = qnorm(1 - alpha/2)

diferencia = prop_graduados - prop_HS

error_estandar = sqrt(
  (prop_graduados *
     (1 - prop_graduados)) / n_graduados +
  (prop_HS *
     (1 - prop_HS)) / n_HS
)

limite_inferior = diferencia -
  z * error_estandar

limite_superior = diferencia +
  z * error_estandar

diferencia
[1] -0.1423094
error_estandar
[1] 0.02825421
limite_inferior
[1] -0.1976866
limite_superior
[1] -0.08693214

El intervalo de confianza del 95% para la diferencia entre las proporciones es:

(-0.1977, -0.0869)

En porcentaje:

(-19.77%, -8.69%)

5.4 Interpretación

Con un nivel de confianza del 95%, el intervalo para la diferencia entre la proporción de estudiantes Graduate y High School que presentan un nivel de estrés Very High se encuentra entre -0.1977 y -0.0869.

La diferencia se calculó como:

\hat{p}_{Graduate}-\hat{p}_{High School}

6 Conclusiones

En este trabajo se calcularon cuatro intervalos de confianza utilizando la base de datos socialmedia.

El primer intervalo permitió estimar la media de horas de uso diario de las redes sociales. El segundo permitió analizar la diferencia entre las medias de los estudiantes Undergraduate y Graduate.

El tercer intervalo permitió estimar la proporción de estudiantes pertenecientes al nivel académico High School. Finalmente, el cuarto intervalo permitió comparar las proporciones de estudiantes Graduate y High School que presentan un nivel de estrés Very High.

Todos los intervalos fueron calculados utilizando un nivel de confianza del 95%.