Cargando la base de datos desde el archivo CSV

data <- read.csv("Student_performance_data _.csv")

Mostrar base de datos

head(data)
##   StudentID Age Gender Ethnicity ParentalEducation StudyTimeWeekly Absences
## 1      1001  17      1         0                 2       19.833723        7
## 2      1002  18      0         0                 1       15.408756        0
## 3      1003  15      0         2                 3        4.210570       26
## 4      1004  17      1         0                 3       10.028829       14
## 5      1005  17      1         0                 2        4.672495       17
## 6      1006  18      0         0                 1        8.191219        0
##   Tutoring ParentalSupport Extracurricular Sports Music Volunteering       GPA
## 1        1               2               0      0     1            0 2.9291956
## 2        0               1               0      0     0            0 3.0429148
## 3        0               2               0      0     0            0 0.1126023
## 4        0               3               1      0     0            0 2.0542181
## 5        1               3               0      0     0            0 1.2880612
## 6        0               1               1      0     0            0 3.0841836
##   GradeClass
## 1          2
## 2          1
## 3          4
## 4          3
## 5          4
## 6          1

Homogeneidad (Chi-cuadrado):

H0: No hay asociación entre la participación de los padres en la educación de los estudiantes y las diferentes categorías de rendimiento académico.

H1:Existe una relación significativa entre los hábitos de estudio de los estudiantes y el apoyo de sus padres.

Se utliza el test de homogeneidad para investigar si la participación de los padres en la educación de los estudiantes es homogénea en diferentes categorías de rendimiento académico.

Tabla_contingencia <- table(data$ParentalSupport, data$GradeClass)
resultado_chi_cuadrado <- chisq.test(Tabla_contingencia)
resultado_chi_cuadrado
## 
##  Pearson's Chi-squared test
## 
## data:  Tabla_contingencia
## X-squared = 73.783, df = 16, p-value = 2.151e-09

Dado que el valor p es significativamente menor que 0.05, hay evidencia estadística para rechazar la hipótesis nula de homogeneidad. # Conclusion: hay una asociación significativa entre la participación de los padres y el rendimiento académico de los estudiantes en este conjunto de datos.

Igualdad de medias (ANOVA):

Hipótesis Nula (H0): No hay diferencias significativas en el rendimiento académico entre los grupos de estudiantes que participan en diferentes actividades extracurriculares.

Hipótesis Alternativa (H1): Existen diferencias significativas en el rendimiento académico entre al menos dos de los grupos de estudiantes que participan en diferentes actividades extracurriculares.

Realizar el análisis de varianza (ANOVA)

modelo_anova_uno <- aov(data$GradeClass ~ data$Extracurricular)

Obtener un resumen del modelo ANOVA

resumen_anova_uno <- summary(modelo_anova_uno)

Mostrar los resultados

print(resumen_anova_uno)
##                        Df Sum Sq Mean Sq F value   Pr(>F)    
## data$Extracurricular    1     18  17.702   11.68 0.000643 ***
## Residuals            2390   3623   1.516                     
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

El valor p asociado con la prueba ANOVA es menor que el nivel de significancia predefinido (0.05), por lo que se rechaza la hipótesis nula y se concluye que existen diferencias significativas en el rendimiento académico entre al menos dos de los grupos de actividades extracurriculares. # Conclusión: la variable Extracurricular tiene un efecto significativo en el rendimiento académico.

Pruebas de diferencia de medias

H0: no hay diferencia significativa en el promedio de asistencia entre los dos grupos. En términos de medias, es decir que la media de asistencia es la misma para ambos géneros.

H1: hay una diferencia significativa en el promedio de asistencia entre los grupos de género masculino y femenino. Es decir que al menos una de las medias de asistencia es diferente entre los dos grupos.

Realizar un ANOVA para comparar el promedio de asistencia entre géneros

modelo_anova_dos <- aov(Absences ~ Gender, data = data)

Realizar el análisis de varianza

resultado_anova_dos <- summary(modelo_anova_dos)

Mostrar los resultados del ANOVA

print(resultado_anova_dos)
##               Df Sum Sq Mean Sq F value Pr(>F)
## Gender         1     79   79.09   1.103  0.294
## Residuals   2390 171349   71.69

Conclusion: al obtener un valor mayor a 0.05, no se rechaza la hipotesis nula, es decir que la variable “genero” no influye de manera significativa en la variable “asistencias”