A. Introducción

A.1 Contexto: descripción de la base de datos

La base de datos utilizada en este análisis es Student Performance Factors. Se descargó desde Kaggle, una plataforma web que recibe más de 150 mil publicaciones por mes. Esta base, se puede encontrar y descargar en el sigiente link: https://www.kaggle.com/datasets/lainguyn123/student-performance-factors

Student Performance Factors es un conjunto de datos sintético generado con fines educativos y analíticos. Los datos no proceden de ninguna institución real, sino que se han creado para simular situaciones realistas con el fin de analizar los factores que influyen en el rendimiento de los estudiantes.

La base recoge información académica y socioeconómica de 6.607 estudiantes. El objetivo central es identificar qué variables inciden en el rendimiento académico, medido a través de la puntuación obtenida en el examen final (escala de 0 a 100). Originalmente, la base contaba con 20 variables; tras un proceso de depuración se retuvieron 16 para el análisis, eliminando aquellas que resultaban redundantes o ajenas al objetivo del estudio.

Las cuatro variables eliminadas fueron: Puntuaciones_anteriores (no constituye un factor causal directo del resultado final), Acceso_internet e Ingresos_familiares (ambas están implícitamente capturadas por la variable Acceso_recursos) y Género (no representa una variable de diferenciación de interés para este estudio).

A partir del análisis exploratorio desarrollados a lo largo de este trabajo. Las visualizaciones generadas revelaron patrones distributivos que invitan a una interpretación más profunda. La forma de las distribuciones, la presencia de valores atípicos y las primeras relaciones observadas entre variables motivaron la formulación de doce preguntas específicas, orientadas a comprender el comportamiento de los datos más allá de los estadísticos descriptivos.

  1. ¿Por qué Sesiones_tutoria tiene sesgo positivo? ¿La asistencia a tutoría se ve reflejada en la variable Puntuacion_examen_final?

  2. ¿Por qué el histograma de Puntuacion_examen_final tiene un apuntamiento (curtosis) tan elevado? ¿La mayoría de estudiantes obtiene notas muy similares?

  3. ¿Qué diferencias hay en el comportamiento en cuanto a horas de estudio, tutoría y asistencia, entre aquellos que sacaron notas muy altas o muy bajas (outliers) ?

  4. ¿La puntuación del examen final es más homogenea en colegios privados o públicos?

  5. ¿Hay alguna relación, entre horas estudiadas, de sueño, de actividad fisica y un mayor acceso a recursos, y sacar mayores puntuaciones en el examen final?

  6. ¿La participación de los padres influye en la motivación de los estudiantes?

  7. ¿La distancia al colegio afecta la asistencia?

  8. ¿Los estudiantes con dificultades de aprendizaje realmente sacan peores notas? ¿Estudian más que los estudiantes sin dificultades de aprendizaje?

  9. ¿Los estudiantes con influencia negativa de compañeros les fue peor en la puntuación final?

  10. ¿Las puntuaciones finales difieren dependiendo de la calidad de profesores?

  11. ¿Cómo afecta el acceso a recursos a las puntuaciones finales? ¿El nivel educativo de los padres influye en las puntuaciones finales?

  12. ¿Cómo se ven afectadas las medidas de tendencia central y dispersión si en vez de imputar hubiéramos eliminado las filas con NA?

A.2 Diccionario de variables

A continuación, se presenta la clasificación completa de las 16 variables que se trabajaran, según su naturaleza estadística:

Variable Tipo Descripción
Horas_estudiadas Cuantitativa discreta Horas de estudio por semana (0-44)
Asistencia Cuantitativa discreta Porcentaje de asistencia a clases (60-100%)
Horas_sueno Cuantitativa discreta Horas de sueño por noche (4-10)
Sesiones_tutoria Cuantitativa discreta Número de sesiones de tutoría recibidas (0-8)
Actividad_fisica Cuantitativa discreta Horas de actividad física por semana (0-6)
Puntuacion_examen_final Cuantitativa discreta Puntaje del examen final — variable objetivo (55-100)
Actividades_extraescolares Cualitativa nominal Participa en actividades extracurriculares (Sí / No)
Tipo_colegio Cualitativa nominal Tipo de institución educativa (Privado / Público)
Dificultades_aprendizaje Cualitativa nominal Presenta dificultades de aprendizaje (Sí / No)
Participacion_padres Cualitativa ordinal Nivel de involucramiento de los padres (Bajo < Medio < Alto)
Acceso_recursos Cualitativa ordinal Acceso a materiales y recursos educativos (Bajo < Medio < Alto)
Nivel_motivacion Cualitativa ordinal Nivel de motivación del estudiante (Bajo < Medio < Alto)
Calidad_profesor Cualitativa ordinal Calidad del docente percibida (Baja < Media < Alta)
Influencia_companeros Cualitativa ordinal Influencia del grupo de pares (Negativa < Neutra < Positiva)
Estudios_padres Cualitativa ordinal Nivel educativo de los padres (Secundaria < Universidad < Posgrado)
Distancia_hogar Cualitativa ordinal Distancia desde el hogar al colegio (Cerca < Moderada < Lejos)

En total, la base contiene 6 variables cuantitativas (todas discretas), 3 variables cualitativas nominales y 7 variables cualitativas ordinales.

La variable asistencia, a pesar de que es un porcentaje, se tomó no como variable cuantitativa continua, sino como discreta. Debido a que en la base de datos, la información suministrada está dada por números enteros, o la parte entera de esos porcentajes.

B. Limpieza y Calidad de Datos

B.1 Valores faltantes (NA)

Durante la revisión inicial se identificó un registro con Puntuacion_examen_final = 101, valor lógicamente imposible en una escala de 0 a 100. Se determinó que se trataba de un error de tipeo y se corrigió a 100, asumiendo que el estudiante obtuvo la nota máxima. Se asumio un valor de 100 y no de 10 debido a que se observo en el boxplot que el valor atípico más bajo para esa variable es de 55.

Valores faltantes por variable
Variable NAs Porcentaje
Horas_estudiadas 0 0%
Asistencia 0 0%
Participacion_padres 0 0%
Acceso_recursos 0 0%
Actividades_extraescolares 0 0%
Horas_sueno 0 0%
Nivel_motivacion 0 0%
Sesiones_tutoria 0 0%
Calidad_profesor 78 1.18%
Tipo_colegio 0 0%
Influencia_companeros 0 0%
Actividad_fisica 0 0%
Dificultades_aprendizaje 0 0%
Estudios_padres 90 1.36%
Distancia_hogar 67 1.01%
Puntuacion_examen_final 0 0%

Al revisar la presencia de valores faltantes, se identificaron NA en tres variables cualitativas:

Calidad_profesor: 78 NA (1.18% de las observaciones)

Estudios_padres: 90 NA (1.36% de las observaciones)

Distancia_hogar: 67 NA (1.01% de las observaciones)

El resto de variables no presentó ningún valor faltante. Dado que el porcentaje de NA en las tres variables afectadas es inferior al 1.5%, se consideró que imputar no afectaria tanto a las medidas estadisticas y a la vez, nos permitira evitar eliminar las filas. Esto habría representado una pérdida innecesaria de información. Por esta razón, frente a la opción de eliminar filas o imputar, se optó por imputar por moda, reemplazando cada NA con el valor más frecuente de su respectiva variable: Media para Calidad_profesor, Secundaria para Estudios_padres y Cerca para Distancia_hogar.

Valores faltantes después de imputación
Variable NAs Porcentaje
Horas_estudiadas 0 0%
Asistencia 0 0%
Participacion_padres 0 0%
Acceso_recursos 0 0%
Actividades_extraescolares 0 0%
Horas_sueno 0 0%
Nivel_motivacion 0 0%
Sesiones_tutoria 0 0%
Calidad_profesor 0 0%
Tipo_colegio 0 0%
Influencia_companeros 0 0%
Actividad_fisica 0 0%
Dificultades_aprendizaje 0 0%
Estudios_padres 0 0%
Distancia_hogar 0 0%
Puntuacion_examen_final 0 0%

B.2 Detección de valores atípicos (Outliers)

Se aplicó el método del rango intercuartílico (IQR) para detectar outliers en las seis variables cuantitativas. Los resultados fueron los siguientes:

Detección de outliers por variable
Variable Outliers Porcentaje Limite_Inf Limite_Sup
Horas_estudiadas 43 0.65% 4.0 36.0
Asistencia 0 0% 40.0 120.0
Horas_sueno 0 0% 3.0 11.0
Sesiones_tutoria 430 6.51% -0.5 3.5
Actividad_fisica 0 0% -1.0 7.0
Puntuacion_examen_final 104 1.57% 59.0 75.0

Variables sin outliers:

Asistencia, Horas_sueno y Actividad_fisica no presentaron ningún valor atípico, lo que indica que los datos de estas variables se distribuyen de forma coherente dentro de rangos esperados.

Variables con outliers:

Horas_estudiadas: se detectaron 43 outliers (0.65%), correspondientes a estudiantes que estudian menos de 4 horas o más de 36 horas semanales. Dado que el límite inferior es de 4 horas y el superior de 36, estos casos representan estudiantes con hábitos de estudio inusualmente bajos o excepcionalmente altos, pero no son valores imposibles, por lo que se mantuvieron en la base.

Sesiones_tutoria: fue la variable con mayor proporción de outliers, con 430 casos (6.51%). El límite superior del IQR es apenas 3.5 sesiones, lo que significa que cualquier estudiante con 4 o más sesiones es clasificado como atípico. Esto se explica por el fuerte sesgo positivo de la variable: la gran mayoría de estudiantes tiene entre 0 y 2 sesiones, haciendo que quienes tienen muchas sesiones queden estadísticamente alejados del centro. No son errores sino una característica real de la distribución.

Puntuacion_examen_final: presentó 104 outliers (1.57%), con un límite inferior de 59 y superior de 75. Esto indica que las notas menores a 59 o mayores a 75 son estadísticamente atípicas, lo que refleja que la mayoría de estudiantes se concentra en un rango estrecho de calificaciones (entre 65 y 69 aproximadamente), y que obtener notas muy altas o muy bajas es poco frecuente en esta muestra.

En todos los casos los outliers fueron conservados, ya que representan comportamientos reales de los estudiantes y no errores de captura o registro.

C. Análisis Descriptivo Univariado

Medidas de tendencia central y dispersión
Variable Media Mediana Moda Varianza Desv_Std CV
Horas_estudiadas 19.98 20 20 35.89 5.99 29.99%
Asistencia 79.98 80 67 133.34 11.55 14.44%
Horas_sueno 7.03 7 7 2.16 1.47 20.89%
Sesiones_tutoria 1.49 1 1 1.51 1.23 82.38%
Actividad_fisica 2.97 3 3 1.06 1.03 34.75%
Puntuacion_examen_final 67.24 67 68 15.13 3.89 5.78%

Cuartiles

Cuartiles
Variable Q1 Q2 Q3
Horas_estudiadas 16 20 24
Asistencia 70 80 90
Horas_sueno 6 7 8
Sesiones_tutoria 1 1 2
Actividad_fisica 2 3 4
Puntuacion_examen_final 65 67 69

Deciles

Deciles
Variable D1 D2 D3 D4 D5 D6 D7 D8 D9
Horas_estudiadas 12 15 17 19 20 21 23 25 28
Asistencia 64 68 72 76 80 84 88 92 96
Horas_sueno 5 6 6 7 7 7 8 8 9
Sesiones_tutoria 0 0 1 1 1 2 2 2 3
Actividad_fisica 2 2 2 3 3 3 3 4 4
Puntuacion_examen_final 63 64 65 66 67 68 69 70 72

Percentiles clave

Percentiles clave
Variable P10 P25 P50 P75 P90
Horas_estudiadas 12 16 20 24 28
Asistencia 64 70 80 90 96
Horas_sueno 5 6 7 8 9
Sesiones_tutoria 0 1 1 2 3
Actividad_fisica 2 2 3 4 4
Puntuacion_examen_final 63 65 67 69 72

Interpretación de variables cuantitativas Horas_estudiadas

Los estudiantes estudian en promedio 19.98 horas semanales, con una mediana y moda de 20 horas, lo que indica una distribución bastante simétrica sin sesgo notable. La desviación estándar de 5.99 horas y un coeficiente de variación del 29.99% señalan una dispersión moderada, es decir, hay diferencias relevantes entre estudiantes en cuanto a sus hábitos de estudio pero sin ser extremas. El 50% central de los estudiantes estudia entre 16 y 24 horas semanales (Q1=16, Q3=24), y el 90% estudia entre 12 y 28 horas, lo que confirma que la mayoría se concentra alrededor de las 20 horas.

Asistencia

La asistencia promedio es del 79.98%, con mediana en 80% y moda en 67%. La discrepancia entre la media/mediana y la moda sugiere que aunque el valor más repetido individualmente es 67%, la distribución se concentra alrededor del 80%. La desviación estándar de 11.55 puntos porcentuales y un CV del 14.44% indican una dispersión relativamente baja en comparación con otras variables. El rango intercuartílico va de 70% a 90%, lo que significa que la mitad central de los estudiantes mantiene una asistencia entre estos valores. No se detectaron outliers, lo que confirma una distribución uniforme sin casos extremos.

Horas_sueno

Los estudiantes duermen en promedio 7.03 horas por noche, con mediana y moda de 7 horas, reflejando una distribución perfectamente simétrica. El CV del 20.89% indica una dispersión moderada. El rango de valores va de 4 a 10 horas, con el 50% central entre 6 y 8 horas (Q1=6, Q3=8). No se registraron outliers, lo que sugiere que los hábitos de sueño de los estudiantes son relativamente homogéneos y se mantienen dentro de rangos fisiológicamente normales.

Sesiones_tutoria

Esta es la variable con mayor variabilidad relativa, con un CV del 82.38%, el más alto de todas las variables cuantitativas. La media es de 1.49 sesiones, pero la mediana y la moda son ambas 1, lo que junto con el coeficiente de asimetría de Pearson de 1.19 confirma un sesgo positivo marcado: la mayoría de estudiantes tiene pocas sesiones y una minoría concentra muchas. Concretamente, el 55.88% de los estudiantes tiene 0 o 1 sesión, y solo el 6.51% tiene 4 o más. El rango intercuartílico es muy estrecho (Q1=1, Q3=2), lo que refleja que el 50% central de los estudiantes tiene entre 1 y 2 sesiones. Los 430 outliers detectados corresponden precisamente a los estudiantes con 4 o más sesiones, que estadísticamente se alejan del comportamiento típico.

Actividad_fisica

Los estudiantes realizan en promedio 2.97 horas de actividad física semanal, con mediana y moda de 3 horas. El CV del 34.75% indica una dispersión moderada-alta. El 50% central se sitúa entre 2 y 4 horas (Q1=2, Q3=4), y no se detectaron outliers, lo que sugiere que los niveles de actividad física están distribuidos de forma bastante uniforme entre 0 y 6 horas semanales.

Puntuacion_examen_final

Esta es con diferencia la variable más homogénea, con un CV del apenas 5.78%, el más bajo de todas. La media es de 67.24 puntos, con mediana de 67 y moda de 68, valores prácticamente idénticos que confirman una distribución muy simétrica. La desviación estándar es de solo 3.89 puntos, lo que significa que la gran mayoría de estudiantes obtiene notas muy similares entre sí. El 50% central se concentra en un rango de apenas 4 puntos (Q1=65, Q3=69), y el 90% de los estudiantes obtiene entre 63 y 72 puntos. Esto se complementa con una curtosis de 10.49, extremadamente alta, que confirma una distribución leptocúrtica: un pico muy pronunciado alrededor de la media con colas muy delgadas. En términos prácticos, obtener una nota por debajo de 59 o por encima de 75 es estadísticamente inusual en esta muestra.

C.2 Variables Cualitativas Interpretación de variables cualitativas Participacion_padres

La participación de los padres es predominantemente media (50.89%), seguida de alta (28.88%) y baja (20.24%). Esto indica que en la mayoría de los hogares los padres tienen un nivel moderado de involucramiento en la educación de sus hijos, y que los casos de baja participación son los menos frecuentes.

Acceso_recursos

La distribución es muy similar a la de participación de padres: nivel medio predomina con el 50.23%, seguido de alto (29.89%) y bajo (19.87%). La mayoría de estudiantes cuenta con un acceso moderado a materiales y recursos educativos, y menos de un 20% reporta acceso bajo.

Actividades_extraescolares

El 59.6% de los estudiantes participa en actividades extracurriculares, frente al 40.4% que no lo hace. Hay una ligera mayoría de estudiantes activos fuera del aula, aunque la diferencia no es abrumadora.

Nivel_motivacion

Al igual que participación de padres y acceso a recursos, el nivel medio es el más frecuente (50.72%), seguido de bajo (29.32%) y alto (19.96%). Es llamativo que el nivel alto de motivación sea el menos frecuente de los tres, lo que podría sugerir que la mayoría de estudiantes tiene una motivación moderada pero pocos alcanzan un nivel de motivación realmente elevado.

Calidad_profesor

La calidad media domina ampliamente con el 60.59% de los casos, seguida de alta (29.47%) y baja (9.94%). Esto es positivo en términos generales: menos del 10% de los estudiantes tiene profesores de baja calidad, y casi el 30% cuenta con profesores de alta calidad.

Tipo_colegio

El 69.59% de los estudiantes asiste a colegios públicos, frente al 30.41% en colegios privados. Esta distribución refleja la realidad típica de muchos sistemas educativos donde la oferta pública es mayoritaria.

Influencia_companeros

Las influencias neutra y positiva están casi empatadas con 39.23% y 39.93% respectivamente, mientras que la influencia negativa representa solo el 20.84%. En conjunto, casi el 80% de los estudiantes se desenvuelve en un entorno de pares neutro o positivo, lo cual es un factor favorable para el rendimiento académico.

Dificultades_aprendizaje

El 89.48% de los estudiantes no reporta dificultades de aprendizaje, mientras que solo el 10.52% sí las tiene. Este fuerte desbalance entre grupos es importante tenerlo en cuenta al interpretar comparaciones entre ambos grupos, ya que el grupo con dificultades es considerablemente más pequeño.

Estudios_padres

La mitad de los estudiantes tiene padres con nivel educativo de secundaria (50.14%), seguido de universidad (30.10%) y posgrado (19.75%). Esto indica que en esta muestra predominan hogares donde los padres no alcanzaron la educación superior, lo cual puede tener implicaciones en el acompañamiento académico que reciben los estudiantes.

Distancia_hogar

La mayoría de estudiantes vive cerca del colegio (59.8%), seguido de distancia moderada (30.24%) y lejos (9.96%). Solo 1 de cada 10 estudiantes enfrenta una distancia considerable al colegio, lo que en principio no debería representar una barrera importante para la asistencia a nivel general.

Participacion_padres

Distribución de Participacion_padres
Categoría Frecuencia Porcentaje
Bajo 1337 20.24%
Medio 3362 50.89%
Alto 1908 28.88%

Moda: Medio (50.89%)

Acceso_recursos

Distribución de Acceso_recursos
Categoría Frecuencia Porcentaje
Bajo 1313 19.87%
Medio 3319 50.23%
Alto 1975 29.89%

Moda: Medio (50.23%)

Actividades_extraescolares

Distribución de Actividades_extraescolares
Categoría Frecuencia Porcentaje
No 2669 40.4%
Si 3938 59.6%

Moda: Si (59.6%)

Nivel_motivacion

Distribución de Nivel_motivacion
Categoría Frecuencia Porcentaje
Bajo 1937 29.32%
Medio 3351 50.72%
Alto 1319 19.96%

Moda: Medio (50.72%)

Calidad_profesor

Distribución de Calidad_profesor
Categoría Frecuencia Porcentaje
Baja 657 9.94%
Media 4003 60.59%
Alta 1947 29.47%

Moda: Media (60.59%)

Tipo_colegio

Distribución de Tipo_colegio
Categoría Frecuencia Porcentaje
Privado 2009 30.41%
Publico 4598 69.59%

Moda: Publico (69.59%)

Influencia_companeros

Distribución de Influencia_companeros
Categoría Frecuencia Porcentaje
Negativa 1377 20.84%
Neutra 2592 39.23%
Positiva 2638 39.93%

Moda: Positiva (39.93%)

Dificultades_aprendizaje

Distribución de Dificultades_aprendizaje
Categoría Frecuencia Porcentaje
No 5912 89.48%
Si 695 10.52%

Moda: No (89.48%)

Estudios_padres

Distribución de Estudios_padres
Categoría Frecuencia Porcentaje
Secundaria 3313 50.14%
Universidad 1989 30.1%
Posgrado 1305 19.75%

Moda: Secundaria (50.14%)

Distancia_hogar

Distribución de Distancia_hogar
Categoría Frecuencia Porcentaje
Cerca 3951 59.8%
Moderada 1998 30.24%
Lejos 658 9.96%

Moda: Cerca (59.8%)

D. Diálogo con los Datos

Conclusiones

Anotaciones:

La base al estar en ingles, se tomo la desición de traducir la información al español. Se comenzo por cambiar el nombre de las variables y luego a las cuanlitativas, se les tradujo los niveles.

Al tratar de detectar NA, nos dimos cuenta que por r aparecia como si ninguna variable tuviera NA. Pero filtrando la información en exel efectivamente había valores faltantes. El probleme era que R estaba tomando el vacio como un nivel, y al traducirlo quedaban establecidos los niveles reales y ahi si detectaba los vacios como na. Por lo que para organizar el codigo, pedimos que nos resumiera los niveles que podria tomar cada variable y efectivamente tomaba el vacio como un nivel. Por lo que el proceso de traducción, cambio de naturaleza y el establecer los niveles de cada variable se hizo en conjunto. Para luego si poder detectar sin problema los na. Se utilizo ese codigo y no solo levels(), ya que para utilizarlo tendriamos primero que cambiar la naturaleza de las variables a factores. Por esto se utilizo unique() ya que funciona para cualquier tipo de variable

En el comando que nos daba cuantos y cuales niveles tenia cada variable se detecto la inconsisitencia para la variable Puntuacion_final. con el valor 101.