LOGO ITM
LOGO ITM

Presentación del proyecto

El presente informe desarrolla un proyecto completo de minería de datos orientado a la caracterización de estudiantes. Se integran procesos de cargue, exploración, identificación de datos atípicos y análisis estadístico mediante técnicas univariadas y multivariadas.

Las etapas desarrolladas son:

a) Cargue y exploración inicial de la base de datos.

b) Identificación de datos atípicos mediante pruebas estadísticas.

c) Aplicación de técnicas multivariadas mediante distancias de Mahalanobis.

d) Preparación de información para análisis posteriores.

1. Cargue de la base de datos

La información se carga desde un archivo local en formato Excel.

2. Aplicación de técnicas de identificación de datos atípicos

2.1 Test de Grubbs

El Test de Grubbs permite identificar un dato atípico individual dentro de una variable cuantitativa, evaluando si el valor máximo o mínimo se encuentra significativamente alejado del comportamiento general.

2.2 Test de Dixon

El Test de Dixon es utilizado para muestras pequeñas y permite evaluar si el valor extremo de una muestra presenta un comportamiento inconsistente respecto al conjunto de observaciones.

2.3 Distancia de Mahalanobis

La distancia de Mahalanobis permite identificar observaciones atípicas considerando simultáneamente varias variables de interés. Para este análisis se utiliza RWizard mediante la función XV9 y posteriormente se integra la clasificación con la base original.

Para el siguiente caso se presenta la identificación de datos atípicos considerando el género biológico. Sin embargo el

Interpretación científica del análisis multivariado. La distancia de Mahalanobis evalúa qué tan alejada se encuentra cada observación del centro multivariado de la población, incorporando simultáneamente la escala de las variables y la estructura de correlación existente entre ellas. En este caso, la evaluación conjunta de IMC, Prom.Global.Semestre y Prom.Acum.Carrera permite detectar perfiles que podrían no parecer extremos cuando cada variable se analiza por separado, pero cuya combinación resulta poco frecuente dentro del patrón general de los estudiantes. Una observación clasificada como atípica no debe interpretarse automáticamente como un error de registro; constituye una señal estadística que requiere revisión, pues puede representar un estudiante con una combinación genuinamente inusual de características antropométricas y académicas. Los registros que no cuentan con información completa en las tres variables respuesta se identifican como No evaluables, debido a que la distancia multivariada no puede calcularse de forma válida con información incompleta.

2.4. Análisis descriptivo:

Se presenta el análisis descriptivo para la identificación de datos atípicos de la distribución del índice de masa corporal y el promedio académico semestral en función del Género, por tipo de trabajo, tipo de carrera y región de residencia.

A continuación se presentará la Tabla de distribución de medidas descriptivas considerando cada una de los grupos analizados. Posteriormente se realizarán los respectivos diagramas de cajas y bigotes para cada una de los pares de variables y se identificarán los datos atípicos probables y seguros en la base de datos original.

Los resultados se muestran a continuación:

Interpretación científica de las medidas descriptivas. Las medidas de tendencia central y dispersión permiten caracterizar la posición y la heterogeneidad de cada distribución antes de realizar inferencias posteriores. La media resume el valor promedio y es sensible a observaciones extremas, mientras que la mediana representa el punto que divide la distribución en dos mitades y es más robusta frente a datos atípicos. La desviación estándar cuantifica la dispersión de las observaciones alrededor de la media. Por su parte, los cuartiles Q1 y Q3 delimitan el 50 % central de los datos y su diferencia corresponde al rango intercuartílico (RIQ), medida robusta de variabilidad especialmente útil cuando existen valores extremos.

La comparación de estas medidas entre género biológico, condición laboral, grupo de carrera, región de residencia y tipo de transporte permite determinar si los grupos difieren principalmente en su nivel central, en su variabilidad o en ambos componentes. En particular, cuando media y mediana son cercanas se obtiene evidencia descriptiva de una distribución relativamente equilibrada; discrepancias importantes entre ambas, combinadas con un RIQ amplio y máximos o mínimos alejados, sugieren asimetría y posible presencia de observaciones extremas. Estas comparaciones son descriptivas y no constituyen, por sí solas, evidencia de diferencias estadísticamente significativas entre grupos.

Interpretación científica de los diagramas de cajas y bigotes

Los diagramas de cajas y bigotes complementan las medidas descriptivas porque permiten examinar simultáneamente la localización, dispersión, asimetría y presencia de observaciones extremas. La línea interna de cada caja representa la mediana; los límites inferior y superior corresponden al primer y tercer cuartil, de modo que la altura de la caja representa el rango intercuartílico. Los bigotes se extienden hasta los valores compatibles con el patrón central según el criterio de Tukey, mientras que los puntos localizados por fuera de ellos constituyen observaciones potencialmente atípicas. En el procedimiento implementado se consideran atípicos probables los valores que exceden 1.5 × RIQ y atípicos seguros aquellos que exceden 3 × RIQ.

En las distribuciones de IMC se aprecia que la mayor parte de las observaciones de los diferentes grupos se concentra en rangos centrales relativamente compactos, pero existen puntos por encima de los bigotes en varias categorías. Este patrón indica una cola superior más extensa y confirma que algunos estudiantes presentan valores de IMC considerablemente mayores que el comportamiento central de su grupo. La existencia de estos puntos no implica que deban eliminarse: primero deben contrastarse con la información original y con criterios sustantivos, pues pueden corresponder a observaciones reales. Las diferencias en la amplitud de las cajas entre categorías reflejan heterogeneidad distinta del IMC entre grupos; no obstante, en categorías con pocos individuos una caja estrecha puede obedecer al tamaño muestral y no necesariamente a una verdadera homogeneidad poblacional.

Para Prom.Global.Semestre, los diagramas muestran una concentración marcada de la mayor parte de los estudiantes en la zona alta de la escala académica y un solapamiento considerable entre las cajas de varios grupos. Descriptivamente, esto sugiere que las diferencias entre género, región, tipo de carrera, condición laboral o transporte son menores que la variabilidad existente dentro de cada grupo. Se observan además algunos valores muy bajos, incluso próximos a cero en ciertas categorías; por su separación respecto al cuerpo principal de la distribución, estos registros deben ser revisados como posibles valores atípicos, registros especiales o casos con una situación académica excepcional.

En Prom.Acum.Carrera se observa igualmente una concentración importante alrededor de valores académicos medios-altos y un solapamiento amplio entre categorías. La dispersión es, en términos generales, moderada, aunque determinadas categorías presentan colas inferiores o puntos alejados de la caja. Este comportamiento evidencia que la identificación de atípicos debe realizarse de manera contextual: un mismo promedio puede ser inusual en un grupo con poca variabilidad y completamente compatible con otro grupo más heterogéneo.

Finalmente, al relacionar las categorías de IMC según la clasificación OMS con los promedios académicos, las cajas presentan un grado importante de superposición. Desde una perspectiva estrictamente descriptiva, esto no muestra una separación clara y sistemática del rendimiento académico entre categorías de IMC. En consecuencia, los gráficos no justifican interpretar una relación causal entre estado nutricional y desempeño académico; para establecer asociaciones de ese tipo serían necesarias pruebas inferenciales específicas, control de variables de confusión y un diseño analítico apropiado.

#3. Técnicas de Imputación de Datos

Las técnicas de imputación de datos utilizan tecnicas descriptivas y modelos lineales o de clasificación o de aprendizaje de máquinas para estimar los valores faltantes de un set de datos en función. El principio de funcionamiento de la técnica se centra en estimar los valores (en variables cualitativa y/o cuantitativas) de acuerdo a la semejanza observada por individuos que presentan condiciones similares. Dentro de las técnicas de imputación que consideraremos se encuentran:

a) Imputación por la media:

El dato imputado será el promedio de los datos presentes sin considerar elementos de grupo o otra variable de interés. A continuación se presenta el modelo y la validación de la imputación

Interpretación del modelo de imputación por la media. La superposición entre la densidad observada y la densidad posterior a la imputación permite evaluar visualmente cuánto se modifica la distribución marginal de cada variable. En los gráficos obtenidos, las curvas mantienen una forma general semejante, lo cual indica que la imputación no altera de manera drástica la localización global de IMC, Prom.Global.Semestre y Prom.Acum.Carrera. Sin embargo, la imputación por la media asigna a todos los valores faltantes un mismo valor central; por ello tiende teóricamente a concentrar observaciones alrededor del promedio, reducir artificialmente la varianza y debilitar covarianzas o correlaciones entre variables. En consecuencia, resulta útil como referencia descriptiva y como procedimiento sencillo, pero debe interpretarse con cautela cuando el objetivo posterior involucra inferencia, modelación o conservación de la estructura multivariada.

2.2. Imputación por regresión

Interpretación del modelo de imputación por regresión. La imputación mediante norm.predict estima los valores faltantes a partir de la relación lineal entre cada variable objetivo y las demás variables incorporadas en el modelo. La proximidad entre las curvas de densidad antes y después de imputar indica que, para estos datos, la distribución marginal se conserva razonablemente en términos de localización y forma general. A diferencia de la imputación por la media, este procedimiento utiliza información multivariada y genera estimaciones específicas para cada individuo. No obstante, al ser una imputación determinística basada en valores predichos, puede producir una dispersión menor que la realmente existente, porque los valores imputados se sitúan sobre la estructura promedio explicada por la regresión y no incorporan completamente la variabilidad residual. Por esta razón, una buena coincidencia visual de las densidades es necesaria, pero no suficiente, para concluir que se ha preservado toda la incertidumbre de los datos faltantes.

2.3. Imputación por Regresion estocástica

Interpretación del modelo de regresión estocástica. La regresión estocástica conserva la estructura predictiva del modelo lineal, pero incorpora un componente aleatorio asociado a la distribución residual. Esta característica evita que todos los valores imputados queden exactamente sobre la superficie de predicción y permite representar de forma más realista la variabilidad no explicada por los predictores. En las densidades obtenidas se observa una elevada superposición entre la distribución original y la imputada, lo que constituye evidencia gráfica favorable de preservación de la forma marginal de las variables. Desde el punto de vista estadístico, esta técnica suele resultar más apropiada que la regresión determinística cuando interesa conservar la dispersión; aun así, sus resultados dependen del supuesto de una relación aproximadamente lineal y del mecanismo que originó los valores faltantes.

3.4. Imputación por KNN

Interpretación del modelo de imputación por KNN. El método de K vecinos más cercanos (KNN) es un procedimiento no paramétrico: no presupone una forma funcional lineal específica, sino que estima cada valor faltante utilizando la información de observaciones consideradas similares en el espacio de variables disponibles. En este análisis se emplean k = 12 vecinos, de modo que cada imputación resume información local de un conjunto de estudiantes con características próximas. La fuerte superposición visual de las densidades originales e imputadas sugiere que el procedimiento mantiene adecuadamente la forma marginal de IMC, Prom.Global.Semestre y Prom.Acum.Carrera. Esta conservación resulta favorable porque indica que la imputación no introduce desplazamientos evidentes en las distribuciones. No obstante, KNN puede ser sensible a la escala de las variables, a la elección de k, a la presencia de valores atípicos y a la dimensionalidad del conjunto de predictores; por ello su desempeño debe evaluarse conjuntamente con la plausibilidad de los valores imputados y no únicamente con la similitud gráfica de las densidades.

Consideración comparativa de los modelos de imputación

En conjunto, las figuras muestran que los cuatro procedimientos generan distribuciones posteriores próximas a las observadas para las variables analizadas. La imputación por la media constituye el método más simple, pero tiene mayor riesgo de reducir la variabilidad. La regresión determinística aprovecha relaciones entre variables, aunque también puede subestimar la dispersión. La regresión estocástica añade variabilidad residual y, por tanto, representa mejor la incertidumbre del proceso de imputación bajo supuestos lineales. KNN ofrece una alternativa flexible basada en semejanza local y evita imponer una ecuación paramétrica. La selección final del método no debería realizarse únicamente por el grado de superposición de las curvas; también deben considerarse el mecanismo de datos faltantes, la preservación de asociaciones entre variables y el propósito analítico posterior.