El presente informe desarrolla un proyecto completo de minería de datos orientado a la caracterización de estudiantes. Se integran procesos de cargue, exploración, identificación de datos atípicos y análisis estadístico mediante técnicas univariadas y multivariadas.
Las etapas desarrolladas son:
a) Cargue y exploración inicial de la base de datos.
b) Identificación de datos atípicos mediante pruebas estadísticas.
c) Aplicación de técnicas multivariadas mediante distancias de Mahalanobis.
d) Preparación de información para análisis posteriores.
La información se carga desde un archivo local en formato Excel.
El Test de Grubbs permite identificar un dato atípico individual dentro de una variable cuantitativa, evaluando si el valor máximo o mínimo se encuentra significativamente alejado del comportamiento general.
El Test de Dixon es utilizado para muestras pequeñas y permite evaluar si el valor extremo de una muestra presenta un comportamiento inconsistente respecto al conjunto de observaciones.
La distancia de Mahalanobis permite identificar observaciones atípicas considerando simultáneamente varias variables de interés. Para este análisis se utiliza RWizard mediante la función XV9 y posteriormente se integra la clasificación con la base original.
Para el siguiente caso se presenta la identificación de datos atípicos considerando el género biológico. Sin embargo el
Interpretación científica del análisis multivariado.
La distancia de Mahalanobis evalúa qué tan alejada se encuentra cada
observación del centro multivariado de la población, incorporando
simultáneamente la escala de las variables y la estructura de
correlación existente entre ellas. En este caso, la evaluación conjunta
de IMC, Prom.Global.Semestre y
Prom.Acum.Carrera permite detectar perfiles que podrían no
parecer extremos cuando cada variable se analiza por separado, pero cuya
combinación resulta poco frecuente dentro del patrón general de los
estudiantes. Una observación clasificada como atípica no debe
interpretarse automáticamente como un error de registro; constituye una
señal estadística que requiere revisión, pues puede representar un
estudiante con una combinación genuinamente inusual de características
antropométricas y académicas. Los registros que no cuentan con
información completa en las tres variables respuesta se identifican como
No evaluables, debido a que la distancia multivariada
no puede calcularse de forma válida con información incompleta.
Se presenta el análisis descriptivo para la identificación de datos atípicos de la distribución del índice de masa corporal y el promedio académico semestral en función del Género, por tipo de trabajo, tipo de carrera y región de residencia.
A continuación se presentará la Tabla de distribución de medidas descriptivas considerando cada una de los grupos analizados. Posteriormente se realizarán los respectivos diagramas de cajas y bigotes para cada una de los pares de variables y se identificarán los datos atípicos probables y seguros en la base de datos original.
Los resultados se muestran a continuación:
Interpretación científica de las medidas
descriptivas. Las medidas de tendencia central y dispersión
permiten caracterizar la posición y la heterogeneidad de cada
distribución antes de realizar inferencias posteriores. La
media resume el valor promedio y es sensible a
observaciones extremas, mientras que la mediana
representa el punto que divide la distribución en dos mitades y es más
robusta frente a datos atípicos. La desviación estándar
cuantifica la dispersión de las observaciones alrededor de la media. Por
su parte, los cuartiles Q1 y Q3 delimitan el
50 % central de los datos y su diferencia corresponde al rango
intercuartílico (RIQ), medida robusta de variabilidad
especialmente útil cuando existen valores extremos.
La comparación de estas medidas entre género biológico, condición laboral, grupo de carrera, región de residencia y tipo de transporte permite determinar si los grupos difieren principalmente en su nivel central, en su variabilidad o en ambos componentes. En particular, cuando media y mediana son cercanas se obtiene evidencia descriptiva de una distribución relativamente equilibrada; discrepancias importantes entre ambas, combinadas con un RIQ amplio y máximos o mínimos alejados, sugieren asimetría y posible presencia de observaciones extremas. Estas comparaciones son descriptivas y no constituyen, por sí solas, evidencia de diferencias estadísticamente significativas entre grupos.
Los diagramas de cajas y bigotes complementan las medidas
descriptivas porque permiten examinar simultáneamente la localización,
dispersión, asimetría y presencia de observaciones extremas. La línea
interna de cada caja representa la mediana; los límites
inferior y superior corresponden al primer y tercer cuartil, de modo que
la altura de la caja representa el rango
intercuartílico. Los bigotes se extienden hasta los valores
compatibles con el patrón central según el criterio de Tukey, mientras
que los puntos localizados por fuera de ellos constituyen observaciones
potencialmente atípicas. En el procedimiento implementado se consideran
atípicos probables los valores que exceden
1.5 × RIQ y atípicos seguros aquellos que
exceden 3 × RIQ.
En las distribuciones de IMC se aprecia que la mayor parte de las observaciones de los diferentes grupos se concentra en rangos centrales relativamente compactos, pero existen puntos por encima de los bigotes en varias categorías. Este patrón indica una cola superior más extensa y confirma que algunos estudiantes presentan valores de IMC considerablemente mayores que el comportamiento central de su grupo. La existencia de estos puntos no implica que deban eliminarse: primero deben contrastarse con la información original y con criterios sustantivos, pues pueden corresponder a observaciones reales. Las diferencias en la amplitud de las cajas entre categorías reflejan heterogeneidad distinta del IMC entre grupos; no obstante, en categorías con pocos individuos una caja estrecha puede obedecer al tamaño muestral y no necesariamente a una verdadera homogeneidad poblacional.
Para Prom.Global.Semestre, los diagramas muestran una concentración marcada de la mayor parte de los estudiantes en la zona alta de la escala académica y un solapamiento considerable entre las cajas de varios grupos. Descriptivamente, esto sugiere que las diferencias entre género, región, tipo de carrera, condición laboral o transporte son menores que la variabilidad existente dentro de cada grupo. Se observan además algunos valores muy bajos, incluso próximos a cero en ciertas categorías; por su separación respecto al cuerpo principal de la distribución, estos registros deben ser revisados como posibles valores atípicos, registros especiales o casos con una situación académica excepcional.
En Prom.Acum.Carrera se observa igualmente una concentración importante alrededor de valores académicos medios-altos y un solapamiento amplio entre categorías. La dispersión es, en términos generales, moderada, aunque determinadas categorías presentan colas inferiores o puntos alejados de la caja. Este comportamiento evidencia que la identificación de atípicos debe realizarse de manera contextual: un mismo promedio puede ser inusual en un grupo con poca variabilidad y completamente compatible con otro grupo más heterogéneo.
Finalmente, al relacionar las categorías de IMC según la clasificación OMS con los promedios académicos, las cajas presentan un grado importante de superposición. Desde una perspectiva estrictamente descriptiva, esto no muestra una separación clara y sistemática del rendimiento académico entre categorías de IMC. En consecuencia, los gráficos no justifican interpretar una relación causal entre estado nutricional y desempeño académico; para establecer asociaciones de ese tipo serían necesarias pruebas inferenciales específicas, control de variables de confusión y un diseño analítico apropiado.
#3. Técnicas de Imputación de Datos
Las técnicas de imputación de datos utilizan tecnicas descriptivas y modelos lineales o de clasificación o de aprendizaje de máquinas para estimar los valores faltantes de un set de datos en función. El principio de funcionamiento de la técnica se centra en estimar los valores (en variables cualitativa y/o cuantitativas) de acuerdo a la semejanza observada por individuos que presentan condiciones similares. Dentro de las técnicas de imputación que consideraremos se encuentran:
a) Imputación por la media:
El dato imputado será el promedio de los datos presentes sin considerar elementos de grupo o otra variable de interés. A continuación se presenta el modelo y la validación de la imputación
Interpretación del modelo de imputación por la
media. La superposición entre la densidad observada y la
densidad posterior a la imputación permite evaluar visualmente cuánto se
modifica la distribución marginal de cada variable. En los gráficos
obtenidos, las curvas mantienen una forma general semejante, lo cual
indica que la imputación no altera de manera drástica la localización
global de IMC, Prom.Global.Semestre y
Prom.Acum.Carrera. Sin embargo, la imputación por la media
asigna a todos los valores faltantes un mismo valor central; por ello
tiende teóricamente a concentrar observaciones alrededor del promedio,
reducir artificialmente la varianza y debilitar covarianzas o
correlaciones entre variables. En consecuencia, resulta útil como
referencia descriptiva y como procedimiento sencillo, pero debe
interpretarse con cautela cuando el objetivo posterior involucra
inferencia, modelación o conservación de la estructura multivariada.
Interpretación del modelo de imputación por
regresión. La imputación mediante norm.predict
estima los valores faltantes a partir de la relación lineal entre cada
variable objetivo y las demás variables incorporadas en el modelo. La
proximidad entre las curvas de densidad antes y después de imputar
indica que, para estos datos, la distribución marginal se conserva
razonablemente en términos de localización y forma general. A diferencia
de la imputación por la media, este procedimiento utiliza información
multivariada y genera estimaciones específicas para cada individuo. No
obstante, al ser una imputación determinística basada en valores
predichos, puede producir una dispersión menor que la realmente
existente, porque los valores imputados se sitúan sobre la estructura
promedio explicada por la regresión y no incorporan completamente la
variabilidad residual. Por esta razón, una buena coincidencia visual de
las densidades es necesaria, pero no suficiente, para concluir que se ha
preservado toda la incertidumbre de los datos faltantes.
Interpretación del modelo de regresión estocástica. La regresión estocástica conserva la estructura predictiva del modelo lineal, pero incorpora un componente aleatorio asociado a la distribución residual. Esta característica evita que todos los valores imputados queden exactamente sobre la superficie de predicción y permite representar de forma más realista la variabilidad no explicada por los predictores. En las densidades obtenidas se observa una elevada superposición entre la distribución original y la imputada, lo que constituye evidencia gráfica favorable de preservación de la forma marginal de las variables. Desde el punto de vista estadístico, esta técnica suele resultar más apropiada que la regresión determinística cuando interesa conservar la dispersión; aun así, sus resultados dependen del supuesto de una relación aproximadamente lineal y del mecanismo que originó los valores faltantes.
Interpretación del modelo de imputación por KNN. El
método de K vecinos más cercanos (KNN) es un procedimiento
no paramétrico: no presupone una forma funcional lineal específica, sino
que estima cada valor faltante utilizando la información de
observaciones consideradas similares en el espacio de variables
disponibles. En este análisis se emplean k = 12 vecinos, de
modo que cada imputación resume información local de un conjunto de
estudiantes con características próximas. La fuerte superposición visual
de las densidades originales e imputadas sugiere que el procedimiento
mantiene adecuadamente la forma marginal de IMC,
Prom.Global.Semestre y Prom.Acum.Carrera. Esta
conservación resulta favorable porque indica que la imputación no
introduce desplazamientos evidentes en las distribuciones. No obstante,
KNN puede ser sensible a la escala de las variables, a la elección de
k, a la presencia de valores atípicos y a la
dimensionalidad del conjunto de predictores; por ello su desempeño debe
evaluarse conjuntamente con la plausibilidad de los valores imputados y
no únicamente con la similitud gráfica de las densidades.
En conjunto, las figuras muestran que los cuatro procedimientos generan distribuciones posteriores próximas a las observadas para las variables analizadas. La imputación por la media constituye el método más simple, pero tiene mayor riesgo de reducir la variabilidad. La regresión determinística aprovecha relaciones entre variables, aunque también puede subestimar la dispersión. La regresión estocástica añade variabilidad residual y, por tanto, representa mejor la incertidumbre del proceso de imputación bajo supuestos lineales. KNN ofrece una alternativa flexible basada en semejanza local y evita imponer una ecuación paramétrica. La selección final del método no debería realizarse únicamente por el grado de superposición de las curvas; también deben considerarse el mecanismo de datos faltantes, la preservación de asociaciones entre variables y el propósito analítico posterior.