Información antes de empezar

Antes de empezar a hablar sobre la investigación es necesarios avisar sobre un cambio que se decidió cambiar la forma de referirse a uno de los datos que se quiere estudiar, el dato originalmente se refería como “carga académica efectiva”, la cual consiste sobre las horas que son consideradas necesarias para que un estudiante pueda aprender y desarrollar las habilidades necesarias para aprobar la asignatura. Este dato paso a llamarse “carga académica estimada mediante SCT”, este cambio se decidió hacer debido que , durante el desarrollo de la investigación este causo confunción sobre a lo que se referían, específicamente porque daba a entender también que se refiere a la carga que realmente realizo el estudiante o en otras palabras “Carga académica declarada bitácora”. Por lo que se decidió cambiarlo durante el desarrollo de este documento para evitar confunciones.

Datos a Estudiar

Para comenzar con el proyecto es necesario conocer cuáles serán los datos que se utilizarán. En esta investigación se hará uso de los datos obtenidos en el proyecto anterior, los cuales contienen distintas bases de datos que permitirán analizar, en una primera instancia, los factores asociados a las diferencias entre la carga académica estimada mediante SCT, declarada y percibida. A continuación, se presentan las bases de datos utilizadas:

Una vez identificadas las bases de datos, es necesario revisar la información que contiene cada una de ellas para determinar qué variables serán utilizadas durante el análisis. A continuación, se presenta un breve resumen de los datos disponibles en cada una de estas bases.

Notas

La base de datos de notas contiene la información de las asignaturas y notas de los 50 estudiantes que participaron en la encuesta, estos están asociados al identificador único (ID). Los datos de estos estudiantes están organizados como aparece dentro de la siguiente tabla.

Base de datos de la notas
variable Descripción
ID Identificador especifico del estudiante
Asignatura 1-6 Asignaturas cursadas del estudiante dividido en seis secciones
Notas 1-6 Notas finales de las asignaturas cursadas por el estudiante, dividido en seis secciones

Encuesta

La base de datos de la encuesta contiene las respuestas entregadas por los 50 estudiantes que participaron en el estudio. Las preguntas pueden agruparse en distintas categorías para facilitar su análisis, tales como antecedentes personales, asignaturas cursadas y percepción sobre las asignaturas.

Si bien en esta sección no se presentarán todas las variables contenidas en la base de datos, sí se mostrarán aquellas consideradas más relevantes para comprender el proceso de análisis. Las variables restantes serán incorporadas y explicadas en las secciones correspondientes cuando sea necesario. En caso de requerirse una descripción completa de todas las preguntas de la encuesta, esta podrá consultarse en el anexo correspondiente.

Base de datos de la encuesta
variables Descripción tipo
ID Identificador especifico del estudiante Identificador
Carrera La carrera que el estudiante esta cursando Categórica
Nivel El nivel dentro de la carrera que esta cursando Numérica
Asignaturas 1-6 Asignaturas cursadas del estudiante dividido en seis secciones Categórica
Porcentaje de tiempo dedicado 1-6 El porcentaje del tiempo dedicado a cada asignatura cursada Porcentaje
Percepcion del tiempo dedicado 1-6 La percepion del estudiante al tiempo que dedico a la asignatura Ordinal

Bitácora

Dentro de la base de datos de la bitácora se encuentra un registro de las actividades de los 50 estudiantes voluntarios, estas registros son guardados a traves de intervalos de 15 minutos, ademas de contener la actividad estas contienen una categorización de la actividad junto a un subcategoria con la finalidad de organizar las actividades.

Base de datos de la bitácora
Variable Descripción Tipo
ID Identificador especifico del estudiante Identificador
Hora de inicio Hora de inicio de la actividad Hora
Hora de termino Hora de termino de la actividad Hora
Fehca Fecha de la actividad Fehca
día Dia el cual se realizo la actividad Categorico
Actividad La actividad realizada por el estudiante Categorico

Sct

Por ultimo esta la base de datos de la SCT, esta contiene 65 observaciones de las carreras y asignaturas de los estudiantes voluntarios ademas de contener el respectivo créditos de SCT-Chile entregados a cada uno de las asignaturas.

Base de datos de la SCT
Valores Descripción Tipo
Carrera Carrera que contiene la asignatura Categorico
Asignatura Asignatura la cual se esta estudiando Categorico
Creditos Creditos de la asignatura Numérica

Estandarizar los datos

Ya conociendo, a grandes rasgos, el contenido de las bases de datos, se mostrarán los pasos realizados para estandarizar los datos. Esto tiene como finalidad mejorar y facilitar el manejo de la información, además de mantener un estándar en los nombres de las asignaturas, carreras y demás variables. A continuación, se presentan cada uno de los pasos realizados.

Eliminación de datos repetidos

Durante el análisis de la base de datos Encuesta, se descubrió que existían estudiantes registrados más de una vez, presentando leves diferencias en sus respuestas. Para esta investigación se decidió conservar únicamente la respuesta más reciente de cada estudiante, descartando las respuestas anteriores. quedándonos de 51 observaciones a solo 50 observaciones, teniendo los 50 estudiantes que participaron.

Distribución de los estudiantes.

Durante la revisión de las carreras de los estudiantes se encontraron tres casos que podían generar problemas durante el análisis estadístico. Estos correspondían a carreras representadas por un único estudiante (Doctorado en Informática, Doctorado en Biomedicina y Magíster en Ingeniería Informática), lo que podía introducir sesgos al momento del moldeamiento.

Con el fin de evitar categorías con muy baja representación, se reviso las asignaturas dentro los tres estudiantes, encontrando que ninguna del conjunto de asignaturas que cada uno de los estudiantes tiene, pertenece alguna de las carreras que se encuentra prominentes, por lo que no se le podría asociar créditos correspondientes a las asignaturas proveniente de la carrera, causaría inconsistencia si se le incorporara a uno de las carreras. Por esa razón, se decidió omitir los datos aportados por los tres estudiantes, quedándonos 47 estudiantes.

Estandarizar la escritura.

  • Se sustituyeron todas las letras mayúsculas por sus correspondientes letras minúsculas.
  • Se eliminaron las tildes de los textos.
  • Se eliminaron espacios en blanco innecesarios.
  • Se transformaron los números romanos a números arábigos.
  • Se eliminaron las palabras “Electivos 1-6” presentes en algunas asignaturas de la base de datos Encuesta.
  • Se estandarizaron los niveles de estudio a valores numéricos.

Estandarizar asignaturas, niveles y carreras.

Durante la revisión de los datos entregados por el estudiantado se observó que las respuestas relacionadas con asignaturas, carreras y niveles presentaban diferencias ortográficas, abreviaciones y distintas formas de numeración.

Para los casos de carreras y niveles, debido a que las diferencias encontradas eran mínimas, se optó por realizar un reemplazo manual.

En caso de las asignaturas de la encuesta, debido a que se encontrara una abundancia de diferencias de escrituras, que se decidió buscar otro método de estandarizar. Con ello se utilizo la creación de un diccionario de correspondencias mediante emparejamiento difuso (Fuzzy Matching) utilizando la distancia de Jaro-Winkler, este diccionario fue desarrollado utilizando como base las carreras y asignaturas encontradas dentro de la base de datos SCT, con ello se tomo las combinaciones carrera asignaturas para compararlo con las asignaturas y carreras encontradas dentro la base de datos de la encuesta, la razón de esta decisión principalmente viene por las diferencias leves entre algunas formas de abreviar las asignaturas que causaba mala interpretación dentro del diccionario. Tras desarrollarlo se obtuvo 101 observaciones, donde nos muestran la carrera, asignatura de la encuesta, asignatura del diccionario y su distancia. Las observaciones nos muestran los mejores emparejamiento que el diccionario encontró con valores entregados, esto no significa que sean los correctos, por lo que fue necesario colocar un umbral de máximo de distancia con la finalidad de encontrar los puntos de mayor distancia y ver los errores. Inicialmente se utilizo un umbral de 0.25, el cual nos dio únicamente 3 casos(Como se muestra en la tabla), estos casos al momento de revisarlos manualmente se encontró que dos de los 3 casos están en lo correcto, y por el caso restante se encontró que el error era una repetición de las primeras palabras de la asignatura, la cual el diccionario lo detecto correctamente. Con ello se decidió subir el umbral al 0.30, ya que no presentaba errores sobre esos y no se tendría que hacer modificaciones individuales.

Para el caso de las asignaturas de la bitácora, se utilizo el mismo método de creación del diccionario, usando carrera y asignatura, pero a diferencia de encuesta, se tiene que aplicar a cada una de las bitácoras de los estudiantes, con ello nos enfocamos solamente en las filas que contengan las asignaturas, para ello se utilizo únicamente las filas que contengan la categorías de “tiempo de estudio autónomo” y “asistencia a clases”, las cuales en la subcategoria nos indican las asignaturas, teniendo estas podemos empezar a utilizar el diccionario de la misma manera usada en la encuesta, pero utilizando el umbral de 0.25, el cual solo mostró un solo caso raro, este siendo “formación integral” a “fundamentos de ingenieria de software” el cual tenia una distancia de 0.4003289, revisándolo manualmente, el estudiante que indicaba cursar formación integral, no tenia esa asignatura registrada, esta tenia “fundamentos de ingeniería de software”, por lo que viendo que solo ese es el caso raro, se subió el umbral máximo a 0.41 para que pase el dato.

Casos raros encontrados en el diccionario
Carrera Asignatura_encuesta Asignatura_Diccionario Distancia
ingenieria civil en biomedica sistemas digitales y sistemas digitales y sistemas digitales y microcontroladores sistemas digitales y microcontroladores 0.2949742
ingenieria civil en biomedica ing clinica ingenieria clinica 0.2508418
ingenieria civil en biomedica lab de biomecanica laboratorio biomecanica 0.2937198

Abreviación de los nombres

Con la finalidad de mejorar la visualización y comprensión de los datos, se redujeron los nombres de las variables, conservando únicamente las palabras más representativas de cada una. Esta conversión no se hizo con todos los nombres, debido a que unicamente los nombres considerablemente largos impedían a la visualización de los datos al momento de graficarlos, por lo que los valores que no producen este problema, se decidio dejarlos igual.

Cambio de los nombres de la variables
Original Cambio
Indique a continuación el porcentaje de tiempo total que dedicó a cada asignatura de este semestre, procurando que la suma de todas las asignaturas sea un 100% Asignatura 1-6 Carga_Declarada_Encuesta
El nivel de carga académica de la asignatura fue bastante abrumadora. Asignatura 1-6 Carga_Percibida_Encuesta
Esta asignatura tuvo una dificultad muy alta. Asignatura 1-6 Dificultad_Percibida_Encuesta
Esta asignatura tuvo una importancia muy alta durante este semestre. 1-6 Importancia_Percibida_Encuesta
Esta asignatura me generó niveles de motivación muy alta durante el semestre. Asignatura 1-6 Motivacion_Percibida_Encuesta
La dedicación a la asignatura fue proporción al rendimiento obtenido. Asignatura 1-6 Dedicacion_Rendimiento_Encuesta
Nivel que cursa actualmente en la carrera (corresponde a la asignatura de nivel mas bajo Nivel
Expresa qué tan de acuerdo o en desacuerdo estás con las siguientes afirmaciones. La carga académica de este semestre es bastante abrumadora. Semestre_Abrumador
Expresa qué tan de acuerdo o en desacuerdo estás con las siguientes afirmaciones. Considero que no tengo suficiente tiempo para completar mis tareas académicas. Tiempo_Insuficiente
Expresa qué tan de acuerdo o en desacuerdo estás con las siguientes afirmaciones. Generalmente me siento estresado/a por las tareas asignadas. Estres_percibido
¿Tiene alguna(s) persona(s) bajo su responsabilidad (cónyugue, familiar, entre otros)? Factor_Responsabilidad
En relación al tiempo de traslado desde y hacia la Universidad, ¿cuánto tiempo invierte diariamente? Factor_Viaje
¿Tuvo, durante el semestre, problemas de salud crónicos o relevantes (incluye condiciones médicas y psicológicas) que haya(n) incidido en el desempeño y tiempo dedicado a las actividades (académicas, personales y laborales)? Factor_Salud
¿Cuál es su principal fuente de financiamiento de sus estudios? Factor_Financiamiento
Tipo establecimiento escolar de egreso Factor_Establecimiento_Escolar

También se hicieron algunos cambios a los nombres de las variables, debido a algunos modificaciones hechas para análisis que más adelantes se explicaran.

Estandarización de la unidad de medida de la carga académica

Uno de los pasos más importantes de esta investigación consiste en estandarizar la unidad de medida de las distintas formas de carga académica (estimada, declarada y percibida). Debido a que las cargas estimada y declarada representan tiempo de dedicación, mientras que la carga percibida corresponde a una escala de opinión, fue necesario definir una unidad común para las tres variables.

Se optó por expresar la carga académica en horas por semana, ya que este formato facilita la interpretación de los resultados y permite comparar directamente las distintas mediciones.

Conversión de créditos SCT-Chile a horas por semana

Cada crédito SCT-Chile representa 27 horas de trabajo durante el semestre. Considerando que la Universidad de Santiago de Chile define una duración de 18 semanas por semestre, la conversión a horas por semana, para cada una de las asignaturas, se realizó mediante la siguiente ecuación:

\[H_s = \frac{C \times 27}{18}\] donde C corresponde a la cantidad de créditos SCT de la asignatura.

Conversión de la carga académica declarada de la encuesta

La carga académica declarada en la encuesta fue registrada como el porcentaje del tiempo total dedicado por el estudiante a cada asignatura. Sin embargo, dicho porcentaje no posee una cantidad absoluta de horas asociada. Tras un análisis se descubrió que dentro de los 47 estudiantes, se encontró que 14 de ellos sobrepasaron los limites. Dentro de estos estudiantes se encontraron dos casos en específicos.

El primero caso, debido al formato de entrega de los porcentajes (Este siendo incrementos de 10%), existe una excepción el primer 10% ya que estos ademas identifica porcentajes menores, se puede notar que un grupo de estos 14 estudiantes sobrepasan los porcentajes por 10% o 20% al 100%, estos casos pueden ser explicados porque el estudiante decidió dedicar un porcentaje inferior al 10% a dos o más asignaturas. Si bien no se sabe los porcentajes en especifico que los estudiantes decidieron dedicarles, Se estimo necesario hacer una interpretación de estos porcentajes y dividir los porcentajes de 10% equitativamente con la finalidad de dejar la suma de porcentaje en 100%.

El segundo caso, a diferencia del primer caso, estos grupos de estudiantes sobrepasan el 100% pero estas no pueden ser explicadas por 10% o menor, estos casos son más delicados o difíciles de resolver, estos es debido a la falta de información sobre cuales son los valores originales pensados por el estudiante, se contemplaron dos opciones, omitir los casos de los estudiantes con este caso o reajustar los valores entregados utilizando normalización. Después de una contemplación se decidió normalizar estos casos, debido a la poca cantidad de datos, ademas de posibles sesgos que resultarían.

Tras solucionar los problemas encontrados sobre los porcentajes, podemos avanzar con el cambio de medición, para ello se utilizo la suma de los créditos SCT de cada una de las asignaturas del estudiante y luego transformarlos en horas necesarias para desarrollarlo por los profesores, y dividirlos por el numero de semanas del semestre(En este caso 18, como lo muestra la ecuación), con esto lograremos tener las horas/semanas para desarrollar todas las actividades de las asignaturas, y ahora podemos aplicar los porcentajes de las horas que fueron declaradas por el estudiante. Así se lograra tener una estimación sobre cuales son las horas/semanas que cada estudiante le dedica a las asignaturas.

Conversión de la carga académica declarada de la bitácora

La base de datos Bitácora posee un formato distinto, por lo que requirió un procedimiento adicional.

Observando los datos obtenidos dentro de cada bitácora de cada estudiante, se puede notar que no todos los estudiantes reportaron las actividades que hicieron, otros reportaron inconsistentemente las actividades, las razones no la sabemos, pero aun así tenemos información útil. Para ello se tomo solo las filas con categorías que tienen relación con las actividades académicas(“tiempo de estudio autónomo” y “asistencia a clases”), y encontrar la asignatura utilizando subcategoria, las cuales las separamos usando estas mismas, esto con el propósito de calcular cuantas semanas el estudiante indico.

Teniendo la cantidad de semanas que el estudiante registro en la bitácora, podemos empezar a calcular las horas/semanas, sumando los registros de 15 minutos asociados a cada una de las asignaturas, estas dividirlas por 60 haciéndolos horas y dividirlas por las semanas registradas. Si bien esta estimación de las horas no es exactamente equivalente a las horas dedicadas a todo el semestre, nos puede dar una muestra o representación de las horas dedicadas por el estudiante durante el transcurso del semestre.

Carga académica percibida

En el caso de la carga académica percibida, no fue posible establecer una transformación objetiva desde la escala Likert hacia una unidad de tiempo como horas por semana.

Por esta razón, para esta investigación se decidió mantener esta variable en su escala Likert original y utilizarla como una medida ordinal de percepción de carga académica.

Tabla Descriptiva

Ya teniendo los datos estandarizados para facilitar el análisis, es posible reorganizar las bases de datos para asociar todos los datos dependientes de las asignaturas con su respectiva asignatura. Para ello, se decidió separar las distintas asignaturas cursadas por cada estudiante en filas independientes, manteniendo el identificador del estudiante (ID), la carrera y todos los valores asociados a dicha asignatura. De esta forma, cada fila representa la relación Estudiante–Asignatura. Para ejemplificar esta transformación, véase la siguiente tabla.

Tabla Descriptiva de ejemplo.
estudiante carrera asignatura Carga_estimada
ID_1 Carrera 1 Asignatura 1 6
ID_1 Carrera 1 Asignatura 2 5
ID_1 Carrera 1 Asignatura 3 4
ID_1 Carrera 1 Asignatura 4 6
ID_2 Carrera 2 Asignatura 1 6
ID_2 Carrera 2 Asignatura 2 5
ID_2 Carrera 2 Asignatura 3 6
ID_3 Carrera 1 Asignatura 1 4
ID_3 Carrera 1 Asignatura 2 5
ID_3 Carrera 1 Asignatura 3 5
ID_3 Carrera 1 Asignatura 4 6
ID_3 Carrera 1 Asignatura 5 6

Con esta estructura es posible desarrollar una tabla descriptiva para cada una de las bases de datos con la finalidad de integrarlas posteriormente en una única tabla de análisis. A continuación, se describen las modificaciones realizadas en cada una de ellas.

Descriptiva estimada

Para la realización de esta tabla no fue necesario modificar su estructura original, ya que esta contiene información propia de las asignaturas y no de los estudiantes. Por ello, no es posible transformarla al formato Estudiante–Asignatura descrito anteriormente.

Sin embargo, esta base de datos será utilizada posteriormente para complementar la información de las demás tablas mediante una unión utilizando como variables comunes la carrera y la asignatura.

Descriptiva Encuesta y Percibida

Para la base de datos de la encuesta se realizó una transformación al formato Estudiante–Asignatura. Para ello, cada asignatura cursada por un estudiante fue convertida en una nueva fila, manteniendo todos los demás datos correspondientes al estudiante.

Como resultado, un mismo estudiante puede aparecer repetido tantas veces como asignaturas haya cursado durante el semestre.

Posteriormente, debido a que este procedimiento genera filas correspondientes a asignaturas inexistentes (valores vacíos), se eliminaron todas aquellas filas que no contenían una asignatura válida.

Dentro de esta misma transformación también se incorporaron los valores correspondientes a la carga académica percibida, ya que estos se encuentran asociados directamente a cada asignatura respondida por el estudiante.

Por ultimo a cada uno de las filas se le agrego los valores personales entregados por el estudiantes como “Establecimiento_Escolar”, aunque estos se repita por todas las asignaturas de los estudiantes.

Descriptiva Bitácora

La construcción de esta tabla es más compleja debido a la estructura de la base de datos. La bitácora registra distintas actividades realizadas por el estudiante, como viajes, alimentación, actividades recreativas y estudio.

Para esta investigación únicamente se utilizaron los registros pertenecientes a las categorías “Tiempo de estudio autónomo” y “Asistencia a clases”, ya que corresponden al tiempo dedicado a las asignaturas. Posteriormente, mediante la subcategoría registrada fue posible identificar la asignatura correspondiente y construir una tabla en formato Estudiante–Asignatura, acumulando el tiempo dedicado a cada una de ellas.

Durante este proceso se identificó un problema importante relacionado con la calidad de los datos. Un número considerable de estudiantes no completó la bitácora o la completó de forma parcial, por lo que esta base de datos contiene una cantidad significativamente menor de observaciones que la encuesta. En particular, existen aproximadamente 65 registros de asignaturas sin información proveniente de la bitácora.

Debido a que esta situación puede introducir un sesgo en los resultados, posteriormente se realizará un análisis para evaluar dicho sesgo.

Descriptiva Notas

Para finalizar la tabla descriptiva de la notas, se realizo la misma acción que en la realización de la tabla descriptiva de la declarada y encuesta, realizar una relación de Estudiante-Asignatura donde una fila es generada por cada asignatura que tiene el estudiante, donde ademas se le agrega las notas finales de las asignaturas. Debido a la relación de ID/Estudiante, no es necesario relacionar las filas Estudiantes-Asignaturas carreras en esta tabla.

Tabla final

Finalmente, se integraron todas las tablas descriptivas en una única base de datos.

para la realización de la tabla, se agrupo utilizando los valores en común, primero se agrego la tabla descriptiva de las notas a la tabla descriptiva de la encuesta y percibida, utilizando ID y la Asignatura las cuales están en común. Luego se asocio a esta tabla, la tabla descriptiva de la bitácora utilizando los valores de ID y Asignatura, si bien no todos las asignaturas de la encuestan tienen una versión con datos respectivos en la bitácora luego se eliminara los datos faltantes. Por ultimo se unió la tabla descriptiva estimada, utilizando los valores en común estos siendo las carreras y las asignaturas, este agregando el valores estimado a cada uno de las asignaturas correspondientes y considerando las carreras que corresponden.

Este procedimiento permitió asociar correctamente la información correspondiente a cada asignatura cursada por cada estudiante, obteniendo una única tabla que contiene todos los datos necesarios para realizar los análisis posteriores de la investigación.

Sesgo

Como se hizo notar en la sección de la tabla descriptiva de la bitácora, surgió el problema de varios datos faltantes. Debido a esto, la base de datos podría presentar una tendencia hacia un tipo de estudiante en particular, en vez de representar a la población en general. Para comprobar esto, se realizarán distintas pruebas estadísticas con la finalidad de determinar si realmente existe un sesgo o no.

Con esa finalidad es necesario colapsar los datos de la tabla completa ordenada estudiante-asignatura, esto se hace debido al formato de esta, al estar estudiante asignatura se podrá observar variadas instancia de un mismo estudiante, la cual si bien hay datos diferentes(Las cargas académicas en general), se incluyen datos que no cambian por asignatura, el cual esto produce una reducción artificial al valor de P

Para ello, se compararon los diferentes resultados de la carga académica declarada con distintas variables que comparten ambas bases de datos.

Comparación

Para la comparación se realizo una tabla que utiliza los valores relacionados al estudiantes recopilados anteriormente dentro de la tabla descriptiva, para ello se decidió hacer un perfil de los estudiantes utilizando el promedio de todos los valores relacionados a la asignatura y estudiante, que no sean la cargas académica estimada y declaradas. En caso de que los valores no varíen se tomo el primer valor de estas filas (Específicamente a los Factores). Por ultimo a esta tabla se le agrego un valor adicional, este valor indica si el estudiante respondió o no la bitácora, estos nos ayuda a separar los grupos de estudiantes y ver los grupos difieren entre ellos.

for (nombre in nombres_sesgo) {
  cat("- ", nombre, "\n")
}
## -  ID 
## -  RespondioBitacora 
## -  Nota_Promedio 
## -  Carga_Percibida_Promedio 
## -  Dificultad_Promedio 
## -  Importancia_Promedio 
## -  Motivacion_Promedio 
## -  Dedicacion_Rendimiento_Promedio 
## -  Carrera 
## -  Nivel 
## -  Semestre_Abrumador 
## -  Tiempo_Insuficiente 
## -  Estres_percibido 
## -  Factor_Salud 
## -  Factor_Responsabilidad 
## -  Factor_Viaje 
## -  Factor_Financiamiento 
## -  Factor_Establecimiento_Escolar

Como no todos los valores que se encuentran dentro de la tabla son la misma forma de medirlos, se necesita utilizar diferentes métodos o herramientas que se especialicen en esos valores, para esto se necesita separa los valores en dos categorías: Valores ordinales y valores categóricas.

valores Categoricos

A continuación se mostrara cuales de los valores de la tabla son considerados categoricos:

variables_categoricas <- c(
  "Carrera",
  "Nivel",
  "Factor_Salud",
  "Factor_Responsabilidad",
  "Factor_Viaje",
  "Factor_Financiamiento",
  "Factor_Establecimiento_Escolar"
)

for (nombre in variables_categoricas) {
  cat("- ", nombre, "\n")
}
## -  Carrera 
## -  Nivel 
## -  Factor_Salud 
## -  Factor_Responsabilidad 
## -  Factor_Viaje 
## -  Factor_Financiamiento 
## -  Factor_Establecimiento_Escolar

Estos elemento contienen valores cualitativos del estudiante, generalmente categorizados. Para el analisis de estos valores se tenían dos herramientas contempladas “Fisher” y “Chi-cuadrado”, las cuales las dos cumplen con la misma función, el encontrar si los grupos tienen diferencias o un sesgo a traves de datos categoricos, pero estas herramientas fueron creadas para distintos grupos de datos en específicos, esto es especialmente para “Chi-cuadrado” la cual funciona mejor con grupos de datos con una gran cantidad de valores, las cuales en esta investigación no tenemos, por otro lado la herramienta de “Fisher” puede trabajar con bases de datos más limitadas los cuales nos ayuda en nuestro caso.

Valores Ordinales

A continuación se mostrara cuales de los valores de la tabla son considerados ordinales:

variables_ordinales <- c(
  "Carga_Percibida_Promedio",
  "Dificultad_Promedio",
  "Importancia_Promedio",
  "Motivacion_Promedio",
  "Dedicacion_Rendimiento_Promedio",
  "Semestre_Abrumador",
  "Tiempo_Insuficiente",
  "Estres_percibido"
)

for (nombre in variables_ordinales) {
  cat("- ", nombre, "\n")
}
## -  Carga_Percibida_Promedio 
## -  Dificultad_Promedio 
## -  Importancia_Promedio 
## -  Motivacion_Promedio 
## -  Dedicacion_Rendimiento_Promedio 
## -  Semestre_Abrumador 
## -  Tiempo_Insuficiente 
## -  Estres_percibido

Estos valores son todos los cuales son numéricas u ordinales como la escala likert. Para el analisis de estos elementos se contemplo usar únicamente Wilcox, la cual responde la misma pregunta que las herramientas categóricas, Si los dos grupos difieren o tienen sesgo, pero a diferencia de esas, esta trabaja con variables numerica o ordinales.

Resultados

Tras haber separado los grupos y mostrar la herramienta la cual utilizar, se realizo la comparación entre los dos grupos, los que respondieron la bitácora y los que no respondieron la bitácora. Para comprobar esto se tiene que revisar los resultados que obtuvimos en cada unos de los diferentes valores, estos resultados estan demostrados con el valor de “P” o “P-value”, el cual nos indica si se encuentra una diferencia entre los grupos, para encontrar indices de que haya diferencia entre los grupos estamos buscando que el valor de “P” o “P-value” sea inferior a 0.05, el cual nos daria una prueba de que se puede encontrar una discrepancia o diferencia entre los dos tipos de grupos. En el siguiente tabla, se mostraran los valores que se evaluaron y sus resultados en “P” o “P-value”.

kable(
  head(resultados_sesgo, n = 18),
  caption = "Resultados Sesgo"
) |>
  kable_styling(
        bootstrap_options = c("striped", "hover", "condensed"),
    full_width = TRUE
  )
Resultados Sesgo
Variable Prueba P_value P_ajustado
Carrera Fisher 0.2389576 0.5387378
Nivel Fisher 0.1049290 0.5387378
Factor_Salud Fisher 0.7154600 0.8943249
Factor_Responsabilidad Fisher 1.0000000 1.0000000
Factor_Viaje Fisher 0.5433746 0.8150618
Factor_Financiamiento Fisher 0.6074039 0.8282781
Factor_Establecimiento_Escolar Fisher 1.0000000 1.0000000
Carga_Percibida_Promedio Wilcoxon 0.1920901 0.5387378
Dificultad_Promedio Wilcoxon 0.8274242 0.9547202
Importancia_Promedio Wilcoxon 0.3678509 0.6130848
Motivacion_Promedio Wilcoxon 0.1529744 0.5387378
Dedicacion_Rendimiento_Promedio Wilcoxon 0.2873268 0.5387378
Semestre_Abrumador Wilcoxon 0.1711308 0.5387378
Tiempo_Insuficiente Wilcoxon 0.2836010 0.5387378
Estres_percibido Wilcoxon 0.2705148 0.5387378

Como se puede notar en la tabla si bien, ninguno de los valores de “P” llegan a ser menor de 0.05, hay algunos que se acercan, como Nivel o Motivación_Percibida. Pero hay que aclarar algo, estos valores “P” son solo correspondiente a única sola prueba específicamente sobre la que se esta estudiando, como por ejemplo facto_viaje no toma en cuenta los otros valores, Por lo que se ajusto los valores de “P” para toamaran en cuenta las demas pruebas, este es llamado el “P-ajustado”, viendo los valores de esta nos queda claro que no tenemos pruebas concluyentes para decir que dentro de los que respondieron la bitácora tengan diferencias sustanciales entre los que no respondieron. Por lo que no podemos decir que se encuentre un sesgo.

Correlaciones

Tras haber revisando si los grupos de estudiantes los cuales respondiero/declararon las horas en la bitacora en contra de los que no, encontrando que no hay pruebas concluyentes de que sean distintos. Continuaremos revisando los grupos de datos, ahora se quiere ver si las distintas cargas las cuales se basan esta investigación, tienen algún tipo de correlación, con eso en mente, vamos a revisar diferentes aspectos entre las cargas académicas para encontrar indices de relaciones entre estas. Para ello se hace el uso de tres algoritmos de correlación “Spearman”, “Pearson” y “Kendall”, las cuales respectivamente revisan la “asociación lineal”, “relación monótona” y la “concordancia” de los valores.

A continuación se mostraran dos gráficos que muestran los resultados de una forma más sencilla de comprender, contienen los mismos resultados que se encontrar en la tabla, con estos resultados se van a trabajar.

Tabla de correlación
Variable_1 Variable_2 Metodo Coeficiente IC_Inferior IC_Superior P_value IC95
Carga estimada SCT Carga declarada encuesta Pearson 0.435 0.2982185 0.5449384 <0.001 [0.298; 0.545]
Carga estimada SCT Carga declarada encuesta Spearman 0.475 0.3479155 0.5785013 <0.001 [0.348; 0.579]
Carga estimada SCT Carga declarada encuesta Kendall 0.376 0.2727816 0.4644992 <0.001 [0.273; 0.464]
Carga estimada SCT Carga declarada bitácora Pearson 0.158 0.0476331 0.2729864 0.0285 [0.048; 0.273]
Carga estimada SCT Carga declarada bitácora Spearman 0.178 0.0412522 0.3116713 0.0135 [0.041; 0.312]
Carga estimada SCT Carga declarada bitácora Kendall 0.136 0.0308061 0.2413785 0.0145 [0.031; 0.241]
Carga estimada SCT Carga percibida Pearson 0.343 0.2154843 0.4682701 <0.001 [0.215; 0.468]
Carga estimada SCT Carga percibida Spearman 0.272 0.1473399 0.4021811 <0.001 [0.147; 0.402]
Carga estimada SCT Carga percibida Kendall 0.235 0.1245729 0.3519496 <0.001 [0.125; 0.352]
Carga declarada encuesta Carga declarada bitácora Pearson 0.404 0.2963764 0.5125828 <0.001 [0.296; 0.513]
Carga declarada encuesta Carga declarada bitácora Spearman 0.418 0.2865092 0.5321678 <0.001 [0.287; 0.532]
Carga declarada encuesta Carga declarada bitácora Kendall 0.294 0.2014685 0.3849540 <0.001 [0.201; 0.385]
Carga declarada encuesta Carga percibida Pearson 0.506 0.4029116 0.6070867 <0.001 [0.403; 0.607]
Carga declarada encuesta Carga percibida Spearman 0.531 0.4312415 0.6332299 <0.001 [0.431; 0.633]
Carga declarada encuesta Carga percibida Kendall 0.422 0.3402808 0.5106522 <0.001 [0.34; 0.511]
Carga declarada bitácora Carga percibida Pearson 0.439 0.3187190 0.5445592 <0.001 [0.319; 0.545]
Carga declarada bitácora Carga percibida Spearman 0.471 0.3177673 0.5960694 <0.001 [0.318; 0.596]
Carga declarada bitácora Carga percibida Kendall 0.367 0.2426666 0.4759212 <0.001 [0.243; 0.476]

Con los resultados de las correlaciones podemos notar unos indices:

Como se puede notar que los valores entregados por los tres metodos nos entregan una asociación positiva moderada, especialmente considerando de que los intervalos estan sobre el cero, esto nos indica que cuando los valores de la carga academica estimada por SCT son mayores se puede enontrar un aumento de las cargas declaradas por los estudiantes.

Por otro lado la relación entre la carga estimada y la declarada por la bitácora es débil, pero aun se puede notar que los umbrales siguen estando sobre el cero, por lo que nos muestra que tienen una relación positiva o una asociación positiva, pero hay que recalcar que es de una magnitud menor.

al igual que “estimada y declarada encuesta”, estos también nos muestran evidencias de que tienen una relación positiva, pero no considerablemente, los que nos muestra que estan en un punto intermedio entre ser considerado moderado y debil.

Similar a los anteriores se encuentran muestras de una relación positiva dentro de los resultados de los métodos, con un nivel moderado entre esas.

Esta es uno de los más altos encontrados entre todas las comparaciones, se puede notar que si hay una relación positivas entre los resultados de los métodos, teniendo una magnitud considerable.

Por ultimo esta correlación se puede notar que hay una relación positiva entre ellos, de una magnitud moderada, parecida a la relación entre la carga declarada de la encuesta y de la bitacora.

Tras revisar cada una de las relaciones de las cargas, se puede notar que las medidas dentro del aspecto del estudiante, estan más relacionadas entre ellas. a la diferencia de la relación más débil que tenemos que seria la de la carga estimada mediante SCT vs la carga declarada por la bitácora. Se puede decir con las evidencias que tenemos, que se encuentra una relación positiva entre los valores pero no de magnitudes considerables.

Descripción de las discrepancias respecto de la carga estimada SCT

Habiendo realizado una revisión de las correlaciones existentes entre las distintas cargas académicas se puede observar que, considerando la importancia de estos resultados, estos son solamente un avance en pos del objetivo principal de esta investigación. Este objetivo corresponde a identificar las discrepancias entre las distintas cargas académicas por medio del análisis de las diferencias entre las cargas académicas estimadas por el SCT-Chile con las cargas académicas declaradas en la bitácora y la encuesta. Para ello, es necesario buscar las diferencias en las comparaciones SCT vs Encuesta y SCT vs Bitácora y calcularlas por medio de la ecuación. \[D_f = Declarada - Estimada\].

La ecuación presentada entrega la diferencia de la carga académica que declaran sentir los estudiantes y la carga académica de acuerdo con el SCT_Chile, donde su valor positivo indicaría un sobre esfuerzo por parte de los estudiantes, en comparación con el estimado. En este proceso, serán las medias, medianas y desviaciones estándares las utilizadas para comprender la naturaleza de estas diferencias.

Tabla de comparaciones
Comparacion Medicion N Media SD Mediana
SCT vs Encuesta SCT 251 5.338645 1.0434848 6.000
SCT vs Encuesta Encuesta 251 8.007968 4.2274186 8.400
SCT vs Encuesta Diferencia 251 2.669323 3.8888186 2.500
SCT vs Bitácora SCT 193 5.373057 0.9819727 6.000
SCT vs Bitácora Bitácora 193 7.348143 5.6301400 5.875
SCT vs Bitácora Diferencia 193 1.975086 5.5604382 0.125

La primera característica que resulta evidente en la tabla es la variación de dimensiones en la comparación de SCT vs Encuesta y SCT vs Bitácora, donde el tamaño de la muestra del primero es 58 puntos mayor que el segundo. Esto se debe a un problema encontrado anteriormente en la base de datos de la bitácora, la cual no posee todos los datos que contiene la encuesta. Con esto en consideración, se decidió mostrar la cantidad de datos trabajado con la finalidad de mostrar y no confundir los valores entregados.

Con este punto aclarado, se puede proceder con la diferencia entre la carga estimada y la carga declarada a través de la Encuesta. Esta comparación cuenta con un tamaño de muestra de 251 filas de Estudiantes-Asignaturas, donde se puede ver que la media o promedio declaradas por los estudiantes es superior en 2.67 horas/semana en comparación con los valores estimados, un valor bastante elevado. La diferencia de la mediana en la misma comparación resulta de 2.50, cercano al mismo valor promedio nombrado, por lo que los datos entregados por los estudiantes se encuentran equilibrados a la media de la diferencia. Finalmente, la desviación estándar muestra que las horas/semana entregadas poseen una alta variabilidad de datos, siendo este valor de 3.89, por lo que se ha de tener en consideración.

Una forma de visualizar los datos que se compararon es con el uso del histograma de las diferencias entre la carga académica estimada mediante SCT con la declarada por la encuesta. La línea roja nos muestra el punto cero del gráfico, representando la separación entre los valores que fueron superiores e inferiores en la encuesta en comparación a la estimación mediante SCT, así como los valores que resultaron equivalentes. Como se puede observar, el histograma muestra una concentración de los datos al lado derecho de la línea roja, mostrando que la mayor parte de los estudiantes en la encuesta muestran un esfuerzo superior al estimado mediante SCT. En el mismo histograma, se pueden encontrar casos donde la diferencia de horas/semana es superior a 10, pero se considerarán datos anómalos. Como apreciaciones finales, se puede ver que la distribución de los datos se enfoca en valores principalmente positivos, con la existencia de valores fuera de la norma en este mismo lado.

Procediendo a la comparación SCT vs Bitácora, la media de la diferencia corresponde al valor 1.98 horas/semana, por lo que se mantiene la misma apreciación que la media anterior, donde los estudiantes declaran más horas de las que se estimaron por el SCT. A pesar de mantener esta apreciación, la mediana de 0.125 horas/semana nos indica que el punto medio de los datos es 7.5 minutos semanales superior a la estimada por SCT, dando una diferencia de 1.885 entre la media y la mediana, por lo que el centro de la distribución se encuentra desplazado en dirección al 0. Viendo ahora la desviación estándar, esta tiene un valor de 5.56, un valor muy superior, por lo que los datos deberían de tener una muy alta distribución. Al ver el histograma, los datos no parecen estar del todo dispersos, pero si se encuentran múltiples observaciones superiores a 10, incluyendo observaciones superiores a 35.

Como ultimas apreciaciones, se puede ver que la discrepancia entre la carga académica declarada por la encuesta y la estimada mediante SCT es consistentemente positiva. Por otro lado, la distribución de la carga académica declarada por la bitácora con la carga académica estimada mediante SCT posee una alta heterogeneidad en los valores positivos de los datos.

Debido a que cada estudiante posee múltiples asignaturas presentes en las distintas bitácoras y encuestas, la evaluación posterior de las diferencias considera esta estructura de medidas repetidas.

Análisis de equivalencia de las formas de medir la carga académica

Como se dio a resaltar anteriormente, debido al formato de la tabla utilizada, se decidió realizar un análisis de Bland-Altman considerando la estructura de medidas repetidas. Este método se utilizó con la finalidad de evaluar la magnitud y variabilidad de las discrepancias entre la carga estimada SCT y las cargas declaradas o registradas por los estudiantes, permitiendo observar si las diferencias entre ambas mediciones se mantienen relativamente constantes o cambian según el nivel de carga académica. Con ello, se analizaron las distintas discrepancias estudiadas, considerando además que un mismo estudiante aporta información correspondiente a múltiples asignaturas.

Resultados del análisis de Bland-Altman y evaluación del sesgo proporcional.
Comparación Sesgo Límite inferior Límite superior β IC 95% inferior IC 95% superior p
Encuesta - SCT 2.669 -4.953 10.291 1.472 1.386 1.559 < 0.001
Bitácora - SCT 1.982 -8.920 12.885 1.764 1.678 1.850 < 0.001

Empezando con la discrepancia entre la carga académica declarada por la encuesta contra la carga académica estimada mediante SCT, se puede observar en la tabla que el sesgo medio fue de 2.67 h/semana, con límites de acuerdo entre −4.95 y 10.29 h/semana, estos resultados nos indican o muestran que se tiene una disperción considerable las diferencias individuales que estan alrededor del sesgo medio. esto se puede observar mejor con el grafico de Bland-Altman

En el grafico representa el valor del sesgo medio a través de la linea azul, con sus limites expresados con la lineas rojas, viendo los valores representados en la gráfica, se puede observar lo visto con solo los valores, esta siendo que se encuentra una dispersión considerable, por otro lado se puede observar que hay un incremento de la discrepancia a medida que aumento la magnitud promedio de las mediciones. Esta tendencia fue evaluada mediante un modelo lineal mixto, incorporando al estudiante como intercepto aleatorio. La pendiente asociada al promedio fue positiva y estadísticamente significativa (β = 1.47; IC 95%: 1.39–1.56; p < 0.001), respaldando la presencia de sesgo proporcional. Estas conclusiones nos muestran que la diferencias dentro de estas cargas académicas no puede ser considerado constante, sino que tiene a incrementar conforme que se aumenta la magnitud de la carga académica.

Pasando a la discrepancia entre la diferencia entre la carga académica declarada por la bitácora en contra de la carga académica estimada mediante SCT. Al igual que al anterior, se puede observar que se estimo un sesgo medio de 1.98 h/semana, con límites de acuerdo entre −8.92 y 12.88 h/semana. Se puede ver que la aplitud que muestra sus limites es superior al de la carga declarada por encuesta, viendo que tiene una dispersión bastante mayor, esto también es complementado lo visto dentro de las distribuciones vistas(Histograma).

Revisando la gráfica de Bland-Altman, se puede ver esta aplitud mencionada anteriormente, ademas se puede notar el modelo lineal mixto hecho, la cual muestra una asociación positiva entre la magnitud promedio de las mediciones y su diferencia (β = 1.76; IC 95%: 1.68–1.85; p < 0.001). Con ello es posible detectar al igual que la encuesta, la bitacora contiene un sesgo proporcional. Estas discrepancias tienden a aumentar a medida qye aumenta la magnitud de la carga registrada, por lo que el sesgo medio no representa una diferencia constante a lo largo de todo el rango de medición.

Como resumen en ambas comparaciones se detectó un sesgo proporcional significativo. La pendiente fue de 1.47 para la encuesta y 1.76 para la bitácora, con intervalos de confianza que no incluyeron cero y valores p inferiores a 0.001. Por tanto, las diferencias respecto de SCT no permanecen constantes: aumentan conforme aumenta la magnitud de la carga académica. Este comportamiento fue más pronunciado en la bitácora.

Análisis de la concordancia entre las formas de medir la carga académica

Tras analizar la magnitud y la variabilidad de las discrepancias entre las cargas académicas, se quiere explorar otro aspecto de estas, se quiere revisar el grado de correspondencia entre la carga estimada mediante SCT, y las cargas declarada en las bitácora y encuesta. Es importante aclarar que a diferencia de los coeficientes de correlación los cuales evalúan principalmente si dos variables varia conjuntamente, el coeficiente de Lin considera además que tan próximos se encuentran estos valores respecto a una concordancia perfecta. En esta investigación, la carga estimada mediante SCT no se considera un estándar de oro, debido al origen de este, una estimación o referencia la cual se usa para evaluar el grado correspondiente a las cargas reportadas individualmente.

Concordancia de lim
comparación concordancia IC95 Cb
Estimada SCT vs Encuesta 0.147 0.106 - 0.187 0.338
Estimada SCT vs Bitácora 0.048 0.005 - 0.090 0.302

Viendo los resultados de la concordancia, se puede observar que la comparación de la carga académica estimada mediante SCT y la carga académica declara por la encuesta, se conseguio un coeficiente de concordancia de lin de pc = 0.147, con un intervalo de confianza del 95% entre el 0.106 y 0.187. Este valor encontrado, se puede observar que esta alejado de una concordancia perfecta de 1, esto demuestra que contienen una baja concordancia entra ellas. Asimismo, el intervalo de confianza se mantiene dentro de valores bajos, nos muestra que se mantiene esta tendencia encontrada aun considerando su incertidumbre.

Por otro lado, el factor de corrección por sesgo fue de Cb = 0,338. Como este tambien esta se encuentra alejado del valor 1, muestra que no solo es baja la concordancia por la asociación entre ambas variables, sino que tambien en la diferencia de localización y escala de los valores.

Lo explicado anterior es posible ser observado graficamente, en vez de existir una concordancia elevada, las observaciones deberia estar proximas la linea de identidad, la cual representa donde los valores de la carga academica estimada mediante SCT y la carga academia declarada mediante la encuesta tomarian valores similares o identicos. Sin embargo, los puntos observables muestran una disperción considerable respecto a la linea anteriormente mencionada. Es posible ver que para similares a la carga estimada mediante SCT, se encuentran diferentes cantidades h/semana declaradas por los estudiantes, mostando que una misma carga estimada no necesariamente corresponde a la misma carga declaradas.

Por otro lado, hablando de la comparación sobre la carga académica estimada mediante SCT y la carga académica declarada mediante la bitacora se obtubo un coeficiente de concordancia de Lin de ρc = 0,048, con un intervalo de confianza del 95 % entre 0,005 y 0,090. Estos resultados muestran una concordancia muy baja entre la variables, siento hasta inferior a la observada con la comparación de la encuesta, esto es apoyado bastante con los intervalos, los cuales están considerablemente próximos al cero.

Viendo el factor de corrección por sesgo alcanzo un valor de Cb = 0,302, que a lo mismo sucedido en la comparación con la encuesta, es considerablemente alejado del 1. Por lo que se puede ver que los valores registrados mediante la bitacora presentan una diferencia importantes respecto a la correspondencia perfecta que busca lin.

Viendo la gráfica de esta comparación, se puede observar que los valores muestra una dispersión aun mayor de los registro de la bitacora al respecto de la linea de identidad. En otras palabras para valores similares de la carga academica estimada mediante SCT se presenta registros considerablemente diferentes entre estudiantes y asignaturas. Esta variabilidad se aprecia particularmente en algunas observaciones que registran una cantidad de horas muy superior a la carga nominal correspondiente.

Comparándolos los dos resultados, se pueden ver que ambas comparaciones presentan una concordancia baja respecto a la carga academica estimada mediante SCT. No obstante, fue aun menor para los registros de la bitácoras (pc = 0,147). Estos resultados muestran que, aunque la carga estiamda mediante SCT establece una referencia nominal para las asignaturas, las horas declaradas por los estudiantes no necesariamente presentas valores similares a esta dicha referencia. Por otro lado la dispersión observada dentro de los graficos evidencia ademas que las cargas estimadas similares pueden estar a asociadas con cantidades diferentes de las horas declaradas por ambas cargas declaradas.

Este resultado complementa el análisis de correlación realizado previamente, ya que la existencia de asociaciones positivas entre las variables no implica necesariamente concordancia entre sus valores. De esta manera, las cargas pueden presentar cierta relación en su comportamiento y, simultáneamente, mostrar una baja correspondencia en magnitud respecto de la carga nominal SCT.

Análisis de factores asociados a las discrepancias

Ya conociendo la diferencia, magnitud, correlación y concordancia de las diferencias entre la carga académica estimada mediante SCT y las cargas declaradas por la encuesta y la bitácora, podemos empezar a ver cuales de los factores estan asociados a la discrepancia. Para ese objetivo se hara uso de los modelos lineales Mixto, debido a que este tipo de modelos responde a la estructura de los datos, esto es debido a que cada estudiante presenta multiples observaciones relacionadas a cada una de sus distintas asignaturas. Por eso es necesario ver estas observaciones no pueden ser consideradas completamente independientes. Para este fin se introducir los estudiante y la asignaturas como variables aleatorias, permitiendo estimar su variabilidad atribuible, mientras que características personales, academicas y de percepcion fueron incorporadas como efectos fijos.

Para ese objetivo, se crearon tres especificaciones a las discrepancias: primero, un modelo personal, compuesto principalmente por variables de percepción del estudiante, segundo un modelo académico que incorpora adicionalmente variables relacionadas al ambito universitario tales como nota, carrera y nivel; tercero, un modelo completo el cual añadio factores personales y contextuales. Es necesario alcarar que estos modetos fueron estimados mediante máxima verosimilitud(REML = FALSE) para permitir su comparación median AIC y pruebas de razón de verosimilitud.

##     Discrepancia    Modelo     AIC    BIC  LogLik P_value
## 1 Encuesta - SCT  Personal  970.98 1009.6 -473.49      NA
## 2 Encuesta - SCT Académico  980.90 1048.5 -469.45  0.5261
## 3 Encuesta - SCT  Completo  994.77 1094.6 -466.39  0.8044
## 4 Bitácora - SCT  Personal 1118.80 1157.5 -547.43      NA
## 5 Bitácora - SCT Académico 1122.30 1189.9 -540.13  0.1027
## 6 Bitácora - SCT  Completo 1128.00 1227.8 -532.99  0.1606

Teniendo los resultados mostrado en la tabla de comparación, primero nos enfocaremos en analizar los datos relacionados a la discrepancia entre la carga estimada y la declarada por la encuesta. Viendo los modelos que utilizaron la encuesta, se puede notar que entre los 3 modelos, los valores encontrados del modelo personal de AIC (970,98) y BIC (1009,6), son los menores. Esto se puede interpretar que la incorporación de las variables academicas y factores personales del estudiante no mejoran estadisticamente en comparación del modelo personal, esto tambien es apoyado por el valor P = 0.5261 y P = 0.8044, de los modelos academicos y completo respectivamente. Con ello considerando conjuntamente la calidad de ajuste y la parsimonia, se decidio selecionar el modelo personal para la interpretación principal.

Por otro lado, viendo los valores relacionados a la discrepancia entre la carga académica estimada mediante SCT y la carga academica declarada mediante la bitacora, se puede notar que tienen un resultado similar encontrado en la comparación de la encuesta. Se tiene que los valores menores de AIC (1118.80) y BIC (1157.5) pertenecen al modelo personal del estudiante, por lo que los valores incorporados en los modelos academico y completo no mejoran estaditicamente, esto tambien lo prueba los resultados de P respectivamente (0.1027 para academico y 0.1606 para el completo). Por lo que, considerando conjuntamente la calidad de ajuste y la parsimonia, se decidio elegir el modelo personal.

Efectos fijos del modelo Personal para la discrepancia Encuesta-SCT.
Variable β EE IC 95% p
Carga_Percibida_Encuesta 0.715 0.231 [0.262; 1.168] 0.002
Semestre_Abrumador -0.073 0.410 [-0.877; 0.732] 0.859
Tiempo_Insuficiente -0.202 0.240 [-0.673; 0.269] 0.402
Estres_percibido -0.333 0.244 [-0.811; 0.146] 0.174
Dificultad_Percibida_Encuesta 0.455 0.234 [-0.004; 0.915] 0.054
Importancia_Percibida_Encuesta 0.471 0.230 [0.02; 0.921] 0.042
Motivacion_Percibida_Encuesta 0.357 0.213 [-0.061; 0.775] 0.096
Dedicacion_Rendimiento_Encuesta -0.255 0.203 [-0.654; 0.143] 0.211

ya teniendo los modelos a utilizar para cada una de las diferencias, empecemos primero por la de la encuesta. Con los resultados encontrados en la tabla, se puede notar que la “carga percibida” presento una asociación positiva y estadisticamente significatova con la discrepancia(β = 0,715; IC 95%: 0,262–1,168; p = 0,002). Esto valores nos indica que, manteniendo constante los demás variables, cuando más sea los valores de la carga academica percibida se asociara a una mayor diferencia entre las cargas estimadas mediante SCT y declarada por la encuesta.

Por otro lado es importante destacar que si bien no al mismo nivel la “Importancia” presento tambien una asociación positiva con la diferencia (β = 0,471; IC 95%: 0,020–0,921; p = 0,042). Por su parte, la dificultad percibida presentó un resultado cercano al umbral convencional de significación (β = 0,455; p = 0,054), aunque su intervalo de confianza incluyó el cero, por lo que no se consideró evidencia concluyente de asociación.

Efectos fijos del modelo Personal para la discrepancia Bitácora-SCT.
Variable β EE IC 95% p
Carga_Percibida_Encuesta 0.676 0.345 [0.001; 1.352] 0.051
Semestre_Abrumador -1.176 0.605 [-2.362; 0.009] 0.053
Tiempo_Insuficiente 0.756 0.352 [0.066; 1.446] 0.033
Estres_percibido 0.694 0.363 [-0.017; 1.406] 0.057
Dificultad_Percibida_Encuesta 0.338 0.359 [-0.365; 1.042] 0.347
Importancia_Percibida_Encuesta 0.188 0.339 [-0.476; 0.852] 0.579
Motivacion_Percibida_Encuesta 0.615 0.317 [-0.007; 1.237] 0.054
Dedicacion_Rendimiento_Encuesta -0.021 0.298 [-0.604; 0.562] 0.944

Por su otro lado, los valores de las variables del modelo personal, muestran que la unica variable que se presento ona asociación estadisticamente significante fue “Tiempo Insuficiente” (β = 0,756; IC 95%: 0,066–1,446; p = 0,033). Viendo el coeficiente positivo nos indica que a mayores sean los valores de esta variable se asocian con una mayor discrepancia entre la cargas estimada mediante SCT y la carga declarada por la bitacora.

Otras variables, como carga percibida (p = 0,051), semestre abrumador (p = 0,053), estrés percibido (p = 0,057) y motivación (p = 0,054), presentaron resultados próximos al umbral de 0,05, pero no alcanzaron el criterio de significación establecido. Por ello, pueden describirse como indicios que requieren cautela y no como asociaciones estadísticamente confirmadas.

##     Discrepancia      Grupo Varianza    SD   ICC
## 1 Encuesta - SCT         ID    0.000 0.000 0.000
## 2 Encuesta - SCT Asignatura    1.278 1.130 0.126
## 3 Encuesta - SCT   Residual    8.891 2.982    NA
## 4 Bitácora - SCT         ID    0.000 0.000 0.000
## 5 Bitácora - SCT Asignatura    6.166 2.483 0.251
## 6 Bitácora - SCT   Residual   18.391 4.288    NA

Por ultimo respecto a los valores aleatorios, la varianza atribuible al estudiante fue estimada en cero, en ambos diferencias, mientras que la asignatura dentro de los modelos, presento una varianza de 1.278 y un ICC de 0,126 al respecto de la encuesta, y en el caso de la bitacora se presento una varianza de 6,166 y un ICC = 0,251. Por lo que indica un 12,6% y 25,1% de la variabilidad de las discrepancias respectivamente, se encuentran asociadas a la diferencias entre asignaturas.En contraste, no se detectó variabilidad adicional atribuible al estudiante para ambos modelos, mediante el intercepto aleatorio una vez considerados los efectos incluidos en el modelo.

En conjunto, los modelos mixtos muestran diferencias en los factores asociados a las dos formas de discrepancia. Para la encuesta, la “carga percibida” y la “importancia percibida” de la asignatura presentaron asociaciones significativas con la diferencia respecto de SCT, mientras que para la bitácora la asociación significativa se observó en la percepción de “tiempo insuficiente”. En ambos casos, los modelos de mayor complejidad no presentaron mejoras significativas suficientes para justificar su selección frente al modelo Personal.

Por otra parte, los componentes de varianza muestran que la asignatura concentra una proporción de la variabilidad de las discrepancias, alcanzando aproximadamente un 12,6 % para encuesta y un 25,1 % para bitácora, mientras que el componente aleatorio correspondiente al estudiante fue estimado en cero en ambos modelos. En consecuencia, los resultados sugieren que las discrepancias no se encuentran únicamente relacionadas con características perceptuales, sino que también presentan una estructura asociada a las asignaturas, particularmente en los registros de bitácora.

Recorda hacer un aparte para el modelo completo.

Predicción de las discrepancias respecto de la carga académica estimada mediante SCT

Tras haber analizado cuáles son los factores que pueden estar asociados a la discrepancia, encontrando que los factores de “carga percibida” e “importancia percibida” para la encuesta y “tiempo insuficiente” en el caso de la bitácora se asocian a esta discrepancia, se procede a revisar si las características y factores disponibles permiten anticipar las discrepancias observadas respecto a la carga académica estimada mediante SCT. Para ello, se desarrollaron modelos predictivos de forma independiente para las discrepancias obtenidas mediante encuesta y bitácora.

para el desarrollo de los modelos predictivos se utilizaron de manera independientes los valores de la discrepancias Encuesta–SCT y Bitácora–SCT como variables objetivo. Por el otro lado se incorporaron como las variables predictores las caracteristicas academicas, personales y de percepción disponibles, es de importancia aclarar que los valores que no se agregaron, los cuales son los que se utilizaron la para la creación de estas diferencia, esto es para evitar que los modelos utilizaran información derivadamente directa a las variables que se quieren predecir.

Para evaluar la capacidad de generalización de los modelos se utilizó validación cruzada de 10 particiones, estas agrupaciones fueron hechas mediante el uso del identificador del estudiante, debido a la naturaleza de la tabla que se utiliza, la cual las son agrupaciones del tipo estudiante-asignatura. De esta manera, las observaciones pertenecientes a un estudiante se mantienen dentro de una misma partición, evitando que información de un mismo individuo se encuentre simultáneamente en los datos utilizados para entrenamiento y validación.

Previo al entrenamiento, se eliminaron las observaciones que presentaban datos faltantes en las variables utilizadas por los modelos. Asimismo, se eliminaron los predictores con varianza nula o cercana a cero. Para aquellos algoritmos sensibles a la escala de las variables se aplicaron adicionalmente procedimientos de centrado y escalado.

Sobre las mismas particiones de validación se entrenaron distintos algoritmos de regresión, incluyendo modelos lineales, métodos de regularización, métodos basados en componentes, vecinos cercanos, máquinas de vectores de soporte, árboles y ensambles, entre otros. El uso de las mismas particiones para los diferentes algoritmos permitió realizar su comparación bajo condiciones equivalentes.

A partir del RMSE obtenido por el baseline se calculó además la mejora porcentual de cada algoritmo, considerando la reducción del error respecto de esta referencia. Valores positivos indican una reducción del error respecto del baseline, mientras que valores negativos indican un desempeño inferior a la predicción de referencia.

Adicionalmente, se estableció un modelo baseline como referencia del desempeño predictivo. Este modelo realiza las predicciones utilizando la media calculada exclusivamente a partir de las observaciones de entrenamiento de cada partición. De esta manera, el desempeño de los algoritmos puede ser comparado con una estrategia predictiva básica que no utiliza las características disponibles de los estudiantes o asignaturas.

Para comparar los modelos predictivos se estableció como criterio principal el error cuadrático medio (RMSE), debido a que permite cuantificar la magnitud del error de predicción en las mismas unidades de la discrepancia estudiada, penalizando en mayor medida los errores de mayor magnitud. Como segundo criterio se utilizó el R² basado en la suma de cuadrados residual, el cual permite evaluar la mejora de las predicciones respecto de utilizar la media como referencia. Finalmente, se consideró el error absoluto medio (MAE) como una métrica complementaria, permitiendo observar la magnitud promedio del error sin penalizar de forma cuadrática las desviaciones mayores.

La selección del modelo se realizó utilizando el menor RMSE promedio como criterio principal. El R² y el MAE fueron utilizados como medidas complementarias para caracterizar el desempeño de los modelos, manteniendo así un mismo criterio de selección para las discrepancias de encuesta y bitácora.