Introducción

En qué consiste el taller

Este trabajo aplica la Teoría Clásica de los Tests (TCT) al análisis de los ítems dicotómicos (respuesta correcta / incorrecta) de la prueba de Lectura de PISA 2022, tomando únicamente a los estudiantes colombianos. El objetivo no es solo calcular índices, sino decidir y justificar cada paso: cómo se identifica y filtra la información, cómo se tratan los datos faltantes, qué mide cada índice y qué límites tiene la interpretación.

El análisis se organiza en seis bloques:

  1. Construcción de la base: pasar de los microdatos originales a una o varias matrices de respuestas 0/1 aptas para el análisis clásico.
  2. Índice de dificultad: qué tan fácil o difícil resultó cada ítem.
  3. Índices de discriminación: qué tan bien separa cada ítem a los estudiantes de mayor y menor habilidad.
  4. Confiabilidad: qué tan consistente es la medición del conjunto de ítems.
  5. Puntuaciones verdaderas e intervalos de confianza: cómo expresar la incertidumbre de la medición de cada persona.
  6. Depuración y síntesis: qué ítems conviene conservar y qué diría un informe técnico.

Los datos

Se parte de dos archivos públicos del Cognitive item data file de PISA 2022:

Archivo Contenido
CY08MSP_STU_COG.SAS7BDAT microdatos: 613 744 estudiantes, ~5 000 variables
CY08MSP_STU_COG.FORMAT.SAS diccionario: nombres de formato y etiquetas de valor

El diseño adaptativo de la prueba

En 2022 la prueba de lectura se aplicó con un diseño adaptativo multietapa: parte del material se asignó según el desempeño previo del estudiante, y las formas rotan bloques de ítems entre estudiantes. Como consecuencia, cada estudiante respondió solo una fracción de los ítems, y la proporción de aciertos de un ítem describe al grupo que efectivamente lo respondió, no a la población colombiana. Los índices que siguen deben leerse en esos términos.

Decisiones de codificación

Se adoptan, y se justifican en cada problema, los siguientes criterios:

  • No administrado (el diseño de formas no incluyó el ítem para ese estudiante) \(\Rightarrow\) NA.
  • Respuesta inválida o ítem presentado sin responder \(\Rightarrow\) 0 (hubo oportunidad de responder).
  • No alcanzado (el estudiante no llegó al ítem) \(\Rightarrow\) criterio explícito; por defecto 0. El bloque 2.3 contrasta este criterio con la alternativa de tratarlo como NA.
  • El análisis se realiza sin ponderación por el diseño muestral complejo, tal como indica el enunciado.

Reproducibilidad

El documento se compila con R Markdown a partir de los archivos originales. Por el tamaño del archivo de microdatos (16 GB), la primera ejecución localiza y extrae el bloque colombiano y lo guarda en col_cog.rds; las compilaciones siguientes reutilizan ese archivo. El código completo está en el .Rmd; en el cuerpo del documento se muestran solo los fragmentos que ilustran una decisión.

Construcción de la base de análisis

Diccionario de ítems

Por qué. El archivo de formatos tiene dos partes: (a) un bloque de definiciones value, donde cada formato lista sus pares código–etiqueta; y (b) una sentencia format, que asigna un formato a cada variable. Los formatos se reutilizan: un mismo bloque de etiquetas sirve a cientos de variables, y el nombre del formato no identifica a la variable. Por eso el tipo de un ítem (dicotómico o politómico) no puede leerse del nombre: hay que cruzar ambas partes y mirar las etiquetas.

fmt_obj  <- parse_sas_formats(fmt_path)
dict     <- build_item_dictionary(fmt_obj)
n_defs   <- length(fmt_obj$defs)      # definiciones de formato
n_assign <- nrow(fmt_obj$assign)      # variables con formato asignado
Las dos partes del archivo de formatos.
Concepto Valor
Definiciones de formato (value) 144
Variables con formato asignado (format) 5019
Variables por formato (promedio) 35

El archivo declara 144 formatos y los asigna a 5 019 variables: en promedio, 35 variables comparten cada formato. La clasificación dicotómico / politómico se hace entonces revisando las etiquetas de valor: si aparece “Partial credit” el ítem es politómico; si solo hay “No credit” y “Full credit” (o “Incorrect” y “Correct”), es dicotómico, sin importar cuántos códigos numéricos use.

Tratamiento de los datos faltantes

Por qué. El enunciado advierte que confundir las categorías de faltante es el error más común. PISA distingue cuatro: Not Reached, Not Applicable, Invalid y No Response. Antes de recodificar hay que verificar cómo llegan al leer el archivo, porque de esa distinción depende el análisis de sensibilidad del bloque 2.3.

Doble codificación de los faltantes (formato del primer ítem de lectura).
Categoría Código numérico Missing SAS
Not Reached 6 .R
Not Applicable 7 .N
Invalid 8 .I
No Response 9 .M

Cada categoría se declara dos veces en el formato: con un código numérico (cuyo ancho varía entre formatos: 6/7/8/9, 96/97/98/99, 9996/9997/...) y con un valor especial de SAS (.R, .N, .I, .M). Al leer el archivo con haven, los faltantes llegan como NA con etiqueta (tagged NA): la función haven::na_tag() recupera la letra (r, n, i, m), de modo que las cuatro categorías sí son distinguibles. Por eso recode_item() decide el valor 0/1/NA de cada celda según esa etiqueta. Se observa además que, en el extracto colombiano, la mayor parte de las celdas vacías son NA sin etiqueta: corresponden a ítems que la forma del estudiante no incluyó, es decir, Not Applicable, que se tratan como NA.

Ítems dicotómicos y politómicos por dominio

Por qué. El enunciado pide comparar la composición de lectura con la de matemáticas y ciencias, y comentar si el resultado es el esperado.

Ítems puntuados definidos en el diccionario de formatos, por dominio.
Dominio Dicotómicos Politómicos Total % dicotómicos
Lectura 239 7 246 97.2
Matemáticas 153 45 198 77.3
Ciencias 87 5 92 94.6

El Cuadro 4 cuenta todos los ítems puntuados que el diccionario de formatos define en cada dominio, no solo los que se administraron en 2022. Con ese criterio, Lectura es el dominio con más ítems dicotómicos en términos absolutos (239) y con la mayor proporción de ellos (97 %). El resultado es el esperado: las tareas de lectura de PISA 2022 se apoyan en respuesta seleccionada y en juicios binarios (verdadero/falso, “¿la afirmación se sustenta en el texto?”), mientras que matemáticas concentra los ítems de construcción con crédito parcial (un procedimiento puede estar a medias); el orden entre dominios se mantiene si en vez del diccionario se cuentan los ítems con datos. De esas 239 variables de lectura, 191 tienen columna de respuesta en el archivo cognitivo de 2022 (126 de unidades ordinarias y 65 de fluidez): son la base del resto del análisis.

Estructura de unidades: la tarea de fluidez lectora

Por qué. Los ítems de lectura se agrupan en unidades (los tres dígitos centrales del nombre): comparten un mismo estímulo. El enunciado anticipa que aparecerá una unidad con un número de ítems muy superior al resto y pide decidir cómo tratarla.

Número de ítems dicotómicos por unidad de lectura. Una unidad se separa por completo del resto.

Número de ítems dicotómicos por unidad de lectura. Una unidad se separa por completo del resto.

La unidad 590 reúne 65 ítems, frente a un máximo de 6 en cualquier otra unidad (mediana de 4). La etiqueta de sus variables es “Reading Fluency – Scored Response” y sus respuestas crudas son “Yes” / “No”: se trata de la tarea de fluidez lectora, en la que el estudiante juzga con rapidez, para unas 65 oraciones breves y sobre un mismo material, si cada una tiene sentido.

Decisión. No son 65 preguntas independientes, sino una sola tarea dividida en indicadores binarios. Comparten estímulo y límite de tiempo, de modo que el supuesto de independencia local (que la respuesta a un ítem no dependa de las demás una vez fijada la habilidad) no se cumple. Por eso la unidad 590 se analiza como una matriz aparte (M_anom), y el resto de unidades se agrupa en M_ord. Se trabajan en paralelo para poder contrastar sus resultados de confiabilidad.

La muestra colombiana

Composición de la muestra colombiana.
Indicador Valor
Estudiantes colombianos en el archivo 7 804
Estudiantes que recibieron lectura 3 033
Modo de aplicación Computador (100 %)
Diseño de lectura: Not used / Diseño A / Diseño B 4768 / 2243 / 793
Ítems ordinarios respondidos por estudiante (mediana) 23
Distribución de los estudiantes colombianos por forma (BOOKID), ordenadas de mayor a menor. El diseño reparte la muestra en decenas de formas de tamaño parecido.

Distribución de los estudiantes colombianos por forma (BOOKID), ordenadas de mayor a menor. El diseño reparte la muestra en decenas de formas de tamaño parecido.

De 7 804 estudiantes colombianos, 3 033 recibieron material de lectura; el resto recibió otros dominios como material adaptativo. La aplicación fue enteramente por computador (ADMINMODE = 2). Los estudiantes se reparten entre 66 formas (BOOKID): 34 principales, de tamaño parecido (unos 200–240 estudiantes cada una), más una cola de formas de tendencia con muy pocos estudiantes (véase la Figura 2). Ninguna forma concentra una fracción apreciable de la muestra. Bajo el diseño adaptativo (Diseños A y B, que se diferencian en el orden de las etapas), cada estudiante respondió una mediana de 23 ítems ordinarios de lectura de los 126 disponibles: la forma y la ruta adaptativa determinan qué bloque recibe. RDESIGN marca a 3036 estudiantes con Diseño A o B; los 3 que no entran en el análisis tienen la marca de diseño pero ninguna respuesta de lectura válida, y el filtro por “al menos un ítem respondido” los descarta.

Matrices de trabajo

Matrices de trabajo resultantes.
Matriz Ítems Estudiantes efectivos % celdas no administradas % faltante residual
M_ord — unidades ordinarias 126 3008 79.9 0
M_anom — fluidez, unidad completa 64 2360 67.7 0
M_fl — fluidez, submuestra completa 21 188 0.0 0

M_ord reúne los 126 ítems ordinarios sobre los 3008 estudiantes que respondieron al menos uno (tras retirar 25 con puntaje nulo o perfecto sobre lo que respondieron, que producen correlaciones indefinidas). El 80 % de celdas vacías de M_ord corresponde a ítems que la forma del estudiante no incluyó: está vacío por diseño, no por omisión. Bajo el criterio de codificación adoptado (no alcanzadas, no respondidas e inválidas \(\Rightarrow\) 0), la única fuente posible de NA es “ítem no administrado”, de modo que el porcentaje de faltantes residual es nulo en las tres matrices.

M_anom es la unidad de fluidez completa, la matriz de análisis que resulta de la decisión del Problema 1.4: 64 de los 65 ítems dicotómicos de fluidez (uno resultó constante en la submuestra colombiana —lo aciertan todos— y limpiar_matriz() lo retira). Pero la fluidez también se rota entre formas: esos ítems se reparten en decenas de patrones de administración, de modo que M_anom conserva un 67.7 % de celdas no administradas y ningún par de ítems tiene covarianza estimable sobre una submuestra grande. Para los índices de escala (bloque 4) y las puntuaciones verdaderas (bloque 5), que exigen una matriz rectangular y completa, se usa M_fl: el mayor grupo de estudiantes (188) que respondió exactamente el mismo subconjunto de 21 ítems de fluidez. Los índices por ítem (bloques 2 y 3) no necesitan ese recorte: se calculan sobre los estudiantes que respondieron cada ítem y son directamente interpretables.

Índice de dificultad

Qué mide. El índice de dificultad \(p_j\) es la proporción de aciertos del ítem \(j\). A pesar del nombre, valores altos indican ítems fáciles. Su varianza es máxima en \(p = 0.5\) y casi nula en los extremos, lo que tiene consecuencias en la discriminación (bloque 3) y en el error de medida.

Distribución del índice de dificultad de los 126 ítems ordinarios de lectura. Líneas: límites del rango convencionalmente informativo [0.20, 0.80].

Distribución del índice de dificultad de los 126 ítems ordinarios de lectura. Líneas: límites del rango convencionalmente informativo [0.20, 0.80].

Descriptivos del índice de dificultad (M_ord).
Estadístico Valor
Media 0.476
Desv. típica 0.181
Percentil 5 0.158
Cuartil 1 0.356
Mediana 0.480
Cuartil 3 0.623
Percentil 95 0.734

Cobertura del continuo y extremos

La dificultad media es \(p = 0.48\) (desviación típica 0.18), con mediana 0.48 y cuartiles 0.36 y 0.62. El continuo está bien cubierto en la zona central, que es donde la prueba distingue mejor a los estudiantes.

Ítems en los extremos de la escala de dificultad.
Indicador Valor
Ítems fuera de [0.20, 0.80] 14
— demasiado difíciles (p < 0.20) 12
— demasiado fáciles (p > 0.80) 2
Proporción fuera del rango 11.1 %

Solo el 11 % de los ítems queda fuera del rango \([0.20, 0.80]\): 12 demasiado difíciles y 2 demasiado fáciles. Un ítem con dificultad extrema es respondido casi igual por todos, así que aporta poca información sobre las diferencias individuales. En los extremos de la escala de habilidad esto se traduce en mayor error de medida relativo: la prueba mide con menos precisión a los estudiantes muy por encima o muy por debajo del nivel medio de los ítems.

Sensibilidad al tratamiento de las respuestas no alcanzadas

Por qué. Una respuesta Not Reached puede tratarse como incorrecta (el estudiante no la contestó) o como faltante (no tuvo oportunidad real). La elección modifica la dificultad estimada; interesa cuantificar cuánto y en qué ítems.

Diferencia en la dificultad estimada según el tratamiento de las respuestas no alcanzadas, frente a la posición del ítem dentro del bloque.

Diferencia en la dificultad estimada según el tratamiento de las respuestas no alcanzadas, frente a la posición del ítem dentro del bloque.

Efecto del tratamiento de las respuestas no alcanzadas.
Indicador Valor
Discrepancia media entre criterios 0.057
Discrepancia máxima 0.208
Correlación con la posición en el bloque 0.220

La discrepancia media es de solo 0.06 puntos de proporción, con un máximo de 0.21. Tratar las no alcanzadas como incorrectas reduce la dificultad estimada (hace ver el ítem más difícil). El efecto no es uniforme: correlaciona +0.22 con la posición del ítem dentro del bloque, es decir, se concentra en los ítems del final, que es donde se acumulan las respuestas no alcanzadas. El patrón coincide con lo que cabe esperar de un mecanismo de fatiga o de falta de tiempo. Como las cuatro categorías de faltante resultaron distinguibles, no fue necesario recurrir a la posición como aproximación; aquí la posición sirve solo para validar el patrón.

Discusión: nombre del índice y dependencia de la muestra

  • El índice se llama “de dificultad” por tradición, pero operacionalmente mide facilidad: es la proporción de aciertos, de modo que valores altos señalan ítems fáciles. Para hablar de dificultad en sentido literal habría que usar \(1 - p_j\).
  • \(p_j\) depende de la muestra porque es un promedio de respuestas de las personas que contestaron el ítem. Si esa muestra tiene un nivel de lectura alto, el mismo ítem exhibirá un \(p_j\) mayor. No es un parámetro fijo del ítem, a diferencia del parámetro de dificultad de los modelos de respuesta al ítem, que —bajo un modelo ajustado— es invariante frente a la distribución de habilidad. En este trabajo, además, el diseño adaptativo asignó parte del material según el desempeño previo, así que \(p_j\) describe el comportamiento del ítem en el grupo que efectivamente lo respondió.

Índices de discriminación

Qué miden. La discriminación indica si el ítem separa a quienes tienen más habilidad de quienes tienen menos. Se calculan tres medidas.

Índice D por grupos extremos

Por qué el 27 %. Se comparan la proporción de aciertos del 27 % con mayor puntaje total y la del 27 % con menor. Ese punto de corte (regla de Kelley) maximiza la razón entre la separación esperada de los dos grupos y su error estándar bajo normalidad del puntaje total: equilibra el contraste (que pediría grupos pequeños y muy extremos) con la estabilidad (que pediría grupos grandes).

Correlación punto-biserial y correlación biserial

Corrección por el propio ítem. La punto-biserial correlaciona el ítem con el puntaje total. Si ese total incluye el ítem, este correlaciona en parte consigo mismo y la discriminación queda inflada; el sesgo es mayor cuando hay pocos ítems. Por eso se usa la versión corregida: el ítem contra el puntaje total menos ese ítem. Es la misma que CTT::itemAnalysis() reporta por defecto en la columna pBis. La verificación en el bloque completo de fluidez (donde itemAnalysis() puede correr, al no tener faltantes) confirma que la función propia coincide:

## dif_max_pBis     alfa_CTT 
##        0.000        0.663
Resumen de los índices de discriminación (M_ord).
Estadístico Valor
Punto-biserial corregida: media 0.329
— mediana 0.333
— mínimo 0.028
— máximo 0.544
Ítems con punto-biserial < 0 0.000
Ítems entre 0 y 0.20 10.000
Índice D: media 0.492
Correlación entre D y punto-biserial 0.830

La punto-biserial corregida promedia 0.33 (mediana 0.33), ninguna es negativa y diez ítems quedan por debajo de 0.20. Los dos índices de discriminación —\(D\) y punto-biserial— coinciden fuertemente (correlación 0.83), lo que respalda usar cualquiera de los dos.

Relación entre dificultad y discriminación

Relación entre dificultad y discriminación. La curva es un suavizado local; la línea punteada marca el umbral habitual de 0.30.

Relación entre dificultad y discriminación. La curva es un suavizado local; la línea punteada marca el umbral habitual de 0.30.

La nube tiene forma de U invertida: la discriminación es máxima para dificultades intermedias y cae hacia los extremos. La correlación entre la discriminación y la distancia de \(p\) a 0.5 es \(-0.33\). El origen es estadístico, no una propiedad del ítem: la varianza de un ítem dicotómico es \(p(1-p)\), casi nula cuando \(p\) se acerca a 0 o a 1; con varianza casi nula, la covarianza entre el ítem y el puntaje —y por tanto cualquier correlación— está acotada hacia cero. En otras palabras, que los ítems muy fáciles o muy difíciles “discriminen poco” es en buena parte un artefacto de la métrica.

Punto-biserial frente a biserial

Diferencia media entre biserial y punto-biserial, por nivel de dificultad.
Tramo de dificultad biserial - punto-biserial (media)
(0,0.2] 0.155
(0.2,0.4] 0.092
(0.4,0.6] 0.091
(0.6,0.8] 0.108
(0.8,1] 0.125

La brecha entre ambas es de unos 0.09 puntos en la zona central y sube a 0.16 en los ítems muy difíciles y a 0.13 en los muy fáciles. La razón está en el supuesto que las diferencia: la biserial asume que detrás de la respuesta 0/1 hay una variable continua y normal que se ha dicotomizado, y corrige la atenuación dividiendo por la densidad normal \(\varphi(z_p)\), que se hace pequeña en los extremos e infla la corrección. La punto-biserial no asume nada sobre esa variable latente. Cuál usar depende de si se acepta ese supuesto de normalidad.

Ítems con discriminación problemática

Los diez ítems con punto-biserial corregida inferior a 0.20.
Ítem p D Punto-biserial Biserial
CR547Q02S 0.322 0.182 0.028 0.037
CR545Q02S 0.566 0.220 0.092 0.115
CR556Q04S 0.149 0.144 0.101 0.155
CR466Q03S 0.078 0.060 0.117 0.216
CR566Q14S 0.312 0.358 0.122 0.160
CR566Q05S 0.290 0.381 0.140 0.186
CR556Q03S 0.476 0.364 0.177 0.222
CR541Q10S 0.455 0.459 0.181 0.227
CR560Q08S 0.455 0.325 0.183 0.230
CR432Q06S 0.034 0.100 0.199 0.480

Ninguna discriminación es negativa. Los diez ítems por debajo de 0.20 son de dos tipos:

  • Dificultad extrema (CR466Q03S, \(p = 0.08\); CR432Q06S, \(p = 0.03\)): la discriminación baja es el artefacto ya descrito, no un defecto del ítem.
  • Dificultad media pero discriminación baja (CR547Q02S, \(p = 0.32\), punto-biserial 0.03; CR545Q02S, \(p = 0.57\), punto-biserial 0.09): estos son sospechosos. Las hipótesis sustantivas son una clave ambigua, un ítem que mide un subconstructo distinto del resto, o dependencia con otro ítem de la misma unidad. Son los candidatos naturales a revisión y a descarte en el bloque 6.

Análisis de distractores

Por qué. Para los ítems de opción múltiple, examinar qué opción eligió cada grupo (no solo si acertó) revela problemas que la punto-biserial no muestra. Se usan las variables de respuesta cruda DR###Q##R. Para cada opción se calcula su frecuencia en el 27 % inferior, el 27 % central y el 27 % superior del puntaje total, y el índice discrim = superior - inferior. La clave se identifica como la opción cuya elección implica acierto.

Proporción que eligió cada opción, por grupo de desempeño, en cinco ítems de opción múltiple.
Ítem Opción Inferior Medio Superior discrim Clave
Machu Picchu - Q02 A 0.259 0.244 0.208 -0.051
B 0.456 0.597 0.689 0.233 <- clave
C 0.122 0.064 0.028 -0.094
D 0.162 0.095 0.075 -0.087
Machu Picchu - Q07 A 0.516 0.293 0.100 -0.416
B 0.234 0.245 0.231 -0.003
C 0.125 0.377 0.631 0.506 <- clave
D 0.125 0.086 0.038 -0.087
Machu Picchu - Q06 A 0.303 0.295 0.156 -0.147
B 0.335 0.219 0.053 -0.282
C 0.152 0.395 0.756 0.604 <- clave
D 0.211 0.091 0.034 -0.177
Nalini Nadkarni - Q04 A 0.701 0.855 0.969 0.268 <- clave
B 0.202 0.093 0.008 -0.194
C 0.060 0.037 0.016 -0.044
D 0.036 0.014 0.008 -0.028
Nalini Nadkarni - Q01 A 0.176 0.052 0.005 -0.171
B 0.243 0.169 0.091 -0.152
C 0.432 0.714 0.886 0.454 <- clave
D 0.149 0.065 0.018 -0.131

Los dos problemas que pide identificar el enunciado aparecen con claridad distinta:

  • Distractor que no atrae a nadie. En el ítem Nalini Nadkarni – Q04, las opciones C y D las elige menos del 4 % de los estudiantes en todos los grupos. No indica un ítem malo, pero el ítem opera de hecho con tres opciones, lo que sube la probabilidad de acierto por azar. Es un problema de construcción: la solución es reescribir la alternativa implausible.
  • Distractor que retiene también al grupo alto. En Machu Picchu – Q02, el distractor A lo elige alrededor de una cuarta parte de los estudiantes en los tres grupos (discriminación \(-0.05\)): atrae por igual a buenos y malos lectores y por tanto no separa. La clave (B) discrimina bien, así que el problema no es la clave, sino que la opción A resulta defendible o ambigua. Es un problema de validez del ítem, y explica por qué CR545Q02S encabeza la lista de discriminación deficiente.

Los otros tres ítems (Machu Picchu – Q06 y Q07, Nalini Nadkarni – Q01) muestran el comportamiento deseable: todos los distractores atraen sobre todo al grupo inferior y su frecuencia cae con fuerza en el superior.

Confiabilidad

Qué mide. La confiabilidad indica qué parte de la varianza de los puntajes corresponde a diferencias reales entre personas y qué parte a error de medida. El coeficiente alfa de Cronbach la estima a partir de la consistencia entre los ítems, y supone que todos miden lo mismo con la misma carga y que sus errores no están correlacionados.

Alfa de Cronbach de cada matriz

Una precisión sobre M_ord. El Anexo del enunciado define el alfa en su forma cruda, \(\alpha = \frac{k}{k-1}\left(1 - \frac{\sum S_j^2}{S_X^2}\right)\), que requiere que todos los ítems tengan varianza y covarianza estimadas sobre los mismos estudiantes. Por el diseño de formas rotadas, no todos los pares de ítems ordinarios fueron respondidos por las mismas personas, así que la matriz de covarianzas completa no está disponible. Se recurre entonces al alfa estandarizado, que solo necesita la correlación media entre ítems \(\bar r\) (calculable con la información por pares): \(\alpha_{std} = \dfrac{k\,\bar r}{1 + (k-1)\,\bar r}\), aplicado a la longitud de una forma típica (la que un estudiante realmente responde). Para M_fl (bloque completo de fluidez), donde sí hay covarianzas completas, se usa el alfa de Cronbach directa, con su intervalo de confianza de Feldt.

Alfa de Cronbach de las matrices de análisis.
Matriz k r media entre ítems Alfa IC 95 %
M_ord — forma típica de lectura (estandarizado) 23 0.116 0.751
M_fl — bloque completo de fluidez (directo) 21 0.093 0.663 [0.59, 0.73]
  • M_ord. La correlación media entre ítems es \(\bar r = 0.116\). Aplicada a la longitud de una forma típica —los 23 ítems ordinarios que responde el estudiante mediano (sección 2.5)— da \(\alpha_{std} \approx 0.75\): la confiabilidad de la prueba de lectura que un estudiante concreto respondió es aceptable para un instrumento de esa longitud. (Proyección hipotética: si los 126 ítems del banco se administraran completos a los mismos estudiantes, la misma \(\bar r\) daría \(\alpha \approx 0.94\); no es una medición, porque ningún estudiante respondió tantos ítems.)
  • M_fl (fluidez). Sobre 21 ítems y 188 estudiantes, \(\alpha = 0.66\) (IC 95 % de Feldt \([0.59, 0.73]\)). Es una confiabilidad moderada: son ítems muy fáciles (\(\bar p = 0.83\)), con poca varianza, y solo 21.

Alfa al eliminar cada ítem

El alfa-si-se-elimina-el-ítem exige el mismo insumo que el alfa cruda —la matriz de covarianzas completa sobre los mismos estudiantes—, de modo que en M_ord no es estimable por la razón ya expuesta (formas rotadas). Se calcula, por tanto, sobre M_fl.

Ítems de fluidez cuya eliminación aumentaría el alfa.
Ítem Alfa si se elimina el ítem Correlación ítem-resto
CR590Q23S 0.677 0.043
CR590Q28S 0.676 -0.021
CR590Q56S 0.675 0.081
CR590Q44S 0.659 0.172

Tres ítems de fluidez (CR590Q23S, CR590Q28S, CR590Q56S) aumentarían el alfa si se eliminaran; son los mismos con la correlación ítem-resto más baja (CR590Q28S la tiene ligeramente negativa, y los otros dos por debajo de 0.10). El criterio coincide con el del Problema 3: los ítems que suben el alfa al retirarse son los de discriminación más débil dentro de su bloque, igual que allí CR547Q02S y CR545Q02S encabezaban la lista de punto-biserial baja en M_ord. En una tarea de fluidez, esto suele señalar oraciones cuyo acierto depende más de su dificultad léxica particular que del nivel general del estudiante: candidatas a revisión, no necesariamente a descarte.

Error estándar de medida

Error estándar de medida (bloque de fluidez).
Indicador Valor
Desviación típica del puntaje 2.79
Error estándar de medida (bruto) 1.62
Como proporción del rango de la escala (0–21) 7.7 %

El error estándar de medida es \(S_E = S_X\sqrt{1 - r_{xx}} = 2.79\sqrt{1 - 0.66} = \mathbf{1.62}\) puntos, sobre una escala de 0 a 21 (7.7 % del rango). Un intervalo de \(\pm 1\) error cubre más de tres puntos: la prueba de fluidez distingue niveles gruesos, no diferencias finas.

Independencia local en las unidades ordinarias

Por qué. El alfa supone que, fijada la habilidad, la respuesta a un ítem no depende de las demás. Entre ítems de una misma unidad ese supuesto puede fallar, y el alfa sobreestimaría la confiabilidad. Para comprobarlo se compara el alfa del conjunto completo con el de un subconjunto que retiene un solo ítem por unidad, proyectando uno de los dos a la longitud del otro con Spearman-Brown.

Comprobación de independencia local en las unidades ordinarias.
Indicador Valor
Alfa estandarizado — conjunto completo (126 ítems) 0.943
Alfa estandarizado — un ítem por unidad (37 ítems) 0.837
— proyectado a 126 ítems (Spearman-Brown) 0.946
Sesgo estimado: completo menos proyectado -0.003

Igualando la longitud con Spearman-Brown, el alfa del conjunto completo y el de un ítem por unidad difieren en menos de 0.01 (sesgo estimado \(\approx -0.003\), es decir, dirección prácticamente nula y magnitud despreciable). No hay evidencia de que la dependencia local entre ítems de una misma unidad infle el alfa en las unidades ordinarias de lectura. El resultado es coherente con su estructura: cada unidad ordinaria tiene pocos ítems (mediana de 4), de modo que hay poco margen para dependencia interna.

Independencia local en la unidad de fluidez

La unidad de fluidez es una sola unidad: “un ítem por unidad” sería un único ítem, y el ejercicio anterior no puede repetirse en la misma forma. Lo que sí puede compararse es el alfa observado de la fluidez (0.66) con el que resultaría de su correlación media entre ítems si los 21 ítems fueran estrictamente paralelos (\(\alpha_{std} \approx 0.68\)): prácticamente coinciden, de modo que tampoco aquí se detecta inflación del alfa más allá del factor común de fluidez.

La diferencia con las unidades ordinarias no está, por tanto, en la magnitud de un sesgo (en ambos casos es cercano a cero), sino en la interpretación: en las unidades ordinarias la varianza compartida entre pasajes distintos puede atribuirse a comprensión lectora; en la fluidez toda la varianza compartida está ligada a un solo estímulo y un solo límite de tiempo, de modo que un alfa alto certificaría “consistencia en esta tarea”, no habilidad lectora en general.

¿Es el alfa el coeficiente adecuado?

Alfa frente a omega en el bloque de fluidez.
Coeficiente Valor
Alfa de Cronbach 0.663
Omega total (McDonald) 0.691

El alfa supone tau-equivalencia: todos los ítems miden el mismo factor con igual carga. Cuando las cargas son desiguales —lo habitual— el alfa es una cota inferior sesgada. El omega de McDonald solo exige unidimensionalidad y admite cargas libres. En el bloque de fluidez, \(\omega = 0.69\) frente a \(\alpha = 0.66\): la pequeña diferencia indica una leve desigualdad de cargas, y \(\omega\) sería preferible. Ninguno de los dos, en todo caso, corrige la dependencia asociada a que la fluidez sea una tarea de método único.

Puntuaciones verdaderas e intervalos de confianza

El problema. El puntaje observado \(X\) de una persona es su puntaje verdadero \(T\) más un error. Un intervalo de confianza expresa cuánto puede alejarse \(X\) de \(T\). Hay dos formas de construirlo, y no coinciden. Todo el bloque se trabaja sobre el bloque de fluidez (\(k = 21\), \(r_{xx} = 0.66\)).

Intervalo centrado en la puntuación observada

Toma como centro el puntaje observado y como dispersión el error estándar de medida: \(X \pm z\,S_E = X \pm 1.96 \times 1.62\). Tiene el mismo ancho para todos (6.35 puntos), lo que es una limitación conocida de la TCT.

Puntuación verdadera estimada e intervalo de Kelley

La puntuación verdadera estimada corrige el puntaje observado acercándolo a la media: \(\hat T = \bar X + r_{xx}(X - \bar X)\). Su intervalo usa el error estándar de estimación \(S_{\hat T} = S_X\sqrt{r_{xx}(1 - r_{xx})} = 1.32\), más pequeño que el error de medida.

Los dos errores estándar y los dos intervalos.
Indicador Valor
Error estandar de medida (S_E) 1.619
Error estandar de estimacion de Kelley (S_Test) 1.318
Razon S_Test / S_E 0.814
Raiz cuadrada del alfa 0.814
Ancho del IC centrado en X 6.348
Ancho del IC de Kelley 5.167

Por qué son distintos. El intervalo alrededor de \(X\) mide la dispersión de \(X\) en torno a \(T\). El intervalo alrededor de \(\hat T\) es más estrecho por el factor \(\sqrt{r_{xx}} = 0.81\) (la razón entre los dos anchos es exactamente esa): \(\hat T\) ya ha “contraído” el puntaje hacia la media, y a cambio de ese sesgo hacia el centro reduce la incertidumbre.

Ambos intervalos en todo el rango

Intervalo de confianza del 95 % centrado en la puntuación observada (azul) y centrado en la puntuación verdadera estimada de Kelley (rojo). La diagonal es la identidad; la vertical, la media.

Intervalo de confianza del 95 % centrado en la puntuación observada (azul) y centrado en la puntuación verdadera estimada de Kelley (rojo). La diagonal es la identidad; la vertical, la media.

Los dos intervalos coinciden cerca de la media, donde \(\hat T \approx X\), y se separan hacia los extremos: el de Kelley se desplaza hacia \(\bar X\) y es más estrecho.

Por qué la puntuación verdadera estimada “regresa” hacia la media

Es una propiedad esperable, no un artificio del modelo. Un puntaje observado muy alto es, en promedio, un puntaje verdadero alto más un error positivo (algo de suerte); la mejor predicción de \(T\) descuenta esa parte, y \(\hat T = \bar X + r_{xx}(X - \bar X)\) hace exactamente eso, atribuyendo al error la fracción \(1 - r_{xx}\). Con \(r_{xx} = 0.66\) la contracción es apreciable: el estudiante con \(X = 7\) sube a \(\hat T = 10.5\) y el que tiene \(X = 20\) baja a \(\hat T = 19.1\). En el límite \(r_{xx} = 1\) no hay regresión; con \(r_{xx} = 0\), \(\hat T = \bar X\) para todos.

Interpretación para tres estudiantes concretos

Intervalos de confianza para un estudiante de puntaje bajo, medio y alto.
Perfil X T estimada IC 95% centrado en X IC 95% de Kelley
Puntaje bajo 7 10.5 [3.8, 10.2] [7.9, 13.1]
Puntaje medio 17 17.1 [13.8, 20.2] [14.6, 19.7]
Puntaje alto 20 19.1 [16.8, 21.0] [16.5, 21.0]

Redactado para un lector no técnico:

  • Puntaje bajo (\(X = 7\) de 21): “Su nivel de fluidez está, con un 95 % de confianza, entre 3.8 y 10.2 puntos según el intervalo centrado en la puntuación observada. Corregido por regresión hacia la media, su nivel se estima en 10.5, con un intervalo de 7.9 a 13.1. No se puede afirmar que su fluidez sea menor que la de otro estudiante cuyo intervalo se solape con el suyo.”
  • Puntaje medio (\(X = 17\)): “Nivel estimado 17.1; intervalo de 13.8 a 20.2 (observado) o de 14.6 a 19.7 (Kelley).”
  • Puntaje alto (\(X = 20\)): “Nivel estimado 19.1; intervalo de 16.8 a 21.0 (observado) o de 16.5 a 21.0 (Kelley); el límite superior toca el máximo de la escala.”

Dos estudiantes solo difieren de forma estadísticamente creíble (95 %) si sus puntajes observados se separan en más de 4.5 puntos (\(z\,S_E\sqrt{2}\)).

Confiabilidad necesaria para reducir el intervalo a la mitad

Longitud necesaria para reducir a la mitad el ancho del intervalo.
Indicador Valor
Confiabilidad actual 0.663
Confiabilidad objetivo 0.916
Factor de longitud (Spearman-Brown) 5.530
Ítems de calidad equivalente 117.000

El ancho del intervalo centrado en \(X\) es proporcional a \(\sqrt{1 - r_{xx}}\). Reducirlo a la mitad exige \(1 - r_{xx}^{nuevo} = (1 - r_{xx})/4\), es decir \(r_{xx}^{nuevo} = 0.92\). Por Spearman-Brown, eso equivale a multiplicar la longitud de la prueba por 5.5: pasar de 21 a unos 117 ítems de calidad equivalente. Es una consecuencia del efecto techo de la tarea de fluidez.

Depuración y síntesis

Criterios de retención

Actuando como equipo psicométrico responsable de depurar el banco, se fijan los siguientes criterios antes de aplicarlos. Combinan las tres propiedades que pide el enunciado —dificultad, discriminación y aporte a la confiabilidad—. Un ítem se retiene si cumple los tres:

  1. Dificultad dentro de un rango informativo: \(0.15 \le p \le 0.90\).
  2. Discriminación suficiente por las dos vías: punto-biserial corregida \(\ge 0.20\) e índice \(D \ge 0.20\).
  3. Aporte no negativo a la consistencia: la punto-biserial corregida (correlación ítem-resto) no es negativa. Es condición necesaria para que el ítem no reduzca el alfa de la escala.

Aplicación y efecto sobre la confiabilidad

Resultado de la depuración del banco de lectura.
Indicador Valor
Ítems evaluados (M_ord) 126
Ítems retenidos 114
Ítems descartados 12
— por dificultad fuera de rango 5
— por punto-biserial < 0.20 10
— por D < 0.20 6
Confiabilidad antes y después de la depuración, controlando por longitud.
Indicador Valor
Ítems de fluidez retenidos (de 21) 13.000
Alfa del bloque depurado 0.666
Alfa original proyectado a esa longitud (Spearman-Brown) 0.549
Efecto de la calidad (depurado - proyectado) 0.118

De los 126 ítems ordinarios, 114 se retienen: se descartan 12, en su mayoría por discriminación insuficiente, y son los mismos ya señalados como problemáticos.

Para separar el efecto de la calidad del efecto del número de ítems se recurre al bloque de fluidez, donde el alfa sí se calcula de forma directa. Aplicando criterios equivalentes (dificultad en el rango \([0.15, 0.90]\) y correlación ítem-resto \(\ge 0.20\)) quedan 13 de 21 ítems. El alfa del bloque depurado es 0.67, casi igual al original (0.66) a pesar de perder 8 ítems. Comparado con el alfa original proyectado a esa longitud (0.55), la mejora de +0.12 es el efecto neto de la calidad: los ítems eliminados aportaban tan poca consistencia que retirarlos compensa el acortamiento.

Ítems de calidad equivalente para alcanzar un alfa de 0.90

Longitud necesaria para llevar el bloque depurado a un alfa de 0.90.
Indicador Valor
Alfa de partida (bloque depurado) 0.666
Alfa objetivo 0.900
Factor de longitud (Spearman-Brown) 4.510
Ítems totales necesarios 59.000
Ítems adicionales 46.000

Partiendo del bloque depurado (\(\alpha = 0.67\), 13 ítems), alcanzar \(\alpha = 0.90\) exige multiplicar la longitud por 4.5: unos 59 ítems de calidad equivalente, es decir 46 más. Coincide con lo hallado en el bloque 5: por el efecto techo, la tarea de fluidez necesita muchos ítems para llegar a confiabilidades altas.

Informe técnico

Dirigido a un comité de evaluación no especializado.

Qué se hizo. A partir de los microdatos originales de PISA 2022 se construyó la base de ítems dicotómicos de Lectura para Colombia (7 804 estudiantes; 3 033 con prueba de lectura). Los ítems se clasificaron cruzando el diccionario de formatos (144 formatos que etiquetan 5 019 variables), se resolvió el tratamiento de las respuestas faltantes y se separó la unidad de fluidez lectora (65 ítems) del resto, por tratarse de una única tarea con dependencia interna. Se calcularon dificultad y discriminación por ítem sobre 126 ítems ordinarios, y confiabilidad y puntuaciones verdaderas sobre el mayor bloque de ítems respondido completo por un grupo de estudiantes.

Qué se encontró. Dificultad: media de 0.48, bien distribuida; 12 ítems demasiado difíciles y 2 demasiado fáciles. Discriminación: punto-biserial corregida media de 0.33, sin valores negativos; 10 ítems con discriminación baja, la mitad por dificultad extrema (sin implicación práctica) y la mitad genuinamente débiles (CR547Q02S, CR545Q02S). Confiabilidad: la de una forma típica de lectura, estimada por su forma estandarizada, es aceptable (\(\alpha \approx 0.75\)); la del bloque completo de fluidez es moderada (\(\alpha = 0.66\), IC 95 % \([0.59, 0.73]\)), con un error estándar de medida de 1.6 puntos sobre 21.

Qué ítems revisar. Los diez de discriminación baja, en especial los de dificultad media; y, en fluidez, CR590Q23S, CR590Q28S y CR590Q56S.

Con qué limitaciones leer el análisis. Los índices describen el comportamiento de los ítems en las formas administradas en Colombia, sin ponderación por el diseño muestral complejo y sin corrección por el mecanismo adaptativo de asignación. No son estimaciones de parámetros poblacionales ni comparables con las cifras oficiales de la OCDE, que se obtienen por escalamiento con modelos de respuesta al ítem y ponderadores replicados. La confiabilidad reportada en detalle corresponde a una tarea concreta (fluidez), no a “la prueba de lectura” en su conjunto.

Límites del marco clásico

El taller pide reconocer las condiciones bajo las cuales los índices clásicos dejan de ser interpretables en sentido poblacional. En este trabajo se hicieron visibles tres:

  1. La dificultad depende de la muestra y de la ruta adaptativa. \(p_j\) describe al grupo que respondió cada ítem; bajo el diseño adaptativo ese grupo está seleccionado por el desempeño previo, así que \(p_j\) no estima la dificultad poblacional del ítem.
  2. El diseño de formas rotadas limita los índices de escala. Como cada estudiante respondió solo una fracción de los ítems, el alfa del conjunto completo de lectura ordinaria no puede calcularse de forma directa: se estimó en su forma estandarizada a partir de la correlación media entre ítems.
  3. La dependencia local existe dentro de cada unidad y es total en la de fluidez. En las unidades ordinarias su efecto sobre el alfa resultó despreciable; en la de fluidez no puede separarse, porque toda la escala descansa en un solo estímulo.

Un análisis que quisiera estimar parámetros poblacionales necesitaría las variables de ruta y dificultad por etapa, imputación múltiple para la matriz incompleta, un modelo de respuesta al ítem y ponderadores replicados: herramientas fuera del alcance de la Teoría Clásica y de este taller.


Fuente de los datos. OECD (2023). PISA 2022 Database (Cognitive item data file, versión SAS).