Este trabajo aplica la Teoría Clásica de los Tests (TCT) al análisis de los ítems dicotómicos (respuesta correcta / incorrecta) de la prueba de Lectura de PISA 2022, tomando únicamente a los estudiantes colombianos. El objetivo no es solo calcular índices, sino decidir y justificar cada paso: cómo se identifica y filtra la información, cómo se tratan los datos faltantes, qué mide cada índice y qué límites tiene la interpretación.
El análisis se organiza en seis bloques:
Se parte de dos archivos públicos del Cognitive item data file de PISA 2022:
| Archivo | Contenido |
|---|---|
CY08MSP_STU_COG.SAS7BDAT |
microdatos: 613 744 estudiantes, ~5 000 variables |
CY08MSP_STU_COG.FORMAT.SAS |
diccionario: nombres de formato y etiquetas de valor |
En 2022 la prueba de lectura se aplicó con un diseño adaptativo multietapa: parte del material se asignó según el desempeño previo del estudiante, y las formas rotan bloques de ítems entre estudiantes. Como consecuencia, cada estudiante respondió solo una fracción de los ítems, y la proporción de aciertos de un ítem describe al grupo que efectivamente lo respondió, no a la población colombiana. Los índices que siguen deben leerse en esos términos.
Se adoptan, y se justifican en cada problema, los siguientes criterios:
NA.0 (hubo oportunidad de responder).0. El bloque 2.3 contrasta este criterio con la
alternativa de tratarlo como NA.El documento se compila con R Markdown a partir de los
archivos originales. Por el tamaño del archivo de microdatos (16 GB), la
primera ejecución localiza y extrae el bloque colombiano y lo guarda en
col_cog.rds; las compilaciones siguientes reutilizan ese
archivo. El código completo está en el .Rmd; en el cuerpo
del documento se muestran solo los fragmentos que ilustran una
decisión.
Por qué. El archivo de formatos tiene dos partes:
(a) un bloque de definiciones value, donde
cada formato lista sus pares código–etiqueta; y (b) una
sentencia format, que asigna un formato a
cada variable. Los formatos se reutilizan: un mismo
bloque de etiquetas sirve a cientos de variables, y el nombre del
formato no identifica a la variable. Por eso el tipo de
un ítem (dicotómico o politómico) no puede leerse del nombre: hay que
cruzar ambas partes y mirar las etiquetas.
fmt_obj <- parse_sas_formats(fmt_path)
dict <- build_item_dictionary(fmt_obj)
n_defs <- length(fmt_obj$defs) # definiciones de formato
n_assign <- nrow(fmt_obj$assign) # variables con formato asignado
| Concepto | Valor |
|---|---|
Definiciones de formato (value) |
144 |
Variables con formato asignado
(format) |
5019 |
| Variables por formato (promedio) | 35 |
El archivo declara 144 formatos y los asigna a 5 019 variables: en promedio, 35 variables comparten cada formato. La clasificación dicotómico / politómico se hace entonces revisando las etiquetas de valor: si aparece “Partial credit” el ítem es politómico; si solo hay “No credit” y “Full credit” (o “Incorrect” y “Correct”), es dicotómico, sin importar cuántos códigos numéricos use.
Por qué. El enunciado advierte que confundir las categorías de faltante es el error más común. PISA distingue cuatro: Not Reached, Not Applicable, Invalid y No Response. Antes de recodificar hay que verificar cómo llegan al leer el archivo, porque de esa distinción depende el análisis de sensibilidad del bloque 2.3.
| Categoría | Código numérico | Missing SAS |
|---|---|---|
| Not Reached | 6 | .R |
| Not Applicable | 7 | .N |
| Invalid | 8 | .I |
| No Response | 9 | .M |
Cada categoría se declara dos veces en el formato: con un
código numérico (cuyo ancho varía entre formatos:
6/7/8/9, 96/97/98/99,
9996/9997/...) y con un valor especial de
SAS (.R, .N, .I,
.M). Al leer el archivo con haven, los
faltantes llegan como NA con etiqueta
(tagged NA): la función haven::na_tag() recupera
la letra (r, n, i,
m), de modo que las cuatro categorías sí son
distinguibles. Por eso recode_item() decide el
valor 0/1/NA de cada celda según esa etiqueta. Se observa
además que, en el extracto colombiano, la mayor parte de las celdas
vacías son NA sin etiqueta: corresponden a
ítems que la forma del estudiante no incluyó, es decir, Not
Applicable, que se tratan como NA.
Por qué. El enunciado pide comparar la composición de lectura con la de matemáticas y ciencias, y comentar si el resultado es el esperado.
| Dominio | Dicotómicos | Politómicos | Total | % dicotómicos |
|---|---|---|---|---|
| Lectura | 239 | 7 | 246 | 97.2 |
| Matemáticas | 153 | 45 | 198 | 77.3 |
| Ciencias | 87 | 5 | 92 | 94.6 |
El Cuadro 4 cuenta todos los ítems puntuados que el diccionario de formatos define en cada dominio, no solo los que se administraron en 2022. Con ese criterio, Lectura es el dominio con más ítems dicotómicos en términos absolutos (239) y con la mayor proporción de ellos (97 %). El resultado es el esperado: las tareas de lectura de PISA 2022 se apoyan en respuesta seleccionada y en juicios binarios (verdadero/falso, “¿la afirmación se sustenta en el texto?”), mientras que matemáticas concentra los ítems de construcción con crédito parcial (un procedimiento puede estar a medias); el orden entre dominios se mantiene si en vez del diccionario se cuentan los ítems con datos. De esas 239 variables de lectura, 191 tienen columna de respuesta en el archivo cognitivo de 2022 (126 de unidades ordinarias y 65 de fluidez): son la base del resto del análisis.
Por qué. Los ítems de lectura se agrupan en unidades (los tres dígitos centrales del nombre): comparten un mismo estímulo. El enunciado anticipa que aparecerá una unidad con un número de ítems muy superior al resto y pide decidir cómo tratarla.
Número de ítems dicotómicos por unidad de lectura. Una unidad se separa por completo del resto.
La unidad 590 reúne 65 ítems, frente a un máximo de 6 en cualquier otra unidad (mediana de 4). La etiqueta de sus variables es “Reading Fluency – Scored Response” y sus respuestas crudas son “Yes” / “No”: se trata de la tarea de fluidez lectora, en la que el estudiante juzga con rapidez, para unas 65 oraciones breves y sobre un mismo material, si cada una tiene sentido.
Decisión. No son 65 preguntas independientes, sino
una sola tarea dividida en indicadores binarios.
Comparten estímulo y límite de tiempo, de modo que el supuesto de
independencia local (que la respuesta a un ítem no dependa de las demás
una vez fijada la habilidad) no se cumple. Por eso la unidad 590 se
analiza como una matriz aparte (M_anom), y
el resto de unidades se agrupa en M_ord. Se trabajan en
paralelo para poder contrastar sus resultados de confiabilidad.
| Indicador | Valor |
|---|---|
| Estudiantes colombianos en el archivo | 7 804 |
| Estudiantes que recibieron lectura | 3 033 |
| Modo de aplicación | Computador (100 %) |
| Diseño de lectura: Not used / Diseño A / Diseño B | 4768 / 2243 / 793 |
| Ítems ordinarios respondidos por estudiante (mediana) | 23 |
Distribución de los estudiantes colombianos por forma (BOOKID), ordenadas de mayor a menor. El diseño reparte la muestra en decenas de formas de tamaño parecido.
De 7 804 estudiantes colombianos, 3
033 recibieron material de lectura; el resto recibió otros
dominios como material adaptativo. La aplicación fue enteramente por
computador (ADMINMODE = 2). Los estudiantes se reparten
entre 66 formas (BOOKID): 34 principales,
de tamaño parecido (unos 200–240 estudiantes cada una), más una cola de
formas de tendencia con muy pocos estudiantes (véase la Figura 2).
Ninguna forma concentra una fracción apreciable de la muestra. Bajo el
diseño adaptativo (Diseños A y B, que se diferencian en el orden de las
etapas), cada estudiante respondió una mediana de 23 ítems
ordinarios de lectura de los 126 disponibles: la forma y la
ruta adaptativa determinan qué bloque recibe. RDESIGN marca
a 3036 estudiantes con Diseño A o B; los 3 que no entran en el análisis
tienen la marca de diseño pero ninguna respuesta de lectura válida, y el
filtro por “al menos un ítem respondido” los descarta.
| Matriz | Ítems | Estudiantes efectivos | % celdas no administradas | % faltante residual |
|---|---|---|---|---|
| M_ord — unidades ordinarias | 126 | 3008 | 79.9 | 0 |
| M_anom — fluidez, unidad completa | 64 | 2360 | 67.7 | 0 |
| M_fl — fluidez, submuestra completa | 21 | 188 | 0.0 | 0 |
M_ord reúne los 126 ítems ordinarios sobre los 3008
estudiantes que respondieron al menos uno (tras retirar 25 con puntaje
nulo o perfecto sobre lo que respondieron, que producen correlaciones
indefinidas). El 80 % de celdas vacías de
M_ord corresponde a ítems que la forma del estudiante no
incluyó: está vacío por diseño, no por omisión. Bajo el
criterio de codificación adoptado (no alcanzadas, no respondidas e
inválidas \(\Rightarrow\)
0), la única fuente posible de NA es “ítem no
administrado”, de modo que el porcentaje de faltantes residual
es nulo en las tres matrices.
M_anom es la unidad de fluidez completa, la matriz de
análisis que resulta de la decisión del Problema 1.4: 64 de los 65 ítems
dicotómicos de fluidez (uno resultó constante en la submuestra
colombiana —lo aciertan todos— y limpiar_matriz() lo
retira). Pero la fluidez también se rota entre formas:
esos ítems se reparten en decenas de patrones de administración, de modo
que M_anom conserva un 67.7 % de celdas no
administradas y ningún par de ítems tiene covarianza estimable sobre una
submuestra grande. Para los índices de escala (bloque
4) y las puntuaciones verdaderas (bloque 5), que exigen una matriz
rectangular y completa, se usa M_fl: el mayor grupo de
estudiantes (188) que respondió exactamente el mismo subconjunto de 21
ítems de fluidez. Los índices por ítem (bloques 2 y 3)
no necesitan ese recorte: se calculan sobre los estudiantes que
respondieron cada ítem y son directamente interpretables.
Qué mide. El índice de dificultad \(p_j\) es la proporción de aciertos del ítem \(j\). A pesar del nombre, valores altos indican ítems fáciles. Su varianza es máxima en \(p = 0.5\) y casi nula en los extremos, lo que tiene consecuencias en la discriminación (bloque 3) y en el error de medida.
Distribución del índice de dificultad de los 126 ítems ordinarios de lectura. Líneas: límites del rango convencionalmente informativo [0.20, 0.80].
| Estadístico | Valor |
|---|---|
| Media | 0.476 |
| Desv. típica | 0.181 |
| Percentil 5 | 0.158 |
| Cuartil 1 | 0.356 |
| Mediana | 0.480 |
| Cuartil 3 | 0.623 |
| Percentil 95 | 0.734 |
La dificultad media es \(p = 0.48\) (desviación típica 0.18), con mediana 0.48 y cuartiles 0.36 y 0.62. El continuo está bien cubierto en la zona central, que es donde la prueba distingue mejor a los estudiantes.
| Indicador | Valor |
|---|---|
| Ítems fuera de [0.20, 0.80] | 14 |
| — demasiado difíciles (p < 0.20) | 12 |
| — demasiado fáciles (p > 0.80) | 2 |
| Proporción fuera del rango | 11.1 % |
Solo el 11 % de los ítems queda fuera del rango \([0.20, 0.80]\): 12 demasiado difíciles y 2 demasiado fáciles. Un ítem con dificultad extrema es respondido casi igual por todos, así que aporta poca información sobre las diferencias individuales. En los extremos de la escala de habilidad esto se traduce en mayor error de medida relativo: la prueba mide con menos precisión a los estudiantes muy por encima o muy por debajo del nivel medio de los ítems.
Por qué. Una respuesta Not Reached puede tratarse como incorrecta (el estudiante no la contestó) o como faltante (no tuvo oportunidad real). La elección modifica la dificultad estimada; interesa cuantificar cuánto y en qué ítems.
Diferencia en la dificultad estimada según el tratamiento de las respuestas no alcanzadas, frente a la posición del ítem dentro del bloque.
| Indicador | Valor |
|---|---|
| Discrepancia media entre criterios | 0.057 |
| Discrepancia máxima | 0.208 |
| Correlación con la posición en el bloque | 0.220 |
La discrepancia media es de solo 0.06 puntos de proporción, con un máximo de 0.21. Tratar las no alcanzadas como incorrectas reduce la dificultad estimada (hace ver el ítem más difícil). El efecto no es uniforme: correlaciona +0.22 con la posición del ítem dentro del bloque, es decir, se concentra en los ítems del final, que es donde se acumulan las respuestas no alcanzadas. El patrón coincide con lo que cabe esperar de un mecanismo de fatiga o de falta de tiempo. Como las cuatro categorías de faltante resultaron distinguibles, no fue necesario recurrir a la posición como aproximación; aquí la posición sirve solo para validar el patrón.
Qué miden. La discriminación indica si el ítem separa a quienes tienen más habilidad de quienes tienen menos. Se calculan tres medidas.
Por qué el 27 %. Se comparan la proporción de aciertos del 27 % con mayor puntaje total y la del 27 % con menor. Ese punto de corte (regla de Kelley) maximiza la razón entre la separación esperada de los dos grupos y su error estándar bajo normalidad del puntaje total: equilibra el contraste (que pediría grupos pequeños y muy extremos) con la estabilidad (que pediría grupos grandes).
Corrección por el propio ítem. La punto-biserial
correlaciona el ítem con el puntaje total. Si ese total
incluye el ítem, este correlaciona en parte consigo
mismo y la discriminación queda inflada; el sesgo es
mayor cuando hay pocos ítems. Por eso se usa la versión
corregida: el ítem contra el puntaje total
menos ese ítem. Es la misma que
CTT::itemAnalysis() reporta por defecto en la columna
pBis. La verificación en el bloque completo de fluidez
(donde itemAnalysis() puede correr, al no tener faltantes)
confirma que la función propia coincide:
## dif_max_pBis alfa_CTT
## 0.000 0.663
| Estadístico | Valor |
|---|---|
| Punto-biserial corregida: media | 0.329 |
| — mediana | 0.333 |
| — mínimo | 0.028 |
| — máximo | 0.544 |
| Ítems con punto-biserial < 0 | 0.000 |
| Ítems entre 0 y 0.20 | 10.000 |
| Índice D: media | 0.492 |
| Correlación entre D y punto-biserial | 0.830 |
La punto-biserial corregida promedia 0.33 (mediana 0.33), ninguna es negativa y diez ítems quedan por debajo de 0.20. Los dos índices de discriminación —\(D\) y punto-biserial— coinciden fuertemente (correlación 0.83), lo que respalda usar cualquiera de los dos.
Relación entre dificultad y discriminación. La curva es un suavizado local; la línea punteada marca el umbral habitual de 0.30.
La nube tiene forma de U invertida: la discriminación es máxima para dificultades intermedias y cae hacia los extremos. La correlación entre la discriminación y la distancia de \(p\) a 0.5 es \(-0.33\). El origen es estadístico, no una propiedad del ítem: la varianza de un ítem dicotómico es \(p(1-p)\), casi nula cuando \(p\) se acerca a 0 o a 1; con varianza casi nula, la covarianza entre el ítem y el puntaje —y por tanto cualquier correlación— está acotada hacia cero. En otras palabras, que los ítems muy fáciles o muy difíciles “discriminen poco” es en buena parte un artefacto de la métrica.
| Tramo de dificultad | biserial - punto-biserial (media) |
|---|---|
| (0,0.2] | 0.155 |
| (0.2,0.4] | 0.092 |
| (0.4,0.6] | 0.091 |
| (0.6,0.8] | 0.108 |
| (0.8,1] | 0.125 |
La brecha entre ambas es de unos 0.09 puntos en la zona central y sube a 0.16 en los ítems muy difíciles y a 0.13 en los muy fáciles. La razón está en el supuesto que las diferencia: la biserial asume que detrás de la respuesta 0/1 hay una variable continua y normal que se ha dicotomizado, y corrige la atenuación dividiendo por la densidad normal \(\varphi(z_p)\), que se hace pequeña en los extremos e infla la corrección. La punto-biserial no asume nada sobre esa variable latente. Cuál usar depende de si se acepta ese supuesto de normalidad.
| Ítem | p | D | Punto-biserial | Biserial |
|---|---|---|---|---|
| CR547Q02S | 0.322 | 0.182 | 0.028 | 0.037 |
| CR545Q02S | 0.566 | 0.220 | 0.092 | 0.115 |
| CR556Q04S | 0.149 | 0.144 | 0.101 | 0.155 |
| CR466Q03S | 0.078 | 0.060 | 0.117 | 0.216 |
| CR566Q14S | 0.312 | 0.358 | 0.122 | 0.160 |
| CR566Q05S | 0.290 | 0.381 | 0.140 | 0.186 |
| CR556Q03S | 0.476 | 0.364 | 0.177 | 0.222 |
| CR541Q10S | 0.455 | 0.459 | 0.181 | 0.227 |
| CR560Q08S | 0.455 | 0.325 | 0.183 | 0.230 |
| CR432Q06S | 0.034 | 0.100 | 0.199 | 0.480 |
Ninguna discriminación es negativa. Los diez ítems por debajo de 0.20 son de dos tipos:
CR466Q03S, \(p = 0.08\); CR432Q06S, \(p = 0.03\)): la discriminación baja es el
artefacto ya descrito, no un defecto del ítem.CR547Q02S, \(p = 0.32\),
punto-biserial 0.03; CR545Q02S, \(p = 0.57\), punto-biserial 0.09): estos
sí son sospechosos. Las hipótesis sustantivas son una
clave ambigua, un ítem que mide un subconstructo distinto del resto, o
dependencia con otro ítem de la misma unidad. Son los candidatos
naturales a revisión y a descarte en el bloque 6.Por qué. Para los ítems de opción múltiple, examinar
qué opción eligió cada grupo (no solo si acertó) revela
problemas que la punto-biserial no muestra. Se usan las variables de
respuesta cruda DR###Q##R. Para cada opción se calcula su
frecuencia en el 27 % inferior, el 27 % central y el 27 % superior del
puntaje total, y el índice discrim = superior - inferior.
La clave se identifica como la opción cuya elección implica acierto.
| Ítem | Opción | Inferior | Medio | Superior | discrim | Clave |
|---|---|---|---|---|---|---|
| Machu Picchu - Q02 | A | 0.259 | 0.244 | 0.208 | -0.051 | |
| B | 0.456 | 0.597 | 0.689 | 0.233 | <- clave | |
| C | 0.122 | 0.064 | 0.028 | -0.094 | ||
| D | 0.162 | 0.095 | 0.075 | -0.087 | ||
| Machu Picchu - Q07 | A | 0.516 | 0.293 | 0.100 | -0.416 | |
| B | 0.234 | 0.245 | 0.231 | -0.003 | ||
| C | 0.125 | 0.377 | 0.631 | 0.506 | <- clave | |
| D | 0.125 | 0.086 | 0.038 | -0.087 | ||
| Machu Picchu - Q06 | A | 0.303 | 0.295 | 0.156 | -0.147 | |
| B | 0.335 | 0.219 | 0.053 | -0.282 | ||
| C | 0.152 | 0.395 | 0.756 | 0.604 | <- clave | |
| D | 0.211 | 0.091 | 0.034 | -0.177 | ||
| Nalini Nadkarni - Q04 | A | 0.701 | 0.855 | 0.969 | 0.268 | <- clave |
| B | 0.202 | 0.093 | 0.008 | -0.194 | ||
| C | 0.060 | 0.037 | 0.016 | -0.044 | ||
| D | 0.036 | 0.014 | 0.008 | -0.028 | ||
| Nalini Nadkarni - Q01 | A | 0.176 | 0.052 | 0.005 | -0.171 | |
| B | 0.243 | 0.169 | 0.091 | -0.152 | ||
| C | 0.432 | 0.714 | 0.886 | 0.454 | <- clave | |
| D | 0.149 | 0.065 | 0.018 | -0.131 |
Los dos problemas que pide identificar el enunciado aparecen con claridad distinta:
CR545Q02S encabeza la lista de discriminación
deficiente.Los otros tres ítems (Machu Picchu – Q06 y Q07, Nalini Nadkarni – Q01) muestran el comportamiento deseable: todos los distractores atraen sobre todo al grupo inferior y su frecuencia cae con fuerza en el superior.
Qué mide. La confiabilidad indica qué parte de la varianza de los puntajes corresponde a diferencias reales entre personas y qué parte a error de medida. El coeficiente alfa de Cronbach la estima a partir de la consistencia entre los ítems, y supone que todos miden lo mismo con la misma carga y que sus errores no están correlacionados.
Una precisión sobre M_ord. El Anexo del
enunciado define el alfa en su forma cruda, \(\alpha = \frac{k}{k-1}\left(1 - \frac{\sum
S_j^2}{S_X^2}\right)\), que requiere que todos los ítems
tengan varianza y covarianza estimadas sobre los mismos
estudiantes. Por el diseño de formas rotadas, no todos los
pares de ítems ordinarios fueron respondidos por las mismas personas,
así que la matriz de covarianzas completa no está disponible. Se recurre
entonces al alfa estandarizado, que solo necesita la
correlación media entre ítems \(\bar r\) (calculable con la información por
pares): \(\alpha_{std} = \dfrac{k\,\bar r}{1 +
(k-1)\,\bar r}\), aplicado a la longitud de una forma
típica (la que un estudiante realmente responde). Para
M_fl (bloque completo de fluidez), donde sí hay covarianzas
completas, se usa el alfa de Cronbach directa, con su
intervalo de confianza de Feldt.
| Matriz | k | r media entre ítems | Alfa | IC 95 % |
|---|---|---|---|---|
| M_ord — forma típica de lectura (estandarizado) | 23 | 0.116 | 0.751 | — |
| M_fl — bloque completo de fluidez (directo) | 21 | 0.093 | 0.663 | [0.59, 0.73] |
M_ord. La correlación media entre
ítems es \(\bar r = 0.116\). Aplicada a
la longitud de una forma típica —los 23 ítems ordinarios que responde el
estudiante mediano (sección 2.5)— da \(\alpha_{std} \approx 0.75\): la
confiabilidad de la prueba de lectura que un estudiante concreto
respondió es aceptable para un instrumento de esa
longitud. (Proyección hipotética: si los 126 ítems del banco se
administraran completos a los mismos estudiantes, la misma \(\bar r\) daría \(\alpha \approx 0.94\); no es una medición,
porque ningún estudiante respondió tantos ítems.)M_fl (fluidez). Sobre 21 ítems y 188
estudiantes, \(\alpha = 0.66\) (IC 95 %
de Feldt \([0.59, 0.73]\)). Es una
confiabilidad moderada: son ítems muy fáciles (\(\bar p = 0.83\)), con poca varianza, y solo
21.El alfa-si-se-elimina-el-ítem exige el mismo insumo que el alfa cruda
—la matriz de covarianzas completa sobre los mismos estudiantes—, de
modo que en M_ord no es estimable por la razón ya expuesta
(formas rotadas). Se calcula, por tanto, sobre M_fl.
| Ítem | Alfa si se elimina el ítem | Correlación ítem-resto |
|---|---|---|
| CR590Q23S | 0.677 | 0.043 |
| CR590Q28S | 0.676 | -0.021 |
| CR590Q56S | 0.675 | 0.081 |
| CR590Q44S | 0.659 | 0.172 |
Tres ítems de fluidez (CR590Q23S,
CR590Q28S, CR590Q56S)
aumentarían el alfa si se eliminaran; son los mismos
con la correlación ítem-resto más baja
(CR590Q28S la tiene ligeramente negativa, y los otros dos
por debajo de 0.10). El criterio coincide con el del Problema 3: los
ítems que suben el alfa al retirarse son los de discriminación más débil
dentro de su bloque, igual que allí CR547Q02S y
CR545Q02S encabezaban la lista de punto-biserial baja en
M_ord. En una tarea de fluidez, esto suele señalar
oraciones cuyo acierto depende más de su dificultad léxica particular
que del nivel general del estudiante: candidatas a revisión, no
necesariamente a descarte.
| Indicador | Valor |
|---|---|
| Desviación típica del puntaje | 2.79 |
| Error estándar de medida (bruto) | 1.62 |
| Como proporción del rango de la escala (0–21) | 7.7 % |
El error estándar de medida es \(S_E = S_X\sqrt{1 - r_{xx}} = 2.79\sqrt{1 - 0.66} = \mathbf{1.62}\) puntos, sobre una escala de 0 a 21 (7.7 % del rango). Un intervalo de \(\pm 1\) error cubre más de tres puntos: la prueba de fluidez distingue niveles gruesos, no diferencias finas.
Por qué. El alfa supone que, fijada la habilidad, la respuesta a un ítem no depende de las demás. Entre ítems de una misma unidad ese supuesto puede fallar, y el alfa sobreestimaría la confiabilidad. Para comprobarlo se compara el alfa del conjunto completo con el de un subconjunto que retiene un solo ítem por unidad, proyectando uno de los dos a la longitud del otro con Spearman-Brown.
| Indicador | Valor |
|---|---|
| Alfa estandarizado — conjunto completo (126 ítems) | 0.943 |
| Alfa estandarizado — un ítem por unidad (37 ítems) | 0.837 |
| — proyectado a 126 ítems (Spearman-Brown) | 0.946 |
| Sesgo estimado: completo menos proyectado | -0.003 |
Igualando la longitud con Spearman-Brown, el alfa del conjunto completo y el de un ítem por unidad difieren en menos de 0.01 (sesgo estimado \(\approx -0.003\), es decir, dirección prácticamente nula y magnitud despreciable). No hay evidencia de que la dependencia local entre ítems de una misma unidad infle el alfa en las unidades ordinarias de lectura. El resultado es coherente con su estructura: cada unidad ordinaria tiene pocos ítems (mediana de 4), de modo que hay poco margen para dependencia interna.
La unidad de fluidez es una sola unidad: “un ítem por unidad” sería un único ítem, y el ejercicio anterior no puede repetirse en la misma forma. Lo que sí puede compararse es el alfa observado de la fluidez (0.66) con el que resultaría de su correlación media entre ítems si los 21 ítems fueran estrictamente paralelos (\(\alpha_{std} \approx 0.68\)): prácticamente coinciden, de modo que tampoco aquí se detecta inflación del alfa más allá del factor común de fluidez.
La diferencia con las unidades ordinarias no está, por tanto, en la magnitud de un sesgo (en ambos casos es cercano a cero), sino en la interpretación: en las unidades ordinarias la varianza compartida entre pasajes distintos puede atribuirse a comprensión lectora; en la fluidez toda la varianza compartida está ligada a un solo estímulo y un solo límite de tiempo, de modo que un alfa alto certificaría “consistencia en esta tarea”, no habilidad lectora en general.
| Coeficiente | Valor |
|---|---|
| Alfa de Cronbach | 0.663 |
| Omega total (McDonald) | 0.691 |
El alfa supone tau-equivalencia: todos los ítems miden el mismo factor con igual carga. Cuando las cargas son desiguales —lo habitual— el alfa es una cota inferior sesgada. El omega de McDonald solo exige unidimensionalidad y admite cargas libres. En el bloque de fluidez, \(\omega = 0.69\) frente a \(\alpha = 0.66\): la pequeña diferencia indica una leve desigualdad de cargas, y \(\omega\) sería preferible. Ninguno de los dos, en todo caso, corrige la dependencia asociada a que la fluidez sea una tarea de método único.
El problema. El puntaje observado \(X\) de una persona es su puntaje verdadero \(T\) más un error. Un intervalo de confianza expresa cuánto puede alejarse \(X\) de \(T\). Hay dos formas de construirlo, y no coinciden. Todo el bloque se trabaja sobre el bloque de fluidez (\(k = 21\), \(r_{xx} = 0.66\)).
Toma como centro el puntaje observado y como dispersión el error estándar de medida: \(X \pm z\,S_E = X \pm 1.96 \times 1.62\). Tiene el mismo ancho para todos (6.35 puntos), lo que es una limitación conocida de la TCT.
La puntuación verdadera estimada corrige el puntaje observado acercándolo a la media: \(\hat T = \bar X + r_{xx}(X - \bar X)\). Su intervalo usa el error estándar de estimación \(S_{\hat T} = S_X\sqrt{r_{xx}(1 - r_{xx})} = 1.32\), más pequeño que el error de medida.
| Indicador | Valor |
|---|---|
| Error estandar de medida (S_E) | 1.619 |
| Error estandar de estimacion de Kelley (S_Test) | 1.318 |
| Razon S_Test / S_E | 0.814 |
| Raiz cuadrada del alfa | 0.814 |
| Ancho del IC centrado en X | 6.348 |
| Ancho del IC de Kelley | 5.167 |
Por qué son distintos. El intervalo alrededor de \(X\) mide la dispersión de \(X\) en torno a \(T\). El intervalo alrededor de \(\hat T\) es más estrecho por el factor \(\sqrt{r_{xx}} = 0.81\) (la razón entre los dos anchos es exactamente esa): \(\hat T\) ya ha “contraído” el puntaje hacia la media, y a cambio de ese sesgo hacia el centro reduce la incertidumbre.
Intervalo de confianza del 95 % centrado en la puntuación observada (azul) y centrado en la puntuación verdadera estimada de Kelley (rojo). La diagonal es la identidad; la vertical, la media.
Los dos intervalos coinciden cerca de la media, donde \(\hat T \approx X\), y se separan hacia los extremos: el de Kelley se desplaza hacia \(\bar X\) y es más estrecho.
Es una propiedad esperable, no un artificio del modelo. Un puntaje observado muy alto es, en promedio, un puntaje verdadero alto más un error positivo (algo de suerte); la mejor predicción de \(T\) descuenta esa parte, y \(\hat T = \bar X + r_{xx}(X - \bar X)\) hace exactamente eso, atribuyendo al error la fracción \(1 - r_{xx}\). Con \(r_{xx} = 0.66\) la contracción es apreciable: el estudiante con \(X = 7\) sube a \(\hat T = 10.5\) y el que tiene \(X = 20\) baja a \(\hat T = 19.1\). En el límite \(r_{xx} = 1\) no hay regresión; con \(r_{xx} = 0\), \(\hat T = \bar X\) para todos.
| Perfil | X | T estimada | IC 95% centrado en X | IC 95% de Kelley |
|---|---|---|---|---|
| Puntaje bajo | 7 | 10.5 | [3.8, 10.2] | [7.9, 13.1] |
| Puntaje medio | 17 | 17.1 | [13.8, 20.2] | [14.6, 19.7] |
| Puntaje alto | 20 | 19.1 | [16.8, 21.0] | [16.5, 21.0] |
Redactado para un lector no técnico:
Dos estudiantes solo difieren de forma estadísticamente creíble (95 %) si sus puntajes observados se separan en más de 4.5 puntos (\(z\,S_E\sqrt{2}\)).
| Indicador | Valor |
|---|---|
| Confiabilidad actual | 0.663 |
| Confiabilidad objetivo | 0.916 |
| Factor de longitud (Spearman-Brown) | 5.530 |
| Ítems de calidad equivalente | 117.000 |
El ancho del intervalo centrado en \(X\) es proporcional a \(\sqrt{1 - r_{xx}}\). Reducirlo a la mitad exige \(1 - r_{xx}^{nuevo} = (1 - r_{xx})/4\), es decir \(r_{xx}^{nuevo} = 0.92\). Por Spearman-Brown, eso equivale a multiplicar la longitud de la prueba por 5.5: pasar de 21 a unos 117 ítems de calidad equivalente. Es una consecuencia del efecto techo de la tarea de fluidez.
Actuando como equipo psicométrico responsable de depurar el banco, se fijan los siguientes criterios antes de aplicarlos. Combinan las tres propiedades que pide el enunciado —dificultad, discriminación y aporte a la confiabilidad—. Un ítem se retiene si cumple los tres:
| Indicador | Valor |
|---|---|
| Ítems evaluados (M_ord) | 126 |
| Ítems retenidos | 114 |
| Ítems descartados | 12 |
| — por dificultad fuera de rango | 5 |
| — por punto-biserial < 0.20 | 10 |
| — por D < 0.20 | 6 |
| Indicador | Valor |
|---|---|
| Ítems de fluidez retenidos (de 21) | 13.000 |
| Alfa del bloque depurado | 0.666 |
| Alfa original proyectado a esa longitud (Spearman-Brown) | 0.549 |
| Efecto de la calidad (depurado - proyectado) | 0.118 |
De los 126 ítems ordinarios, 114 se retienen: se descartan 12, en su mayoría por discriminación insuficiente, y son los mismos ya señalados como problemáticos.
Para separar el efecto de la calidad del efecto del número de ítems se recurre al bloque de fluidez, donde el alfa sí se calcula de forma directa. Aplicando criterios equivalentes (dificultad en el rango \([0.15, 0.90]\) y correlación ítem-resto \(\ge 0.20\)) quedan 13 de 21 ítems. El alfa del bloque depurado es 0.67, casi igual al original (0.66) a pesar de perder 8 ítems. Comparado con el alfa original proyectado a esa longitud (0.55), la mejora de +0.12 es el efecto neto de la calidad: los ítems eliminados aportaban tan poca consistencia que retirarlos compensa el acortamiento.
| Indicador | Valor |
|---|---|
| Alfa de partida (bloque depurado) | 0.666 |
| Alfa objetivo | 0.900 |
| Factor de longitud (Spearman-Brown) | 4.510 |
| Ítems totales necesarios | 59.000 |
| Ítems adicionales | 46.000 |
Partiendo del bloque depurado (\(\alpha = 0.67\), 13 ítems), alcanzar \(\alpha = 0.90\) exige multiplicar la longitud por 4.5: unos 59 ítems de calidad equivalente, es decir 46 más. Coincide con lo hallado en el bloque 5: por el efecto techo, la tarea de fluidez necesita muchos ítems para llegar a confiabilidades altas.
Dirigido a un comité de evaluación no especializado.
Qué se hizo. A partir de los microdatos originales de PISA 2022 se construyó la base de ítems dicotómicos de Lectura para Colombia (7 804 estudiantes; 3 033 con prueba de lectura). Los ítems se clasificaron cruzando el diccionario de formatos (144 formatos que etiquetan 5 019 variables), se resolvió el tratamiento de las respuestas faltantes y se separó la unidad de fluidez lectora (65 ítems) del resto, por tratarse de una única tarea con dependencia interna. Se calcularon dificultad y discriminación por ítem sobre 126 ítems ordinarios, y confiabilidad y puntuaciones verdaderas sobre el mayor bloque de ítems respondido completo por un grupo de estudiantes.
Qué se encontró. Dificultad: media de 0.48,
bien distribuida; 12 ítems demasiado difíciles y 2 demasiado fáciles.
Discriminación: punto-biserial corregida media de 0.33, sin
valores negativos; 10 ítems con discriminación baja, la mitad por
dificultad extrema (sin implicación práctica) y la mitad genuinamente
débiles (CR547Q02S, CR545Q02S).
Confiabilidad: la de una forma típica de lectura, estimada por
su forma estandarizada, es aceptable (\(\alpha \approx 0.75\)); la del bloque
completo de fluidez es moderada (\(\alpha = 0.66\), IC 95 % \([0.59, 0.73]\)), con un error estándar de
medida de 1.6 puntos sobre 21.
Qué ítems revisar. Los diez de discriminación baja,
en especial los de dificultad media; y, en fluidez,
CR590Q23S, CR590Q28S y
CR590Q56S.
Con qué limitaciones leer el análisis. Los índices describen el comportamiento de los ítems en las formas administradas en Colombia, sin ponderación por el diseño muestral complejo y sin corrección por el mecanismo adaptativo de asignación. No son estimaciones de parámetros poblacionales ni comparables con las cifras oficiales de la OCDE, que se obtienen por escalamiento con modelos de respuesta al ítem y ponderadores replicados. La confiabilidad reportada en detalle corresponde a una tarea concreta (fluidez), no a “la prueba de lectura” en su conjunto.
El taller pide reconocer las condiciones bajo las cuales los índices clásicos dejan de ser interpretables en sentido poblacional. En este trabajo se hicieron visibles tres:
Un análisis que quisiera estimar parámetros poblacionales necesitaría las variables de ruta y dificultad por etapa, imputación múltiple para la matriz incompleta, un modelo de respuesta al ítem y ponderadores replicados: herramientas fuera del alcance de la Teoría Clásica y de este taller.
Fuente de los datos. OECD (2023). PISA 2022 Database (Cognitive item data file, versión SAS).