Cada agosto, los estudiantes descubren que una nota A en matemáticas requería el 78 por ciento de los puntos, mientras que una A en física necesitaba el 62, y que ambas cifras difieren de las del año anterior. La lectura instintiva es que algo ha salido mal, o que los estándares están decayendo. La lectura precisa es que el sistema está haciendo exactamente lo que se diseñó para hacer: los límites se mueven porque las notas se anclan deliberadamente a la cohorte, no al examen.

Empecemos por la calificación en sí, que es la parte menos misteriosa. Cuando los exámenes salen de la sala de examen, se escanean, se dividen en preguntas individuales y se distribuyen electrónicamente a los examinadores, la mayoría de ellos profesores que califican en pantalla siguiendo un esquema de corrección refinado en una reunión de estandarización. Un examinador puede ver miles de respuestas a una sola pregunta y nada más. El control de calidad funciona continuamente: se introducen de forma anónima en la cola de cada corrector "exámenes semilla" ya calificados por examinadores sénior, y cualquier persona cuyos resultados se desvíen más allá de la tolerancia es detenida, reentrenada o eliminada, y su trabajo anterior es vuelto a calificar. El resultado de todo esto es una nota bruta sobre, por ejemplo, 100 por examen. Lo que esa nota bruta vale en términos de calificación es una decisión separada que se toma más tarde.

Esa decisión se toma en una reunión de adjudicación, celebrada por cada junta examinadora —AQA, Pearson Edexcel, OCR y WJEC Eduqas en Inglaterra y Gales— una vez que la calificación está esencialmente completada. Los examinadores sénior analizan exámenes de archivo de años anteriores, los exámenes de este año en los puntos de corte de los candidatos y, de manera decisiva, las predicciones estadísticas. El juicio que están realizando no es "cuántos puntos debería requerir una A en abstracto", sino "¿en qué punto de este examen específico el trabajo de este año coincide con la A del año pasado?". No hay dos exámenes que tengan la misma dificultad, por muy cuidadosamente que se redacten. Si el examen de este año resulta ser más difícil, la misma calidad de candidatos obtiene menos puntos brutos, y el límite baja para compensar. Un límite que cae de 68 a 61 no es generosidad; es la corrección que mantiene el mismo significado para la nota.

Las estadísticas que disciplinan este proceso son el núcleo de los "resultados comparables", el enfoque que Ofqual, el regulador de exámenes de Inglaterra, formalizó alrededor de 2011. Cada junta recibe predicciones de la proporción de sus inscritos que se espera que logre cada nota, construidas a partir del rendimiento previo de la cohorte —para los A-levels, principalmente sus resultados de GCSE dos años antes—. Si la inscripción de química de este año llega con un perfil de GCSE más fuerte que el del año pasado, la predicción permite más notas altas; si es más débil, menos. Las juntas deben acercarse a estas predicciones o justificar la divergencia ante Ofqual. El juicio del examinador sigue operando en los márgenes, y las asignaturas con pocas inscripciones dependen más del escrutinio de los exámenes reales, pero para los A-levels con grandes inscripciones, la predicción estadística es el ancla.

Por qué la cohorte, no el examen

La lógica es un equilibrio entre tipos de equidad. La referencia normativa, utilizada hasta la década de 1980, fijaba el porcentaje de cada nota de antemano, por lo que tu nota dependía de superar a otros candidatos de tu año; una cohorte fuerte era simplemente castigada. La referencia por criterios pura, calificar solo frente a descriptores escritos, suena más justa pero no puede lidiar con el hecho de que los exámenes varían en dificultad y la severidad de los examinadores fluctúa, que es, en términos generales, como las notas de los GCSE se inflaron año tras año durante los años 90 y 2000. Los resultados comparables encuentran un punto medio: mantienen estable el valor de una nota a lo largo de los años asumiendo que una cohorte con un rendimiento previo similar merece una distribución de notas similar, dejando que los límites absorban todo el ruido de los exámenes.

El coste es que el sistema es opaco para las personas que están dentro de él. Un estudiante no puede saber en el aula qué nota necesita, los profesores no pueden prometer que un rendimiento determinado asegure una nota determinada, y una cohorte genuinamente mejor enseñada verá su mejora parcialmente descontada, porque las estadísticas esperan que se parezca a las cohortes anteriores. El enfoque también falló estrepitosamente cuando se forzó más allá de su diseño: el debacle del algoritmo de 2020, cuando se cancelaron los exámenes y la estandarización se aplicó a centros individuales en lugar de a la cohorte nacional, mostró lo que sucede cuando se le pide al anclaje estadístico que califique a personas en lugar de calibrar exámenes. Sin embargo, dentro de su uso previsto, la maquinaria es defendible. Aproximadamente 800,000 exámenes de A-level al año son calificados por decenas de miles de examinadores en cuatro juntas, y la nota que ve un tutor de admisiones significa casi lo mismo en 2026 que en 2019. Los límites se mueven precisamente para que las notas no lo hagan.

Cómo se califican los A-levels y por qué cambian los límites de las notas
Photo: Erwin Verbruggen from Amsterdam, The Netherlands / Wikimedia Commons (CC BY-SA 2.0)