Saltar al contenido principal

Auditoría editorial

Auditoría editorial: resultados históricos y alcance actual.

Generar evaluación con IA es fácil. Generarla bien es otra cosa. La mayoría de los cursos que se publican con LLM hoy son aprobables sin haber leído el contenido — basta con marcar la opción más larga, o la letra "a", o descartar las frases obviamente jocosas.

La auditoría documentada cubrió los controles disponibles el 2026-05-04 y cuatro cursos. Los controles K y L seguían en backlog; no se presenta este resultado como una auditoría del catálogo actual.

El problema

Un quiz generado por LLM sin gobernanza es vulnerable a heurísticas de superficie.

Cuando un modelo de lenguaje genera preguntas de elección múltiple sin restricciones explícitas, tiende a producir patrones que un alumno aprovecha sin haber aprendido nada. La opción correcta lleva la información completa, los distractores son cortos. La letra "a" o "b" se concentran como respuesta correcta porque son frecuentes en el corpus de entrenamiento del modelo. Los distractores se reutilizan entre preguntas porque el modelo recurre a su propia caché.

En tres cursos de LearnIA generados con un modelo ligero detectamos estos patrones. En el peor caso medimos la opción correcta como la más larga en el 99,3% de las preguntas y la letra correcta concentrada en una sola opción en el 98,9% del banco. El passing_score de 4/5 (80%) no protege: el banco entero es vulnerable.

El análisis editorial forma parte de trabajo interno de LearnIA en preparación. Esta página no presenta un repositorio público ni un preprint como evidencia de conformidad.

Así se ve por dentro

Un nodo auditado, no solo una pregunta con cuatro opciones

Panel de un nodo real de LearnIA (ACV — Análisis del Ciclo de Vida) con analogía, para qué sirve, qué no es y fuentes normativas citadas
Captura real de un nodo del curso de Ecodiseño para la moda: analogía, para qué sirve, qué no es, y fuentes normativas citadas (AENOR/ISO).

Las 12 dimensiones

Dimensiones documentadas y alcance de la auditoría

A

Length bias

La opción correcta no puede ser sistemáticamente la más larga. Si lo es, el alumno aprueba marcando longitud, no comprensión.

Umbral: ≤ 50% por curso

B

Position bias

Las correctas se reparten entre las cuatro letras (a/b/c/d). Si se concentran en una, el alumno aprueba memorizando una letra.

Umbral: Cada letra ≥ 15%

C

Distractor banality

Los distractores no pueden ser frases jocosas reutilizadas en cientos de preguntas. Se descartan a la vista sin haber leído nada.

Umbral: Ningún distractor literal repetido > 5 veces

D

Absolute language

Las opciones con "siempre/nunca/todos" tienden a ser distractores y las "suele/puede" tienden a ser correctas. El alumno aprovecha la pista.

Umbral: Ratio equilibrado correcta vs distractor

E

Vocabulary leakage

La correcta no puede repetir literalmente el vocabulario del nodo mientras los distractores usan otro registro. Es una pista a flor de piel.

Umbral: Solapamiento Jaccard equilibrado

F

All / none of the above

Patrones como "todas las anteriores" son explotables. Veto absoluto.

Umbral: 0 ocurrencias

G

Length-variance intra-pregunta

Si la opción más larga es 3× la más corta, destaca por sí sola sin haber leído.

Umbral: Ratio max/min ≤ 2.5×

H

Bloom collapse

Si las cinco preguntas de un nodo son recall puro, basta con memorizar los términos clave. No hay comprensión ni aplicación.

Umbral: 2 recall + 2 comprehension + 1 application por nodo

I

Distractor diversity

Reutilizar el mismo distractor literal en 100 preguntas le quita valor pedagógico y revela el patrón.

Umbral: Conteo de distractores únicos elevado

J

Out-of-topic distractor

Un distractor de otro dominio es descartable a la vista sin saber del tema.

Umbral: Solapamiento con vocabulario del nodo

K

Two-opposites

Pares contradictorios entre opciones revelan que una es correcta por construcción. En backlog v2 del validador.

Umbral: Detección heurística — backlog v2

L

Sintaxis delatora

Si solo una opción tiene la forma gramatical que pide el enunciado, se elige por sintaxis. En backlog v2.

Umbral: Coincidencia gramatical — backlog v2

Resultados por curso

1.205 preguntas de cuatro cursos en la auditoría documentada.

Estado documentado el 2026-05-04 sobre cuatro cursos publicados hasta esa fecha. Hoy el catálogo tiene 6 cursos; la auditoría completa del catálogo actual está pendiente de una nueva revisión verificable.

Ecodiseño moda avanzado

Preguntas
230
Length bias
49.6%
Letras
28 / 24 / 24 / 24
Validador
Resultado histórico — alcance parcial

Comunicación estratégica

Preguntas
175
Length bias
0%
Letras
27 / 26 / 25 / 22
Validador
Resultado histórico — alcance parcial

ChatGPT productivo

Preguntas
65
Length bias
33.8%
Letras
29 / 29 / 22 / 20
Validador
Resultado histórico — alcance parcial

IA aplicada (regen Opus)

Preguntas
735
Length bias
< 50%
Letras
distribución equilibrada
Validador
Resultado histórico — alcance parcial

Alcance

Qué cubren estos resultados

Los resultados documentan cuatro cursos auditados el 2026-05-04. No acreditan una auditoría completa de los seis cursos actuales ni la aplicación de doce controles implementados.

La auditoría completa del catálogo actual y cualquier publicación externa de herramientas requieren evidencia técnica y una revisión verificable antes de poder declararse.

¿Tienes un banco de preguntas y quieres revisar sus controles editoriales disponibles?

Auditamos contenido evaluativo de terceros bajo acuerdo. Útil para universidades que están migrando MOOCs heredados a microcredenciales verificables, y para empresas que han generado formación interna con LLM y necesitan saber qué tienen.

Hablemos de auditar tu banco →