P3 · IA y evaluación

Inteligencia artificial en la educación: la IA rompió el entregable y esto es lo que sigue siendo evaluable

Qué cambió la inteligencia artificial generativa en la educación, por qué los detectores de IA no son la solución, qué sigue siendo evaluable (proceso, persona, defensa) y cómo usar la IA en el aula con una regla: la IA sugiere, el docente decide.

En este artículo
11 min de lectura · volver arriba

En noviembre de 2022 cualquier estudiante del mundo con conexión a internet pasó a poder producir en minutos un ensayo, un informe, un caso resuelto, una presentación o un fragmento de código con una calidad formal aceptable. La reacción de la mayoría de las instituciones fue, por este orden: prohibir, detectar y, cuando lo primero no funcionó y lo segundo tampoco, resignarse. Casi cuatro años después, la conversación sigue atascada en la pregunta equivocada: cómo saber si el estudiante usó IA.

Este artículo responde a lo que se suele buscar sobre inteligencia artificial en la educación, y después cambia la pregunta: qué cambió de verdad, por qué los detectores no son la salida, qué sigue siendo evaluable cuando el entregable ya no prueba nada, cómo usar la IA en el aula sin que evalúe por el docente, y cómo escribir una política de integridad que funcione. Con una regla que atraviesa todo el texto: la IA sugiere, el docente decide.

Qué es la inteligencia artificial en la educación (respuesta corta)

Cuando hoy se habla de inteligencia artificial en la educación se mezclan dos cosas distintas. La IA analítica lleva años en las plataformas educativas: recomienda contenidos, detecta riesgo de abandono, corrige tests de opción múltiple. La IA generativa (ChatGPT, Gemini, Claude, Copilot y sus derivados) es lo que cambió en 2022: produce texto, imágenes, código y presentaciones nuevas a partir de una instrucción en lenguaje natural, con una calidad que a menudo no se distingue del trabajo de un estudiante medio.

La UNESCO publicó en 2023 su Guía para el uso de IA generativa en educación e investigación, y su punto de partida sigue siendo el más razonable: la IA generativa es una herramienta poderosa que exige un enfoque centrado en las personas, con regulación, formación docente y protección de los estudiantes, y no un sustituto de la relación pedagógica. Nada de eso dice cómo evaluar. Ese es el hueco que este artículo intenta llenar.

Por qué la IA rompió la evaluación por entregables

Durante un siglo la educación evaluó productos: el examen escrito, el ensayo, el informe, el trabajo final, la presentación. La lógica era sólida: si el estudiante produjo esto, aprendió aquello. La IA generativa rompió el “si”: ahora el producto se puede generar sin haber aprendido nada, y un producto excelente ya no es evidencia de nada.

Conviene ser precisos sobre lo que se rompió y lo que no:

  • Se rompió el entregable como prueba. Cualquier tarea que se pueda resolver con texto o código producido fuera del aula, sin supervisión y sin rastro del proceso, ya no distingue a quien aprendió de quien pidió.
  • No se rompió el aprendizaje. Los estudiantes siguen aprendiendo cuando hacen algo con consecuencias, reflexionan y lo aplican. Lo que se rompió es nuestra manera de verlo.
  • No se rompió la honestidad de la mayoría. Las encuestas de Lee, Pope y colaboradores (Universidad de Stanford, Challenge Success) en institutos de Estados Unidos, con datos de antes y después de noviembre de 2022, encontraron que las conductas de copia se mantuvieron estables tras la llegada de ChatGPT; y la mayoría de los estudiantes opinaba que usar un chatbot para producir un trabajo entero no debería estar permitido. El problema no es que todos copien; es que ya no podemos saber quién aprendió mirando solo el producto.

Detectores de IA: por qué no son la solución

La primera reacción institucional fue comprar detectores. Hay tres motivos para no apoyar en ellos una política de integridad:

No son fiables. OpenAI retiró su propio clasificador de texto generado por IA en julio de 2023 por su baja precisión. Ningún detector puede demostrar que un texto fue generado por un modelo; solo estima una probabilidad, y esa estimación se equivoca en los dos sentidos.

Se equivocan de forma sesgada. Liang y colaboradores mostraron en 2023 que los detectores clasifican como “generado por IA” con mucha más frecuencia los textos escritos por personas no nativas en inglés. Un falso positivo no es un error estadístico: es un estudiante acusado de algo que no hizo, sin posibilidad de demostrar lo contrario.

Convierten al docente en policía y al estudiante en sospechoso. Una relación pedagógica basada en la vigilancia produce exactamente lo que dice combatir: estudiantes que aprenden a esquivar el detector en lugar de a aprender.

La alternativa no es rendirse. Es dejar de buscar la prueba en el producto y buscarla donde siempre estuvo: en el proceso y en la persona.

Dos carriles de evaluación: seguro y abierto

Qué sigue siendo evaluable: el proceso, la persona y la defensa

Liu y Bridgeman, de la Universidad de Sídney, propusieron en 2023 un enfoque de dos carriles que se ha extendido por muchas universidades: un carril seguro, con evaluaciones supervisadas donde se comprueba que el estudiante sabe hacer algo por sí mismo (exámenes presenciales, defensas orales, tareas en clase), y un carril abierto, donde el uso de IA se permite y se declara, y lo que se evalúa es el proceso, el criterio y el resultado con IA incluida. La tensión que muchas instituciones viven (prohibir o permitir) desaparece cuando se acepta que hacen falta los dos.

Dentro del carril abierto, que es donde vive el aprendizaje experiencial, cinco cosas siguen siendo evaluables aunque el entregable no lo sea:

1. El punto de partida individual. Antes del equipo y antes de cualquier herramienta, cada estudiante escribe qué sabe, qué cree y qué necesitaría saber sobre el problema. Es el “antes” contra el que comparar; sin él, es imposible distinguir aprendizaje de producción.

2. El proceso por fases. Entregas intermedias con fecha, versiones sucesivas, decisiones documentadas, qué se descartó y por qué. La IA puede producir la versión final; lo que no puede producir es la historia coherente de cómo se llegó a ella.

3. La contribución de cada persona. Quién hizo qué en cada fase, valorado por el propio estudiante, por sus compañeros y por el docente. La contribución trazable resiste a la IA porque no evalúa el texto, evalúa a la persona en el tiempo.

4. La defensa. Cinco minutos de conversación sobre el trabajo propio siguen siendo la prueba más barata y más fiable que existe: quién decidió, por qué, qué habría hecho distinto. Quien no hizo el trabajo no puede defenderlo; quien lo hizo con IA y entendió lo que hacía, sí, y eso también es aprendizaje.

5. La valoración de alguien de fuera. Cuando el problema lo planteó una organización real, su valoración de la solución no depende de si hubo IA en el camino: depende de si la solución sirve. Es una mirada que la IA no puede falsear.

Con estas cinco piezas, la pregunta “¿usó IA?” deja de importar. Lo que importa es “¿qué sabía al empezar, qué hizo, qué aportó, qué puede defender y a quién le sirvió?”.

Cómo usar la IA en el aula sin que evalúe por el docente

La regla es simple de enunciar y exigente de cumplir: la IA sugiere, el docente decide. Perkins, Furze, Roe y MacVaugh propusieron en 2024 la AI Assessment Scale, una escala de cinco niveles que cada docente asigna a cada tarea, desde “sin IA” hasta “IA como socia de trabajo”, y que se comunica al estudiante antes de empezar. Su virtud no es la escala en sí, sino que obliga a decidir y a explicitar en lugar de prohibir en abstracto.

Lo que la IA puede hacer por el docente, con el docente decidiendo en cada paso:

  • Proponer la estructura de fases de una experiencia a partir de la competencia que se quiere desarrollar y del contexto.
  • Sugerir criterios de evaluación y de coevaluación alineados con una competencia declarada, para que el docente los ajuste.
  • Señalar un desequilibrio de contribución en un equipo a mitad de camino, para que el docente hable con ese equipo antes de que sea tarde.
  • Redactar un primer borrador de un caso o de una consigna a partir de una situación real que el docente le cuente.

Lo que la IA no debe hacer: decidir la calificación de un estudiante, sustituir la retroalimentación del docente ni interpretar por él lo que un estudiante aprendió. No por principio abstracto, sino porque la evidencia pierde su valor si nadie responsable la respalda.

Lo que el estudiante puede hacer, declarándolo: usar la IA para explorar un problema, contrastar su propio análisis, mejorar la redacción o generar alternativas que después evalúa con criterio. La declaración de uso (qué herramienta, para qué, qué se conservó y qué se descartó) es parte del proceso evaluable, no una confesión.

Qué sigue siendo evaluable cuando el entregable no lo es

Una política de integridad académica que funciona: seis puntos

  1. Declarar, no prohibir. Cada tarea lleva un nivel de uso de IA explícito y comunicado antes. El estudiante declara qué usó y para qué.
  2. Dos carriles. Evaluaciones supervisadas para comprobar lo que cada uno sabe hacer solo; evaluaciones abiertas donde se evalúa proceso, criterio y resultado con IA.
  3. Proceso antes que producto. Punto de partida individual, fases con entregas, contribución trazable. El entregable final es una evidencia más, no la única.
  4. Defensa como norma, no como sospecha. Todos defienden su trabajo, no solo los sospechosos. Cinco minutos bastan.
  5. Sin detectores como prueba. Pueden servir como señal para una conversación; nunca como base de una acusación.
  6. Formación docente en diseño, no en vigilancia. El tiempo que se iba a gastar en detectar se gasta en rediseñar las tareas para que la IA no pueda hacerlas por el estudiante, o para que hacerlas con IA siga exigiendo aprender.

Ejemplos en universidad, escuela y formación técnica

Universidad (derecho). El caso práctico ya no se entrega y se corrige. Cada estudiante sube su análisis individual antes de la sesión; se discute en clase; y la nota sale de la defensa oral de cinco minutos y de la coevaluación, no del texto. Los estudiantes pueden usar IA para preparar el análisis y lo declaran.

Escuela (secundaria, lengua). El ensayo se escribe en tres fases con entregas: esquema y tesis (en clase, a mano), borrador (con IA permitida y declarada), versión final con una nota del estudiante explicando qué cambió y por qué. Se evalúa la evolución, no el texto final.

Formación técnica (informática). El proyecto de programación se hace con IA de asistencia, como en cualquier empresa hoy. Lo que se evalúa: el repositorio con su historial de cambios, la explicación de cada decisión de diseño y una sesión en la que el estudiante modifica el código en vivo ante el docente.

En los tres casos la IA está presente y en los tres el aprendizaje sigue siendo visible, porque lo que se mira es la persona en el proceso.

Lo que esto no significa

No significa que la IA no importe para la integridad. Significa que la integridad se construye con diseño de la evaluación y con relación pedagógica, no con software de sospecha.

No significa que el examen supervisado haya muerto. El carril seguro existe precisamente para eso: comprobar que cada estudiante sabe hacer solo lo que debe saber hacer solo.

No significa que la IA diseñe y evalúe la experiencia. Sugiere estructura, criterios y alertas; el docente decide qué se hace y qué aprendió cada estudiante. Sin esa regla, la evidencia pierde lo que la hace valiosa: que alguien responsable la respalda.

Por dónde empezar

HoyCon la evaluación rediseñada
La pregunta es “¿usó IA?”La pregunta es “¿qué sabía al empezar, qué hizo, qué aportó y qué puede defender?”
Se prohíbe en abstracto y se detecta a posterioriCada tarea declara su nivel de uso de IA antes de empezar
El entregable final es la pruebaEl proceso, la contribución y la defensa son la prueba; el entregable es un resultado más
El detector decide y el estudiante se defiendeEl estudiante defiende su trabajo como norma; el detector no acusa a nadie
El docente vigilaEl docente diseña y acompaña; la IA le sugiere, él decide

Tres preguntas para saber dónde está tu institución:

  1. De las tareas que evalúas, ¿cuántas podría resolver hoy un estudiante con IA en una tarde sin aprender nada, y sin que lo notaras?
  2. ¿Tu política de IA dice qué está prohibido, o dice qué nivel de uso tiene cada tarea y cómo se declara?
  3. Si un estudiante te reclama que un detector lo acusó falsamente, ¿tienes algo más que el detector?

Con BeChallenge tus docentes diseñan experiencias en las que el punto de partida individual, las fases, la contribución trazable y la evaluación 360° son la evidencia, con la IA sugiriendo estructura y criterios y el docente decidiendo. Es el ecosistema; la evaluación y el criterio son de tu institución. Si quieres verlo con una tarea real de tu programa, crea una cuenta gratis y prueba el Diseñador IA.

Referencias

  • UNESCO (2023). Guía para el uso de IA generativa en educación e investigación. Leer
  • OpenAI (2023). New AI classifier for indicating AI-written text (actualización de julio de 2023: el clasificador se retira por su baja precisión). Leer
  • Liang, W., Yuksekgonul, M., Mao, Y., Wu, E. y Zou, J. (2023). GPT detectors are biased against non-native English writers. Patterns, 4(7). Leer
  • Liu, D. y Bridgeman, A. (2023). What to do about assessments if we can’t out-design or out-run AI? Universidad de Sídney, Teaching@Sydney. Leer
  • Perkins, M., Furze, L., Roe, J. y MacVaugh, J. (2024). The Artificial Intelligence Assessment Scale (AIAS): A framework for ethical integration of generative AI in educational assessment. Journal of University Teaching and Learning Practice, 21(6). Leer
  • Lee, V. R., Pope, D., Miles, S. y Zárate, R. C. (2024). Cheating in the age of generative AI: A high school survey study of cheating behaviors before and after the release of ChatGPT. Computers and Education: Artificial Intelligence, 7. Resumen
  • Wiggins, G. (1990). The case for authentic assessment. Practical Assessment, Research & Evaluation, 2(2).