BookinglyTech News
Inteligencia artificial

Microsoft simula estudiantes con Qwen3-4B para entrenar tutores de IA más rápido

StudentSim crea réplicas digitales de cada alumno a partir de muy pocos datos y supera a GPT-5.4 actuando como estudiante en ajedrez, inglés y matemáticas.

3 min de lecturaThe Decoder0 vistas

Microsoft ha publicado StudentSim, un sistema que entrena tutores de IA contra réplicas digitales de alumnos en lugar de contra personas reales. El método usa Qwen3-4B-Instruct como modelo base y, según sus autores, supera a GPT-5.4 cuando a este se le pide hacer de estudiante en ajedrez, inglés como lengua extranjera y matemáticas. El repositorio está en GitHub y el artículo en arXiv.

El punto de partida es un problema de coste. Entrenar un tutor con un grupo amplio y diverso de alumnos reales sale carísimo y lleva mucho tiempo, y por eso las mejoras en estos tutores se han quedado atrás respecto a los avances en los propios modelos. La propuesta es sustituir a los estudiantes por copias.

Para que la copia sirva, tiene que hacer dos cosas a la vez: equivocarse como se equivocaría ese alumno y corregirse cuando el tutor le da una pista. Los enfoques que ya existían cubren solo una. Unos reproducen con fidelidad el comportamiento del estudiante a partir de datos reales, pero no entienden explicaciones. Otros son modelos de lenguaje a los que se pide actuar de alumno: siguen las pistas, pero no se parecen al estudiante que imitan.

Dos etapas para estirar pocos datos

El obstáculo mayor es la falta de material. En el conjunto de escritura en inglés, el estudiante medio había escrito tres redacciones y más de dos tercios, cinco o menos. Entrenar directamente con tan pocos ejemplos hace que el modelo se sobreajuste a ellos. StudentSim lo reparte en dos fases: primero un modelo base aprende los patrones compartidos de todos los alumnos de una materia, incluidos los errores típicos y cómo revisan sus respuestas después de una pista; después se adapta a cada persona concreta con los pocos registros que haya de ella. En todas las materias el punto de partida es el mismo, el Qwen3-4B-Instruct de Alibaba.

Un tutor de ajedrez como prueba de concepto

Las pruebas se hicieron con 60 estudiantes de ajedrez, inglés y matemáticas, sobre conjuntos de datos públicos de alumnos reales. En ajedrez, StudentSim acierta el siguiente movimiento de un jugador el doble de veces que GPT-5.4 y casi siempre sigue las indicaciones correctivas. El ejemplo que dan los autores es ilustrativo: ante una posición, tres jugadores reales eligieron tres movimientos distintos; un modelo de ajedrez especializado predijo el mismo para los tres, GPT-5.4 falló en los tres y StudentSim acertó cada uno.

Como segunda demostración, usaron una réplica para mejorar un tutor de ajedrez. Jugadores profesionales evaluaron tres versiones: una sin entrenamiento extra, otra entrenada con GPT-5.4 como alumno y otra con StudentSim. La última quedó arriba en las tres medidas, con menos errores factuales graves y mejores notas en calidad de explicación y adaptación al alumno. La entrenada con GPT-5.4 puntuó peor en precisión factual que la que no recibió entrenamiento adicional.

El propio equipo lo presenta como prueba de concepto, no como el mejor tutor posible. El ajedrez vale porque un motor puede juzgar objetivamente si un movimiento es bueno; la redacción y las matemáticas abiertas no tienen una función de puntuación fiable. Lo siguiente que quieren modelar es cómo los alumnos adquieren, retienen y olvidan conocimiento a lo largo de varias sesiones.

Conviene mirar el conjunto con calma. Las réplicas de personas ya se han mostrado propensas al error en otros trabajos, y Microsoft también prueba tutores con alumnos de verdad: en un piloto en Nigeria, estudiantes usaron Copilot dos veces por semana durante seis semanas. OpenAI y Google tienen sus propios modos de aprendizaje, Study Mode y Guided Learning, que se apoyan en instrucciones de sistema y modelos ajustados para enseñar, pero ninguno mantiene un modelo del alumno concreto.