Beatriz: un filtro epistemico gratuito para evitar el envenenamiento de datos en el afinamiento de LLMs
Con un portátil Toshiba de 2006 y GPUs T4 gratuitas, el autor muestra cómo un proxy ligero puede detectar y bloquear datos maliciosos durante la fine‑tuning de modelos de lenguaje.

Beatriz es un proxy defensivo que se instala entre la fuente generativa y el modelo que se va a afinar. Su objetivo es detectar ataques de envenenamiento de datos que alteran hechos específicos sin afectar métricas globales como la perplexidad.
El proyecto se probó con cinco arquitecturas: GPT‑2 (124 M), Qwen‑2.5‑0.5B, TinyLlama‑1.1B, Pythia‑1.4B y Phi‑3‑mini‑4k‑instruct (3.8 B). Cada experimento se ejecutó en una máquina Toshiba Satellite 2006 con 2 GB de RAM, orquestando las tareas en GPUs T4 de Kaggle sin coste.
¿Cómo funciona?
- Verificación de texto: Beatriz compara cada fragmento generado con un corpus inmutable usando similitud coseno en el espacio de embeddings.
- Pérdida compuesta: Se combinan dos términos:
- LceLce mantiene la fluidez lingüística.
- LcontrastivaLcontrastiva (Softplus) impone presión para que el modelo se mantenga anclado a la verdad aun cuando la entropía cruzada se satura.
- Latencia: 0,1 ms por decisión, lo que no afecta el flujo de entrenamiento.
Resultados
- GATE_ONLY (filtrado puro) aporta el 65 % del beneficio defensivo.
- El término contrastivo aporta el 35 % restante.
- En un benchmark de 30 hechos multi‑dominio sin ataque, Beatriz alcanza +4,19 ± 0,08 de margen de verdad, con 0,93 de precisión y 0,80 de recall.
¿Qué se publica ahora?
- Código y notebooks de EXP08 y EXP09, reproducibles en Kaggle.
- Whitepaper (WHITEPAPER.md/WHITEPAPER.es.md) con los 16 experimentos.
- Manual correctivo (docs/MANUAL_CORRECTIVO.md) con especificaciones matemáticas de la pérdida.
El repositorio de GitHub está abierto a la comunidad: https://github.com/EduardoAyalaT/beatriz-epistemic-gate- .
Para cualquier desarrollador o investigador que trabaje con fine‑tuning local, Beatriz ofrece una solución de bajo coste que puede integrarse sin modificar los bucles de entrenamiento.
¿Por qué importa?
El envenenamiento de datos sigue siendo una amenaza silenciosa, especialmente para equipos pequeños que afinan modelos localmente. Beatriz demuestra que con recursos modestas se puede implementar una defensa efectiva. La próxima fase del proyecto incluirá pruebas de escalabilidad y soporte para más arquitecturas.

