Un prompt de verificación arregló un auditor de IA que se equivocaba con seguridad
Un agente que revisaba páginas de lanzamiento falló de cinco formas previsibles. Añadir una etapa que exige citas textuales y descarta lo que no se pueda citar cortó los falsos positivos.
Un desarrollador que firma como AllyOtter montó un agente para auditar 25 páginas de lanzamiento de producto contra las normas de revisión de WarriorPlus y JVZoo y redactar un aviso para cada vendedor. La primera pasada automática parecía correcta y falló de cinco maneras distintas, todas predecibles. Lo que la arregló no fue un regex mejor: fue un segundo paso con un prompt estricto que obliga al modelo a citar.
Los cinco fallos
El auditor marcó la expresión "get rich quick" dentro de listas del tipo "esto NO es para ti". Leyó un "30-Day Action Roadmap" como si fuera un segundo periodo de reembolso. Señaló el código de cuenta atrás de un plugin global cuando en la página no había ningún temporizador. Dio por ausente un aviso legal que un script insertaba más tarde. Y calificó de "sin contacto" una dirección de soporte que era un Gmail normal.
Ninguno de esos errores es raro. Son el mismo problema de siempre: el modelo encuentra texto que encaja con una regla sin comprobar en qué contexto aparece.
Cita o descarta
El arreglo fue añadir una etapa de verificación con este prompt, más o menos:
For each finding, quote the exact text or element from the page and say where it is. If the quote is inside a disclaimer, a 'not for you' list, a testimonial or example content, drop the finding. Say which source the rule comes from: something the reviewer asked us for, or the network's published guideline. If you can't quote it, drop it.
La regla es simple: cada hallazgo lleva su cita literal y su ubicación. Si la cita cae dentro de un descargo, una lista de exclusiones, un testimonio o un ejemplo, el hallazgo desaparece. Y hay que declarar de dónde sale la norma: si la pidió el revisor o si está en la guía publicada por la red. Sin cita, no hay hallazgo.
Aun así, una persona leyó cada borrador antes de enviarlo. De los 20 que salieron, 2 se descartaron, 6 se reescribieron, sobre todo por atribuir afirmaciones a la fuente equivocada, y otros 6 perdieron un enlace de auditoría que le habría enseñado al vendedor una advertencia falsa.
El autor reconoce que la herramienta ya está corregida y el enlace que comparte apunta a su propio sitio. Las cifras son suyas: no hay benchmark independiente ni demo pública del antes y el después.
El patrón se puede trasladar a cualquier flujo de extracción o revisión con un LLM: separar la generación de la verificación y exigir evidencia textual antes de aceptar un resultado. Obligar al modelo a citar es lo que convierte una alucinación en un hallazgo descartable. Lo que no está claro es si aguanta fuera de un nicho con reglas escritas y tan acotadas.

