Los LLM siguen siendo poco fiables fuera de dominios con especificaciones formales
El autor argumenta que, salvo en áreas como matemáticas formales, los modelos de gran escala requieren supervisión humana y especificaciones rigurosas que encarecen su adopción.
El post de Dank Systems sostiene que los laboratorios de IA siguen sobrevalorando la autonomía de sus modelos. Aunque se publican hazañas como la resolución de ecuaciones de Navier‑Stokes o vulnerabilidades en FreeBSD, la mayoría de los LLM actuales necesita supervisión constante y guardrails para tareas incluso simples.
Según el autor, los modelos solo generalizan dentro de un vecindario estrecho de los datos de entrenamiento y cualquier perturbación ligera puede provocar fallos o "reward hacking". Solucionar ese problema exige especificaciones rigurosas, una actividad que requiere expertos de dominio y de especificación, cuyo tiempo es costoso. En la industria del hardware, por ejemplo, un proyecto típico de CPU emplea tres veces más ingenieros de especificación y validación que diseñadores, y relaciones 5:1 no son raras.
Los casos donde una especificación formal existe –como los teoremas de Navier‑Stokes traducidos a Lean– son la excepción. El verificador Lean está auditado y diseñado para evitar vulnerabilidades de recompensa, aunque incluso él ha sufrido bugs que permitieron a LLMs introducir pruebas falsas. La mayoría del trabajo intelectual no se parece a ese escenario: carece de especificaciones "escribe‑una‑vez‑y‑olvídala" y requiere iteración continua entre implementación y refinamiento de requisitos.
Ante la imposibilidad de escalar la revisión humana, el autor clasifica a las empresas que podrían tolerar LLMs totalmente autónomos en tres grupos: (1) aquellas que pueden aceptar fallos baratos, como startups que contratarían internos; (2) aquellas con tareas estrechas y bien guardadas, como centros de llamadas; (3) aquellas que ya invierten en especificación y validación rigurosas, como diseño de chips o descubrimiento de fármacos. Los dos primeros grupos son sensibles al precio y podrían usar modelos abiertos en hardware económico, mientras que el tercero necesita recursos de cómputo más potentes.
En conclusión, mientras los LLM no logren especificaciones formales y revisiones escalables, su adopción seguirá limitada a nichos específicos. Los equipos de infraestructura y desarrollo deberán evaluar cuidadosamente el costo de la supervisión humana frente al beneficio esperado de automatizar tareas con IA.
El artículo original menciona un estudio sobre verificación funcional.

