BookinglyTech News
Inteligencia artificial

DSPy 2.6 y MIPROv2: compilar prompts en lugar de escribirlos a mano

El framework de Stanford NLP consolida su enfoque declarativo: firmas tipadas, modulos reutilizables y un optimizador que genera las instrucciones y los ejemplos contra una metrica.

2 min de lecturaDev.to0 vistas

DSPy 2.6 consolida la compilacion declarativa de prompts en Python. En lugar de retocar frases a mano, declaras firmas con tipos, montas un pipeline con modulos y dejas que un optimizador genere las instrucciones y los ejemplos few-shot contra una metrica de evaluacion. El proyecto vive en el repositorio de stanfordnlp.

La pieza que ha circulado estos dias sobre la version 2.6 viene, en realidad, de un dossier promocional de un blog propio, y eso se nota en el tono.

Que propone el framework

La idea de fondo es la de siempre que alguien compara prompts con codigo: si escribes instrucciones a mano, estas acoplado al modelo concreto. Cambia la version de la API, cambia la capa de cuantizacion en el servidor o llega una consulta fuera del patron de entrenamiento, y el sistema se cae. El texto original lo ilustra con un dato llamativo: la tasa de error al parsear JSON pasando del 2% al 35% tras un cambio de modelo. No hay nada que respalde esa cifra mas alla de la afirmacion del propio articulo.

La respuesta de DSPy es separar el programa de los pesos y de los prompts. El desarrollador define signatures con tipado estricto via Pydantic, encadena modulos como dspy.Predict, dspy.ChainOfThought, dspy.ReAct o dspy.ProgramOfThought, y no escribe nunca un prompt de sistema. Del ajuste se encarga un teleprompter, y el nombre que mas se repite es MIPROv2, que propone variaciones de instruccion, sintetiza ejemplos demostrativos en bucle cerrado, los evalua contra una metrica y devuelve la combinacion que mejor puntua para ese modelo en concreto.

Lo que el articulo no ensena

Ahi se acaba lo aprovechable. El texto promete una batalla de benchmarks con cuatro modelos de frontera en HotpotQA, GSM8K-Hard y otros conjuntos, y anuncia ganancias de entre el 25% y el 40% frente a prompts escritos por ingenieros senior. Justo en ese punto el original se corta: no hay tabla, ni resultados, ni script reproducible. Tampoco hay demo de la implementacion industrial que se anuncia mas arriba.

Los nombres de modelo que cita el dossier no coinciden con ninguna version publicada que se pueda consultar, lo que resta credibilidad a todo el bloque comparativo. Y el marco general ("alquimia de prompts", "ingenieria de sistemas neurales deterministicos") es marketing, no medicion.

Dicho esto, el enfoque tiene recorrido y no es exclusivo de este proyecto: tratar el prompt como un artefacto que se compila y se versiona, en vez de como texto que se reescribe a mano cada vez que el proveedor toca algo, es una decision de arquitectura razonable. Quien quiera evaluar si MIPROv2 le sirve deberia ir a la documentacion y al codigo, y montar su propia metrica, porque la unica cifra que circula en este anuncio viene sin respaldo detras.