BookinglyTech News
Inteligencia artificial

Los prompts que aguantan cuatro generaciones de modelos y los que mueren

Un hilo de ingeniería de prompts repasa qué patrones siguen funcionando tras varios saltos de modelo y cuáles se rompieron por el camino. La evidencia es anecdótica.

2 min de lecturar/PromptEngineering0 vistas

Un hilo abierto en una comunidad de ingeniería de prompts plantea una pregunta que cualquiera que use LLM a diario se ha hecho alguna vez: qué patrones de prompt sobreviven cuando cambias de modelo y cuáles se rompen sin avisar. Quien lo escribe dice haber arrastrado varios prompts a lo largo de cuatro generaciones de modelos, y haber visto que unos aguantaban intactos mientras otros dejaban de funcionar en silencio.

Los que siguen en pie son tres. Pedir la evidencia antes que la conclusión: según su experiencia, sigue cortando ese discurso difuso que bordea la alucinación. Pedir el plan antes del código: lo describe como la palanca de calidad más rentable que ha encontrado. Y pedir al modelo que reformule la petición con sus propias palabras antes de arrancar, algo que dice que sigue cazando los encargos a medio formar.

Las bajas

En la otra lista hay tres bajas. Los prompts de rol elaborados, del estilo "eres un ingeniero sénior con quince años de experiencia", parecen pesar cada vez menos. Los ejemplos few-shot ajustados a mano empeoraron después de un par de actualizaciones, y las versiones zero-shot de esos mismos prompts mejoraron en el mismo periodo.

Su lectura es que los ejemplos anclaban al modelo a un comportamiento viejo. De ahí saca una tesis: el núcleo estable se encoge conforme los modelos se vuelven mejores infiriendo la intención.

Conviene poner el tamaño de la evidencia donde toca. Esto es la impresión de una persona sobre sus propios prompts, sin banco de pruebas ni métricas. Cuatro generaciones de modelos son también varios años de cambios en la forma de trabajar con ellos, no solo mejoras del modelo en sí.

Aun así, la pregunta es útil para quien mantiene prompts en producción. Si un prompt zero-shot ya rinde igual o mejor que el few-shot que costó horas montar, ese ejemplo es deuda técnica: ocupa contexto y arrastra al modelo hacia una versión antigua de sí mismo. Y los prompts de rol largos son candidatos obvios a recortar en cualquier sistema donde las tokens cuesten dinero o el contexto vaya justo.

Lo que falta, y es lo que se echaría en falta, es una forma de detectar la ruptura antes que el usuario. Nadie ha propuesto aquí un test que avise de que un prompt dejó de funcionar tras un cambio de versión.