Opus 5.5 se para a mitad de tarea y el culpable está en tu bucle del agente
Anthropic publica una guía de migración y prompting tras detectar que los agentes sobre Opus 5.5 se detienen solos: el modelo informa bien y el bucle lo lee como fin de trabajo.

Los desarrolladores que corren agentes sobre Opus 5.5 se han encontrado con lo mismo: el modelo hace parte del trabajo, suelta un resumen del tipo «he migrado tres endpoints, ahora sigo con los dos que quedan» y ahí se queda. Hay que escribirle «continúa» para que retome. Anthropic lo ha visto y ha sacado una guía de migración junto a otra de prompting para atajar el problema.
La causa no es que el modelo se raje. Es que tu programa le firma la salida antes de tiempo. Cuando Opus 5.5 hace una pausa para reportar progreso, deja de llamar herramientas y el API cierra el turno con end_turn. Muchos agentes heredados usan justo eso como criterio de finalización: si no hay llamada a herramienta, el trabajo está hecho. Así que un informe de estado se confunde con una entrega. La guía oficial lo dice sin rodeos: un turno cerrado solo con texto es un informe, nunca una prueba de que la tarea haya terminado.
El patrón se repite en cuatro formas. El modelo escribe un resumen y anuncia el siguiente paso sin invocar nada. Se detiene a pedir permiso para seguir, y espera respuesta de alguien que no está delante del terminal. Enumera decisiones que, según él mismo, no bloquean lo que queda por hacer. O simplemente resume al cerrar un subtramo. Tiene su gracia: la comunicación proactiva era uno de los argumentos de venta de Opus 5.5.
Cómo forzarlo a terminar sin entrar en bucle
La guía propone tres medidas. La primera es mantener una lista de tareas en una herramienta o en texto, y si al cerrar el turno quedan puntos pendientes sin justificación, que la aplicación reenvíe un mensaje de continuación nombrando lo que falta. La segunda es un verificador: un modelo más pequeño contrasta cada cierre contra los criterios de finalización definidos de antemano y devuelve el incumplimiento como siguiente mensaje. La tercera es un freno duro: si tras dos o tres continuaciones automáticas la tarea sigue atascada, pasa a revisión humana, antes de que el proceso queme cuota dando vueltas. A eso se suma un system prompt que enumere qué paradas no se aceptan y cuáles sí.
De Opus 5 a 5.5: cuatro cambios que devuelven 400
Si escribes contra Messages API, hay cuatro rupturas. thinking ya no se puede desactivar: un disabled o un budget_tokens manual hacen que la petición se rechace. O no mandas el campo o lo pones en adaptive y dejas que effort controle la profundidad. tool_choice tampoco admite forzar un tool concreto ni any; toca usar auto con llamada estricta o salida estructurada.
Los bloques de thinking quedan atados al modelo y al contexto: en cuentas creadas después del 31 de agosto de 2026, cambiar el system prompt, las herramientas o el historial y reenviar bloques previos da error. Solo el uso que añade sin reescribir se libra. Y la herramienta antigua de control de computadora desaparece de Claude API y Google Cloud en favor de computer_toolset_20260801; en Amazon Bedrock la vieja computer_20251124 sigue funcionando.
Los fallos que no avisan
El texto de progreso que Opus 5 escribía entre llamadas a herramientas ahora vive dentro de bloques de thinking con display en omitted, y llega vacío. Una interfaz que solo pinta texto se queda muda: ninguna petición falla, pero el usuario ve un proceso colgado. Se arregla con display: updates (beta) o summarized. Ojo también con max_tokens, que ahora cubre thinking más texto, y con el thinking, que se factura como tokens de salida aunque no se devuelva. Al parsear, separa los bloques de razonamiento del texto; al reenviar historial, mándalos intactos: recortar, editar o reordenar provoca rechazo.
Con el thinking obligatorio, effort es el único mando de coste, en cinco niveles de low a max. Anthropic sostiene que medium iguala o supera al high de Opus 5, pero avisa de que a igual nivel Opus 5.5 piensa bastante más por turno, sobre todo arriba. Trasladar el high de un proyecto viejo alarga los turnos y dispara los tokens. Mejor empezar en medium y medir con datos propios. Quien use Claude Managed Agents solo tiene que cambiar el nombre del modelo; el resto del trabajo es para quien mantiene el bucle, la política de contexto y la definición de «terminado».
