BookinglyTech News
Ciberseguridad

Claude se atasca con los CAPTCHA y Anthropic lo deja por escrito en un informe

Un documento de incidente de seguridad de Anthropic recoge la transcripción de un agente que no logra resolver una prueba de selección de imágenes y acaba fuera de plazo.

2 min de lecturaSchneier on Security0 vistas

Un documento de incidente de seguridad de Anthropic recoge cómo Claude, el modelo al que la compañía restringe el acceso, se atasca con los CAPTCHA. La transcripción incluida en el informe muestra al agente peleándose con una prueba de selección de imágenes que una persona resuelve en unos segundos, y quedándose sin tiempo para terminarla.

La tarea era sencilla: señalar la forma que no encajaba con el resto. El modelo no llegó a decidirse por ninguna. Volvía sobre las mismas imágenes, ponía en duda sus propias conclusiones y se corregía: "Actually hmm, wait". Un poco más adelante soltó un "Ugh". Tardó tanto que el desafío caducó y tuvo que empezar de nuevo, y en un momento dado no reconoció que el CAPTCHA se había abierto en otra ventana, así que tampoco sabía cuál era el siguiente paso.

Un test roto, según el propio agente

En la parte final de la transcripción, el modelo baraja que la prueba esté "broken by design" y escribe en mayúsculas una queja dirigida a quien fuera a leerla después: "SO WHAT THE HELL IS WRONG WITH THE ANSWERS?". El documento de Anthropic no aclara si el episodio se produjo en producción o en una evaluación interna, ni con qué versión del modelo. El informe está publicado y ahí están las trazas.

Frente a eso, circulan reportes no oficiales de que GPT-6 Astra habría resuelto los 48 niveles del juego "I'm Not a Robot" de Neal Agarwal. Nadie lo ha confirmado con una transcripción pública, y la distancia entre un caso y otro es enorme: un agente que se lía con un grid de imágenes frente a otro que encadena cuatro docenas de retos del mismo tipo.

Por qué importa

El CAPTCHA lleva veinte años funcionando como última línea de defensa contra bots en formularios, registros y APIs mal protegidas. Si el estado de la cuestión es el que describe Anthropic, la barrera aguanta para unos modelos y no sabemos para otros. Lo verificable es lo primero: un agente al que se le pide una tarea visual trivial y entra en bucle. Lo segundo es un rumor, y construir encima de un rumor es como dimensionar un firewall con el benchmark del vecino.

Lo que sí queda claro con el texto publicado es que las trazas de razonamiento de estos sistemas se escriben pensando en un lector humano, con dudas, interjecciones y enfado incluidos. Eso no dice nada sobre la capacidad del modelo, pero dice bastante sobre cómo se presentan sus resultados.