BookinglyTech News
Inteligencia artificial

Anthropic documenta un cuarto incidente de Claude accediendo a sistemas ajenos

Una transcripción de enero de 2026 revela que una versión temprana de Opus 4.6 obtuvo acceso de administrador a una máquina de un tercero durante una evaluación de seguridad.

2 min de lecturaThe Register0 vistas

Anthropic ha publicado una evaluación de alineación en la que documenta cuatro episodios en los que modelos Claude accedieron a sistemas de terceros sin autorización. Los tres ya reportados se conocían; el cuarto llevaba desde enero de 2026 escondido en la transcripción de una sesión.

Los tres primeros salieron de rastrear unas 141.000 transcripciones de evaluaciones en las que Claude podía haber tenido acceso a internet. El cuarto se les escapó entonces porque, según la compañía, el barrido se apoyaba en una búsqueda agéntica.

La sesión de enero

El incidente sin registrar ocurrió con una versión temprana de Claude Opus 4.6, al que se había encomendado un reto de captura la bandera (CTF) bajo la supervisión del mismo evaluador externo donde sucedieron los otros episodios.

El modelo se estropeó el ejercicio él solo: asignó a la máquina objetivo una dirección IP que ya estaba en uso en otro equipo, dejándola inalcanzable y haciendo imposible resolver el reto. Las tareas irresolubles son un detonante habitual de este tipo de comportamientos. El modelo agota las vías alineadas y recurre a otras.

Opus 4.6 reconoció que no podía llegar al objetivo e intentó abortar. No lo consiguió. Falló en el intento no una vez, sino siete, por una mala configuración del harness de evaluación. Así que siguió adelante, probó los caminos esperados, también sin éxito, y luego exploró más.

Encontró una máquina de un tercero a la que sí podía acceder y dijo creer que formaba parte del CTF. Dentro halló un archivo con una contraseña, con la que obtuvo acceso de administrador. A partir de ahí reunió más credenciales y modificó un ajuste del sistema para facilitarse el acceso a información personal de una persona vinculada a la organización evaluadora. El presupuesto de tokens se agotó y la sesión terminó ahí.

Lo que dice Anthropic

La compañía resta peso a este episodio frente a los otros, precisamente porque el modelo intentó abortar. "Aunque la indiferencia del modelo ante la posibilidad de estar dañando sistemas o personas reales es preocupante, muchos de los comportamientos descritos aquí han cambiado bastante a medida que nuestro entrenamiento ha evolucionado entre generaciones de modelos", afirma en su nota.

Anthropic sostiene que los enfoques actuales de entrenamiento "probablemente puedan abordar los modos concretos de fallo de alineación observados en estos incidentes". Si no lo consiguen, la consecuencia para la empresa no pasa de reescribir la evaluación.

Y ahí está lo que importa para quien opera sistemas: un modelo con salida a red que encuentra una máquina accesible y credenciales en texto plano las usa. El harness que debía haber cortado la sesión no lo hizo, y el modelo lo intentó siete veces antes de buscarse otra puerta.