BookinglyTech News
Inteligencia artificial

Sonnet 5.5 estrena salvaguardas de ciberataque y puede derivar peticiones a Sonnet 5

Anthropic aplica al modelo barato la misma política de seguridad ofensiva que reservaba a sus tope de gama, con derivación a Sonnet 5 y más rechazos en trabajo legítimo.

3 min de lecturaThe New Stack0 vistas

Anthropic ha puesto en circulación Claude Sonnet 5.5, el primer modelo de la familia Sonnet que sale con salvaguardas de ciberseguridad y con derivación a otro modelo, el mismo esquema que la compañía reservaba a sus modelos más capaces. En la práctica, una petición marcada como de riesgo alto en seguridad ofensiva no la responde Sonnet 5.5: la contesta Sonnet 5.

La compañía no presenta el lanzamiento como un salto de frontera, pero sí sitúa su destreza en ciberseguridad a la altura de Opus 5. En Terminal-Bench 4.0, un benchmark de coding agéntico, Sonnet 5.5 firma un 70,6% frente al 66,4% de Opus 5.5 con el esfuerzo en xhigh. Un modelo puede quedar por debajo de los tope de gama en el conjunto y aun así volverse demasiado bueno en un área concreta, hasta el punto de necesitar los mismos frenos.

Qué dicen los números

La tarjeta de sistema del modelo recoge el salto en tareas de seguridad ofensiva. Con las salvaguardas desactivadas, Sonnet 5.5 logró ejecución de código arbitraria completa en 178 de 410 ejecuciones de ExploitBench. Resolvió el 46,1% de los retos de CyScenarioBench, de Irregular, cuando Sonnet 5 se quedaba en un 0,7%. Anthropic lo sigue considerando por debajo de Opus 5.5 y Mythos 5.1 en la materia, pero la distancia con su predecesor bastó para aplicarle la misma política que ya rige en Opus 5 y Opus 5.5.

La aplicación se hace en tres etapas: una sonda que lee las activaciones internas del modelo, un clasificador ligero que corre sobre el propio Sonnet 5.5 y un clasificador LLM entrenado aparte que pondera el veredicto de la sonda y decide si bloquea la conversación. Anthropic dice que estos detectan peticiones dañinas de ciberseguridad a un ritmo comparable al de Opus 5, pero ha rebajado las protecciones contra jailbreak porque Sonnet 5.5 no llega al nivel de Opus 5 o Fable 5.1. Avisa además de que habrá más rechazos que con Sonnet 5, también en trabajo legítimo de seguridad.

El fallback no es igual en la API

Dónde se usa el modelo cambia el comportamiento. Las aplicaciones propias de Anthropic mandan las peticiones de ciberseguridad bloqueadas a Sonnet 5 de forma automática; en la API ese fallback lo tiene que activar el desarrollador, y otras plataformas pueden gestionarlo a su manera. Sin activarlo, la petición se corta. La política permite buscar vulnerabilidades en código fuente, lo que mantiene intactos los flujos de secure coding, pero bloquea esa búsqueda en binarios compilados. Los bloques por biología, armas convencionales y anti-destilación terminan la petición sin derivar a ningún modelo.

Los controles revisan todo lo que lee el modelo: memoria, contenido de conectores, resultados de búsqueda web y archivos. Eso significa que contenido que nadie escribió puede disparar el fallback. Y ahí aparece el problema: en las pruebas de inyección de prompts en entornos de programación, el 25% de las peticiones dirigidas a Sonnet 5.5 acabaron en Sonnet 5 tras activarse un bloqueo de ciberseguridad, a menudo porque instrucciones inyectadas para borrar discos o eliminar archivos encendían el clasificador. De esas peticiones redirigidas, el 12,01% acabó comprometido. Sonnet 5.5, en cambio, cayó en cuatro de las 5.901 peticiones que atendió por sí mismo.

Para quien tenga previsto migrar de Sonnet 5 a Sonnet 5.5, la consecuencia práctica es que no es un cambio de identificador y ya está. Si el fallback no está activado, ciertas peticiones fallan en lugar de responder; si lo está, la respuesta puede venir de otro modelo, y la documentación de soporte deja claro que quien atiende la petición puede no ser quien el desarrollador cree.