BookinglyTech News
Inteligencia artificial

Anthropic acusa al modelo chino GLM-5.3 de servir para ciberataques

La compañía afirma en un informe de red teaming que las salvaguardas del modelo de pesos abiertos de Zhipu AI se pueden saltar y que con él se genera contenido malicioso.

2 min de lecturaTom's Hardware0 vistas

Anthropic ha publicado un informe en el que sostiene que GLM-5.3, el modelo de pesos abiertos de la china Zhipu AI, se puede emplear para generar contenido malicioso y para montar ciberataques. La compañía asegura además que sus salvaguardas se sortean con varios métodos conocidos, y enmarca esas capacidades en lo que llama "clase Mythos", la etiqueta que utiliza en su trabajo de red teaming de frontera.

Qué dice el informe

El documento, firmado por el equipo de red teaming de frontera de Anthropic, describe varias vías para desactivar las barreras del modelo y afirma que con ellas se puede producir material ofensivo a demanda. Las salvaguardas, según el informe, no aguantan un intento decidido de saltárselas.

La afirmación no está sola. El Center for AI Standards and Innovation, dependiente del NIST, ha publicado su propia evaluación de las capacidades ciber del modelo. Es decir, hay al menos dos evaluadores que han mirado el mismo modelo con la misma pregunta encima de la mesa: qué se puede hacer con él cuando los filtros no están.

El contexto

El informe aparece en plena discusión sobre el ritmo del desarrollo de IA. Anthropic lleva tiempo pidiendo gobernanza y regulación para la frontera, y su consejero delegado, Dario Amodei, ha defendido públicamente que conviene frenar. La compañía publicó Claude Opus 5.5 y Claude Sonnet 5.5 días después de que se levantaran las alarmas.

Para quien administra sistemas, el punto interesante no es la etiqueta. Un modelo de pesos abiertos se descarga y se ejecuta donde uno quiera: no hay un proveedor filtrando prompts por delante ni un interruptor remoto que apague el modelo si alguien lo afina para otra cosa. Si responde a peticiones ofensivas, el control pasa a ser responsabilidad de quien lo despliega, y eso incluye a cualquiera que lo levante en su propia infraestructura.

Queda por ver qué técnicas concretas hay detrás de la afirmación y si los evaluadores independientes llegan a la misma conclusión. De momento, lo que hay es una acusación de una empresa que compite en el mismo mercado que el modelo señalado.