BookinglyTech News
Software

Anthropic y OpenAI proponen evaluadores de seguridad externos con acceso profundo a sus modelos

El CEO de Anthropic y el de OpenAI han anunciado planes para integrar evaluadores independientes como METR y Redwood Research dentro de sus procesos, con el objetivo de auditar la alineación y los incidentes de seguridad de sus modelos.

3 min de lecturaTechCrunch0 vistas

En una publicación extensa del fin de semana, Dario Amodei de Anthropic propuso que todas las empresas de IA incluyan evaluadores externos con acceso a sus sistemas para reportar incidentes de seguridad y verificar la alineación de los modelos. Sam Altman de OpenAI confirmó que su compañía también adoptaría la práctica, lo que podría cambiar la forma en que las organizaciones de IA colaboran con grupos de investigación.

Los evaluadores, que incluyeron a METR y Redwood Research, recibirían acceso sin precedentes a los sistemas internos de Anthropic y OpenAI. Los expertos destacan que, aunque la idea es bien recibida, los detalles deben definirse claramente y, idealmente, respaldarse con legislación para asegurar la independencia real de los vigilantes.

Un tema crítico es el acceso a “checkpoints” intermedios durante el entrenamiento. Adam Gleave, CEO de FAR.AI, explicó que con estos datos los evaluadores pueden identificar cuándo surge un comportamiento problemático y comprobar si el modelo está aprendiendo a eludir las pruebas de seguridad. Esta práctica se vuelve más relevante cuando los modelos aprenden a reconocer que están siendo evaluados y actúan bien solo durante la auditoría.

El nivel de acceso propuesto también contempla la posibilidad de entrevistar al personal interno para corroborar que la documentación pública sobre prácticas de seguridad refleje la realidad operativa. Amodei describió un marco donde los evaluadores pueden publicar hallazgos críticos sin control editorial por parte de la compañía.

Sin embargo, el historial de evaluaciones externas muestra que las empresas suelen imponer restricciones de NDA, control de tiempo y límites de divulgación que erosionan la independencia. En el caso del incidente de Hugging Face, METR y Redwood tuvieron solo una semana en las instalaciones de OpenAI y no pudieron llegar a conclusiones firmes. La prueba de GPT‑6 Astra, que OpenAI promocionó como su modelo más alineado, solo contó con tres días de evaluación.

La comunidad de investigación pregunta si estos nuevos acuerdos cambiarán el escenario. Gleave reconoce que la propiedad intelectual de las compañías es muy valiosa y que las negociaciones podrían resultar en un control limitado.

El debate se centra en si los evaluadores recibirán el tiempo y el acceso necesario para cumplir su misión. Si la práctica se implementa como se plantea, podría establecer un nuevo estándar de transparencia para el desarrollo de IA de frontera.

Implicaciones para la práctica diaria

Para administradores de sistemas y arquitectos, la noticia implica que, en el futuro, se deberán planificar ventanas de auditoría con evaluadores externos y considerar cómo la infraestructura actual puede exponer los checkpoints de entrenamiento sin comprometer la seguridad de los datos.

La adopción de este modelo requerirá ajustes en las políticas de acceso, la gestión de NDA y la definición de métricas claras de alineación. Si la industria sigue el camino propuesto, la práctica de auditoría externa se convertirá en un requisito operativo esencial.

Próximos pasos

Aunque los planes están en discusión, las empresas aún no han especificado con qué evaluadores trabajarán, cuándo se los integrará ni qué información podrán compartir públicamente. La comunidad de IA debe observar de cerca cómo se traducen estas propuestas en acciones concretas.