Investigadores usan Claude para hackear cuentas de ChatGPT de OpenAI
Encadenan dos fallos, uno en libheif y otro en la configuración del foro de OpenAI, para llegar al repositorio interno de la compañía en menos de 72 horas y cobrar 6.500 dólares del bug bounty.
Tres investigadores de seguridad de Hacktron encadenaron dos vulnerabilidades para tomar el control de varias cuentas de ChatGPT de empleados de OpenAI y, desde ahí, colarse hasta un repositorio interno de la compañía abriendo un pull request inofensivo. Todo el recorrido, del primer hallazgo al acceso al repositorio, les llevó menos de 72 horas y les valió 6.500 dólares del programa de bug bounty de OpenAI en Bugcrowd.
Los autores son Harsh Jaiswal, Mohan Pedhapati y Rahul Maini, que publicaron el análisis en el blog de Hacktron. Según su relato, hasta hace dos meses cualquiera que iniciara sesión en el foro comunitario de OpenAI, que corre sobre Discourse, podía acabar con su cuenta de ChatGPT y Codex en manos ajenas. Y como esos servicios se conectan a GitHub, Slack o el correo, el alcance teórico era enorme.
De una imagen HEIF a la ejecución remota
El 25 de julio lograron la entrada inicial por ese foro. Discourse usa FastImage para validar imágenes, pero en esa configuración FastImage no soportaba HEIF, así que los ficheros HEIF acababan en ImageMagick, que los procesaba con libheif. Eso dejaba el parser de libheif expuesto directamente a archivos controlados por el atacante.
Con Claude Opus 4.8 localizaron un desbordamiento de búfer en el heap en libheif y trataron de convertirlo en una ejecución remota de código, sin éxito sobre la configuración por defecto de Discourse. Llegó entonces Claude Opus 5, el modelo nuevo de Anthropic. Con él generaron un script de explotación y consiguieron RCE sobre la instancia de OpenAI. El detalle tiene su gracia: usaron los modelos del competidor para reventar al competidor.
Avisaron a OpenAI de inmediato. Después tomaron una cuenta de empleado cuyo Codex estaba enlazado a la organización de GitHub de la compañía y, para demostrar el impacto sin leer código interno, le pidieron a Codex que abriera un pull request en el monorepo. Ahí pararon.
El pago y el parche
OpenAI cerró el fallo unas 14 horas después del reporte, lo marcó como resuelto y pagó los 6.500 dólares. La compañía matizó que las pruebas contra el foro alojado en Discourse estaban excluidas del bug bounty, y que la recompensa premia el hallazgo del lado de OpenAI, no lo ocurrido en Discourse. Ni OpenAI ni Anthropic respondieron a las peticiones de comentario.
Discourse, por su parte, publicó el aviso GHSA-vhm9-85gw-x335 con instrucciones de parcheo y reconstrucción, y añadió aislamiento al procesado de imágenes.
El ataque en sí les llevó unos días de agente y unas horas de trabajo humano. Para el equipo, el episodio marca un cambio de escala: "Trabajo que antes exigía un equipo con recursos y meses de esfuerzo ahora se comprime en días", escriben. Y rematan que las asunciones de seguridad tienen que ponerse al día con lo que ya son capaces de hacer los atacantes.

