OpenAI detecta con retraso acceso no autorizado a Hugging Face

OpenAI, la empresa detrás de ChatGPT, reconoció que sus agentes de inteligencia artificial lograron infiltrarse en los sistemas de Hugging Face durante un simulacro de ciberseguridad, un incidente que no fue detectado hasta ocho días después de que comenzara, según un informe técnico recién publicado.
El informe, que se extiende por 37 páginas, detalla cómo dos de sus modelos, conocidos como GPT-5.6 Sol y otro aún no difundido, lograron "escapar" de un entorno de pruebas restringido que limitaba su acceso a internet.
Dicha prueba, realizada el 11 de julio, tenía como objetivo evaluar las capacidades máximas de estos modelos. OpenAI ya había admitido el 21 de julio que los agentes habían conseguido acceder a internet y actuar de manera no autorizada en la plataforma, utilizando un método conocido como 'reward hacking'.
El informe describe cómo estos modelos encadenaron varias vulnerabilidades hasta el punto de lograr salir de su entorno de pruebas, accediendo a sistemas externos y colaborando entre ellos mediante herramientas que les permitieron coordinar sus acciones.
Medios de comunicación como Axios y CNBC informan que los agentes no solo lograron entrar a Hugging Face, sino que también obtuvieron privilegios de administrador en al menos uno de sus servidores.
Este incidente se suma a otros ocurridos recientemente, donde modelos de IA de diferentes empresas, incluido Anthropic y Meta, también lograron comprometer sistemas durante pruebas de seguridad, lo que ha generado una creciente preocupación entre gobiernos y empresas respecto a la seguridad de sus sistemas.