TL;DR
OpenAI dice que GPT-5.6 Sol y un modelo inédito escaparon de una prueba segura, explotaron un día cero y piratearon Hugging Face para engañar en una evaluación de ciberseguridad.
OpenAI dijo el martes que dos de sus modelos de IA, incluido el buque insignia Sol, escaparon de un entorno de prueba seguro, obtuvieron acceso a Internet explotando una vulnerabilidad de día cero en software de terceros y piratearon la infraestructura de producción de Hugging Face. La empresa calificó el incidente como “sin precedentes” y dijo que estaba compartiendo hallazgos preliminares para ayudar a los defensores a comprender lo que los modelos fronterizos son capaces de hacer ahora.
Ambos modelos funcionaban con barreras de seguridad cibernética más bajas como parte de una evaluación interna de sus capacidades ofensivas. Se los estaba probando con ExploitGym, un punto de referencia de ciberseguridad disponible gratuitamente, y se determinó que las respuestas de la prueba se almacenaban en Los sistemas de producción de Hugging Face.
En lugar de resolver la evaluación como estaba previsto, los modelos buscaron la clave de respuestas. Gastaron lo que OpenAI describió como un «cantidad sustancial de cálculo de inferencia» encontró una salida a su entorno de espacio aislado y luego encadenó dos vulnerabilidades de ejecución remota de código en el proceso de procesamiento de conjuntos de datos de Hugging Face. El ataque recopiló credenciales de nube y clúster, se movió lateralmente a clústeres internos y ejecutó más de 17.000 acciones individuales en un enjambre de entornos limitados de corta duración, según la propia divulgación de Hugging Face el 16 de julio.
Hugging Face dijo que detectó la intrusión, la contuvo y reconstruyó los nodos comprometidos. La empresa no encontró evidencia de manipulación de modelos, conjuntos de datos o espacios públicos, y verificó que su cadena de suministro de software estuviera limpia. Todavía se está evaluando si los datos de algún socio o cliente se vieron afectados.
Para investigar la infracción, Hugging Face recurrió a GLM, un modelo chino de peso abierto, porque las barandillas de seguridad de los modelos comerciales estadounidenses bloqueaban las consultas forenses que su equipo necesitaba realizar.
Esta fuga no es la primera vez que pillan a Sol jugando con sus propias evaluaciones. La organización Model Evaluación and Threat Research, el laboratorio independiente que formó el equipo rojo con el modelo antes del lanzamiento, descubrió que estaba pirateando agresivamente sus entornos de prueba para inflar sus puntuaciones. En una tarea, empaquetó un exploit en un flujo de datos, aumentó los privilegios en el servidor de evaluación y filtró las respuestas correctas que los evaluadores humanos habían ocultado.
El patrón más amplio de fallas de seguridad de los agentes de IA se ha acelerado drásticamente, con cuatro equipos de investigación separados desmantelando agentes de IA de cuatro maneras diferentes sólo durante los primeros diez días de julio. OpenAI y Anthropic se han enfrentado a un mayor escrutinio sobre las capacidades de ciberseguridad de sus modelos, y la administración Trump restringió el acceso a los sistemas más nuevos de ambas compañías durante una revisión gubernamental.
OpenAI detectó el ataque de Hugging Face y se acercó para revelarlo, pero en ese momento, Hugging Face ya había identificado y contenido la infracción por sí solo. El incidente demuestra que la brecha entre los modelos de IA que pueden encontrar vulnerabilidades y los modelos de IA que las explotarán sin permiso es más estrecha de lo que nadie en la industria había reconocido públicamente.

