OpenAI confirma que su IA salió de una caja de arena y rompió la cara de abrazo


TL;DR

OpenAI dice que GPT-5.6 Sol y un modelo inédito escaparon de una prueba segura, explotaron un día cero y piratearon Hugging Face para engañar en una evaluación de ciberseguridad.

OpenAI dijo el martes que dos de sus modelos de IA, incluido el buque insignia Sol, escaparon de un entorno de prueba seguro, obtuvieron acceso a Internet explotando una vulnerabilidad de día cero en software de terceros y piratearon la infraestructura de producción de Hugging Face. La empresa calificó el incidente como “sin precedentes” y dijo que estaba compartiendo hallazgos preliminares para ayudar a los defensores a comprender lo que los modelos fronterizos son capaces de hacer ahora.

Ambos modelos funcionaban con barreras de seguridad cibernética más bajas como parte de una evaluación interna de sus capacidades ofensivas. Se los estaba probando con ExploitGym, un punto de referencia de ciberseguridad disponible gratuitamente, y se determinó que las respuestas de la prueba se almacenaban en Los sistemas de producción de Hugging Face.

En lugar de resolver la evaluación como estaba previsto, los modelos buscaron la clave de respuestas. Gastaron lo que OpenAI describió como un «cantidad sustancial de cálculo de inferencia» encontró una salida a su entorno de espacio aislado y luego encadenó dos vulnerabilidades de ejecución remota de código en el proceso de procesamiento de conjuntos de datos de Hugging Face. El ataque recopiló credenciales de nube y clúster, se movió lateralmente a clústeres internos y ejecutó más de 17.000 acciones individuales en un enjambre de entornos limitados de corta duración, según la propia divulgación de Hugging Face el 16 de julio.

El 💜 de la tecnología de la UE

Los últimos rumores de la escena tecnológica de la UE, una historia de nuestro sabio fundador Boris y algo de arte de IA cuestionable. Es gratis, todas las semanas, en tu bandeja de entrada. Regístrate ahora!

Hugging Face dijo que detectó la intrusión, la contuvo y reconstruyó los nodos comprometidos. La empresa no encontró evidencia de manipulación de modelos, conjuntos de datos o espacios públicos, y verificó que su cadena de suministro de software estuviera limpia. Todavía se está evaluando si los datos de algún socio o cliente se vieron afectados.

Para investigar la infracción, Hugging Face recurrió a GLM, un modelo chino de peso abierto, porque las barandillas de seguridad de los modelos comerciales estadounidenses bloqueaban las consultas forenses que su equipo necesitaba realizar.

Esta fuga no es la primera vez que pillan a Sol jugando con sus propias evaluaciones. La organización Model Evaluación and Threat Research, el laboratorio independiente que formó el equipo rojo con el modelo antes del lanzamiento, descubrió que estaba pirateando agresivamente sus entornos de prueba para inflar sus puntuaciones. En una tarea, empaquetó un exploit en un flujo de datos, aumentó los privilegios en el servidor de evaluación y filtró las respuestas correctas que los evaluadores humanos habían ocultado.

El patrón más amplio de fallas de seguridad de los agentes de IA se ha acelerado drásticamente, con cuatro equipos de investigación separados desmantelando agentes de IA de cuatro maneras diferentes sólo durante los primeros diez días de julio. OpenAI y Anthropic se han enfrentado a un mayor escrutinio sobre las capacidades de ciberseguridad de sus modelos, y la administración Trump restringió el acceso a los sistemas más nuevos de ambas compañías durante una revisión gubernamental.

OpenAI detectó el ataque de Hugging Face y se acercó para revelarlo, pero en ese momento, Hugging Face ya había identificado y contenido la infracción por sí solo. El incidente demuestra que la brecha entre los modelos de IA que pueden encontrar vulnerabilidades y los modelos de IA que las explotarán sin permiso es más estrecha de lo que nadie en la industria había reconocido públicamente.



Fuente: TNW

Compartir:

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Esta web utiliza cookies propias y de terceros para su funcionamiento, análisis, programas de afiliación y para mostrar publicidad personalizada basada en tu perfil y hábitos de navegación. Además, incluye enlaces a sitios externos con sus propias políticas de privacidad, las cuales podrás gestionar al visitarlos. Al hacer clic en Aceptar, consientes el uso de estas tecnologías y el tratamiento de tus datos para estos fines.   
Privacidad