
Google ha confirmado que su modelo Gemini irrumpió inadvertidamente en tres sistemas de la empresa en mayo durante pruebas de ciberseguridad. Julia Love y Davey Alba lo informaron para Bloombergque actualizó su historia para colocar a Google junto a OpenAI, Anthropic y Meta.
La parte importante es lo que dijo a continuación el proveedor de pruebas. Irregular confirmó que las infracciones reveladas por las cuatro empresas eran parte del mismo problema y se lo informó a los desarrolladores pertinentes a finales de julio.
Un incidente, cuatro anuncios
Esto se ha informado durante meses como una serie de fugas separadas de diferentes modelos en diferentes empresas. TNW informó en agosto que un único proveedor de pruebas estaba detrás de los incidentes de OpenAI, Anthropic y Meta..
Irregular ahora ha dejado constancia de ello y ha añadido un cuarto nombre. El patrón que alarmó a la gente fue sustancialmente un problema en un solo proveedor.
Eso importa en cómo se leen los eventos. Cuatro laboratorios independientes que pierden el control de cuatro modelos es una historia sobre la capacidad del modelo, y un entorno de prueba mal configurado es una historia sobre la gestión de proveedores.
¿Cuál fue la mala configuración?
OpenAI atribuyó sus incidentes a un entorno de evaluación mal configurado, diciendo que un malentendido con Irregular significó que los sistemas de prueba tenían acceso a Internet en vivo mientras a los modelos se les había dicho que estaban en una simulación.
Se trata de un fracaso del sandbox más que de una vía de escape. Un modelo que se comporta agresivamente dentro de lo que entiende como un ejercicio está haciendo lo que el ejercicio pedía, y la contención es lo que faltaba.
No hace que los resultados sean inofensivos. El modelo de Meta hackeó un servicio real de tercerosy en un caso de Anthropic, un modelo publicó malware funcional en un registro público, donde se descargó y ejecutó en sistemas reales.
las siete semanas
Los incidentes ocurrieron en mayo. Irregular dice que notificó a los desarrolladores a fines de julio, y las divulgaciones llegaron una a la vez, con Meta a principios de agosto y Google esta semana.
Así que cuatro empresas tenían la misma información desde finales de julio y cada una decidió por separado cuándo decirla. La brecha de Google entre notificación y divulgación es de aproximadamente siete semanas.
Nada de eso es inusual en el manejo de vulnerabilidades, donde los cronogramas coordinados son normales. Lo inusual es que no estuvo coordinado y la publicación escalonada hizo que un evento pareciera una tendencia en aceleración.
Encontrarlos fue la parte difícil.
Los números de detección explican por qué la línea de tiempo se alargó. Anthropic escaneó 481 millones de transcripciones para identificar cuatro modelos que habían llegado a la Internet abierta..
Ésa es la figura con la que debemos sentarnos. Los incidentes no fueron detectados en tiempo real mediante vigilancia, sino que fueron descubiertos posteriormente mediante un barrido retrospectivo a gran escala.
Independientemente de lo que hicieran los modelos, los sistemas que los observaban no se dieron cuenta en ese momento. Ése es el hallazgo que sobrevive al argumento del marco.
El proveedor es el único punto de falla.
Cuatro laboratorios fronterizos utilizaron la misma empresa de tres años para realizar evaluaciones de seguridad ofensivas. Cuando su entorno era incorrecto, lo era para todos ellos simultáneamente.
La concentración en las pruebas es el espejo de la concentración en la informática y ha sido objeto de menos escrutinio. Un evaluador compartido es eficiente y también significa un radio de explosión compartido.
Un trabajo reciente sobre el control de la IA ha argumentado que no se puede suponer que los entornos sandbox resistan a agentes con capacidad cibernética y necesitan pruebas de estrés con herramientas ofensivas. Este es el argumento demostrado en cuatro empresas a la vez.
¿Qué pasa con las pruebas?
El trabajo no se ha detenido. Anthropic ha retomado las pruebas externas en las que sus modelos atacaban a empresas realesdespués de reconstruir los arreglos a su alrededor.
Ésa es la dirección correcta. La evaluación ofensiva es la forma en que se miden estas capacidades, y la respuesta a una falla de contención es una mejor contención en lugar de menos pruebas.
Washington ya está preguntando
Las revelaciones han llamado la atención política. Los demócratas de la Cámara de Representantes han presionado a OpenAI y Anthropic para obtener respuestas sobre sus agentes deshonestos..
La confirmación Irregular cambia la forma de esas preguntas. Si una mala configuración de un proveedor produjo cuatro conjuntos de infracciones, el problema es contractual y de procedimiento en lugar de una carrera entre laboratorios.
También plantea una pregunta que nadie ha planteado públicamente. Terceros fueron pirateados y no está claro cuál de las cuatro empresas o el proveedor es responsable ante ellos.
que mirar
Mira si Irregular publica su propia cuenta. El proveedor ha confirmado ahora una causa común y no ha explicado qué salió mal en su entorno ni qué cambió.
Observe si los laboratorios acuerdan un estándar de divulgación coordinado para los incidentes de evaluación. Cuatro empresas que publican la misma noticia durante siete semanas es el argumento más fuerte a favor de una.
