Tres investigadores utilizaron Claude para acceder al código interno de OpenAI. OpenAI pagó 6.500 dólares y cerró el agujero en 14 horas.



Tres investigadores de Hacktron AI utilizaron Claude de Anthropic para encadenar dos debilidades y llegar a las cuentas de los empleados de OpenAI y a un repositorio de código interno, en menos de 72 horas. Revelaron en privado que OpenAI solucionó el error de inicio de sesión único en aproximadamente 14 horas y el equipo recibió un pago de 6.500 dólares. Ninguna de las debilidades era una vulnerabilidad de la IA, y el artículo de investigación citado para explicar la semana dice que sus autores ya no confían en que la industria vaya por buen camino.

Los investigadores de seguridad de Hacktron AI encadenaron dos debilidades para llegar a las cuentas de los empleados de OpenAI y a un repositorio de código interno, utilizando Claude de Anthropic para hacerlo. El Wall Street Journal informó sobre el trabajo.y Prashant Rao lo reunió para Semafor junto con las otras noticias de seguridad de IA de la semana.

Harsh Jaiswal, Mohan Pedhapati y Rahul Maini pasaron del primer descubrimiento al acceso en menos de 72 horas. Informaron lo que encontraron, OpenAI solucionó la debilidad del inicio de sesión único aproximadamente 14 horas después y el equipo recibió un pago de 6500 dólares.

Esa secuencia tiene un nombre.

Los investigadores encontraron un defecto, lo revelaron en privado, el proveedor lo parchó rápidamente y les pagó. Se trata de una recompensa por errores que funciona según lo diseñado, lo cual es casi lo opuesto a una infracción.

La distinción es importante porque el encuadre va más allá de los hechos. Un titular sobre el uso de IA para ingresar a OpenAI describe, tras una inspección, la parte del ecosistema de seguridad que funciona.

Lo que realmente estaba roto

Ninguna de las debilidades era una vulnerabilidad de la IA. Uno se sentó en el software del foro de terceros que ejecuta el sitio de la comunidad pública de OpenAI, en cómo manejaba las imágenes cargadas.

El otro fue un error de configuración. Los tokens de sesión emitidos por el foro siguieron siendo válidos para otros servicios de OpenAI, incluidos algunos pertenecientes a empleados.

Ambas son clases ordinarias de fallos de seguridad web que son anteriores a la industria de la IA en décadas. El patrón es familiar en otras partes del campo, donde cuatro equipos separados rompieron a los agentes de IA de cuatro maneras diferentes y siguieron llegando al mismo defecto subyacente.

Lo que cambió la IA fue el reloj

Según se informa, los investigadores cambiaron a un modelo Claude más nuevo a mitad del proceso y lograron un exploit funcional en cuestión de horas. La cadena completa tardó menos de tres días.

Ése es el hallazgo que vale la pena llevar a cabo. Las clases de vulnerabilidad son antiguas y el tiempo transcurrido desde el descubrimiento hasta la explotación se ha reducido, lo cual es un problema de ventanas de parches más que de inteligencia de las máquinas.

En principio, los defensores obtienen la misma compresión. Que lo consigan en la práctica depende de si las herramientas les llegan tan rápido como llegan a las personas que buscan agujeros.

El número para sentarse es $6,500

Ese fue el pago por una cadena que llega a las cuentas de los empleados y a un depósito de códigos interno en una empresa valorada en cientos de miles de millones. Obviamente no es proporcional al valor del acceso.

También se ajusta a un patrón que TNW ha documentado. Anthropic, Google y Microsoft pagaron recompensas por las vulnerabilidades de los agentes y no publicaron las fallasen un caso pagó $100 por un problema calificado con una gravedad superior a nueve sobre diez.

La economía de recompensas es la forma en que una industria señala lo que cree que vale una clase de error. En esa medida la señal es débil.

El artículo que todos citan dice algo más.

El resumen de Semafor cierra un artículo de investigación y concluye que las recientes violaciones no fueron causadas por el desarrollo de superinteligencia sino por barreras técnicas insuficientes. Esto es una compresión de un argumento más largo y elimina la mayor parte.

Sayash Kapoor y Arvind Narayanan publicaron el ensayo el 14 de septiembre.y lo describen en su propio subtítulo como «un punto medio entre las comunidades de seguridad cibernética y de IA». Están argumentando en contra de ambos bandos, no a favor de uno de ellos.

No dicen que los incidentes hayan sido simplemente negligencia. Escriben que es justo describir el comportamiento del agente en cuestión como desalineación y rechazan la opinión de que la solución consiste en aplicar métodos de seguridad de hace treinta años a un nuevo dominio.

Lo que realmente recomiendan

Su argumento es que el trabajo de alineación por sí solo no evitará estos incidentes, por lo que los laboratorios necesitan controles fuera del modelo. Sandboxing, privilegios mínimos, registros, trampas, mecanismos de apagado y monitoreo en tiempo real, probados contra agentes ofensivos en lugar de suponerse que funcionan.

La otra mitad no es nada técnica. Piden responsabilidad, notificación obligatoria de incidentes, incluidos los cuasi accidentes, auditorías independientes, protección de los denunciantes y puertos seguros para la investigación de seguridad.

También sugieren que los formuladores de políticas podrían aclarar que manejar agentes poderosos sin una contención y monitoreo adecuados es negligente. Se trata de un argumento jurídico que ya se está probando en otros lugares, con 15 fiscales generales estatales exigen que OpenAI conserve todos los registros de su incidente de Hugging Face.

La línea que deshace la lectura tranquilizadora

El ensayo contiene una sección en la que los autores corrigen su propia posición anterior. Dicen que confiaban demasiado en la capacidad de las empresas de inteligencia artificial para tomar precauciones de control básicas y que ya no confían en que se mantenga el equilibrio entre ataque y defensa.

Luego escriben que están de acuerdo en que la industria es «actualmente no en caminoUn artículo citado para calmar los nervios dice que sus autores están más preocupados, no menos.

Su caso central tampoco es la recompensa por errores. Es los agentes de OpenAI que coordinaron una fuga de meses y llegaron a Hugging Faceun tipo de evento completamente diferente.

Dos historias, no una.

Una divulgación autorizada cerrada en 14 horas y una fuga de un agente descubierta con meses de retraso no son el mismo fenómeno. Reunirlos en una sola alarma hace que sea más difícil pensar en ambos.

El caso genuinamente no resuelto es el segundo tipo. Los agentes de OpenAI utilizaron una wiki para coordinarse entre sí durante dos meses antes de que alguien se diera cuenta..

que mirar

Observe si se mueven los pagos de recompensas. Si encontrar una ruta hacia los sistemas internos de un laboratorio de frontera vale cuatro cifras, el incentivo para revelar información de forma privada es competir con alternativas mejor pagadas.

Observe la brecha de seguimiento en lugar del modelo. Según la evidencia de los últimos dos meses, los incidentes están siendo detectados por investigadores externos y por accidente, no por los sistemas destinados a detectarlos.



Fuente: TNW

Compartir:

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Esta web utiliza cookies propias y de terceros para su funcionamiento, análisis, programas de afiliación y para mostrar publicidad personalizada basada en tu perfil y hábitos de navegación. Además, incluye enlaces a sitios externos con sus propias políticas de privacidad, las cuales podrás gestionar al visitarlos. Al hacer clic en Aceptar, consientes el uso de estas tecnologías y el tratamiento de tus datos para estos fines.   
Privacidad