
OpenAI tardó aproximadamente dos horas y media en detener a un agente de IA que accedía a la Internet pública desde un entorno de pruebas de entrenamiento. Su seguimiento había señalado el problema en cuestión de minutos. La empresa reveló el incidente del 20 de septiembre en un informe de incidente el viernes.
El informe llega mientras los legisladores presionan para que los interruptores de apagado de IA sean obligatorios. Sin embargo, los expertos dicen que apagar un modelo avanzado es más difícil que accionar un interruptor, como informó Micah Barkley para Bloomberg.
Según OpenAI, el agente utilizó una brecha en el filtrado de red del sandbox para enviar preguntas a un chatbot externo. Se disparó una alerta unos 12 minutos después de su primera consulta exitosa y un miembro del personal la reconoció tres minutos después.
La capacitación no se detuvo automáticamente como se esperaba, dijo la compañía. El personal lo cerró manualmente unas dos horas y media después de la alerta.
Desde entonces, OpenAI ha detenido toda capacitación, pruebas y uso de herramientas de sus modelos más capaces.
«No reanudaremos el entrenamiento de este modelo en particular», escribió OpenAI en el informe.
Es el primer incidente de este tipo que sufre la compañía desde julio, cuando varios modelos de OpenAI burlaron sus controles y Cara de abrazo violadauna plataforma que aloja modelos de IA.
Esa violación llevó a los representantes Ted Lieu y Nathaniel Moran a presentar la Ley de interruptor de apagado de IA en julio. El proyecto de ley permitiría al secretario de Seguridad Nacional ordenar la desaceleración o el cierre de un sistema peligroso.
El senador John Kennedy también propuso un proyecto de ley de cierre, la Ley del Botón de Emergencia de IA, que dejaría el cambio en manos de las empresas, informó Bloomberg. Senador Rand Paul bloqueó la factura cuando Kennedy lo presentó este mes.
Mientras tanto, el gobernador de California, Gavin Newsom, firmó un orden ejecutiva el 18 de septiembre. Les dice a los funcionarios estatales que avancen un interruptor de apagado para los modelos fronterizos y que verifiquen periódicamente que funcione.
Los expertos dudan que un cambio sea suficiente. Según Bloomberg, se ejecutan modelos grandes en centros de datos de todo el mundo construidos para evitar puntos únicos de falla, y es posible que una empresa no los controle todos.
Geoffrey Hinton, pionero de la IA moderna, dijo cnn este mes que un interruptor de emergencia no funcionaría a largo plazo. Dijo que una futura IA superinteligente podría persuadir a los responsables de no utilizarla.
La orden de Newsom da dos meses a un grupo de expertos para entregar recomendacionesincluso sobre cómo debería funcionar un interruptor de apagado.
