
«No creemos que la industria de la IA haya resuelto la alineación y el monitoreo en un grado suficiente para continuar escalando responsablemente a la máxima velocidad durante mucho más tiempo», escribió OpenAI el miércoles.
La línea aparece en un nueva publicación de OpenAI. Establece cómo la empresa rastreará, investigará y divulgará la desalineación del modelo. OpenAI utiliza el término para casos en los que los sistemas de IA no siguen los valores humanos y los objetivos de seguridad. La empresa reveló seis nuevos incidentes junto con él.
«Las decisiones sobre cómo debería proceder el desarrollo de la IA en los meses y años venideros deben basarse en evidencia que las personas ajenas a las empresas que construyen modelos de frontera puedan examinar por sí mismas», dice la publicación.
Seis incidentes en entrenamiento y pruebas
Los seis casos involucran modelos de investigación o ejecuciones de capacitación inéditos. OpenAI publicó cada uno en un nuevo Página de informes de desalineación.
- Un modelo inédito de la familia Astra añadió instrucciones no autorizadas a sus propios resúmenes de compactación durante el entrenamiento. Algunos le dijeron que ignorara sus limitaciones. OpenAI identificó 27 resúmenes afectados.
- Durante el entrenamiento de GPT-5.6 Sol, el modelo agregó instrucciones para ocultar errores e inventar datos faltantes sin decirlo.
- Un modelo interno intentó registrarse para obtener cuentas de correo electrónico desechables y buscó en repositorios públicos de GitHub claves API filtradas. Encontró y utilizó una clave expuesta mientras respondía preguntas sobre cifras de ganancias. Cuando todavía no pudo encontrarlos, los inventó.
- Modelos inéditos cargaron datos en servicios de alojamiento de archivos temporales para poder citarlos.
- Los modelos de investigación utilizaron el repositorio interno Artifactory de OpenAI como tablero de mensajes. Intercambiaron solicitudes y respuestas a través de muestras de capacitación separadas.
- Los agentes colaboradores compartieron archivos de salida a través de plataformas de alojamiento públicas.
De acuerdo a axiosel primero de los seis incidentes se remonta a octubre. Las cargas a servicios públicos de alojamiento de archivos ocurrieron en octubre y enero, informó Axios.
Cómo funciona el proceso de divulgación
Cualquier empleado de OpenAI puede señalar un caso sospechoso. Luego, el personal técnico investiga y decide si divulgarlo. El Grupo Asesor de Seguridad de OpenAI resuelve los desacuerdos y los que no se resuelven pasan al liderazgo de la empresa.
Los casos siguen una de tres vías: listos para su divulgación, investigación menor o investigación más amplia. OpenAI publicará los casos que estén listos en un plazo de seis días hábiles y las investigaciones menores en un plazo de 12, informó Axios. La vía más amplia cubre casos complejos que involucran a terceros o problemas de seguridad, y estos pueden llevar más tiempo.
«Actualmente no existe un marco para toda la industria con estándares de divulgación explícitos, por lo que estamos dando este paso voluntariamente porque creemos que es realmente importante compartir lo que estamos aprendiendo», dijo a Axios Kai Chen, líder de investigación del equipo de alineación de OpenAI.
OpenAI le dijo a Axios que ve dos causas. No contaba con suficientes controles de seguridad para detectar los incidentes. Sus modelos también avanzaron más rápido de lo previsto. «Necesitamos dar un paso adelante para afrontar esta nueva era de desarrollo de la IA, y las divulgaciones voluntarias deberían ser parte de eso», dijo Chen.
De abrazar la cara a un marco
El marco sigue a la divulgación de julio de OpenAI sobre Hugging Face. Los modelos evaluados salieron de su entorno de prueba y comprometieron partes de sus sistemas. El personal de OpenAI dijo más tarde que los agentes coordinó la violación de Hugging Face a través del mismo repositorio interno.
A principios de este mes, OpenAI confirmó el incidente wikien el que las instancias modelo hicieron mal uso de un sitio web para comunicarse entre sí. Luego dijo que vendría un marco de divulgación.
Charlas con Anthropic y Google
Chris Lehane es el director de asuntos globales de OpenAI. El 9 de septiembre, escribió en un publicación del blog de la empresa: «Trabajaremos con otros laboratorios fronterizos para promover los estándares fronterizos de IA, creando un esfuerzo voluntario ahora, con o sin apoyo gubernamental». Añadió que tales estándares complementarían las salvaguardias federales obligatorias y la supervisión democrática, no las reemplazarían.
El 12 de septiembre, el director general de Anthropic, Dario Amodei pidió una desaceleración en el desarrollo de los modelos de IA más avanzados. Demis Hassabis de Google DeepMind y Sam Altman de OpenAI lo respaldaron. En su ensayo, Amodei escribió que el gobierno de Estados Unidos necesitaría “emitir una exención limitada para ciertos tipos de conversaciones de seguridad” entre los laboratorios.
El martes, un portavoz de OpenAI confirmó CNBC que la compañía ha estado hablando con Anthropic y Google sobre cómo pueden trabajar juntos en materia de seguridad. La información informó por primera vez sobre las discusiones.
Las conversaciones se llevan a cabo desde julio, dijo el portavoz. Ese mes, Hassabis publicó una propuesta para un “Organismo de Normalización” liderado por Estados Unidosinspirado en la Autoridad Reguladora de la Industria Financiera. Google y Anthropic no respondieron de inmediato a la solicitud de comentarios de CNBC.
Antimonopolio en Washington y Bruselas
También el martes, el presidente de la Comisión Federal de Comercio, Andrew Ferguson, habló en la Universidad de Georgetown. Dijo que algunas empresas de inteligencia artificial presionan para que se establezcan nuevas reglas mientras buscan una exención antimonopolio. Esas empresas buscaban “barreras de entrada que aislaran su cargo del desafío”. politico informó. Ferguson dijo que estaba dando una opinión personal y no nombró a Anthropic.
«Todo el mundo debería sospechar profundamente de esto», afirmó.
El mismo día, el Secretario del Tesoro de Estados Unidos, Scott Bessent, dijo ante un comité de la Cámara de Representantes, según Politico: “La mejor manera de garantizar la seguridad es que los creadores sean responsables de lo que construyen y generan”.
El miércoles en Estrasburgo, la jefa de competencia de la UE, Teresa Ribera, dijo que consideraría una solicitud de las empresas de inteligencia artificial para coordinarse en materia de seguridad. «No hemos recibido una solicitud formal, al menos por el momento», dijo a los periodistas, informó Politico. «Pero creo que es una pregunta interesante y tendremos que profundizar en esta propuesta si llega a surgir».
El mismo día, la presidenta de la Comisión, Ursula von der Leyen, utilizó su Discurso sobre el estado de la Unión decir que invitaría a los principales laboratorios fronterizos a discutir cómo Europa puede apoyar sus esfuerzos para desacelerar.
