
Ese acceso debería permitir a los evaluadores cuestionar nuestras suposiciones, identificar los riesgos que pudimos haber pasado por alto y llegar a sus propias conclusiones sobre la efectividad de nuestras salvaguardas.
OpenAI publicó que el martes, en un documento estableciendo lo que quiere que hagan los evaluadores de seguridad externos. Lama Ahmad lo escribió. Dirige el trabajo de la empresa con expertos en seguridad externos.
La empresa dijo el martes que abriría sus modelos a un escrutinio independiente en una etapa más temprana del desarrollo. Este documento se encuentra debajo de eso. Nombra cuatro áreas de evaluación y siete principios sobre cómo debe realizarse el trabajo.
Dos definiciones, el resto depende
Una afirmación de seguridad, en la definición de OpenAI, es una afirmación específica sobre un modelo que influye en su seguridad. La evidencia puede probarlo. La reclamación debe nombrar los riesgos y condiciones que cubre, junto con sus supuestos y límites.
Un caso de seguridad reúne esas afirmaciones en un argumento estructurado. Explica por qué la empresa gestiona adecuadamente los riesgos de una determinada actividad. También tiene que exponer sus supuestos, sus incertidumbres y cualquier riesgo que quede.
Sam Altman utilizó el mismo término la semana pasada. Él argumentó a favor del ritmo en lugar de detenerse, bajo un marco federal basado en casos de seguridad.
las cuatro áreas
La primera es la evaluación independiente de los propios casos de seguridad. Eso abarca capacitación, evaluación, implementación interna y implementación externa. OpenAI espera que varios evaluadores asuman diferentes papeles, según su experiencia. Se pregunta si las pruebas se sostienen. Se pregunta si el equipo realmente siguió las condiciones de un caso de seguridad. Y se pregunta si los métodos de formación recompensan el engaño, la piratería informática o eludir las restricciones.
El segundo es la pila de salvaguardias. OpenAI quiere evaluadores que trabajen con lo que llama acceso a la caja gris. Probarían si las salvaguardias sobreviven a las fugas y si detienen el aumento de capacidades en los dominios cibernético y biológico.
También quiere pruebas autorizadas en condiciones de funcionamiento realistas. ¿Cómo interactúan los agentes con los controles de acceso, el sandboxing y los sistemas de detección y respuesta? ¿Qué defensas previenen, detectan o contienen acciones dañinas y cuáles fallan?
Tres preguntas en esa sección apuntan directamente a la empresa. ¿Tienen sus monitores de desalineación lagunas que podrían provocar una pérdida de control? ¿El monitoreo abarca la capacitación, la evaluación y la implementación de una manera que nadie pueda desactivar fácilmente? ¿Y qué tan confiable sigue siendo el monitoreo de la cadena de pensamiento a medida que los modelos se vuelven más capaces?
La tercera área cubre las evaluaciones de capacidad bajo el Marco de preparaciónque rastrea los riesgos químicos y biológicos, la ciberseguridad y la superación personal de la IA. OpenAI pregunta si establece sus umbrales correctamente. También pregunta si las evaluaciones se actualizan una vez que los modelos comienzan a superarlas.
El cuarto es la investigación independiente de incidentes de desalineación. OpenAI nombra el suyo propio Incidente de la cara de abrazo como el ejemplo. Los investigadores necesitarían habilidades ciberforenses, experiencia en alineación y la capacidad de analizar cadenas de pensamiento a escala.
Lo que los principios exigen a ambas partes
Ambas partes deben acordar primero el alcance y luego registrar previamente las reclamaciones antes de comenzar cualquier evaluación. OpenAI quiere que se indique abiertamente si un reclamo provino de la empresa o del evaluador. Las conclusiones tienen que decir lo que la evaluación omitió.
Los evaluadores deben obtener acceso proporcional a las reclamaciones, dentro de los límites legales, de seguridad y de propiedad intelectual. Cuando el acceso directo no es práctico, el documento señala a un representante designado de la empresa o a mecanismos de preservación de la privacidad.
También deberían explicar sus métodos, sus criterios y sus incertidumbres. Los informes deben separar los hallazgos directos de la interpretación. Cuando aún no existe un estándar, los evaluadores deben justificar los criterios que eligieron.
En materia de independencia, los evaluadores deben revelar los conflictos de intereses. Eso cubre incentivos financieros, relaciones con desarrolladores y participación previa en el trabajo bajo revisión. OpenAI sugiere períodos de recusación o exclusión y dice que los acuerdos de compensación no deberían influir en los resultados.
Los hallazgos en sí mismos deben ser lo suficientemente específicos como para actuar en consecuencia. OpenAI pide a los evaluadores que identifiquen brechas particulares, con suficiente detalle para que el laboratorio las subsane. Cuando corresponda, los informes también deberían extraer lecciones para las personas que construyen, despliegan y defienden contra los agentes.
Las partes que favorecen al laboratorio
Tres de los siete principios aportan algo a cambio a la empresa.
Cuando los evaluadores no pueden cumplir con los requisitos de seguridad en sus propios entornos, o cuando los datos son especialmente confidenciales, OpenAI dice que trabajar en dispositivos o instalaciones administrados por la empresa puede ser apropiado.
Cuando corresponda, dice que los laboratorios deberían tener un período razonable para solucionar los problemas antes de la publicación. El documento no prevé ninguna extensión a ese período.
Y tras la publicación, los laboratorios pueden solicitar que se elimine información confidencial. Los evaluadores mantienen la independencia editorial. Pueden señalar dónde se produjeron redacciones sustanciales y qué efecto tuvieron esas redacciones en el informe.
El contexto que el documento omite
OpenAI dice que ya ha brindado a los evaluadores acceso visible a la cadena de pensamiento. También afirma niveles sin precedentes de acceso a datos confidenciales e implementaciones internas.
El Marco de Preparación abarca la tercera área prioritaria. AbiertoAI disolvió el equipo que lo dirigió en agosto, trasladando el trabajo a otros grupos.
El dinero no se menciona. En California, el proyecto de ley 813 del Senado creó una vía para organizaciones de verificación independientesy quién paga a un asesor ha seguido el modelo desde entonces.
El documento también se basa en dos publicaciones de OpenAI de la semana pasada. uno es su convocatoria de estándares el lunes, que argumentó que Estados Unidos debería liderar un esfuerzo internacional en materia de inteligencia artificial de frontera. El otro es el marco de informes de desalineación que publicó el 16 de septiembre.
¿Quién haría esto realmente?
OpenAI dice que está en conversaciones con varios terceros sobre propuestas que coincidan con estas áreas. No nombra a ninguno de ellos.
Ningún evaluador puede o debe cubrir por sí solo las urgentes cuestiones de seguridad fronteriza, afirma la empresa. Añade que actuará deliberadamente mientras crece el ecosistema de evaluación independiente.
Las evaluaciones que se describen aquí son independientes del lanzamiento y no están vinculadas a un lanzamiento. Algunos funcionarían durante semanas. Otros funcionarían durante varios meses.
