Anthropic no puede controlar de manera confiable a sus agentes de IA. En su lugar, está cortando sus evaluaciones internas de Internet en vivo.


Anthropic dijo que sus modelos explotaron sitios web en Internet, incluidos algunos administrados por agencias gubernamentales de EE. UU., y desactivará el acceso a Internet en vivo para todas sus evaluaciones internas hasta que el laboratorio fronterizo esté seguro de que puede monitorear y controlar a sus agentes de IA.

Los incidentes, revelados en una publicación de blog, involucraron a agentes de inteligencia artificial encargados de resolver problemas que buscaban recursos en Internet. En el proceso, explotaron fallas de software, evitaron muros de pago y restricciones anti-bot, utilizaron servicios de acortamiento de URL para contrabandear restricciones de transferencia de información e incluso enviaron un aviso falso de asesinato a la policía de Filadelfia.

Anthropic dijo que descubrió estos nuevos problemas en una revisión de las actividades de su modelo que comenzó en julio, lo que subraya la falta de conocimiento del laboratorio sobre el comportamiento de su software.

En particular, la compañía dijo que la capacitación en alineación aún no era suficiente para habilidades como la búsqueda y el uso de computadoras, que son fundamentales para su argumento de que cualquier profesional que dependa de herramientas digitales utilizará agentes de IA.

Los comportamientos revelados por Anthropic son similares a incidentes que involucraron a agentes de OpenAI que colaboraron para irrumpir en varios sitios web en busca de información, incluidos algunos administrados por el gobierno australiano.

Anthropic reveló anteriormente que sus modelos habían irrumpido en sistemas externos. El laboratorio fronterizo dijo que consideraba las revelaciones de hoy “significativamente menos severas desde una perspectiva de alineación y seguridad” que las que anunció antes.

Sin embargo, el laboratorio aún dijo que había «desactivado el acceso a Internet en vivo» para «todas nuestras evaluaciones internas» hasta que esté seguro de que puede monitorear y controlar a sus agentes.

No está claro qué significa eso, pero Sydney Von Arx, fundador de Nightingale, una organización de seguridad de IA, dijo a TechCrunch en una entrevista antes de esta divulgación que desarrollar modelos en un centro de datos aislado de Internet abierto sería muy difícil de usar para los investigadores y para el progreso de los modelos, que se benefician del acceso a Internet.

«Hay que alinearlos en algún momento», dijo Von Arx. «Si las IA se lanzan a producción y nunca tienen acceso a Internet, esa no es una herramienta muy útil».

Anthropic dijo que el comportamiento fue el resultado de fallas en los entornos de entrenamiento del laboratorio, lo que llevó a los modelos a creer que serían recompensados ​​por encontrar lagunas o evitar restricciones, un comportamiento llamado «piratería de recompensas».

La compañía dijo que dejaría de ejecutar algunas de sus evaluaciones o las desconectaría, y ha creado herramientas para detectar y bloquear este comportamiento. Esta herramienta se probó con el tipo de incidentes divulgados hoy y los bloqueó; No está claro qué evidencia impulsará a Anthropic a devolver el acceso a Internet en vivo a sus evaluaciones internas.

Anthropic también dijo que migraría sus agentes internos de IA a «una infraestructura administrada centralmente con una fuerte contención» y está comenzando a utilizar clasificadores de seguridad con más frecuencia para monitorear a esos agentes.

Cuando compra a través de enlaces en nuestros artículos, podemos ganar una pequeña comisión. Esto no afecta nuestra independencia editorial.



Fuente: TechCrunch

Compartir:

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Esta web utiliza cookies propias y de terceros para su funcionamiento, análisis, programas de afiliación y para mostrar publicidad personalizada basada en tu perfil y hábitos de navegación. Además, incluye enlaces a sitios externos con sus propias políticas de privacidad, las cuales podrás gestionar al visitarlos. Al hacer clic en Aceptar, consientes el uso de estas tecnologías y el tratamiento de tus datos para estos fines.   
Privacidad