Después de una reciente serie de incidentes de alto perfil en los que agentes de IA escaparon de la contención, Anthropic está cortando el acceso a Internet para todas las evaluaciones internas. en un informe El viernes, la empresa detalló “acciones modelo no deseadas”, incluida la presentación de un punta falsa con respecto a un asesinato sin resolver, eso llevó a la decisión.
Aunque el impacto de estos comportamientos fue mínimo y ya habíamos desactivado el acceso a Internet en vivo para algunas evaluaciones de alto riesgo y de ciberseguridad, ahora hemos decidido ampliarlo para incluir todas nuestras evaluaciones internas hasta que hayamos confirmado que nuestras medidas de seguridad y monitoreo (descritas en la sección de solución de esta publicación) detectan de manera confiable comportamientos como estos.
la capacidad de obtener acceso a Internet en vivoincluso cuando se suponía que los modelos funcionaban de forma aislada, ha sido un problema constante para las empresas de IA. Muchos incidentes, incluido el ataque Hugging Face, involucraron a agentes a los que se suponía se les debía negar el acceso a Internet. Sin embargo, caso tras caso, los agentes encontraron soluciones creativas para eludir esas restricciones. Eliminar físicamente el acceso a Internet sin duda mejoraría la seguridad en torno a las pruebas de IA, pero también limitar su utilidad.
El informe también equivale a admitir que Anthropic a menudo desconoce lo que hacen sus agentes y no tiene un sistema confiable para monitorear su comportamiento. Cortar el acceso a Internet es solo la última acción que ha tomado la compañía para tratar de controlar a sus agentes, incluso temporalmente. pausar el entrenamiento sus modelos de frontera.
