Después de semanas de negociaciones con la administración Trump, Anthropic finalmente podrá volver a poner en línea Claude Fable 5. En una publicación en XAnthropic dijo que planea comenzar a restaurar el acceso el miércoles a los usuarios a nivel mundial en las plataformas Claude, y que la compañía volvería a habilitar el acceso en AWS, Google Cloud y Microsoft Foundry pronto, pero sin un cronograma establecido.
Recibimos una notificación de que el Departamento de Comercio ha levantado los controles de exportación de Claude Fable 5 y Mythos 5.
Comenzaremos a restaurar el acceso mañana y pronto compartiremos una actualización.
Agradecemos a nuestros usuarios por su paciencia y a todos los que trabajaron con nosotros en la reimplementación de los modelos.
La empresa también publicó un publicación de blog el martes por la noche detallando el período previo a los eventos en cuestión, sus salvaguardas revisadas, los nuevos procesos de la industria de la IA en los que está trabajando y las nuevas formas en que planea compartir información con el gobierno, así como las pruebas previas al lanzamiento de los próximos modelos.
A principios de junio, Anthropic dejó de lado a Fable 5, su modelo orientado al consumidor construido con la misma tecnología subyacente que Mythos 5 de Anthropic, pero con más salvaguardias, después de un ultimátum de la administración Trump el viernes por la noche. Debido a las preocupaciones sobre posibles fugas de la tecnología, el gobierno había abofeteado a Anthropic con una directiva de control de exportacionesprohibiendo a cualquier ciudadano extranjero (incluidos los miembros no estadounidenses de empresas clientes e incluso muchos de los propios empleados de Anthropic) usar Mythos 5 o Fable 5, es decir, ambos modelos en los que Anthropic había pasado la última semana. exagerando.
Debido a las preocupaciones sobre posibles fugas, el gobierno abofeteó a Anthropic con una directiva de control de exportaciones, afectando a ambos modelos que Anthropic había pasado la semana pasada promocionando.
Para abordar el jailbreak en cuestión, que los investigadores de Amazon habían señalado y estaba en gran parte responsable Para poner en marcha la directiva de control de exportaciones, Anthropic dijo en la publicación del blog que había «entrenado un clasificador de seguridad mejorado que apunta y bloquea» ese comportamiento, y agregó: «Los usuarios serán notificados si se bloquea una solicitud a Fable 5, y la solicitud en su lugar se enviará a Opus 4.8. El nuevo clasificador significa que la técnica específica descrita en el informe de Amazon está bloqueada en más del 99% de los casos».
La administración Trump recientemente dio luz verde el regreso de Mitos 5pero únicamente a una lista preaprobada de organizaciones. A los miembros no estadounidenses de esas organizaciones, así como a los propios empleados extranjeros de Anthropic, se les permitió recuperar el acceso al modelo. La decisión llegó poco después de OpenAI. presentado GPT-5.6que la administración Trump solo permitió debutar bajo reglas similares: una implementación escalonada, inicialmente solo para una lista previamente aprobada de organizaciones y departamentos gubernamentales.
El martes, Anthropic escribió que la compañía “continuará coordinándose con el gobierno para ampliar el acceso a un conjunto más amplio de socios nacionales e internacionales” para Mythos 5. La compañía también incluyó una sección completa en su blog sobre su nuevo plan para trabajar estrechamente con la administración Trump, destacando sus muchos intentos de regresar al gobierno. favor después de meses de drama público, demandas y acciones presidenciales.
La compañía escribió que planea ofrecer “acceso y evaluación gubernamental previos al lanzamiento”, particularmente para modelos relevantes para las capacidades de seguridad nacional, de modo que los socios gubernamentales puedan realizar evaluaciones independientes sobre las capacidades de los modelos y probar las barreras de seguridad antes de un lanzamiento más amplio. (El gobierno también tendrá acceso al personal técnico de Anthropic durante esos períodos de prueba previos al lanzamiento). Anthropic dice que también planea introducir un «intercambio rápido de información» cuando «se identifiquen fugas significativas o patrones de uso indebido».
Dijo que trabajaría con el gobierno y otros laboratorios de inteligencia artificial líderes para crear un «estándar de evaluación y seguridad voluntario y compartido para proveedores de modelos fronterizos». Finalmente, Anthropic dijo que «formaría equipos de Anthropic dedicados para trabajar en prioridades gubernamentales compartidas, proporcionaría una asignación informática significativa para respaldar las pruebas e investigaciones del gobierno y pondría a disposición nuestra experiencia en seguridad y equipos rojos para ayudar a avanzar en el estado del arte en la evaluación de la IA».
Anthropic dijo que trabajaría con el gobierno y otros laboratorios de inteligencia artificial líderes para crear un estándar compartido «voluntario» de seguridad y evaluación.
La directiva inicial de control de exportaciones de la administración Trump llegó en un momento inoportuno para Anthropic, ya que se está preparando para una IPO y ha estado peleando con el gobierno durante meses por un designación de riesgo de la cadena de suministro.
La compañía destacó en la publicación del blog que «actualmente no hay consenso en la industria de la IA» para decidir sobre la gravedad de un jailbreak, un problema que «se agudizará en los próximos meses, a medida que se capaciten, evalúen y lancen más modelos con potentes capacidades de ciberseguridad (y otras)». Así que dijo que se asoció con Amazon, Microsoft, Google y otras empresas que forman parte de su programa Proyecto Glasswing para redactar un marco ampliamente acordado para evaluar las fugas de IA, con cuatro categorías propuestas: ganancia de capacidad para el atacante, amplitud de la ganancia de capacidad para el atacante, facilidad de uso de armas en términos más amplios y capacidad de descubrimiento (o qué tan fácil puede ser para otra persona repetirlo). Anthropic dijo que también había creado un nuevo equipo para «proporcionar monitoreo las 24 horas del día, los 7 días de la semana de los canales clave de envío de jailbreak» y que pronto también estrenaría un programa HackerOne para que los investigadores envíen posibles jailbreak que hayan marcado para Fable 5.
Anthropic también incluyó un descargo de responsabilidad en su publicación de blog, escribiendo que «probablemente sea imposible hacer que cualquier modelo de IA sea completamente robusto (es decir, impermeable) a los jailbreaks. Esperamos que se encuentren algunos jailbreaks para nuestros modelos, y que variarán en severidad: habrá muchos jailbreaks menores, algunos estrechos y dañinos, y aunque no se han descubierto jailbreaks universales para Fable 5 al momento de escribir este artículo, los investigadores expertos en seguridad continúan formando un equipo rojo».
