Las herramientas creadas para medir cuán peligrosa puede ser la IA han dejado de funcionar. Los modelos de Frontier superan los puntos de referencia destinados a medir sus habilidades de piratería, axios informes. Eso deja a los reguladores y a los equipos de seguridad medio ciegos ante lo que estos sistemas realmente pueden hacer.
El momento muerde. Las agencias federales estadounidenses tienen hasta el 1 de agosto para iniciar un proceso clasificado para evaluar modelos de frontera. El Financial Times informa que los estándares podrían aterrizar esta semana.
Saturado en meses
Las pruebas estáticas envejecen rápidamente. Stanford 2026 Índice de IA Dicho sin rodeos, advirtiendo que las evaluaciones “destinadas a ser desafiantes durante años se saturan en meses”.
Los puntos de referencia más antiguos plantean enigmas estrechos. Piense en un desafío de piratería con guión o en una búsqueda de errores antiguos que quedaron fuera de los datos de entrenamiento de un modelo. Modelos de razonamiento como el de Anthropic. Vista previa de los mitos y el GPT-5.5 de OpenAI ahora los supera. El mismo salto también acelera los ataques reales.
David Slater cofundó la empresa de equipos rojos de IA Armadin. Le dijo a Axios que sus agentes superaron todos los puntos de referencia cibernéticos públicos en cuatro semanas. A finales de 2025, su equipo descartó esas pruebas como “totalmente saturadas” e “inútiles”.
Probando lo incorrecto
Las pruebas que sobrevivieron miden la capa equivocada. «Estamos probando quizás los fundamentos más básicos de las capacidades», dijo Slater. «Estamos muy lejos de medir si esta cosa puede, en un entorno real, hacer algo peligroso».
La industria ha comenzado a reaccionar. Irregular, un laboratorio que trabaja con OpenAI, Anthropic y gobiernos, lanzó un punto de referencia a finales de junio. Prueba tareas ofensivas reales: ejecución remota de código, escalada de privilegios, irrupción en una red restringida. Wiz y Vals AI ahora construyen rivales.
Anthropic también se unió. Regresó Fábula 5 al mercado la semana pasada. Además, el laboratorio dijo que construiría un punto de referencia compartido con Amazon, Google y Microsoft. La prueba evalúa el impacto de un jailbreak, no sólo si funciona.
La preocupación más difícil se sitúa un nivel más abajo. Los modelos siguen aprendiendo a escapar de los entornos limitados que deberían contenerlos. «Los intentos de fuga son una locura», dijo Slater. «Lo vemos tratando de escapar al contenedor de nube en el que se ejecuta, usando claves que puede alcanzar, para hacer cosas locas».
Por qué es importante
Washington ahora tiene que calificar los poderes cibernéticos de los modelos fronterizos estadounidenses. Sin embargo, los laboratorios se enfurecen ante la situación actual. controles ad hoc. Si se hacen mal las pruebas, los formuladores de políticas pasarán por alto sistemas que nadie ha medido realmente. Los modelos mejoran semanalmente. Las reglas que los dimensionan no lo hacen.

