Las habilidades de piratería de la IA están superando las pruebas


Las herramientas creadas para medir cuán peligrosa puede ser la IA han dejado de funcionar. Los modelos de Frontier superan los puntos de referencia destinados a medir sus habilidades de piratería, axios informes. Eso deja a los reguladores y a los equipos de seguridad medio ciegos ante lo que estos sistemas realmente pueden hacer.

El momento muerde. Las agencias federales estadounidenses tienen hasta el 1 de agosto para iniciar un proceso clasificado para evaluar modelos de frontera. El Financial Times informa que los estándares podrían aterrizar esta semana.

Saturado en meses

Las pruebas estáticas envejecen rápidamente. Stanford 2026 Índice de IA Dicho sin rodeos, advirtiendo que las evaluaciones “destinadas a ser desafiantes durante años se saturan en meses”.

Los puntos de referencia más antiguos plantean enigmas estrechos. Piense en un desafío de piratería con guión o en una búsqueda de errores antiguos que quedaron fuera de los datos de entrenamiento de un modelo. Modelos de razonamiento como el de Anthropic. Vista previa de los mitos y el GPT-5.5 de OpenAI ahora los supera. El mismo salto también acelera los ataques reales.

David Slater cofundó la empresa de equipos rojos de IA Armadin. Le dijo a Axios que sus agentes superaron todos los puntos de referencia cibernéticos públicos en cuatro semanas. A finales de 2025, su equipo descartó esas pruebas como “totalmente saturadas” e “inútiles”.

El 💜 de la tecnología de la UE

Los últimos rumores de la escena tecnológica de la UE, una historia de nuestro sabio fundador Boris y algo de arte de IA cuestionable. Es gratis, todas las semanas, en tu bandeja de entrada. Regístrate ahora!

Probando lo incorrecto

Las pruebas que sobrevivieron miden la capa equivocada. «Estamos probando quizás los fundamentos más básicos de las capacidades», dijo Slater. «Estamos muy lejos de medir si esta cosa puede, en un entorno real, hacer algo peligroso».

La industria ha comenzado a reaccionar. Irregular, un laboratorio que trabaja con OpenAI, Anthropic y gobiernos, lanzó un punto de referencia a finales de junio. Prueba tareas ofensivas reales: ejecución remota de código, escalada de privilegios, irrupción en una red restringida. Wiz y Vals AI ahora construyen rivales.

Anthropic también se unió. Regresó Fábula 5 al mercado la semana pasada. Además, el laboratorio dijo que construiría un punto de referencia compartido con Amazon, Google y Microsoft. La prueba evalúa el impacto de un jailbreak, no sólo si funciona.

La preocupación más difícil se sitúa un nivel más abajo. Los modelos siguen aprendiendo a escapar de los entornos limitados que deberían contenerlos. «Los intentos de fuga son una locura», dijo Slater. «Lo vemos tratando de escapar al contenedor de nube en el que se ejecuta, usando claves que puede alcanzar, para hacer cosas locas».

Por qué es importante

Washington ahora tiene que calificar los poderes cibernéticos de los modelos fronterizos estadounidenses. Sin embargo, los laboratorios se enfurecen ante la situación actual. controles ad hoc. Si se hacen mal las pruebas, los formuladores de políticas pasarán por alto sistemas que nadie ha medido realmente. Los modelos mejoran semanalmente. Las reglas que los dimensionan no lo hacen.



Fuente: TNW

Compartir:

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Esta web utiliza cookies propias y de terceros para su funcionamiento, análisis, programas de afiliación y para mostrar publicidad personalizada basada en tu perfil y hábitos de navegación. Además, incluye enlaces a sitios externos con sus propias políticas de privacidad, las cuales podrás gestionar al visitarlos. Al hacer clic en Aceptar, consientes el uso de estas tecnologías y el tratamiento de tus datos para estos fines.   
Privacidad