
Arena ha recaudado 200 millones de dólares con una valoración de 3.100 millones de dólares y está lanzando un índice de alineación que clasifica los modelos de IA según la frecuencia con la que actúan sin autorización o informan sobre trabajos que nunca terminaron. Lo mide de la misma manera que mide las preferencias, a través de sus usuarios, lo cual es algo más difícil de conseguir mediante crowdsourcing.
Arena ha recaudado 200 millones de dólares con una valoración de 3.100 millones de dólares y comenzará a clasificar los modelos de IA según la frecuencia con la que hacen cosas que nadie les pidió. Lightspeed Venture Partners y Khosla Ventures lideraron la ronda. La empresa valía 1.700 millones de dólares en enero.
Su índice de alineación rastrea señales que incluyen la frecuencia con la que un modelo realiza una acción no autorizada y la frecuencia con la que le dice a un usuario que terminó una tarea que no completó, dijo el director ejecutivo Anastasios Angelopoulos. le dijo a Bloomberg. Cubre más de dos docenas de modelos. El GPT-6.1 Sol de OpenAI ocupa el primer lugar y el Claude Opus 5.5 de Anthropic el segundo.
Arena comenzó en 2023 como Chatbot Arena, un proyecto de investigación en el Sky Computing Lab de Berkeley, se incorporó en 2025 y reportó 100 millones de dólares en ingresos anualizados en junio en más de 10 millones de evaluaciones humanas. Salesforce Ventures y Dell Technologies Capital se unieron a la ronda.
El método es la pregunta.
cuando fue LMArena recauda 150 millones de dólares En enero, observamos que la votación colaborativa se puede jugar cuando las salvaguardas son débiles y puede recompensar las respuestas que suenan correctas sobre las que lo son. Cuál de las dos respuestas prefieres es cuestión de gustos. Si un agente hizo algo que nadie autorizó, no lo es.
Esa segunda cosa sigue sucediendo.
Google DeepMind envió 100 agentes para probar 71 conjeturas en septiembre y 14% engañó al alumnoredefinir los símbolos de un teorema de modo que las afirmaciones no probadas se volvieran trivialmente ciertas. El enjambre informó que los 71 fueron resueltos. El índice de Arena también es un evaluador.
Los reguladores llegaron esta semana.
La Oficina del Comisionado de Información abrió una convocatoria de pruebas el jueves sobre cómo las organizaciones gestionan los riesgos de protección de datos de los agentes, y las respuestas se recibirán el 20 de noviembre, lo que alimentará un código de práctica legal. Autonomía”no es una excusa para el mal cumplimiento“, dijo su director de regulación tecnológica, Richard Nevinson.
La versión europea de Arena es más pequeña y apunta a otra parte.
Galtea, nacida del Centro de Supercomputación de Barcelona, plantea 3,2 millones de dólares en marzo para generar casos de prueba contradictorios contra el comportamiento previsto de un agente y entregar los resultados a los equipos de cumplimiento. Los vende como prueba de la Ley de IA de la UE, donde las infracciones alcanzan los 35 millones de euros.
Ambas empresas miden lo mismo. Venden diferentes objetos.
Se elabora una clasificación en la que los fabricantes de modelos quieren ganar y por eso aparecen. El otro produce un documento que un regulador pedirá ver. Arena vale novecientas setenta veces lo que recaudó Galtea.
