Arena, que se originó en 2023 como un proyecto de investigación en UC Berkeley que elaboraba clasificaciones de modelos de IA de forma colectiva, ha recaudado una ronda Serie B de 200 millones de dólares con una valoración de 3.100 millones de dólares, dijo el jueves.
Esto se produce después de que la compañía dijera que alcanzó los 100 millones de dólares en ingresos anualizados en junio.
La ronda fue liderada por Lightspeed Venture Partners y Khosla Ventures, a la que se unieron Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis y otros. Arena anunció previamente una Serie A de 150 millones de dólares en enero con una valoración posterior al dinero de 1.700 millones de dólares. En ese momento, sus ingresos anualizados eran de 30 millones de dólares, dijo. Eso significa que su valoración casi se ha duplicado en unos 10 meses.
Arena proporciona una plataforma de colaboración abierta que los consumidores pueden utilizar de forma gratuita. Las personas ingresan indicaciones o solicitan proyectos codificados por vibración y luego califican qué modelo lo hace mejor. Arena afirma tener decenas de millones de visitantes mensuales.
En septiembre del año pasado, presentó su producto comercial, AI Assessments, un servicio que proporciona a laboratorios modelo y empresas análisis de rendimiento detallados basados en los comentarios de su comunidad. El momento resultó impecable. Este año, los laboratorios de IA se dieron cuenta de que sus modelos estaban jugando pruebas de evaluación comparativa, encontrando formas de acumular buenos puntajes sin obtenerlos realmente. Al mismo tiempo, las empresas querían ayuda para determinar qué modelo funciona mejor para sus propias necesidades internas en lugar de depender únicamente de puntos de referencia estandarizados.
«La IA avanza más rápido que nuestra capacidad para evaluarla, y los puntos de referencia estáticos se desmoronan una vez que los modelos reconocen que están siendo probados», dijo la compañía en su anuncio de financiación. «El mundo necesita un tercero neutral para medir cuán segura y alineada es realmente la IA una vez que está en manos de personas reales. Arena está asumiendo ese papel hoy», agregó.
Para ello, Arena también ha añadido una nueva categoría a su clasificación: alineación. Aquí es donde clasifica los modelos en función de cuestiones como acciones no autorizadas (realizar acciones que no se le pidió que realizara); atribución falsa (acreditar erróneamente declaraciones o hechos a la fuente equivocada); y lo que llama “finalización engañosa” (mentir acerca de completar tareas que no hizo).
Actualmente, una serie de modelos de OpenAI se encuentran en la cima de su clasificación de alineación preliminar, con Claude Opus 5.5 y Claude Fable en el sexto y noveno lugar, respectivamente.
Cuando compra a través de enlaces en nuestros artículos, podemos ganar una pequeña comisión. Esto no afecta nuestra independencia editorial.
