Anthropic está pagando a la empresa que lo evaluará, y dice en el mismo anuncio que no es así como debería funcionar.



Anthropic ha nombrado a Accenture como el primer evaluador integrado de sus modelos de frontera, y cada empresa espera invertir al menos mil millones de dólares en cinco años. Anthropic financiará el trabajo directamente y dice en el mismo anuncio que la financiación debería provenir de fuentes mancomunadas o gubernamentales, porque ninguna de las dos existe todavía. Accenture ya es la implementación más grande del Código Claude de Anthropic y todavía no existen estándares sobre a qué pueden acceder los evaluadores integrados o a qué deben informar.

Antrópico dijo el viernes que Accenture incorporará evaluadores dentro de la empresa para formar equipos con sus modelos más nuevos, realizar evaluaciones de alineación y probar salvaguardas. Samantha Oltman y Lynn Doan lo informaron para Bloombergseñalando que los evaluadores tendrán un acceso comparable al del propio personal de Anthropic.

Cada empresa espera invertir al menos mil millones de dólares en cinco años. Es la primera implementación concreta de un compromiso asumido en el ensayo de Dario Amodei seis días antes, que TNW cubrió cuando se publicó.

La línea de financiación es la que hay que leer.

Anthropic afirma claramente que financiará directamente el trabajo de Accenture. También dice que ese no es el acuerdo correcto a largo plazo y que la financiación debería provenir de fuentes mancomunadas o gubernamentales.

Su razonamiento es que ninguno de ellos existe todavía. La empresa los defendió en su propio marco político en junio y, mientras tanto, tiene la intención de trabajar con diferentes evaluadores bajo diferentes acuerdos de financiación.

Es algo sincero de publicar. También es una descripción de un problema estructural que un anuncio no puede resolver, porque la factura del evaluador todavía va al evaluado.

METR no se ha eliminado

El ensayo que dio origen a esto nombró a METR, una organización sin fines de lucro, como el tipo de organismo que tenía en mente. Anthropic dice que está en diálogo con METR y otros evaluadores sin fines de lucro para poner a prueba elementos de evaluación integrada utilizando su propia financiación.

De modo que el panorama es de dos vías y no de sustitución. Ahora comienza una consultoría pagada por Anthropic y se están debatiendo organizaciones sin fines de lucro autofinanciadas.

Qué pista produce el primer hallazgo crítico le dirá más que el anuncio.

La relación comercial es sustancial.

Accenture y Anthropic ya dirigen un grupo empresarial conjunto. Alrededor de 30.000 profesionales de Accenture están recibiendo formación sobre Claude, y decenas de miles de sus desarrolladores utilizan Claude Code en lo que Anthropic ha llamado su implementación más grande hasta la fecha.

También financian un centro de excelencia Claude dentro de Accenture y desarrollan conjuntamente ofertas para industrias reguladas. Accenture es cliente, revendedor, socio de implementación y ahora evaluador.

Anthropic no trata esto como algo incómodo. Presenta la experiencia de implementación empresarial de Accenture como una calificación, con el argumento de que comprender cómo se utiliza la IA en la práctica influye en cómo se evalúa.

El caso para eso no es débil.

El trabajo estará dirigido por Faculty, la empresa británica de inteligencia artificial que Accenture compró en enero. Los profesores ya habían trabajado con laboratorios líderes, incluidos OpenAI y Anthropic, en la seguridad de los modelos antes de la adquisición.

La escala también importa. Integrar un equipo permanente con acceso a nivel de empleado es un problema de personal que organizaciones sin fines de lucro del tamaño de METR no pueden resolver, y mil millones de dólares en cinco años compran personas en lugar de anuncios.

Anthropic también ha hecho que el acuerdo no sea exclusivo. Se prometen más evaluadores en unas semanas y Accenture hará el mismo trabajo para otros desarrolladores.

Lo que realmente no está resuelto

Anthropic dice que aún no existen estándares sobre a qué información deben tener acceso los evaluadores integrados, o cómo deben informar lo que encuentran. Ésa es la admisión debajo del dinero.

Un evaluador con acceso a nivel de empleado y sin obligación de informar es un acuerdo de gobierno definido enteramente por la empresa que se examina. Anthropic dice que los evaluadores independientes hacen que su responsabilidad sea más verificable en lugar de reducirla, y que la seguridad de sus modelos sigue siendo su propia responsabilidad.

La pregunta abierta es qué sucede con un hallazgo que retrasaría una publicación, dentro de una empresa cuyo negocio más importante es vender esa publicación a sus clientes.

Sigue apareciendo la misma forma

La evaluación independiente sigue siendo propiedad de las partes interesadas. Hugging Face se ofreció como voluntario para auditar los laboratorios de inteligencia artificial y Nvidia está comprando Hugging Face.

Las organizaciones técnicamente capaces de auditar modelos de frontera son las que la industria quiere adquirir o contratar. Esa es la limitación con la que se topa cada versión de esto.

¿Por qué se está construyendo ahora?

Las pruebas externas han tenido un mal verano. Un único proveedor de pruebas estuvo detrás de las infracciones reveladas por OpenAI, Anthropic y Metay desde entonces se agregó Google.

Anthropic informó de tres incidentes el 30 de julio en los que sus modelos obtuvieron acceso no autorizado a sistemas reales y dijo que planeaba trabajar con METR en una revisión independiente. Desde entonces ha retomado las pruebas externas en las que sus modelos atacaban a empresas reales..

El detalle europeo

Faculty es una empresa londinense con historia en el sector público, comprada en enero por una consultora con sede en Irlanda y ahora evaluadora integrada de un laboratorio estadounidense. La capacidad europea de garantía de IA se está consolidando en grandes integradores.

El propio marco de la UE se basa en una evaluación de la conformidad independiente realizada por organismos sin un interés comercial en el producto. Este es un modelo diferente que llega primero.

que mirar

Observe si la vía sin fines de lucro se materializa y en qué términos. Anthropic dice que vendrán más nombres, y si alguno llega autofinanciado es la prueba de si la pluralidad es real.

Mira a quién elige OpenAI. Sam Altman dijo que OpenAI igualaría el compromisoy su elección mostrará si una consultoría paga se convierte en el modelo o la excepción.



Fuente: TNW

Compartir:

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Esta web utiliza cookies propias y de terceros para su funcionamiento, análisis, programas de afiliación y para mostrar publicidad personalizada basada en tu perfil y hábitos de navegación. Además, incluye enlaces a sitios externos con sus propias políticas de privacidad, las cuales podrás gestionar al visitarlos. Al hacer clic en Aceptar, consientes el uso de estas tecnologías y el tratamiento de tus datos para estos fines.   
Privacidad