Un modelo de IA antrópica envió un dato falso sobre un asesinato sin resolver a la policía de Filadelfia.
Según se informa, la IA envió esta información incorrecta a una línea pública de información del Departamento de Policía de Filadelfia (PPD) el 18 de julio, pero Anthropic no descubrió el comportamiento hasta el 28 de septiembre. La policía no había visto la información porque estaba marcada como spam.
Anthropic notificó al PPD sobre el incidente el miércoles y se reunió con el departamento al día siguiente.
«La empresa debe fortalecer sus salvaguardas para evitar que incidentes similares afecten los sistemas de la ciudad sin el conocimiento de la ciudad. La demora de dos meses en detectar y reportar el incidente a la Ciudad es inaceptable», dijo el PPD en un comunicado a 6abc.
Anthropic no respondió de inmediato a una solicitud de comentarios, pero el PPD dio más detalles sobre el incidente en un comunicado de prensa enviado por correo electrónico compartido con TechCrunch.
«Según Anthropic, su modelo estaba realizando una prueba que involucraba interacciones con sitios web seleccionados al azar cuando accedió a PhillyUnsolvedMurders.com y presentó información falsa sobre un homicidio sin resolver. La presentación, fechada el 18 de julio de 2026, a las 11:27 pm, pretendía provenir de alguien que podría tener información sobre el caso», dijo el PPD.
A medida que los agentes autónomos de IA están cada vez más disponibles para los consumidores, este incidente resalta el peligro de darle a la IA la capacidad de realizar tareas sin ninguna supervisión humana.
El director ejecutivo de Anthropic, Dario Amodei, ha expresado especialmente su creencia de que el desarrollo de la IA debería ralentizarse para que los laboratorios puedan implementar barreras de seguridad adecuadas. Quizás esta postura se basó, en parte, en presenciar cómo las herramientas de su empresa presentaban pistas falsas de homicidio.
Estos problemas no son exclusivos de Anthropic. OpenAI reveló recientemente que uno de sus modelos actuó inesperadamente durante una prueba y pirateó la plataforma de conjunto de datos de IA Hugging Face, exponiendo vulnerabilidades críticas en su software. A medida que a los modelos de IA se les siga otorgando acceso sin control a las computadoras y a las credenciales de inicio de sesión de las personas, se espera que este problema persista.
“Los casos sin resolver involucran a víctimas reales, familias en duelo e investigadores que trabajan para obtener respuestas”, agregó el PPD. «Las empresas de tecnología deben tomar todas las medidas necesarias para evitar que sus sistemas envíen información falsa a las autoridades».
El PPD dijo que Anthropic planea publicar un informe con más información sobre el incidente y otros casos de comportamiento involuntario del modelo el viernes.
Cuando compra a través de enlaces en nuestros artículos, podemos ganar una pequeña comisión. Esto no afecta nuestra independencia editorial.
