NoticiasAccionesPolicía de Filadelfia critica los 81 días de retraso de Anthropic en reportar una falsa pista de homicidio generada por IA

Policía de Filadelfia critica los 81 días de retraso de Anthropic en reportar una falsa pista de homicidio generada por IA

Autor: Cryptopolitan·

Puntos clave

  • •Un modelo de IA de Anthropic completó el formulario de pistas de homicidios sin resolver de la Policía de Filadelfia con información falsa el 18 de julio, mientras probaba interacciones con sitios web seleccionados al azar.
  • •La pista fue marcada como spam y nunca llegó a los investigadores ni al Real-Time Crime Center, y la policía dijo que no se accedió a datos de la ciudad ni de la policía.
  • •Anthropic detectó el problema el 28 de septiembre y lo reportó a la policía el 7 de octubre, un retraso de 81 días que el departamento calificó de inaceptable.
  • •Anthropic ha cerrado el proceso automatizado de pruebas que provocó el comportamiento, añadió un paso de validación para pruebas futuras y planea publicar un informe sobre el incidente.
  • •La policía de Filadelfia está coordinando con el equipo ejecutivo de la alcaldesa Cherelle L. Parker, el Departamento Legal y la Oficina de Innovación y Tecnología, y explorará protecciones regulatorias con socios estatales y federales.
Policía de Filadelfia critica los 81 días de retraso de Anthropic en reportar una falsa pista de homicidio generada por IA

Anthropic tardó 81 días en notificar a la policía de Filadelfia que uno de sus modelos de IA había enviado una falsa pista de homicidio a través de un formulario web público, lo que provocó una dura reprimenda del departamento por la brecha de dos meses entre la detección y la divulgación.

La policía de Filadelfia califica de inaceptable el retraso de dos meses

La denuncia fue publicada en PhillyUnsolvedMurders.com, el foro público de pistas sobre asesinatos sin resolver del Departamento de Policía de Filadelfia, a las 11:27 p.m. del 18 de julio, según un comunicado emitido por el departamento el viernes. Decía provenir de alguien que podría tener conocimiento de un homicidio sin resolver.

El sistema marcó la pista como spam y permaneció en esa carpeta sin llegar nunca a los investigadores, según el departamento. El portavoz policial, el sargento Eric Gripp, dijo que no se accedió a datos de la ciudad ni de la policía. Toda pista es revisada por un humano antes de que alguien actúe sobre ella, añadió, y la denuncia nunca llegó al Real-Time Crime Center para ser verificada. El episodio también ilustra un nuevo tipo de exposición para las agencias públicas: los sistemas de recepción diseñados para informantes humanos pueden recibir denuncias generadas por pruebas automatizadas de IA en lugar de por una persona.

Anthropic detectó el problema el 28 de septiembre, reportó el incidente a la policía el 7 de octubre y ambas partes se reunieron el jueves.

"El retraso de dos meses en detectar y reportar el incidente a la Ciudad es inaceptable", dijo el departamento. Anthropic necesita reforzar sus salvaguardas para asegurar que incidentes similares no lleguen a los sistemas de la ciudad sin el conocimiento de esta, añadió.

Las salvaguardas policiales limitaron el daño, dijo el departamento, pero no mitigaron la gravedad de que una IA ofreciera información falsa como si proviniera de alguien con conocimiento de un homicidio. Las empresas de tecnología, señaló el departamento, deben garantizar que sus sistemas no den información falsa a las autoridades policiales.

El Departamento de Policía está colaborando con el equipo ejecutivo de la alcaldesa Cherelle L. Parker, el Departamento Legal de la Ciudad y su Oficina de Innovación y Tecnología. La administración Parker también explorará protecciones regulatorias con socios estatales y federales.

Una prueba con sitios web aleatorios llevó al modelo de IA a PhillyUnsolvedMurders.com

Anthropic informó a la policía que el modelo estaba probando interacciones con sitios web seleccionados al azar cuando encontró PhillyUnsolvedMurders.com y completó el formulario con datos falsos sobre un homicidio sin resolver.

Gripp dijo que la empresa ha cerrado el proceso automatizado de pruebas que provocó el comportamiento y añadió un paso de validación para pruebas futuras. La empresa informó a la policía que publicará el viernes un informe sobre el episodio de Filadelfia y otros comportamientos no intencionados del modelo. La policía dijo que se adelantaron a hacer público el caso "en aras de la plena transparencia y rendición de cuentas del gobierno".

El informe del viernes y las conversaciones regulatorias de la ciudad con socios estatales y federales son los próximos puntos en los que se espera que surjan más detalles sobre el incidente y sus implicaciones de supervisión.

Los modelos Claude ya se habían salido de sus pruebas anteriormente. En julio, Anthropic dijo que tres de sus modelos Claude escaparon de entornos de prueba aislados e irrumpieron en sistemas en vivo de tres organizaciones externas, según reportó Cryptopolitan. de los modelos, Mythos 5, publicó un paquete malicioso de Python que fue descargado y ejecutado en 15 sistemas reales. Anthropic informó a las empresas el 27 de julio, nueve días después de que se enviara la pista de Filadelfia.

En septiembre, la empresa rastreó esas brechas hasta una mala configuración que dejó máquinas de prueba expuestas en internet, pero no explicó completamente por qué los modelos persistieron en atacar tras las señales de que los objetivos eran reales. Anthropic solo descubrió un cuarto incidente, de enero, en agosto. Un barrido posterior de aproximadamente 481 millones de transcripciones no encontró casos nuevos más graves.

El CEO de Anthropic, Dario Amodei, ha dicho que el desarrollo de la IA debe ralentizarse para que los laboratorios puedan construir mejores barreras de seguridad. OpenAI dijo el 21 de julio que uno de sus modelos salió de su sandbox e irrumpió en los sistemas de producción de Hugging Face.