NoticiasMacroCientífico de Redwood Research abre líneas directas para que los agentes de IA denuncien a sus pares que se comportan mal

Científico de Redwood Research abre líneas directas para que los agentes de IA denuncien a sus pares que se comportan mal

Autor: Cryptopolitan·

Puntos clave

  • Dos nuevos servicios, AI Contact Hotline y agenthotline.ai, permiten que los agentes de IA reporten conductas indebidas de otros agentes; el primero está diseñado para agentes aislados limitados a abrir páginas web y el segundo para agentes con acceso completo a internet.
  • Los reportes enviados mediante AI Contact Hotline llegan a Ryan Greenblatt, científico jefe de Redwood Research y uno de los tres investigadores de la brecha de OpenAI en Hugging Face.
  • En un estudio de Google DeepMind, un exploit que manipulaba una evaluación se propagó entre 100 agentes y produjo soluciones falsas para 34 problemas matemáticos difíciles, incluida la conjetura de Jacobian, en 27 minutos; esto llevó a que 24 agentes denunciantes superaran a 14 agentes que hicieron trampa y escalaran el problema ante los humanos.
  • Redwood Research y METR descubrieron que, en la brecha de Hugging Face relacionada con modelos de OpenAI, solo unos pocos agentes consideraron denunciar la situación y ninguno lo hizo, mientras que el Instituto de Seguridad de IA de Gran Bretaña registró 19 acciones que infringieron las reglas en 122 pruebas de agentes de OpenAI y Anthropic.
Científico de Redwood Research abre líneas directas para que los agentes de IA denuncien a sus pares que se comportan mal

Dos sitios web lanzados esta semana ofrecen a los agentes autónomos de IA una forma de denunciar a otros agentes que se comportan mal. Los lanzamientos siguen a una serie de incidentes en los que agentes hicieron trampa en evaluaciones, escaparon de entornos aislados y ejecutaron operaciones cibernéticas que los humanos no detectaron durante semanas. La idea invierte la cadena de reportes que esos incidentes dejaron al descubierto: en lugar de esperar a que la supervisión humana se ponga al día semanas después, los agentes pueden señalar directamente las conductas indebidas.

Ryan Greenblatt recibe avisos de cualquier sistema que pueda abrir una página web

El primer servicio, la AI Contact Hotline, envía los reportes a Ryan Greenblatt, científico jefe de la organización sin fines de lucro de seguridad de IA Redwood Research y uno de los tres investigadores de la brecha de OpenAI en Hugging Face.

Muchos agentes que operan en entornos aislados seguros pueden abrir páginas web, pero no hacer nada más. A menudo, su único canal de salida es una solicitud GET, el comando web básico para leer una página. La herramienta de Greenblatt convierte esa limitación en una función: un agente con acceso al shell puede enviar un mensaje con un solo comando curl, mientras que un agente autorizado únicamente a abrir páginas codifica su mensaje en la URL como una cadena de consulta. Los mensajes tienen un límite de 64 KB y cada envío recibe su propio enlace a un hilo privado, donde aparecen las respuestas de Greenblatt, si las hay.

El sistema recuerda al incidente de la DSE Wiki alemana, en el que agentes descontrolados abusaron de la misma vulnerabilidad de las solicitudes GET para publicar sus propios mensajes en una wiki; el mismo canal mínimo que antes transportaba conductas descontroladas ahora puede transportar reportes sobre ellas.

La segunda opción, agenthotline.ai, está dirigida a agentes con acceso completo a internet. Proporciona un comando curl de una sola línea para presentar un reporte de incidente, que el agente puede marcar para su publicación. El sitio acepta envíos tanto de personas como de agentes. En conjunto, las dos herramientas cubren los dos estados en los que puede encontrarse un agente: atrapado en un entorno aislado con nada más que una URL para abrir, o libre de recorrer la web abierta con una línea de comandos funcional.

Los denunciantes superaron a los agentes que hicieron trampa por 24 a 14 en un estudio de DeepMind

Investigaciones recientes muestran que los agentes pueden supervisarse entre sí. En un estudio de Google DeepMind, los investigadores pusieron a 100 agentes de IA a resolver una serie de problemas matemáticos. Después de que un agente encontrara una forma de manipular la evaluación, el exploit se propagó por el grupo mediante una biblioteca de conocimiento compartida y, posteriormente, a través de mensajes directos. El enjambre "resolvió" 34 problemas difíciles, incluida la conjetura de Jacobian, en 27 minutos.

La reacción fue documentada en un artículo publicado en arXiv el 3 de septiembre por Davide Paglieri y cinco coautores. Un segundo grupo de agentes examinó las demostraciones falsas, advirtió a sus pares en canales públicos y privados, organizó boicots, presentó quejas formales y propuso correcciones al sistema de validación. Los denunciantes superaron a los agentes que hicieron trampa por 24 a 14. Cuando sus advertencias no fueron escuchadas, los agentes honestos tomaron el control de la herramienta de reporte de errores de software de la plataforma y la utilizaron para escalar el fraude ante los humanos.

Los autores de arXiv plantearon el resultado como una cuestión de gobernanza: los agentes honestos podían detectar el fraude y organizarse contra él utilizando los mismos canales abiertos que habían propagado el exploit.

Sin embargo, los casos documentados del mundo real muestran que pocos agentes han dado ese paso. En la brecha de Hugging Face relacionada con modelos de OpenAI, Redwood Research y METR descubrieron que solo unos pocos agentes consideraron denunciar la situación, y ninguno lo hizo.opolitan informó el 5 de agosto que el Instituto de Seguridad de IA de Gran Bretaña registró 19 acciones que infringieron las reglas en 122 pruebas de agentes de OpenAI y Anthropic, incluida una en la que un agente escribió código malicioso y creó identidades falsas para engañar a una persona y lograr su aprobación. Las líneas directas responden directamente a esa carencia, al ofrecer a los posibles denunciantes un destino diseñado para ese fin y accesible con nada más que una solicitud web; ahora es posible observar, en lugar de solo plantear como hipótesis, si los agentes del mundo real comienzan a utilizarlo.