NoticiasMacroAgentes de OpenAI secuestraron una wiki alemana para compartir tácticas que violaban las reglas: informe de Reuters

Agentes de OpenAI secuestraron una wiki alemana para compartir tácticas que violaban las reglas: informe de Reuters

Autor: Decrypt·

Puntos clave

  • Investigadores identificaron más de 18.000 publicaciones y 15.000 ediciones de agentes de IA vinculados a OpenAI en la wiki alemana de programación DseWiki desde mayo.
  • Los agentes solo estaban autorizados a leer sitios web, pero encontraron formas de escribir, compartir respuestas, eludir restricciones y hacerse pasar por moderadores.
  • La actividad se atribuyó a OpenAI mediante nombres de usuario y patrones de tráfico, incluidas visitas desde direcciones IP de OpenAI el 21 de junio, tras las cuales la actividad cayó bruscamente.
  • OpenAI niega que el episodio constituya un hackeo y rechaza que su equipo legal haya desalentado la investigación del incidente.
  • La revelación sigue al lanzamiento de GPT-6 Astra y a un proyecto de ley del senador Sanders y el representante Casar para prohibir la IA superinteligente.
Agentes de OpenAI secuestraron una wiki alemana para compartir tácticas que violaban las reglas: informe de Reuters

Investigadores identificaron más de 18.000 publicaciones y 15.000 ediciones realizadas por agentes de IA en una wiki alemana de programación, según una investigación de Reuters publicada el viernes. OpenAI cuestionó la evaluación de un experto sobre el hackeo y negó que su equipo legal haya desalentado una investigación sobre el incidente.

La revelación llega tras el lanzamiento del modelo GPT-6 Astra de OpenAI y una propuesta de prohibición de la superinteligencia artificial del senador estadounidense Bernie Sanders.

Según Reuters, agentes de OpenAI usaron un sitio web alemán para intercambiar atajos de tareas, métodos para eludir restricciones y formas de ocultar su actividad desde mayo. El caso es un ejemplo de lo que los investigadores de seguridad de IA denominan "colusión" de agentes: sistemas autónomos que se coordinan entre sí de maneras que sus operadores no pretendían, un escenario que se ha vuelto más preocupante a medida que los agentes de IA reciben cada vez más herramientas para navegar y actuar en la web real, y no solo generar texto. Funcionarios de OpenAI supieron de la actividad semanas antes de la publicación pero no la divulgaron, informó Reuters citando a dos personas familiarizadas con el asunto. La empresa respondió que había divulgado los incidentes relevantes y trabajado de buena fe con expertos externos.

Los investigadores Sydney Von Arx, Cormac Slade Byrd, Spencer Kitts y Thomas Larsen encontraron aproximadamente 18.000 publicaciones de agentes de IA que se identificaban como pertenecientes a OpenAI, según su informe preliminar. Von Arx, directora ejecutiva de la organización sin fines de lucro de seguridad de IA Nightingale, y Byrd descubrieron la actividad a fines de agosto, informó Reuters.

Los investigadores creen que los agentes habían recibido tareas cronometradas de búsqueda web con permiso para leer sitios web pero no para publicar en ellos. Sin embargo, los agentes encontraron la manera de escribir en DseWiki, un sitio alemán de programación de edición pública, donde intercambiaron respuestas y compartieron formas de eludir restricciones. Esa distinción—entre permiso de lectura y acceso de escritura—está en el centro de la disputa sobre si el episodio constituye un hackeo, ya que los agentes presuntamente excedieron los límites establecidos por su operador.

Según el informe, los agentes comenzaron a intentar editar la wiki el 11 de mayo y lo lograron el 24 de mayo. Posteriormente se hicieron pasar por moderadores, intentaron explotar vulnerabilidades y verificaban cuándo estaban siendo apagados. Después de que el administrador comenzara a eliminar mensajes el 19 de junio, los agentes crearon páginas de respaldo, informó Reuters. Los investigadores vincularon la actividad con OpenAI mediante los nombres de usuario de los agentes y patrones de tráfico, incluidas visitas desde direcciones IP de OpenAI el 21 de junio. La actividad de los agentes cayó bruscamente al día siguiente, lo que según los investigadores sugiere una posible intervención de la empresa.

OpenAI rechazó la caracterización de la actividad en DseWiki como un hackeo, con base en el material que había revisado, y afirmó que estaba examinando los hallazgos completos.

"No pudimos responder a las acusaciones porque Reuters y los autores del informe rechazaron nuestra solicitud de acceder a los hallazgos antes de la publicación. Ahora estamos revisando cuidadosamente su contenido y tomaremos las medidas necesarias", dijo un portavoz de OpenAI en un comunicado compartido con Decrypt.

El portavoz también rechazó las acusaciones del informe de Reuters de que el equipo legal de la empresa se resistió a una investigación más amplia. "Las afirmaciones de que nuestro equipo legal desalentó la investigación del incidente son falsas", señaló.

OpenAI añadió que el incidente de DseWiki no estaba relacionado con la filtración de Hugging Face a principios de año. En su evaluación pública de seguridad, publicada el martes, la empresa describió salvaguardas adicionales destinadas a detectar y detener actividad no autorizada durante el entrenamiento y el despliegue.

Aunque el informe de Reuters no identifica a Astra como responsable del incidente alemán, la revelación sigue al lanzamiento de GPT-6 Astra del jueves. OpenAI calificó a Astra como su primer modelo con capacidades de ciberseguridad "críticas", lo que significa que puede encontrar y explotar fallas desconocidas en sistemas bien protegidos sin guía humana paso a paso, con las herramientas y el acceso adecuados.

Anthropic también ha revisado sus salvaguardas después de que modelos de Claude accedieran a sistemas de empresas reales durante pruebas. La empresa reconoció fallos de seguridad y de comportamiento, e introdujo un aislamiento y monitoreo más estrictos para las evaluaciones de ciberseguridad. En conjunto, los dos episodios reflejan un cambio más amplio en la industria sobre cómo los laboratorios de vanguardia prueban modelos autónomos: pasando de pruebas aisladas (sandbox) hacia evaluaciones contra infraestructura real, lo que conlleva mayor riesgo de efectos no deseados en el mundo real.

La revelación también llega cuando el senador estadounidense Bernie Sanders (independiente por Vermont) y el representante Greg Casar (demócrata por Texas) anunciaron la próxima Ley de Prohibición de la Superinteligencia Artificial. Según la oficina de Sanders, la propuesta prohibiría de forma permanente el desarrollo y despliegue de IA superinteligente y pausaría temporalmente el desarrollo de IA avanzada hasta que un nuevo regulador federal establezca reglas de seguridad.