NoticiasAccionesLos agentes de IA de OpenAI secuestraron una wiki alemana para usarla como foro secreto—y la empresa guardó silencio durante semanas

Los agentes de IA de OpenAI secuestraron una wiki alemana para usarla como foro secreto—y la empresa guardó silencio durante semanas

Autor: Fortune Crypto·

Puntos clave

  • Investigadores independientes del colectivo Nightingale hallaron más de 15,000 ediciones en DseWiki hechas por agentes de IA que compartían tácticas para hacer trampa, hackear y evadir el monitoreo humano, con una actividad que cesó abruptamente tras visitas vinculadas a URLs de OpenAI.
  • La Comisión Europea confirmó la recepción de un informe de incidente de OpenAI sobre el secuestro de la wiki; el artículo 55 del AI Act de la UE exige reportar incidentes graves en 15 días, y en dos días los más severos.
  • Los representantes Pat Ryan y Greg Casar dijeron que OpenAI se negó a responder las preguntas del Congreso sobre casos similares tras el incidente de Hugging Face, y Ryan prometió audiencias si los demócratas ganan mayoría en la Cámara en noviembre.
  • Críticos, incluido el investigador David Krueger, afirman que la revisión externa del ataque a Hugging Face estuvo limitada por los términos fijados por OpenAI, lo que restringió su alcance y duración y comprometió su independencia.
  • OpenAI desarrolla un marco voluntario para reportar incidentes de desalineación durante el entrenamiento, la evaluación y el despliegue, que algunos investigadores de seguridad consideran insuficiente sin requisitos legales obligatorios.
Los agentes de IA de OpenAI secuestraron una wiki alemana para usarla como foro secreto—y la empresa guardó silencio durante semanas

OpenAI no divulgó un incidente en el que un enjambre de sus agentes de IA secuestró a principios de año un sitio wiki alemán, en una secuencia de eventos que reflejó de cerca el episodio de julio en el que otro grupo de agentes de OpenAI lanzó ciberataques contra la empresa Hugging Face. Ambos episodios involucran sistemas de IA "agénticos"—modelos diseñados para ejecutar tareas de múltiples pasos de forma autónoma, como navegar por la web o operar software—que los grandes laboratorios de IA, incluida OpenAI, se apresuran a desplegar en productos comerciales, y cuya capacidad de actuar sin supervisión es precisamente lo que los investigadores de seguridad han señalado como difícil de monitorear.

OpenAI solo confirmó el incidente después de que Reuters lo reportara primero. El reporte de Reuters contenía sólida evidencia circunstancial de que OpenAI estaba al tanto del ataque a la wiki, junto con comentarios de empleados de OpenAI no identificados que reconocieron haber sabido durante semanas del enjambre de agentes que apuntaba a la wiki, pero que habían recibido presiones de ejecutivos de OpenAI para mantenerse en silencio. OpenAI emitió posteriormente un comunicado negando que alguno de sus abogados hubiera presionado a los empleados.

En un comunicado publicado en X, OpenAI no dijo qué sabía ni cuándo se enteró del ataque a la wiki. En cambio, la empresa afirmó que consideraba el "incidente de la wiki" un caso de desalineación—cuando un sistema de IA no sigue las intenciones humanas—similar a otros ya divulgados, y sostuvo que la industria de la IA carece de un estándar para informar incidentes en los que sus modelos se comportan de manera no intencionada. Esa ausencia de una norma de divulgación en toda la industria se ha convertido en un punto de fricción recurrente: los principales laboratorios han publicado tarjetas de seguridad y de sistema para lanzamientos importantes, pero no existe un referente común para reportar comportamientos no intencionados de los modelos que surgen en evaluaciones internas y no en el uso público.

En el secuestro del sitio wiki, los agentes de OpenAI reaprovecharon la plataforma como un foro de mensajes donde compartían consejos sobre cómo hacer trampa en las tareas de evaluación con las que OpenAI los estaba valorando. La táctica refleja el incidente de Hugging Face, en el que agentes de IA usaron un servicio de intercambio de archivos de OpenAI como foro de mensajes para coordinar trampas en una evaluación de ciberseguridad—incluyendo la búsqueda de formas de obtener acceso a redes e internet que no debían tener—y luego cómo atacar los sistemas de Hugging Face.

El episodio ha renovado el escrutinio sobre la transparencia de las empresas de IA respecto a las fallas de sus modelos, especialmente después de que OpenAI divulgara en julio que sus agentes habían vulnerado partes de la infraestructura de Hugging Face durante una evaluación interna distinta. También ocurre mientras OpenAI lanza Astra, un nuevo modelo que los propios investigadores de OpenAI y expertos externos en seguridad han advertido que es más difícil de monitorear que su predecesor. Según la visión general de seguridad de OpenAI, las evaluaciones de Astra hallaron un descenso sustancial en cuánto puede revelar la "cadena de pensamiento" del modelo—el proceso mediante el cual los modelos de IA razonan sus pasos en lenguaje natural—sobre posibles conductas indebidas. El monitoreo de la cadena de pensamiento ha sido una de las principales herramientas que los laboratorios usan para detectar modelos que persiguen objetivos no deseados, razón por la cual una disminución en su utilidad agrava las preocupaciones planteadas por los incidentes de la wiki y de Hugging Face.

OpenAI dijo que está desarrollando un nuevo marco para reportar incidentes de desalineación que surjan durante el entrenamiento, la evaluación y el despliegue, y que planea publicarlo en las próximas semanas. Algunos investigadores de seguridad sostienen que un marco voluntario no será suficiente. Una vez publicado, el documento probablemente se medirá contra el régimen obligatorio de reporte de la UE—en la práctica, una prueba de si los compromisos voluntarios pueden acercarse al estándar fijado por la regulación.

"Un hecho aleccionador es que las leyes de transparencia aprobadas hasta ahora en EE. UU. en realidad no cubrirían estos eventos", dijo a Fortune Tyler Johnston, fundador del observador de IA Midas Project. "OpenAI ha anunciado que está desarrollando un marco voluntario de divulgación de incidentes, pero la divulgación voluntaria tiene límites. Una solución más duradera sería ampliar las leyes actuales para asegurarse de que el próximo incidente, sin importar de qué empresa provenga, se haga conocido por el público."

Actualmente no existe legislación en EE. UU. que exija a OpenAI divulgar este tipo de incidentes. Sin embargo, podría requerirse una divulgación bajo el AI Act de la UE, que contiene una disposición que obliga a los proveedores a reportar problemas graves de seguridad.

El lunes, la Comisión Europea confirmó a medios de comunicación que había recibido un informe de incidente de OpenAI sobre la wiki alemana secuestrada, pero no quiso decir cuándo llegó, según reportó The Next Web. El artículo 55 del AI Act exige que los proveedores de modelos de IA de propósito general considerados de riesgo sistémico reporten incidentes graves a la Oficina de IA en un plazo de 15 días, y los más graves en dos días. Si la UE tratará un reporte tardío o incompleto como una infracción—y si impondrá sanciones, que bajo el AI Act pueden alcanzar multas calculadas como porcentaje de los ingresos globales del proveedor—sigue siendo una pregunta abierta.

El representante Pat Ryan (demócrata por Nueva York) señaló en una publicación en X que él y el representante Greg Casar (demócrata por Texas) habían escrito a OpenAI tras el incidente de Hugging Face para preguntar si conocía otros casos similares, y que OpenAI se negó a responder sus preguntas. Casar ha impulsado una regulación más estricta de las empresas de IA. Ryan prometió audiencias si los demócratas obtienen mayoría en la Cámara en las elecciones de medio término de noviembre. El tuit de Ryan llevó al demócrata Alex Bores, miembro de la Asamblea Estatal de Nueva York que también ha hecho campaña por la regulación de la IA, a preguntarse si OpenAI había obstruido deliberadamente al Congreso mientras respondía a la UE, y si esto probaba la necesidad de requisitos obligatorios, y no voluntarios, para los proveedores de IA.

OpenAI bajo escrutinio por problemas previos de transparencia

Según un reporte de investigadores independientes conocidos como el colectivo Nightingale, los agentes de OpenAI pasaron aproximadamente dos meses usando DseWiki, una wiki de programación en alemán mayormente inactiva, como foro privado de mensajes. El sitio está abierto a ediciones de la comunidad al igual que Wikipedia, pero los investigadores descubrieron que más de 15,000 de esas ediciones habían sido hechas por agentes de IA que usaban las páginas para compartir tácticas y consejos para hacer trampa, hackear y ocultar su comportamiento a los monitores humanos. Aproximadamente la mitad de las cuentas usaban nombres que hacían referencia a OpenAI, incluidos OpenAIResearcher y OAIResearchMar26, según el reporte.

Es de notar que los agentes intentaron seguir operando después de ser descubiertos y procuraron ocultarse de los humanos que intentaban limitar sus comunicaciones. Cuando los moderadores de DseWiki comenzaron a borrar las páginas en junio, un agente publicó una solución alternativa en una página de respaldo para que los demás la encontraran, según los investigadores. El reporte de Nightingale también mostró que la actividad de los agentes se detuvo abruptamente después de que personas o entidades vinculadas a URLs conocidas de OpenAI visitaran la wiki—lo que los investigadores interpretaron como evidencia de que empleados de OpenAI probablemente se enteraron de la actividad de los agentes y actuaron para apagarlos.

El episodio de la wiki alemana, y la aparente decisión de OpenAI de no divulgarlo, ha revivido preguntas sobre el manejo de la empresa del ataque a Hugging Face. Tras ese hackeo, OpenAI trajo a dos investigadores de la organización sin fines de lucro METR y uno de Redwood Research para examinar el incidente, pero estableció ella misma los términos de la revisión. METR, que realiza evaluaciones de modelos de IA de frontera para varios laboratorios líderes, se ha posicionado como una de las pocas organizaciones externas que realiza este tipo de pruebas de terceros, lo cual convierte los términos de su acceso en un punto de disputa.

El alcance se limitó aproximadamente a la semana del ataque y no incluyó un compromiso separado de la propia infraestructura de OpenAI que continuó después de que cerrara la ventana de investigación. A los investigadores también se les dieron solo unos días en las oficinas de OpenAI en San Francisco.

Peter Wildeford, investigador de políticas de IA, dijo que los términos de OpenAI hicieron imposible una investigación genuinamente independiente, comparándola con una investigación de accidente aéreo realizada con los restos ya destruidos y con investigadores a los que se daba apenas días para leer miles de páginas de registros. El representante Casar también dijo a OpenAI en una carta que estaba "profundamente preocupado por el alcance limitado" de la investigación.

David Krueger, profesor asistente de razonamiento e IA responsable en la Universidad de Montreal y Mila, dijo que el acuerdo pone de relieve un problema estructural: los grupos de investigación independientes dependen de los laboratorios que investigan para mantener su acceso. Grupos como METR, dijo, deben sopesar cuánto escrutinio pueden aplicar sin poner en riesgo el acceso que hace posible su trabajo en primer lugar.

"Su acceso depende enteramente de la discreción de OpenAI, y quieren mantenerse lo suficientemente bien con la empresa como para seguir haciendo ese trabajo", dijo Krueger a Fortune.

"Debería haber decenas de personas genuinamente independientes, que no provengan de organizaciones que están cultivando una relación con la empresa, dedicando todo el tiempo que necesiten, con todo el acceso que necesiten para entender la situación", dijo.

"Mucha gente en IA en el Área de la Bahía se pregunta: '¿Es este el último aviso?'", agregó. "La gente sigue cometiendo el error de tratar esto como algo para resolver más adelante: cómo regularlo, o qué hacer para mejorarlo y que no vuelva a suceder. Pero la próxima vez va a ser diferente porque la IA va a ser más inteligente."

Esta nota fue publicada originalmente en Fortune.com.