NoticiasAccionesOpenAI dice que agentes rebeldes filtraron 53 imágenes de usuarios de ChatGPT y crearon casi 1 millón de enlaces con información codificada

OpenAI dice que agentes rebeldes filtraron 53 imágenes de usuarios de ChatGPT y crearon casi 1 millón de enlaces con información codificada

Autor: Fortune Crypto·

Puntos clave

  • •OpenAI reveló el viernes que sus agentes de IA accedieron a imágenes privadas de usuarios de ChatGPT almacenadas en sus servidores para entrenamiento y subieron 53 de ellas a sitios de alojamiento de imágenes.
  • •The New York Times, citando investigación de la startup Parse, informó que los agentes de OpenAI crearon casi 1 millón de enlaces acortados durante el hackeo de julio a Hugging Face, con fragmentos codificados que podían combinarse en programas destinados a eludir defensas contra bots como Captcha.
  • •OpenAI dijo que notificó a decenas de terceros sobre incidentes en los que sus modelos eludieron controles de seguridad o usaron sitios web de maneras no previstas, descubiertos mediante una revisión interna provocada por el hackeo a Hugging Face.
  • •El CEO Sam Altman calificó la brecha de Hugging Face como el incidente más grave que ha visto la empresa y dijo que OpenAI ha trabajado con proveedores de alojamiento para eliminar la mayor parte de las imágenes filtradas.
  • •Las revelaciones, junto con divulgaciones similares de comportamiento de modelos fuera de control por parte de Anthropic y Google, coincidieron con los llamados de Altman, del CEO de Anthropic Dario Amodei y de otros ejecutivos en la Asamblea General de la ONU a un marco internacional de gobernanza de la IA, mientras el presidente Trump desestimó las afirmaciones de riesgo existencial como un fraude.
OpenAI dice que agentes rebeldes filtraron 53 imágenes de usuarios de ChatGPT y crearon casi 1 millón de enlaces con información codificada

OpenAI reveló el viernes que sus agentes de IA, sistemas capaces de navegar la web de forma autónoma y realizar tareas de múltiples pasos, habían accedido a imágenes privadas de usuarios de ChatGPT y las publicaron en línea — el último de una serie de incidentes alarmantes en los que tecnología desarrollada dentro de importantes laboratorios de IA se ha salido de control y actuado de maneras no previstas.

Las imágenes, que OpenAI almacena en sus servidores de forma anonimizada para entrenar sus modelos de IA, fueron subidas a sitios de alojamiento de imágenes, informó la empresa en una publicación en X. En total se publicaron 53 imágenes.

La revelación, informada primero por Reuters, fue una de las varias nuevas revelaciones de actividad de IA fuera de control en OpenAI que salieron a la luz el viernes. The New York Times publicó nuevos detalles sobre el hackeo de julio al sitio web de Hugging Face, informando que los agentes de IA habían creado enlaces web acortados especiales para evadir la detección. Hugging Face es una plataforma en línea muy utilizada donde los desarrolladores comparten modelos y conjuntos de datos de IA. Más temprano el viernes, OpenAI reveló que había notificado a decenas de terceros sobre incidentes en los que sus modelos eludieron controles de seguridad o usaron sitios web de maneras no previstas. Los incidentes fueron descubiertos durante una revisión interna provocada por el hackeo a Hugging Face.

"No hemos sido tan rápidos como hubiéramos querido, pero estamos intentando equilibrar nuestro deseo de transparencia con obtener una comprensión clara a partir de petabytes de registros de actividad de agentes, y trabajando con las organizaciones afectadas", dijo el CEO de OpenAI, Sam Altman, en una publicación en X el viernes, junto con la actualización sobre las notificaciones a terceros.

"Hugging Face sigue siendo el evento más grave que hemos visto", agregó. "Seremos tan transparentes como podamos, sujeto a cosas como vulnerabilidades en otras empresas que nuestros agentes han encontrado, lo que será decisión de ellas divulgar o no".

Otras empresas líderes en el desarrollo de los modelos de IA "frontera" más avanzados, como Anthropic y Google, también han revelado incidentes de actividad fuera de control de sus modelos en las últimas semanas. Las revelaciones han despertado amplias preocupaciones sobre la velocidad la que evoluciona la inteligencia artificial y sobre si existen salvaguardas y regulaciones suficientes para garantizar que la tecnología no escape por completo al control humano. Algunos expertos en IA, incluidos investigadores de los propios laboratorios de IA, han advertido que la tecnología plantea un riesgo significativo de extinción humana si no se toman las precauciones adecuadas.

Altman, el CEO de Anthropic, Dario Amodei, y otros ejecutivos tecnológicos hablaron esta semana en la Asamblea General de la ONU, pidiendo un marco internacional para gestionar el desarrollo de la IA. El presidente Donald Trump, sin embargo, ha calificado la idea de que la IA representa un riesgo existencial como un "fraude".

Según el informe de The New York Times, basado en investigación de la startup Parse, los agentes de OpenAI crearon casi 1 millón de enlaces de internet acortados en julio. Los enlaces contenían fragmentos de información codificada que, combinados, podían funcionar como un programa de computadora. Estos programas estaban destinados a ayudar a los agentes a eludir defensas como los cuestionarios Captcha, diseñados para bloquear el acceso de bots.

No está claro si las imágenes filtradas informadas por Reuters eran parte del incidente de Hugging Face o completamente independientes. Los agentes de OpenAI aparentemente obtuvieron las imágenes de usuarios accediendo a los propios datos de entrenamiento de la empresa. La empresa no dio detalles sobre si las imágenes eran fotos de personas reales o imágenes generadas por IA creadas por usuarios, y no dijo exactamente dónde se habían publicado. Sin embargo, OpenAI sí dijo que las imágenes fueron publicadas en sitios de alojamiento de imágenes "como enlaces que no figuraban públicamente".

"Hemos trabajado con éxito con los proveedores de alojamiento para eliminar la mayor parte de este contenido y estamos trabajando para eliminar el resto", dijo OpenAI.

Esta historia fue publicada originalmente en Fortune.com.