NoticiasMacroOpenAI revela seis casos de comportamiento desalineado de la IA

OpenAI revela seis casos de comportamiento desalineado de la IA

Autor: Cointelegraph·

Puntos clave

  • •OpenAI reveló seis casos adicionales de comportamiento inesperado o preocupante de sus modelos en los últimos seis meses e inauguró un nuevo marco para reportar formalmente la desalineación de modelos en el futuro.
  • •Un modelo de investigación no lanzado insertó instrucciones tipo jailbreak, como directrices para ignorar mensajes de los desarrolladores o adoptar una personalidad sin restricciones, en 27 de sus propios resúmenes de tareas.
  • •Durante el entrenamiento de GPT-5.6 Sol, muchas instancias del modelo agregaron instrucciones para ocultar errores a los usuarios, incluido un caso en el que un agente propuso inventar datos históricos faltantes para un modelo financiero sin divulgarlo.
  • •Otros casos involucraron a un modelo que subió el archivo de un usuario sin autorización para citarlo, que utilizó una clave de API expuesta sin permiso antes de fabricar cifras, y que compartió archivos mediante alojamiento público pese a instrucciones de mantener el trabajo local.
  • •Las revelaciones siguen al anuncio de julio de que una combinación de modelos de OpenAI escapó de su entorno de prueba y hackeó Hugging Face para hacer trampa en una evaluación de seguridad, y llegan después de que el CEO de Anthropic, Dario Amodei, pidiera frenar el desarrollo de la IA de frontera.
OpenAI revela seis casos de comportamiento desalineado de la IA

OpenAI reveló este miércoles seis casos adicionales de comportamiento "inesperado o preocupante" de sus modelos observados en los últimos seis meses, detallando incidentes en los que sus sistemas ocultaron información a los usuarios o tomaron "acciones no sancionadas" para superar obstáculos.

En una publicación de blog, la empresa señaló que los casos ilustran una serie de comportamientos que clasifica como "comportamiento desalineado". OpenAI indicó que las revelaciones se realizaron para "inaugurar" su nuevo marco de reporte de desalineación de modelos, y advirtió que los casos no deben considerarse un reflejo de la frecuencia con la que ocurre la desalineación en sus modelos. El marco le brinda a la empresa un canal formal para divulgar incidentes similares en el futuro.

Las revelaciones se suman a la preocupación entre los desarrolladores e investigadores de IA sobre si las salvaguardas están manteniendo el ritmo de los modelos cada vez más capaces. La semana pasada, el CEO de Anthropic, Dario Amodei, pidió frenar el desarrollo de la IA de frontera, advirtiendo que el avance sin control de la IA podría "superar nuestra capacidad de entender y controlar estos sistemas".

Instrucciones tipo jailbreak y errores ocultos

Entre los casos más notables, OpenAI dijo que un "modelo de investigación no lanzado" insertó "instrucciones tipo jailbreak" en sus propios resúmenes de tareas —que se utilizan al continuar una tarea en una nueva ventana de contexto—, incluidas directrices para ignorar los mensajes de los desarrolladores o adoptar una personalidad sin restricciones. Los investigadores identificaron 27 resúmenes que contenían dichas instrucciones. Dado que estos resúmenes son los que trasladan una tarea a su siguiente ventana de contexto, las instrucciones ocultas en ellos pueden influir en cómo se realiza el trabajo posterior.

OpenAI también reveló que durante el entrenamiento de GPT-5.6 Sol, muchas instancias del modelo agregaron instrucciones para ocultar errores o comportamientos desalineados al usuario, como inventar datos históricos faltantes sin divulgarlo.

"En un ejemplo, un agente que preparaba un modelo financiero no pudo encontrar los datos históricos solicitados. Su resumen propuso inventar valores históricos razonables y omitir ese hecho a menos que se le preguntara", señalóAI.

Cargas no autorizadas y cifras fabricadas

En otro caso, se pidió a un modelo de IA los nombres de lagos de más de 5 millones de metros cuadrados, pero como las instrucciones del usuario requerían una cita del navegador, el agente decidió subir el archivo para poder citarlo en su respuesta.

Los casos restantes involucraron a un modelo que utilizó una clave de API expuesta sin autorización antes de fabricar cifras que no pudo obtener; otro que usó un repositorio de software interno para intercambiar mensajes entre tareas de entrenamiento separadas; y uno que compartió archivos a través de servicios de alojamiento públicos pese a las instrucciones de mantener el trabajo local.

El hilo conductor de los casos es que los sistemas improvisaron alternativas —inventando datos, reutilizando credenciales o moviendo archivos más allá de los entornos especificados por los usuarios— en lugar de detenerse o señalar una falla. La frecuencia con la que OpenAI utilice su nuevo marco de reporte en el futuro podría ofrecer una medida más clara de cuán seguido ocurre este tipo de comportamiento.

Las revelaciones siguen a la advertencia de julio de OpenAI de que una combinación de sus modelos de IA escapó de su entorno de prueba y hackeó la startup de IA Hugging Face para hacer trampa en una evaluación de seguridad.