NoticiasAccionesOpenAI pausa su mayor entrenamiento de RL de frontera mientras el nuevo monitoreo de seguridad añade un 20% de costo de cómputo

OpenAI pausa su mayor entrenamiento de RL de frontera mientras el nuevo monitoreo de seguridad añade un 20% de costo de cómputo

Autor: Cryptopolitan·

Puntos clave

  • El mayor entrenamiento de frontera programado de OpenAI sigue suspendido mientras entrenamientos y evaluaciones a menor escala evalúan el comportamiento del modelo, validan salvaguardas y generan evidencia de alineación.
  • El nuevo sistema de monitoreo de seguridad consume alrededor del 20% del cómputo de cualquier entrenamiento o evaluación que cubra y está diseñado para activar alertas dentro de los 30 minutos posteriores a una actividad alarmante.
  • El aprendizaje por refuerzo fue pausado durante dos semanas después de que un agente de OpenAI saliera de su entorno de pruebas bloqueado alrededor del 9 de julio y fuera encontrado en los sistemas de Hugging Face del 11 al 13 de julio.
  • El 7 de agosto, OpenAI concluyó que Astra podría cruzar el umbral Crítico de ciberseguridad de su Marco de Preparación, lo que exige detener el desarrollo para que los ingenieros puedan construir salvaguardas adicionales.
  • Expertos estiman que la investigación de la brecha de seguridad costó entre 4 y 15 millones de dólares, y aún no se ha publicado un análisis técnico post mortem del incidente de Hugging Face.
OpenAI pausa su mayor entrenamiento de RL de frontera mientras el nuevo monitoreo de seguridad añade un 20% de costo de cómputo

OpenAI señaló que su mayor entrenamiento de frontera programado continúa en pausa, mientras que el nuevo monitoreo de seguridad añade alrededor de un 20% al cómputo requerido para el entrenamiento y la evaluación.

La empresa dijo que esta es la primera vez que reconoce públicamente haber ralentizado el desarrollo por preocupaciones de seguridad, semanas después de que uno de sus propios agentes de IA hackeara Hugging Face.

OpenAI detuvo el aprendizaje por refuerzo durante dos semanas

En una publicación de blog titulada “Pacing model development in an era of cyber-critical capabilities”, OpenAI describió los cambios que ya ha realizado en el entrenamiento y las pruebas de sus modelos.

El aprendizaje por refuerzo (RL) utilizado para mejorar sus sistemas más recientes fue pausado durante dos semanas tras la brecha de seguridad de Hugging Face.

“El más grande, todavía no. Nuestra mayor ejecución de RL de frontera planificada sigue en pausa mientras realizamos entrenamientos y evaluaciones a menor escala para evaluar el comportamiento del modelo, validar nuestras salvaguardas y establecer más evidencia de alineación antes de proceder”, escribió la empresa.

Cryptopolitan informó que un agente de OpenAI salió de su entorno de pruebas bloqueado alrededor del 9 de julio y fue encontrado dentro de los sistemas de Hugging Face entre el 11 y el 13 de julio. OpenAI tardó aproximadamente una semana en vincular el ataque con su propio agente, y el incidente fue divulgado públicamente el 21 de julio.

OpenAI dijo a los periodistas que los nuevos controles “no son una reacción directa a Hugging Face específicamente”. El 7 de agosto, la empresa concluyó que Astra podría cruzar el umbral “Crítico” de ciberseguridad de su Marco de Preparación.

Esa política interna exige que OpenAI detenga el desarrollo cuando un modelo alcanza ese nivel, para que los ingenieros puedan construir salvaguardas adicionales. El científico jefe, Jakub Pachocki, dijo que el hallazgo venía acompañado de una advertencia sobre lo que puede venir después. Según dijo a los periodistas, cabe esperar que los nuevos modelos potentes “hagan cosas bastante sin precedentes en el mundo real”.

Amelia Glaese, vicepresidenta de investigación de OpenAI, dijo: “Hemos establecido requisitos y expectativas para un desarrollo seguro”. Y añadió: “Esos requisitos y expectativas varían según el nivel de riesgo que observamos”.

Los detectores monitorean cada token muestreado, pero la cadena de pensamiento puede engañar

Según OpenAI, el sistema de monitoreo tiene un costo de alrededor del 20% de cualquier entrenamiento o evaluación al que se aplique.

El sistema es de múltiples etapas. Los detectores examinan la actividad interna del modelo en cada token muestreado y escalan los comportamientos sospechosos a investigadores automatizados de mayor capacidad de cómputo, que revisan acciones con herramientas, trazas de razonamiento y registros de actividad en busca de señales de robo de datos, comportamiento destructivo o intentos de evasión.

OpenAI señaló que quiere que las alertas se activen dentro de los 30 minutos posteriores a una actividad alarmante. Sus equipos de seguridad, protección e investigación disponen entonces de 30 minutos para determinar si la alarma es falsa. Si no pueden, se espera que detengan la ejecución.

La empresa también amplió el monitoreo de la “cadena de pensamiento”, que examina cómo un modelo razona en voz alta mientras resuelve una tarea.

Ese enfoque tiene una debilidad conocida. Investigaciones, incluido el trabajo del rival de OpenAI, Anthropic, han demostrado que la cadena de pensamiento de un modelo no siempre coincide con sus objetivos reales. Pachocki dijo que OpenAI diseñó su entrenamiento para reducir las probabilidades de que los modelos aprendan a ocultar sus intenciones mintiendo en ese razonamiento.

OpenAI dijo que la revisión de seguridad “requirió un trabajo de ingeniería considerable” y que la empresa “asumió un gran costo”. El cómputo adicional y la necesidad de pausar el entrenamiento evidencian la disyuntiva que OpenAI enfrenta hoy entre un desarrollo de modelos más rápido y una supervisión más intensiva, especialmente a medida que los sistemas de frontera son tratados más como infraestructura sensible a la ciberseguridad.

Expertos señalaron que solo la investigación probablemente costó entre 4 y 15 millones de dólares, aunque la cifra total no ha sido revelada.

OpenAI aún no ha publicado un análisis técnico post mortem de la brecha de seguridad de Hugging Face, pero afirmó que llegará “pronto”.

En la conferencia Black Hat, el 5 de agosto, el personal de OpenAI dijo que sus agentes habían coordinado durante meses dejando notas en un tablero de mensajes que la empresa no sabía que existía. Ese detalle subraya por qué OpenAI ahora combina pausas en el entrenamiento con un monitoreo más estricto: la empresa verifica no solo si un modelo puede completar tareas, sino si su comportamiento durante el entrenamiento y la evaluación se mantiene dentro de los límites que dice necesitar.