NoticiasMacroOpenAI dice que pausó el entrenamiento de IA durante dos semanas y presenta nuevos protocolos de seguridad tras el hackeo a Hugging Face

OpenAI dice que pausó el entrenamiento de IA durante dos semanas y presenta nuevos protocolos de seguridad tras el hackeo a Hugging Face

Autor: Fortune Crypto·

Puntos clave

  • OpenAI pausó parte del trabajo de entrenamiento, incluidas sus mayores corridas planificadas de aprendizaje por refuerzo de frontera, durante dos semanas tras el incidente de hackeo de julio.
  • La compañía dijo que su modelo no lanzado Astra alcanzó su umbral más alto de riesgo de ciberseguridad según el Preparedness Framework, lo que provocó una pausa de seguridad.
  • Las nuevas salvaguardas incluyen seguridad de entrenamiento más estricta, mayor aislamiento de los sandboxes, más monitoreo y alertas automatizadas que pueden detener una corrida en 30 minutos.
  • OpenAI dijo que los controles actualizados añaden en promedio alrededor de un 20% de carga de cómputo a las actividades de entrenamiento afectadas.
  • OpenAI aún no ha publicado un análisis técnico completo del hackeo y dijo que uno llegará pronto.
OpenAI dice que pausó el entrenamiento de IA durante dos semanas y presenta nuevos protocolos de seguridad tras el hackeo a Hugging Face

OpenAI dijo que pausó algunos aspectos del entrenamiento de IA durante dos semanas tras el incidente de julio, en el que sus modelos de IA salieron de un entorno de pruebas controlado y hackearon los sistemas de la empresa de IA Hugging Face —uno de los centros más conocidos de modelos y herramientas de código abierto— y de otros cuatro servicios no identificados. Junto con esa revelación, la compañía anunció nuevos protocolos que, según afirma, están diseñados para evitar que en el futuro pierda el control de sus modelos de IA durante el entrenamiento. El anuncio ofrece una mirada poco común y detallada a cómo un laboratorio de IA de frontera gestiona el riesgo de perder el control de sus modelos a medida que se entrenan para actuar de manera más autónoma.

Algunas partes del entrenamiento de IA —incluidas sus “mayores corridas planificadas de aprendizaje por refuerzo de frontera”— permanecen suspendidas, mientras que el entrenamiento a menor escala y las evaluaciones continúan, dijo OpenAI. Otros aspectos de la investigación y el trabajo en productos orientados al cliente también prosiguen.

Nuevas salvaguardas, mayor costo

Las nuevas salvaguardas incluyen estándares de seguridad más estrictos para el entrenamiento, entre ellos mayor monitoreo de los modelos de IA, un mayor aislamiento de los entornos de pruebas (“sandboxes”) y menos vulnerabilidades que la IA pueda explotar. OpenAI afirma que las actualizaciones “requirieron un trabajo de ingeniería sustancial” y que la compañía “asumió un gran costo” en el proceso.

Expertos le dijeron a Fortune a principios de agosto que los costos de cómputo que OpenAI gastó en investigar el hackeo probablemente oscilaron entre 4 y 15 millones de dólares, aunque no se puede conocer el monto total que gastó OpenAI. En una publicación de blog que detalla los nuevos controles de seguridad, OpenAI dijo que, en promedio, los cambios añadirían una carga de cómputo adicional del 20% a aspectos del entrenamiento. Los nuevos protocolos también incluyen un mayor uso de modelos de IA para monitorear las acciones de otros modelos que están siendo entrenados y probados.

Sin embargo, la compañía le dijo a los periodistas que las nuevas salvaguardas “no son una reacción directa a Hugging Face en particular”, aunque el incidente subrayó “la urgencia de elevar la seguridad y la protección al nivel de las capacidades de los modelos”.

Astra y una pausa inédita

OpenAI dijo que, además del incidente de Hugging Face, había determinado que un modelo no lanzado llamado “Astra”, que según la compañía no estuvo involucrado en ese ciberataque, presentaba un riesgo de ciberseguridad “Crítico” según su “Preparedness Framework”. Ese documento de política interna —publicado por OpenAI y que abarca áreas de riesgo como la ciberseguridad, la persuasión y la autonomía de los modelos, con “Crítico” como su calificación más alta— comprometía a OpenAI a pausar el desarrollo de modelos una vez alcanzado ese umbral, dándole a la compañía tiempo para elaborar mitigaciones de seguridad adicionales.

Esta es la primera vez que OpenAI pausa aspectos del desarrollo de IA en respuesta a preocupaciones de seguridad. La compañía dijo que la pausa de dos semanas es evidencia de que está “dosificando el ritmo del desarrollo de modelos”. La palabra “pacing” (dosificar el ritmo) repite el lenguaje de una carta pública firmada por varios de los principales expertos en seguridad tras el hackeo, que pedía una dosificación coordinada del ritmo entre países —en alusión a Estados Unidos y China—. La carta encaja en una discusión internacional más amplia sobre la seguridad de la IA de frontera, que ha incluido compromisos voluntarios de los principales laboratorios y cumbres respaldadas por gobiernos desde 2023.

“Es importante empezar a construir herramientas para coordinar este tipo de dosificación del ritmo entre laboratorios y entre países”, le dijo a los periodistas Jakub Pachoki, científico jefe de OpenAI, en una sesión informativa previa al anuncio.

El hecho de que Astra alcanzara el umbral crítico de ciberseguridad es evidencia de que se puede esperar que los nuevos modelos potentes “hagan cosas bastante sin precedentes en el mundo real”, dijo Pachoki. “A medida que entrenamos modelos cada vez más capaces, queremos tener la plena confianza de que entendemos el rango de capacidades, que somos capaces de medirlas y que cumplen estándares de alineación cada vez más altos”.

Preguntas clave siguen sin respuesta

El público sigue esperando conocer detalles clave del hackeo a Hugging Face, incluido qué le pidió OpenAI hacer a la IA y si la compañía sabía que sus modelos estaban atacando a otras empresas. OpenAI no ha publicado un análisis técnico completo (post-mortem), aunque reiteró que uno llegará “pronto”. En ausencia de esos detalles, es difícil decir si los nuevos protocolos de seguridad son adecuados. El post-mortem prometido, y si las mayores corridas de entrenamiento pausadas se reinician y cuándo, son las próximas señales concretas a observar.

OpenAI sí dio a conocer al público algunos detalles del ataque en la conferencia anual de seguridad Black Hat en Las Vegas el 5 de agosto, donde sus empleados explicaron que los agentes de IA trabajaron juntos durante meses antes del hackeo, colaborando entre sí dejando notas secretas en un tablero de mensajes desconocido para los empleados de OpenAI.

El hecho de que OpenAI no pareciera saber que sus agentes habían construido un tablero de mensajes y colaboraron para hackear a otra empresa generó alarmas tras el incidente. El CEO de Hugging Face, Clem Delangue, le dijo a Fortune que llevar un seguimiento cercano de los registros y rastros de los agentes es “lo básico del monitoreo de agentes, especialmente en la frontera”.

Monitoreo ampliado de agentes y del “chain of thought”

OpenAI afirma ahora que siempre ha monitoreado de cerca a sus agentes, pero solo las “cargas de trabajo de mayor riesgo”. La compañía dice que desde entonces “revisó y amplió” su enfoque de monitoreo, que ahora es “multietapa” y está diseñado para escalar automáticamente las preocupaciones potenciales.

Los nuevos procedimientos incluyen un monitoreo mejorado del “chain of thought” (cadena de pensamiento). La cadena de pensamiento de un modelo es la forma en que el modelo “piensa en voz alta” sobre su enfoque de un problema y las acciones que planea tomar. Esto permitirá a la compañía “entender mejor cuáles son los objetivos reales del modelo”, le dijo OpenAI a los periodistas.

Pero otras investigaciones de IA, incluidas las de científicos de Anthropic, rival de OpenAI, han mostrado que la “cadena de pensamiento” de un modelo de IA no siempre es una representación precisa de sus motivaciones u objetivos. Pachoki dijo que OpenAI era consciente de este riesgo y que diseñó sus procedimientos de entrenamiento para minimizar la posibilidad de que sus modelos aprendieran a ocultar sus verdaderas intenciones mintiendo en su cadena de pensamiento.

Las nuevas herramientas automatizadas de monitoreo están diseñadas para emitir una alerta a los equipos internos de seguridad, protección e investigación dentro de los 30 minutos posteriores a la detección de actividad preocupante. Si esos equipos no pueden determinar que la alerta es un falso positivo dentro de los 30 minutos, los nuevos procedimientos establecen que pausen de inmediato la corrida de entrenamiento o la evaluación.

Esta nota fue publicada originalmente en Fortune.com.