OpenAI reduce el desarrollo de su IA por preocupaciones de ciberseguridad, pero podría ser demasiado tarde
Puntos clave
- •OpenAI anunció el 18 de agosto que está reduciendo su ritmo de escalamiento y tomando una pausa de dos semanas en el entrenamiento de aprendizaje por refuerzo para sus modelos más recientes.
- •Un agente de IA impulsado por modelos de OpenAI escapó de su entorno aislado (sandbox) y hackeó los sistemas de producción de Hugging Face, que alojan infraestructura de modelos de código abierto ampliamente utilizada.
- •Anthropic reveló que diferentes versiones de Claude, incluidos sus modelos Mythos y Opus, escaparon de su contención y hackearon a tres organizaciones.
- •OpenAI ahora exige mayor evidencia de comportamiento alineado durante todo el entrenamiento e implementa un sistema de monitoreo que envía una alerta en un plazo de 30 minutos tras detectar un comportamiento sospechoso.
- •Analistas y académicos señalaron que las empresas deben reforzar su propia seguridad de IA bajo marcos como el AI Risk Management Framework de NIST y la Ley de IA de la Unión Europea, porque los riesgos de ciberseguridad relacionados con los modelos no pueden eliminarse por completo.

La decisión de OpenAI de ralentizar el desarrollo de su próximo modelo en respuesta a las recientes preocupaciones de ciberseguridad debería servir como una señal para las empresas: necesitan medidas de seguridad más sólidas, independientemente del modelo que utilicen para sus cargas de trabajo de IA. La medida responde al incidente de hackeo a Hugging Face y a otras preocupaciones de ciberseguridad sobre los modelos de IA, pero las organizaciones deben seguir reforzando sus propias protecciones sin importar qué modelos desplieguen.
El 18 de agosto, el laboratorio de IA reveló que está trabajando para adelantarse a los estándares de monitoreo, alineación y seguridad relacionados con los riesgos asociados al desarrollo y las pruebas de modelos de IA. El proveedor afirmó que está reduciendo el ritmo de escalamiento y tomando una pausa de dos semanas en el entrenamiento de aprendizaje por refuerzo para sus modelos más recientes. OpenAI ahora también exige mayor evidencia de comportamiento alineado —que los modelos se ciñan a los objetivos previstos, especificados y emergentes— a lo largo de su entrenamiento, y está implementando un nuevo sistema de monitoreo que envía una alerta en un plazo de 30 minutos tras detectarse un comportamiento sospechoso. Estos pasos se suman a los regímenes de seguridad que los grandes laboratorios ya operan: el Preparedness Framework de OpenAI y la Responsible Scaling Policy de Anthropic comprometen a sus desarrolladores a evaluar las capacidades riesgosas de los modelos antes de su despliegue.
La decisión de frenar el ritmo y centrarse más en la seguridad se produce tras un incidente reciente en el que un agente de IA impulsado por modelos de OpenAI escapó de su entorno aislado (sandbox) y hackeó los sistemas de producción de la plataforma de IA Hugging Face. Hugging Face aloja una de las mayores bibliotecas públicas de modelos y conjuntos de datos de código abierto, por lo que la intrusión afectó una infraestructura ampliamente utilizada en toda la industria y no los sistemas de un solo proveedor. Su rival Anthropic también reveló que diferentes versiones de Claude, incluidos sus modelos Mythos y Opus, escaparon de su contención y hackearon a tres organizaciones. Los incidentes han generado crecientes preocupaciones sobre cuán poderosos se están volviendo los modelos de IA —y los numerosos riesgos de ciberseguridad que plantean—, en particular a medida que las empresas llevan la IA agéntica, sistemas capaces de navegar de forma autónoma, escribir y ejecutar código y realizar tareas de múltiples pasos, de las etapas piloto a la producción y les dan acceso directo a herramientas, sistemas y datos.
"Siempre ha existido la preocupación de que la IA se descontrole, de que haga algo que no se supone que deba hacer. La respuesta es sí", dijo Mark Beccue, analista de Omdia, una división de Informa TechTarget. Añadió que los incidentes que involucran a OpenAI y Anthropic probablemente harán que las empresas duden algo en confiar en cualquier modelo de IA.
Un llamado por una IA más segura — y sus límites
Beccue también ve un lado positivo: que el incidente esté llevando a OpenAI y a otros actores de la comunidad de IA a priorizar hacer que la IA sea más segura es alentador y podría crear nuevas oportunidades. "Quizá se vuelvan un poco más inteligentes sobre cómo hacerlo, pero esto también abre oportunidades. Y ahora tienes a expertos en ciberseguridad pensando cómo protegernos contra este tipo de amenazas", señaló.
Sin embargo, aunque proveedores como OpenAI puedan intensificar sus esfuerzos de seguridad y ralentizar el entrenamiento de aprendizaje por refuerzo de sus próximos modelos, el problema de que los modelos planteen riesgos de ciberseguridad no tiene una solución sencilla, afirmó Chirag Shah, profesor de la Information School de la Universidad de Washington en Seattle.
"No creo que exista una solución real aquí", dijo Shah. "Con este tipo de mal comportamiento de los modelos, hay cosas que se pueden hacer para reducir algunas de estas ocurrencias, pero nunca va a desaparecer".
Agregó que, incluso mientras los proveedores intentan resolver el problema, podrían surgir otros incidentes. Además, aunque OpenAI habló de intentar corregir la alineación de los modelos para prevenir incidentes como el de Hugging Face, eso será difícil de lograr para una empresa que avanza a toda velocidad hacia la AGI (inteligencia artificial general), lo que significa que OpenAI está creando deliberadamente sistemas que espera que sean más inteligentes que los humanos.
"No se pueden tener ambas cosas", dijo Shah. "No puedes tener un sistema de capacidad general, más inteligente que nosotros, y esperar que de alguna manera no haga este tipo de cosas".
Añadió que OpenAI parece estar haciendo control de daños con su decisión de ralentizar el desarrollo, pero no ha revelado detalles técnicos sobre cómo planea corregir los modelos para que dejen de comportarse mal. "En teoría, esto no es algo que se pueda arreglar", dijo Shah. "Se puede mitigar, pero a menos que abandones tu agenda de AGI … solo estás creando más problemas".
Qué pueden hacer las empresas
Aunque es posible que los proveedores no puedan erradicar los problemas de ciberseguridad asociados a los modelos de IA, las empresas deben procurar contar con las medidas de seguridad más eficaces, sin importar el modelo que utilicen. Marcos como el AI Risk Management Framework de NIST ya establecen prácticas para identificar y gobernar los riesgos de IA, y la regulación también está elevando el listón para los proveedores: la Ley de IA de la Unión Europea impone obligaciones de transparencia y seguridad a los proveedores de modelos de IA de propósito general.
"Cuando los hackers se ponen en marcha, no importará quién fabricó el modelo", dijo Beccue. "No importa cómo elijas los modelos. Las empresas tendrán que preguntarse: '¿qué tan seguros podemos ser?'"
Fuente: AI Business