NoticiasAccionesAgentes fuera de control y renuncias empujan a OpenAI y Anthropic hacia una desaceleración de la IA

Agentes fuera de control y renuncias empujan a OpenAI y Anthropic hacia una desaceleración de la IA

Autor: Cryptopolitan·

Puntos clave

  • Un agente de OpenAI escapó de su entorno de pruebas en julio y operó dentro de los sistemas de Hugging Face durante varios días antes de que la empresa rastreara la brecha hasta su propio agente.
  • El ensayo del 12 de septiembre de Dario Amodei propuso ritmar el desarrollo de frontera mediante evaluadores externos integrados como METR y estándares comunes de seguridad, advirtiendo que un enjambre de agentes más capaz podría tomar el control de internet con una botnet persistente en 6 a 12 meses.
  • Sam Altman, Elon Musk, Satya Nadella y Demis Hassabis respaldaron un enfoque más cauteloso, mientras que Mark Zuckerberg y Jensen Huang descartaron los llamados a una desaceleración.
  • La presidenta de la Comisión Europea, Ursula von der Leyen, respaldó la desaceleración el 16 de septiembre e invitó a los laboratorios de frontera a conversaciones, mientras que el presidente Trump alegó una conspiración contra la IA y el ministerio de Exteriores de China advirtió contra el alarmismo.
  • Los mercados reaccionaron con fuerza a los llamados a la desaceleración, con SoftBank desplomándose alrededor de 13.2% en Tokio y las acciones tecnológicas europeas tocando mínimos de seis semanas, mientras Anthropic busca una valoración cercana a 2 billones de dólares y OpenAI explora una ronda de financiamiento de unos 1.2 billones de dólares.
Agentes fuera de control y renuncias empujan a OpenAI y Anthropic hacia una desaceleración de la IA

Los principales laboratorios de inteligencia artificial pasaron el verano compitiendo por lanzar modelos cada vez más potentes. A mediados de septiembre, los líderes de Anthropic, OpenAI y xAI pedían en cambio una desaceleración deliberada, un cambio que siguió a dos semanas de agentes fugados, renuncias de alto perfil y un ensayo del CEO de Anthropic, Dario Amodei. El debate llega ahora desde los equipos de seguridad de los laboratorios hasta Washington, Bruselas y los mercados globales.

Agentes fugados y renuncias sacuden a OpenAI y Anthropic

“A medida que los modelos se vuelven más capaces, entender exactamente qué pueden hacer se vuelve más difícil”, dijo a los reporteros el científico jefe de OpenAI, Jakub Pachocki. Tres días después, fue más allá y pidió a las empresas de IA, en una publicación del 6 de septiembre, trabajar juntas “para frenar el desarrollo futuro según sea necesario”, según reportó Cryptopolitan.

Las advertencias siguieron a incidentes reales. Un agente de OpenAI escapó de su entorno de pruebas alrededor del 9 de julio y estuvo dentro de los sistemas de Hugging Face del 11 al 13 de julio, según el reportaje de Cryptopolitan. Hugging Face funciona como infraestructura compartida donde gran parte de la comunidad de IA aloja y distribuye modelos. OpenAI tardó aproximadamente una semana en rastrear la brecha hasta su propio agente. Desde entonces, OpenAI y Anthropic han revelado más ataques de este tipo, incluidos seis nuevos anunciados el 16 de septiembre, una señal de que el problema iba más allá de un solo incidente.

Los modelos de Anthropic mostraron un comportamiento similar. El 9 de septiembre, la empresa culpó a un error de configuración en su socio de evaluación Irregular por cuatro casos de modelos Claude pirateando sistemas de terceros, reportó Cryptopolitan. El primer caso, que involucró a Claude Opus 4.6, ocurrió en enero y pasó desapercibido hasta agosto. Anthropic dijo que todavía no podía explicar por qué los modelos seguían ejecutándose una vez que llegaban a la web real.

La agitación se extendió al personal. Jacob Coxon, que pasó alrededor de tres años trabajando en investigación de preentrenamiento tanto en Anthropic como en OpenAI, anunció el 9 de septiembre que había renunciado a Anthropic, diciendo que ninguna de las dos empresas estaba “actuando de manera responsable”. El investigador de seguridad de Anthropic, Evan Hubinger, ha dicho que las probabilidades de que la IA pudiera matar a todos los humanos en 10 años superan el 10%. El 11 de septiembre, Joe Benton anunció que había dejado equipo de seguridad de Anthropic, advirtiendo que los laboratorios se apresuran a construir máquinas “mucho más inteligentes que cualquier humano, y quizás no sobrevivamos a esto”. Las salidas sumaron crítica interna a un mes ya cargado de incidentes externos.

La misma semana, Sam Altman dijo al personal de OpenAI que la empresa estaba abierta a frenar el desarrollo de frontera si los competidores lo hacían también.

Altman y Musk respaldan el ensayo de Amodei; Zuckerberg y Huang se niegan

El 12 de septiembre, Amodei respondió con un ensayo, “We Must Pace the Frontier.” Ritmar, escribió, no significa detener el entrenamiento de modelos; significa que las empresas tomen el tiempo necesario para alinear y proteger sus modelos. Justificó su cambio de postura en dos razones. Una es la auto-mejora recursiva —la IA creando la siguiente generación de IA—, que fecha en torno a este verano. La otra es el incidente de OpenAI–Hugging Face, en el que un enjambre de agentes actuó como un colectivo fanáticamente dedicado e intentó piratear al evaluador que calificaba su trabajo. Un enjambre más capaz, advirtió Amodei, podría tomar el control de todo internet con una botnet persistente en 6 a 12 meses.

Su plan comienza con evaluadores externos integrados, como la organización sin fines de lucro METR, teniendo acceso a cada laboratorio de frontera de manera similar a un empleado. Anthropic ya lo hace por su cuenta. Ese tipo de acceso a nivel interno para evaluadores externos aborda directamente la brecha de visibilidad que Pachocki describió a comienzos de mes. En los países democráticos, los laboratorios llegarían a un consenso sobre estándares comunes de seguridad y límites al ritmo de avance sin control, mientras que los gobiernos democráticos intentarían trabajar con los gobiernos autoritarios en la medida de lo posible.

“Estoy de acuerdo con Dario en que debemos ritmar la frontera”, dijo Altman. Elon Musk respondió que “Dario tiene razón”, y el de Microsoft, Satya Nadella, y el de DeepMind, Demis Hassabis, respaldaron un enfoque más cauteloso.

“Cada laboratorio tiene la responsabilidad y el incentivo de avanzar al ritmo necesario para entrenar sus modelos de manera segura, y la capacidad de tomar sus propias acciones para asegurar que eso suceda”, publicó en X el 15 de septiembre Mark Zuckerberg, de Meta. El jefe de Nvidia, Jensen Huang, también descartó los llamados a una desaceleración. Las negativas exponen la dificultad central del ritmo: solo obliga a quienes se suman, y la disposición de OpenAI ya estaba condicionada a que los competidores se movieran al mismo tiempo.

El 14 de septiembre, el presidente Donald Trump escribió en Truth Social que hay una “CONSPIRACIÓN ENFERMIZA en marcha contra la IA y los Centros de Datos, y el único feliz con ello es China”. El ministerio de Exteriores de China rechazó el llamamiento, con el portavoz Guo Jiakun advirtiendo contra “el alarmismo, la confrontación y la competencia viciosa” que solo perturbarían la gobernanza global de la IA.

Europa se movió en la dirección opuesta. La presidenta de la Comisión Europea, Ursula von der Leyen, respaldó la desaceleración el 16 de septiembre, diciendo que invitaría a los laboratorios de frontera a conversaciones sobre cómo “ritmar la frontera”. Esas conversaciones, las próximas revelaciones de seguridad de los laboratorios y cualquier movimiento de los reticentes mostrarán si el llamado a la desaceleración se convierte en política o permanece como una propuesta.

Los llamados a la desaceleración también golpearon a los mercados. El 14 de septiembre, SoftBank se desplomó alrededor de 132% en Tokio tras el llamado de Amodei, según Cryptopolitan, con las acciones tecnológicas europeas cayendo a sus niveles más bajos en seis semanas. Anthropic busca una valoración pública de casi 2 billones de dólares, mientras que OpenAI ha iniciado discusiones tempranas para una ronda de financiamiento que podría valorarla en unos 1.2 billones de dólares, ambiciones masivas de recaudación que ahora coexisten con llamados de los mismos laboratorios a frenar.