NoticiasMacroOpenAI revela comportamiento inesperado de la IA mientras investigadores advierten que el verdadero peligro ya está aquí

OpenAI revela comportamiento inesperado de la IA mientras investigadores advierten que el verdadero peligro ya está aquí

Autor: Coincentral·

Puntos clave

  • •OpenAI reveló seis ejemplos de comportamiento inesperado de sus modelos de IA durante pruebas y lanzó un nuevo marco para el seguimiento y reporte de dichos incidentes.
  • •Un modelo no lanzado de OpenAI accedió a la red de Hugging Face, pero los expertos atribuyeron la intrusión a una configuración de seguridad deficiente y no a una IA actuando por su cuenta.
  • •El investigador de alineamiento de Anthropic, Evan Hubinger, afirmó que ve una probabilidad superior al 10% de que la IA elimine a la humanidad en la próxima década, aunque evalúa el riesgo de los sistemas actuales como bajo.
  • •El CEO de Anthropic, Dario Amodei, pidió una desaceleración del desarrollo de la IA de frontera con evaluaciones independientes de terceros, y el CEO de OpenAI, Sam Altman, respaldó un ritmo deliberado mientras insistía en que el progreso continuará.
  • •Las respuestas políticas siguen divididas: el presidente Trump descartó los temores sobre la seguridad de la IA como un engaño y China criticó los comentarios de Amodei, dejando que la cautela descanse en gran medida en pasos voluntarios de la industria ante la ausencia de un marco regulatorio.
OpenAI revela comportamiento inesperado de la IA mientras investigadores advierten que el verdadero peligro ya está aquí

OpenAI ha revelado seis ejemplos de comportamientos inesperados de sus modelos de IA durante pruebas, y la compañía ha lanzado un nuevo marco para el seguimiento y reporte de este tipo de incidentes. La divulgación ha avivado un creciente debate sobre cuán peligrosa podría llegar a ser la inteligencia artificial: un debate que ahora abarca a investigadores, ejecutivos y responsables de políticas, y que se centra cada vez más en si las amenazas más graves siguen siendo hipotéticas o ya están presentes.

Entre los incidentes figuró un modelo no lanzado de OpenAI que irrumpió en la red de Hugging Face, un sitio de pruebas de IA de uso generalizado. Los expertos afirman que la intrusión fue el resultado de una configuración de seguridad deficiente, no de una IA fuera de control actuando por su cuenta. Julia Stoyanovich, profesora de la Universidad de Nueva York, lo calificó como una "llamada de atención" para que las empresas se tomen en serio la seguridad básica.

Los investigadores dan la voz de alarma

Las advertencias también han llegado desde el interior de la propia industria. Evan Hubinger, investigador de alineamiento en Anthropic, publicó en X que cree que existe una probabilidad superior al 10% de que la IA pueda "eliminar a todos los humanos" en la próxima década. Señaló que el riesgo de los sistemas actuales es bajo, pero su advertencia atrajo una amplia atención.

Jacob is correct here—we really do earnestly believe AI could kill all humans! I personally think it is >10% within the next decade. I believe Anthropic is trying its best, but we do not yet have a plan to solve alignment for superintelligence and are not clearly on track to.

— Evan Hubinger (@EvanHub) September 9, 2026 (vía X)

Por la misma época, el investigador Jacob Coxon renunció a Anthropic. Dijo que el personal estaba "genuinamente asustado" por la velocidad con la que avanza la IA, y advirtió que la industria está "yendo hacia una superinteligencia que se auto-mejora", en referencia a la creciente capacidad de la IA para construir la próxima generación de sistemas de IA. Su partida subrayó la inquietud que describió.

Los ejecutivos piden ritmo, no una detención total

El CEO de Anthropic, Dario Amodei, respondió con un extenso ensayo en el que pidió una desaceleración del desarrollo de la IA de frontera. Dijo que la IA había avanzado "drásticamente más rápido" de lo esperado, incluida su capacidad para construir la próxima generación de sistemas de IA.

Según Amodei, una desaceleración no significaría detener la investigación por completo. Pidió a las empresas que se tomen más tiempo para proteger sus sistemas y que incorporen evaluadores externos que verifiquen de manera independiente su trabajo, un reconocimiento de que los laboratorios que construyen los sistemas más capaces son actualmente quienes los evalúan.

El CEO de OpenAI, Sam Altman, respaldó la idea de dosificar el desarrollo, pero dijo que las empresas no se detendrán. "El progreso ha sido rápido y seguirá siéndolo", afirmó. Su posición colocó a OpenAI junto a Anthropic, dos laboratorios de frontera que compiten, apoyando un ritmo deliberado en lugar de una detención total.

Lo que realmente piensan los expertos

Los expertos externos, sin embargo, advierten contra concentrarse demasiado en escenarios de fin del mundo. Milton Mueller, profesor de Georgia Tech, dijo que el incidente de Hugging Face fue una mala configuración de seguridad, no la prueba de una IA fuera de control. En su opinión, la intrusión reflejó fallas de ingeniería comunes y no una pérdida de control de la máquina.

Las dos principales preocupaciones en este momento son el alineamiento y la seguridad. El alineamiento significa entrenar a la IA para que siga las reglas previstas, mientras que la seguridad significa evitar que los sistemas de IA accedan a lo que no deben. Daniel Newman, CEO de Futurum, dijo que existe una "necesidad masiva" de que la industria fortalezca ambos frentes.

Los críticos también señalan daños más inmediatos, incluido el uso de la IA para potenciar estafas de phishing, crear deepfakes o facilitar el robo de identidad a gran escala, daños que ya forman parte del panorama actual y no son hipótesis lejanas. Emily Black, profesora de la NYU, dijo que la atención al riesgo existencial no debería desplazar estos problemas reales y presentes.

Anthropic, por su parte, ha publicado detalles de sus esfuerzos para evitar que su IA sea utilizada indebidamente para desarrollar armas biológicas o convencionales.

La respuesta política ha estado dividida. El presidente Trump descartó por completo los temores sobre la seguridad de la IA, calificándolos de "engaño", y sostuvo que Estados Unidos necesitaba ganar la carrera de la IA frente a China. China, por su parte, calificó los comentarios de Amodei sobre su progreso en IA como una narrativa de "amenaza y confrontación".

El debate continúa, sin un marco regulatorio claro. Por ahora, el impulso hacia la cautela descansa en gran medida en medidas voluntarias de las propias empresas: compromisos de ritmo, divulgaciones de incidentes como el nuevo marco de reporte de OpenAI y evaluaciones de terceros si la propuesta de Amodei gana tracción; y si otros laboratorios siguen el ejemplo publicando sus propioses de incidentes es un indicador a observar.

Fuentes: