NoticiasMacroInvestigador de Anthropic dice que la IA tiene más de 10% de probabilidad de matar a todos los humanos en la próxima década

Investigador de Anthropic dice que la IA tiene más de 10% de probabilidad de matar a todos los humanos en la próxima década

Autor: Fox Business Markets·

Puntos clave

  • Evan Hubinger dijo que estima en más de 10% la probabilidad de que la IA mate a todos los humanos dentro de la próxima década.
  • Hubinger dijo que el peligro inmediato no proviene de los modelos actuales, sino de una superinteligencia desarrollada mediante automejora recursiva.
  • Hubinger reconoció que Anthropic todavía no tiene un plan para resolver la alineación de la superinteligencia ni un camino claro para hacerlo.
  • El exinvestigador Jacob Coxon renunció a Anthropic tras acusar a la empresa y a OpenAI de perseguir de manera imprudente sistemas de IA capaces de mejorarse a sí mismos.
  • Coxon dijo que podría ser necesaria una prohibición temporal de mejorar las capacidades de los modelos para evitar una carrera global peligrosa.
Investigador de Anthropic dice que la IA tiene más de 10% de probabilidad de matar a todos los humanos en la próxima década

Un investigador sénior de seguridad de Anthropic dijo el martes que la inteligencia artificial tiene una probabilidad superior al 10% de “matar a todos los humanos” dentro de “la próxima década”, en respuesta a un exempleado que renunció tras acusar a la empresa de actuar de manera irresponsable.

El exinvestigador de Anthropic y OpenAI Jacob Coxon escribió el domingo, en un extenso hilo de renuncia publicado en X, que “las personas que están desarrollando IA realmente creen que podría matarnos a todos antes de que termine la década”.

“Hoy renuncié a Anthropic. Pasé los últimos tres años haciendo investigación de preentrenamiento tanto en OpenAI como en Anthropic. Ninguna de las dos empresas está actuando de manera responsable. Se dirigen directamente hacia una superinteligencia capaz de mejorarse a sí misma y están apostando con nuestras vidas”, escribió Coxon.

Evan Hubinger, líder de ciencia de alineación de Anthropic, respondió al hilo de Coxon en una publicación citada. Hubinger dijo que la evaluación de Coxon era correcta, aunque añadió algunas salvedades sobre el origen y el momento del riesgo.

“Jacob tiene razón aquí: ¡realmente creemos, de manera sincera, que la IA podría matar a todos los humanos!”, escribió Hubinger. “Personalmente, creo que la probabilidad es superior al 10% dentro de la próxima década. Creo que Anthropic está haciendo su mejor esfuerzo, pero todavía no tenemos un plan para resolver la alineación de la superinteligencia y no estamos claramente encaminados a lograrlo”.

Hubinger dijo que el riesgo potencialmente mortal no proviene de los modelos de IA actuales. “Para ser claros, como decimos en nuestro último Risk Report, creo que el riesgo de los modelos actuales es bajo”, escribió. “Lo que me preocupa es el surgimiento de una superinteligencia a partir de la automejora recursiva, algo que, como hemos dicho, está ocurriendo más rápido de lo que pensábamos”.

La automejora se refiere a la capacidad de un modelo de IA para mejorar continuamente su propio código fuente o sus métodos de entrenamiento. Coxon citó específicamente la investigación sobre esta capacidad como una de las principales razones de su renuncia.

“Pronto serán sistemas sobrehumanos capaces de hackear cualquier cosa, revolucionar cualquier campo de la noche a la mañana y adquirir poder y recursos reales. Todos hemos sido testigos del progreso en cada uno de estos ámbitos, y el progreso no se está desacelerando”, escribió Coxon en su hilo de X.

Coxon dijo que los científicos de Anthropic entienden los riesgos de su trabajo, pero continúan avanzando porque temen que una empresa menos responsable pueda desbloquear primero esas capacidades potencialmente desastrosas.

“En Anthropic, se entienden bien las implicaciones, pero están atrapados en una carrera para llegar primero: creen que nadie más actuará de manera responsable, así que deben hacerlo ellos mismos, a pesar del riesgo”, añadió Coxon.

Para evitar lo que describió como una catástrofe absoluta, Coxon sugirió que el mundo podría necesitar una prohibición temporal de mejorar las capacidades de los modelos.

“No siento que estemos encaminados a evitar una carrera global, lo que podría requerir medidas costosas como una prohibición temporal de mejorar las capacidades de los modelos”, escribió.

Coxon finalmente instó a los investigadores y desarrolladores de IA de todo el mundo a considerar las consecuencias de su trabajo y actuar de manera más responsable.

“Si eres investigador en un laboratorio, te insto a considerar cómo se sentirán realmente los próximos años. ¿Quieres iniciar una ejecución de RL superinteligente sin comprender rigurosamente su mente? ¿Deberías agachar la cabeza porque ‘de todos modos está sucediendo’ o aprovechar este momento para pedir condiciones diferentes?”, concluyó su hilo de X.

FOX Business contactó a Coxon, Hubinger, Anthropic y OpenAI para solicitar comentarios adicionales.