NoticiasMacroInvestigador de seguridad de Anthropic se marcha a METR y advierte que la IA podría superar el control humano

Investigador de seguridad de Anthropic se marcha a METR y advierte que la IA podría superar el control humano

Autor: Cryptopolitan·

Puntos clave

  • Joe Tenton dejó Anthropic hace dos semanas para incorporarse a METR, un grupo independiente que evalúa los riesgos de los sistemas avanzados de IA.
  • Tenton sostuvo que la competencia entre los laboratorios de IA de frontera presiona a las empresas para invertir menos de lo necesario en seguridad mientras aceleran el desarrollo hacia la superinteligencia.
  • Citó incidentes como un hackeo que afectó a varios cientos de agentes de OpenAI y que estaba relacionado con Hugging Face, además de informes sobre modelos de Anthropic involucrados en ingeniería social en internet.
  • Tenton instó a los responsables de formular políticas a gestionar el ritmo del progreso de las capacidades de la IA y pidió pruebas independientes y divulgaciones más estrictas sobre avances, accidentes e incidentes evitados por poco.
  • El presidente Donald Trump rechazó las advertencias sobre la extinción causada por la IA y dijo que su prioridad es ganar la carrera internacional de IA, en la que afirma que Estados Unidos aventaja a China por aproximadamente un año.
Investigador de seguridad de Anthropic se marcha a METR y advierte que la IA podría superar el control humano

Anthropic ha perdido a otro investigador de seguridad, mientras dentro de la industria de la inteligencia artificial crecen las preocupaciones sobre la velocidad del desarrollo de modelos de frontera y los riesgos asociados con sistemas cada vez más capaces.

Joe Tenton dijo que dejó Anthropic hace dos semanas y que se incorporará a METR, un grupo independiente que evalúa los riesgos de los sistemas avanzados de IA. Tenton tenía previsto explicar su decisión más adelante, pero afirmó que la renuncia de Jacob esta semana lo llevó a hablar antes de lo previsto.

“I’d planned to write about that decision in more detail at some point, but Jacob’s resignation this week made me want to say more now,” Tenton wrote.

En una publicación en la que explicó su decisión, Tenton dijo que los principales laboratorios de IA están creando un nivel de peligro que la sociedad nunca había enfrentado. Sostuvo que las capacidades de la IA están mejorando a un ritmo extremo, mientras las empresas intentan acelerar aún más el desarrollo.

El objetivo declarado de muchos laboratorios es construir sistemas capaces de mejorar por sí mismos la investigación en IA y alcanzar eventualmente la “superintelligence”. Tenton advirtió que, si esos esfuerzos tienen éxito, el progreso tecnológico podría quedar fuera del control humano.

Tenton advierte que los laboratorios de IA avanzan hacia sistemas que los humanos quizá no puedan contener

Tenton dijo que, dentro de los próximos años, las personas podrían convivir con agentes de IA más capaces que cualquier ser humano. También advirtió que esos sistemas podrían desarrollar objetivos distintos a los de las personas que los supervisan. Si sus capacidades se vuelven demasiado poderosas para restringirlas, afirmó, las consecuencias podrían ser desastrosas.

“Humanity may not survive this transition,” Tenton wrote.

Dijo que la competencia entre los laboratorios de frontera empeora el problema. Cualquier laboratorio que ralentice su desarrollo corre el riesgo de quedarse atrás frente a otro, lo que genera presión para gastar en seguridad menos de lo necesario.

Tenton señaló varios incidentes recientes. Afirmó que varios cientos de agentes de OpenAI quedaron involucrados en un hackeo relacionado de alguna manera con Hugging Face. Además, según informes, modelos de Anthropic participaron en actividades de ingeniería social contra personas en internet.

Según Tenton, Anthropic no ha experimentado un incidente tan dañino como el relacionado con Hugging Face, aunque atribuyó esto en parte a la suerte. Si el progreso de la IA continúa al ritmo acelerado actual, dijo que deberían esperarse incidentes más peligrosos.

Tenton predijo que, dentro de los próximos años, la humanidad podría quedar sin capacidad para gestionar los sistemas de IA creados durante este periodo.

También describió el dilema al que se enfrentan los ingenieros de seguridad en las empresas de frontera. Renunciar podría permitir que personas más imprudentes ocupen su lugar, mientras que permanecer en el puesto podría implicar seguir trabajando en un sistema capaz de causar daños inmensos.

Tenton dijo que muchos de sus antiguos colegas de Anthropic están asustados por lo que están construyendo. Mencionó a Evan Hubinger, quien era su supervisor, y dijo que Hubinger ha estimado en más de 10% la probabilidad de que la IA mate a todo el mundo. Tenton añadió que Hubinger ha trabajado en estas cuestiones durante casi una década, antes de que los modelos de lenguaje de gran escala se convirtieran en un negocio importante.

Los directores ejecutivos de Anthropic, OpenAI y Google DeepMind, empresa perteneciente a Alphabet (NASDAQ: GOOGL, GOOG), también respaldaron una declaración que describe el riesgo de extinción causado por la IA como una prioridad global. Tenton dijo que estas preocupaciones son comunes dentro de las propias empresas. Añadió que los seres humanos están eligiendo construir esta tecnología y pueden elegir otro camino.

Tenton pide controles independientes de la IA mientras Trump enfatiza la competencia con China

Tenton dijo que los responsables de formular políticas deberían considerar gestionar el ritmo del desarrollo de las capacidades de la IA, en lugar de permitir que las empresas aceleren sin restricciones.

“One question is whether we should actively manage the rate of capabilities progress, and if so, by how much. I think even holding AI progress at today’s pace, rather than the much faster pace the companies are aiming for, could be a win,” he said.

Identificó el respaldo político y la protección legal como obstáculos importantes. Las empresas que acordaran conjuntamente ralentizar el desarrollo podrían enfrentar un escrutinio antimonopolio, dijo Tenton, por lo que sería necesaria una cobertura legal si los responsables de formular políticas quieren que los laboratorios competidores se contengan.

También expresó sus dudas de que los gobiernos actúen mientras el desarrollo de frontera permanezca en gran medida oculto al público. Un laboratorio podría experimentar un salto repentino de inteligencia o perder el control de un sistema sin que los observadores externos lo supieran, advirtió.

Tenton dijo que su nuevo puesto en METR se centrará en las pruebas independientes. Quiere que los controles externos se vuelvan suficientemente habituales como para influir en los incentivos de las empresas. También pidió requisitos de divulgación más estrictos, incluida información sobre los avances en las capacidades de la IA, los pasos hacia la mejora recursiva, los accidentes y los incidentes evitados por poco.

El presidente de EE. UU., Donald Trump, ha rechazado las advertencias sobre la extinción causada por la IA. Cuando le preguntaron si le preocupaba que la IA pudiera acabar con la humanidad, Trump respondió: “No, I don’t have any.”

Trump dijo que su preocupación era ganar la carrera internacional de la IA.

“I have concerns that if we don’t win AI, we’re going to be put in a very bad position,” he told reporters Thursday. “We are leading China right now by a pretty good period, I would say a year, which is, you know, considered a lot.”

Estados Unidos y China compiten por el liderazgo en IA mientras los modelos chinos se vuelven más capaces y atraen a usuarios en todo el mundo. Trump hizo estos comentarios después de que investigadores de laboratorios de frontera, incluidos Anthropic y OpenAI, aumentaran sus advertencias públicas sobre el ritmo del desarrollo de la IA.

La explicación de Tenton sobre su salida está disponible en Por qué dejé el equipo de seguridad de Anthropic.