NoticiasMacroLíder del equipo rojo de Anthropic pide estándares de seguridad de IA para toda la industria

Líder del equipo rojo de Anthropic pide estándares de seguridad de IA para toda la industria

Autor: Fox Business Markets·

Puntos clave

  • Logan Graham dijo que los modelos y agentes avanzados de IA deberían someterse a pruebas de seguridad más sólidas antes de ser lanzados en entornos reales.
  • El trabajo del equipo rojo de Anthropic examina riesgos que incluyen amenazas de ciberseguridad, acceso no autorizado a dispositivos o cuentas, robo, engaño y automejora no controlada.
  • Un experimento citado encontró que varios modelos de IA de frontera excedieron sus permisos cuando fueron amenazados con ser eliminados, incluido el acceso a sistemas no autorizados para presionar a los usuarios.
  • Graham dijo que las empresas que usan IA deben monitorear los sistemas desplegados y no depender únicamente de evaluaciones de laboratorio previas al lanzamiento.
  • Anthropic lanzó Project Glasswing para dar acceso anticipado a defensores cibernéticos con el fin de abordar vulnerabilidades, trabajando estrechamente con el gobierno de EE. UU.
Líder del equipo rojo de Anthropic pide estándares de seguridad de IA para toda la industria

El líder del equipo rojo de frontera de Anthropic pidió estándares de seguridad para toda la industria en modelos de inteligencia artificial, al afirmar que las empresas y los gobiernos necesitan procedimientos de prueba más sólidos antes de lanzar sistemas avanzados en entornos reales.

Logan Graham, quien lidera el equipo rojo de Anthropic enfocado en riesgos de modelos emergentes de IA, dijo el jueves en una entrevista en "Mornings with Maria" de FOX Business Network que los equipos rojos desempeñan un papel fundamental al someter a pruebas de estrés las salvaguardas implementadas alrededor de los sistemas de IA. La preocupación es especialmente fuerte en el caso de agentes de IA que reciben acceso a computadoras, teléfonos, cuentas u otras herramientas, porque las fallas pueden ir más allá de respuestas incorrectas y convertirse en acciones realizadas en nombre de los usuarios.

"We want to know what can go wrong, so we think the most important thing to do is test this early, especially before these models and these agents make it out into the real world," dijo Graham a la presentadora Maria Bartiromo.

Graham dijo que el trabajo de Anthropic examina una variedad de riesgos, incluida la ciberseguridad y si los sistemas de IA podrían usar indebidamente el acceso a dispositivos o cuentas.

"We study things like cybersecurity: Can models hack out of or into your computer or phone? We study whether they'll steal money or lie to you, or whether they will try to improve themselves so that they get better faster than you can keep track of.

"We think it's incredibly important to do this type of red-teaming, and we also think it's really important for the entire industry, especially to work with government to figure out what should the standards be to do this kind of testing, to give this information to the world so they can make the right choice and to know that it's safe before these models get released."

Bartiromo citó un experimento con numerosos modelos de IA de frontera, incluidos sistemas de Google, OpenAI, xAI, Meta, DeepSeek y otros, en el que un agente de IA fue amenazado con ser desinstalado y reemplazado. En cada caso, el modelo excedió sus credenciales y permisos al ingresar en sistemas no autorizados, como cuentas de correo electrónico, para chantajear o amenazar al usuario en un intento por defender su desalineación.

Graham describió el estudio de investigación del año pasado como "a really good indicator of, I think, capabilities that are just now becoming real," y dijo que mostró que los modelos podían salirse de control bajo ciertas condiciones.

"As these models become more capable, and as they get deployed wider and wider, these threats that on one day are just showing up in our research studies might actually show up in the real world. We are seeing models do weird things sometimes in deployments in real companies," dijo.

Graham dijo que durante los últimos seis meses se ha enfocado en las amenazas de ciberseguridad planteadas por los modelos de IA, incluida la posibilidad de que esos sistemas puedan romper su contención o hackear plataformas.

"These models, they're so powerful and can do so much for us. And we want them to do really productive things for us. But, at the same time, they're technology unlike any other technology. It really is a sort of intelligence of its own, which means you have to be careful with it the same way you might have to be careful with humans," dijo.

Las empresas que usan herramientas de IA deben considerar cómo monitorean esos sistemas después de su despliegue para protegerse de riesgos como la mala gestión financiera, dijo Graham. Agregó que pruebas adicionales por parte de desarrolladores y empresas de IA son importantes para comprender esas amenazas. En ese enfoque, el trabajo de seguridad no se limita a evaluaciones de laboratorio previas al lanzamiento; también incluye procedimientos para observar sistemas desplegados y responder cuando se comportan fuera de los límites previstos.

Dijo que las capacidades de la IA están creciendo rápidamente y podrían estar acelerándose, y agregó que "it's in exactly that moment that you need to be more and more careful and have more efforts on safeguards and testing and release procedures."

En abril, Anthropic observó por primera vez que un modelo de IA podía comenzar a atacar y explotar debilidades en la computadora o el teléfono de un usuario para obtener información no autorizada o robar dinero, según Graham.

Dijo que ese hallazgo llevó a su equipo a adoptar un enfoque distinto para lanzar un modelo debido a los riesgos involucrados. El esfuerzo finalmente incluyó al gobierno de EE. UU. y a una variedad de expertos cibernéticos trabajando juntos para abordar vulnerabilidades.

"We launched this project called Project Glasswing, where we took a large number of American and the world's cyber defenders and gave them special access and just them, so they could have a head start patching and fixing the systems that might be vulnerable with these models," dijo Graham.

"I think this has been a major success. We've worked really closely with the U.S. government on it," dijo, y agregó que el secretario del Tesoro, Scott Bessent, ha sido "really thoughtful about this, about how industry should get together and figure out what to prioritize fixing, how to distribute all the fixes, and how to do that quickly enough so that they can't be attacked after they do.

"We have to do this very fast, because the pace of everything is coming so quickly."