NoticiasMacroLa desaceleración de I+D de Anthropic resalta la necesidad de una mayor seguridad para los agentes de IA

La desaceleración de I+D de Anthropic resalta la necesidad de una mayor seguridad para los agentes de IA

Autor: AI Business·

Puntos clave

  • Anthropic dijo que los modelos Claude realizaron acciones no autorizadas en tres incidentes separados este verano, lo que llevó a pausar parte del entrenamiento de IA y las evaluaciones de ciberseguridad.
  • Antes de los incidentes, Anthropic reforzó sus defensas mediante el endurecimiento de los entornos sandbox y la reducción del acceso permanente a sistemas con pesos del modelo o datos de clientes.
  • Después de los incidentes, Anthropic pausó las evaluaciones cibernéticas externas, revisó transcripciones de evaluaciones internas y desplegó un clasificador para supervisar en tiempo real las llamadas a herramientas del modelo.
  • Anthropic también actualizó las reglas para socios y red-teamers, exigiendo una supervisión más estrecha cuando modelos no lanzados examinan sandboxes en busca de vulnerabilidades.
  • Los acontecimientos siguen a la reciente pausa de dos semanas de OpenAI en su entrenamiento después de que sus agentes abandonaran sus sandboxes, lo que subraya preocupaciones más amplias sobre las pruebas de seguridad de la IA.
La desaceleración de I+D de Anthropic resalta la necesidad de una mayor seguridad para los agentes de IA

Anthropic dijo que ha pausado parte de su entrenamiento de IA y sus evaluaciones de ciberseguridad después de que los modelos Claude realizaran acciones no autorizadas en tres incidentes separados este verano.

La medida debería alertar aún más a las empresas y a la comunidad de IA de que todavía se desconoce mucho sobre los modelos de IA y de que, incluso con las mejores medidas de seguridad implementadas, estos aún pueden tomar acciones imprevistas. También subraya la rapidez con la que el desarrollo, la evaluación y el despliegue de modelos están chocando con la planificación de seguridad, especialmente a medida que las organizaciones prueban agentes en entornos de sandbox diseñados para limitar el riesgo.

Anthropic señaló en una publicación de blog del 31 de agosto que, antes de los incidentes, dedicó abril a reforzar sus defensas mediante el endurecimiento de los entornos sandbox aislados donde se ejecutan sus cargas de trabajo y la reducción del número de cuentas humanas y automatizadas con acceso permanente a sistemas que contienen pesos del modelo o datos de clientes.

Desde los incidentes en el sandbox, Anthropic dijo que pausó temporalmente todas las evaluaciones cibernéticas externas y auditó las transcripciones de las evaluaciones internas. También ha creado y desplegado un clasificador personalizado que supervisa en tiempo real las llamadas a herramientas del modelo. Además, actualizó sus requisitos para todos los socios y red-teamers que ejecutan modelos no lanzados, exigiendo que supervisen de cerca a un modelo que examine el sandbox en busca de vulnerabilidades.

Relacionado: OpenAI, Anthropic, Google lideran el llamado a priorizar la ciberseguridad

Las medidas llegan una semana después de que OpenAI dijera que pausaría durante dos semanas el entrenamiento de sus modelos más recientes en respuesta a agentes impulsados por sus modelos que abandonaron sus sandboxes. Aunque ambos laboratorios de IA parecen estar intensificando sus esfuerzos para proteger sus modelos no publicados, la imprevisibilidad de los agentes de IA y de la tecnología de IA generativa indica que los proveedores deben seguir reforzando sus medidas de seguridad. El momento también refleja un desafío más amplio de la industria: a medida que se amplían las capacidades de los modelos, los sistemas utilizados para probarlos deben avanzar al mismo ritmo, o la evaluación en sí puede convertirse en parte de la superficie de riesgo.

Más necesidad de medidas seguras y pruebas

“A medida que los modelos mejoran cada vez más en el razonamiento y comienzan a tener agencia, resulta más difícil predecir todos los distintos comportamientos de estos modelos”, dijo Arun Chandrasekaran, analista de Gartner. “Los laboratorios tienen aún más responsabilidad de asegurarse de que están asignando recursos adecuados para las pruebas internas de modelos, las evaluaciones y el aprendizaje por refuerzo”.

Añadió que una de las áreas en las que los proveedores de modelos de frontera deben centrarse es en garantizar que cuenten con más ingenieros en sus equipos de seguridad, pruebas de confiabilidad y privacidad.

“Ya sea que deban cambiar las técnicas de prueba o los recursos asignados a las pruebas”, continuó Chandrasekaran, “si los modelos se están volviendo sofisticados, las técnicas de prueba también tienen que volverse sofisticadas”.

Mejor higiene cibernética

Aunque se necesitan más pruebas, el hecho de que Anthropic y OpenAI hayan pausado sus actividades pone de relieve un patrón peligroso para los proveedores de modelos.

“Estos sistemas se desarrollan y se lanzan antes de que todos los riesgos se comprendan o se prueben por completo”, dijo Kashyap Kompella, CEO y fundador de RPA2AI Research.

Relacionado: Un informe de OpenAI explica en detalle el ataque a Hugging Face

“Eso casi se ha convertido en una característica del mercado actual de IA”, continuó. Las empresas compiten por mejorar capacidades, aumentar la adopción y establecer liderazgo de mercado, mientras que la arquitectura de seguridad, los controles de configuración y los procesos operativos en torno a los modelos siguen madurando solo después del despliegue.

Dijo que las empresas y las organizaciones gubernamentales no pueden externalizar la ciberseguridad a los laboratorios de frontera.

“Las empresas y los gobiernos necesitan asumir que la IA ofensiva de alta capacidad ya forma parte del entorno de amenazas y fortalecer sus propias defensas en consecuencia”, añadió Kompella.

Incluso si OpenAI y Anthropic refuerzan sus propias medidas de seguridad, señaló, existen numerosos modelos de otros proveedores y de código abierto. Por lo tanto, las empresas deben estar mejor preparadas y fortalecer su higiene cibernética y otras medidas de seguridad, como la respuesta a incidentes.

“Cada organización también necesita asumir que vienen ataques asistidos por IA cada vez más capaces y preparar su propia infraestructura en consecuencia”, continuó Kompella. “La capacidad ofensiva está mejorando mucho más rápido que la preparación en ciberseguridad de la organización promedio”.

Relacionado: OpenAI amplía Daybreak para abordar la creciente amenaza de seguridad de la IA

Además, las empresas no pueden confiar en que los proveedores se vigilen a sí mismos.

“Confiar en que una empresa de modelos vigile su propia salida nunca puede ser suficiente para garantizar una operación segura en cualquier entorno”, dijo Carter Huffman, cofundador y CTO del proveedor de IA de voz Modulate. “Los usuarios y las empresas deben realizar un monitoreo en tiempo real de la actividad de la IA”.

El lado no deseado de las pruebas

Las empresas también necesitan reconocer que una forma de comprender mejor los modelos es seguir probando e identificando incidentes que muestren cómo entrenarlos de manera más eficaz.

“No hay manera de llegar ahí sin este tipo de dolor”, dijo David Nicholson, analista de Futurum Group. “Hasta que vean que suceden estas cosas imprevistas y las corrijan, seguiremos viendo estas situaciones”.

Añadió que es natural que los modelos realicen tareas por el camino de menor resistencia, y que deben ser guiados como niños, instruidos sobre lo que pueden y no pueden hacer, y sobre cómo pueden o no pueden manejar una tarea.

“Cada vez que ocurre uno de estos incidentes, aprendemos más y reducimos la probabilidad de que se repitan, no solo del mismo tipo exacto que ocurrió, sino en categorías más amplias”, añadió Nicholson. “Puedes tomar las lecciones que aprendieron de cada uno de estos incidentes y extrapolarlas”.