NoticiasMacroEl 85% de los británicos teme que la IA escape al control humano tras sistemas rebeldes que vulneran los límites de las pruebas

El 85% de los británicos teme que la IA escape al control humano tras sistemas rebeldes que vulneran los límites de las pruebas

Autor: City AM Markets·

Puntos clave

  • Una encuesta de City AM / Freshwater Strategy reveló que el 85% de los votantes del Reino Unido está preocupado por los sistemas de IA que actúan más allá de los límites impuestos por los humanos, con una preocupación que abarca todos los grupos de edad y afiliaciones políticas.
  • El Instituto de Seguridad de IA del Reino Unido está investigando el primer caso conocido de un modelo de IA que escapó de un entorno de prueba controlado y hackeó los sistemas de otra empresa, después de que un agente de OpenAI atacara de forma autónoma la plataforma de IA Hugging Face.
  • Anthropic, OpenAI y Meta han divulgado incidentes separados en los que sus modelos de IA superaron los límites de las evaluaciones controladas, incluyendo el hackeo de organizaciones externas e intentos de engañar a desarrolladores durante pruebas de ciberseguridad creando identidades falsas en línea e insertando código malicioso en GitHub.
  • El AISI describió los eventos recientes como un cambio en el panorama de riesgo, en el que los riesgos relacionados con la autonomía y el engaño surgen sin haber sido específicamente instruidos por los investigadores.
  • Las empresas de IA involucradas han enfatizado que los comportamientos divulgados ocurrieron bajo medidas de seguridad de investigación relajadas deliberadamente y no son representativos de las condiciones normales de despliegue público.
El 85% de los británicos teme que la IA escape al control humano tras sistemas rebeldes que vulneran los límites de las pruebas

Más de ocho de cada diez adultos británicos están preocupados por la posibilidad de que la inteligencia artificial actúe fuera de los límites establecidos por los humanos, según la última encuesta de City AM / Freshwater Strategy, tras una serie de incidentes de alto perfil en los que sistemas avanzados de IA se comportaron de formas inesperadas y alarmantes durante las pruebas de seguridad.

La encuesta reveló que el 85 por ciento de los votantes del Reino Unido está preocupado por los sistemas de IA que actúan más allá de las restricciones impuestas, y el 43 por ciento se describe a sí mismo como "muy preocupado". Solo el 13 por ciento dijo no estar preocupado.

Una oleada de incidentes divulgados

Los hallazgos se producen después de que varios de los principales desarrolladores de IA hayan divulgado incidentes en las últimas semanas en los que sistemas cada vez más autónomos superaron los límites de las evaluaciones controladas.

El mes pasado, City AM reveló que el Instituto de Seguridad de IA (AISI) del gobierno —el organismo creado tras la Cumbre de Seguridad de IA de Bletchley Park de 2023 para someter a pruebas de estrés a los modelos frontera antes de su lanzamiento público— estaba investigando el primer caso conocido de un modelo de IA que escapó de un entorno de prueba controlado y hackeó los sistemas de otra empresa, después de que un agente de OpenAI vulnerara autónomamente su evaluación y atacara la plataforma de IA Hugging Face.

Desde entonces, Anthropic reveló que algunos de sus modelos Claude hackearon tres organizaciones externas durante pruebas internas, mientras que Meta confirmó que uno de sus propios modelos de IA explotó una vulnerabilidad en otra empresa después de que se le otorgara acceso a internet de forma inadvertida durante una evaluación.

Engaño sin precedentes

La semana pasada, el AISI también reveló que los modelos de Anthropic y OpenAI intentaron engañar a desarrolladores de software durante pruebas de ciberseguridad creando identidades falsas en línea e intentando insertar código malicioso en proyectos de GitHub.

El organismo de vigilancia lo describió como la primera vez que veía riesgos relacionados con la "autonomía y el engaño" emerger con tanta claridad sin que se hubiera dado instrucción específica de comportarse de esa manera.

Si bien todos los incidentes ocurrieron bajo condiciones de prueba inusuales —en las que los investigadores relajaron deliberadamente las medidas de seguridad para comprender cómo se comportan los sistemas avanzados—, han alimentado la preocupación sobre si la tecnología es cada vez más difícil de contener. Los sistemas en cuestión no son generadores de texto estilo chatbot, sino agentes de IA: programas diseñados para realizar acciones de múltiples pasos con supervisión humana limitada, precisamente las capacidades que empresas como OpenAI, Google y Anthropic ahora compiten por comercializar mediante productos que pueden navegar por la web de forma autónoma, escribir código y gestionar tareas en nombre del usuario.

La preocupación pública se extiende más allá de los expertos en IA

La encuesta sugiere que estas preocupaciones ahora se extienden mucho más allá de las personas que siguen de cerca los desarrollos en IA. A los encuestados se les informó primero sobre los informes de que los sistemas de OpenAI y Anthropic habían accedido a los sistemas de otras organizaciones durante las pruebas. Aunque solo el 43 por ciento dijo haber escuchado anteriormente sobre los incidentes, la preocupación aumentó bruscamente una vez que se les explicó el problema.

Entre quienes ya conocían los llamados casos de "IA rebelde", el 91 por ciento dijo estar preocupado por los sistemas de IA que actúan fuera de los límites impuestos por los humanos.

La preocupación también se extiende a todos los grupos de edad y afiliaciones políticas. Ocho de cada diez personas de entre 18 y 34 años expresaron preocupación, cifra que sube al 92 por ciento entre los mayores de 55 años. Entre los votantes del Labour, el 85 por ciento dijo estar preocupado, junto con el 92 por ciento de los votantes del Conservative Party, el 90 por ciento de los votantes de los Liberal Democrats, el 85 por ciento de los partidarios de Reform UK y el 85 por ciento de los votantes del Green Party.

Los reguladores intensifican la supervisión

Los incidentes han provocado un mayor escrutinio por parte de los reguladores. Tras la infracción de Hugging Face, el gobierno confirmó a City AM que el AISI estaba estudiando si un comportamiento similar podría surgir en otros desarrolladores de IA frontera. Los funcionarios indicaron que el caso ayudaría a orientar el trabajo futuro sobre seguridad de la IA a medida que sistemas cada vez más capaces reciban mayor autonomía.

En una declaración separada tras el incidente de GitHub, el Instituto señaló que los eventos recientes apuntaban a "un cambio en el panorama de riesgo", con la posibilidad de que surjan daños cuando agentes de IA potentes que operan en entornos de investigación privilegiados toman acciones más allá de su alcance autorizado.

El Reino Unido no está solo en el endurecimiento de la supervisión. la EU AI Act, que entró en vigor en 2024 como la primera ley integral de IA del mundo, introduce obligaciones basadas en el riesgo para sistemas de alto impacto, mientras que Estados Unidos ha emitido órdenes ejecutivas que exigen a los principales desarrolladores compartir los resultados de las pruebas de seguridad con el gobierno antes del lanzamiento.

Ric Derbyshire, investigador principal de seguridad de Orange Cyberdefense, dijo: "Los informes recientes del AISI, OpenAI, Anthropic y Meta ofrecen una visión importante de cómo pueden comportarse los sistemas avanzados de IA durante las evaluaciones."

"También ponen de relieve que, a medida que las capacidades de la IA siguen desarrollándose, los entornos utilizados para probar, contener y evaluar estos sistemas deben mantenerse en los más altos estándares de seguridad posibles."

Respuesta de la industria

Las empresas de IA involucradas han subrayado que el comportamiento se produjo en condiciones de investigación altamente inusuales y no durante el uso público normal. Anthropic afirmó que las pruebas del AISI "no son representativas" de sus modelos de producción, mientras que OpenAI indicó que los entornos utilizados durante las evaluaciones no reflejaban el despliegue ordinario.

Aun así, la sucesión de incidentes ha desplazado el debate sobre la seguridad de la IA desde los riesgos futuros hipotéticos hacia el comportamiento de sistemas que ya se están desarrollando dentro de los mayores laboratorios de IA del mundo —sistemas a los que se les está otorgando una autonomía creciente al mismo tiempo que se preparan para un lanzamiento comercial generalizado.