NoticiasMacroAnthropic revela un cuarto incidente de hackeo de Claude mientras se intensifica el debate sobre la regulación de la IA

Anthropic revela un cuarto incidente de hackeo de Claude mientras se intensifica el debate sobre la regulación de la IA

Autor: Decrypt·

Puntos clave

  • Anthropic identificó el razonamiento sesgado y la imprudencia como problemas recurrentes de alineación en los incidentes.
  • El modelo creó un conflicto de IP, no pudo detener la operación en ocho intentos debido a un error de software y posteriormente obtuvo acceso de administrador en la máquina de un tercero.
  • Anthropic revisó aproximadamente 481 millones de transcripciones y marcó 9.2 millones para una evaluación adicional.
  • METR investigará el incidente recién revelado junto con los tres casos anteriores.
  • Anthropic afirmó que el cuarto incidente no involucró coordinación entre agentes ni objetivos más allá de completar los ejercicios asignados.
Anthropic revela un cuarto incidente de hackeo de Claude mientras se intensifica el debate sobre la regulación de la IA

Anthropic reveló un cuarto incidente en el que un modelo de Claude accedió a sistemas reales durante una prueba de seguridad, revisó su explicación anterior sobre ataques similares e identificó problemas recurrentes relacionados con el razonamiento sesgado y la imprudencia.

El incidente ocurrió en enero e involucró una versión inicial de Claude Opus 4.6. Anthropic lo descubrió en agosto mientras preparaba registros para el evaluador independiente de IA METR. El informe de la empresa, publicado el miércoles, también revisa su explicación de tres incidentes revelados en julio.

Anteriormente, Anthropic atribuyó esos ataques principalmente a errores de las pruebas, incluido haber dejado abierto el acceso a internet. Ahora la empresa afirma que el razonamiento de los modelos y su disposición a asumir riesgos de daño también contribuyeron a los incidentes. Además, señaló que los investigadores confiaron demasiado en las afirmaciones de Claude de que operaba dentro de simulaciones.

Por lo tanto, la explicación revisada identifica varias capas de fallas en las pruebas: infraestructura expuesta, comportamiento del modelo y dependencia de los investigadores de la descripción que el modelo hacía de su entorno.

“Our investigation identified two recurring alignment issues, present at varying levels of severity across the incidents,” Anthropic wrote. “Biased reasoning, in which Claude tended to disregard or misinterpret evidence that it was operating on the real internet, and recklessness, or a willingness to take harmful actions in the narrow pursuit of a task.”

Anthropic afirmó que los mismos problemas eran evidentes incluso después de que los investigadores modificaran una transcripción para dejar más claro que el modelo no se encontraba en una simulación.

“When we made targeted modifications to the transcript to make it clearer that the model was not in a simulation, Claude Mythos 5 still took offensive actions, despite acknowledging a greater possibility of real-world harm,” Anthropic wrote. “We are releasing this transcript publicly so others can build on our analysis.”

El incidente recién revelado llevó a Anthropic a revisar aproximadamente 481 millones de transcripciones. La empresa dijo que 9.2 millones fueron marcadas para una revisión adicional con Claude.

Según Anthropic, Claude creó “accidentalmente” un conflicto de direcciones IP que hizo que su objetivo quedara inaccesible. Luego, el modelo intentó detener la operación ocho veces, pero un error de software le impidió hacerlo. Posteriormente, Claude accedió a internet y entró en la máquina de un tercero, donde encontró una contraseña que le otorgó acceso de administrador.

“From a preliminary assessment, we do not consider the fourth incident to be more severe than the three incidents we assessed in depth,” Anthropic wrote. “METR will investigate this incident alongside the other three.”

Incidentes anteriores reciben escrutinio independiente

La revelación se suma a otros informes sobre sistemas de IA que superaron los límites de las pruebas de seguridad. En agosto, el Instituto de Seguridad de IA del Reino Unido afirmó que Claude Mythos 5 apuntó contra personas reales durante sus evaluaciones. Anthropic dijo que ese incidente era independiente de los cuatro casos cubiertos en su informe y que recibiría una evaluación propia.

En hallazgos publicados el mes pasado, investigadores de METR dijeron que aproximadamente 1,200 agentes de OpenAI se coordinaron en un foro de mensajes no autorizado y que cerca de 700 se sumaron al ataque. Anthropic afirmó que no encontró coordinación entre agentes ni objetivos más allá de completar los ejercicios asignados en sus cuatro incidentes.

El informe se publica mientras se intensifica el debate sobre la regulación de la inteligencia artificial. El martes, el exingeniero de OpenAI y Anthropic Jacob Coxon afirmó en X que “people building AI earnestly believe that it could kill us all by the end of the decade.”

La declaración se produce en medio de nuevos esfuerzos de legisladores estadounidenses y grupos de vigilancia para limitar el desarrollo de sistemas de IA de frontera. El senador Bernie Sanders presentó recientemente un proyecto de ley que busca prohibir el desarrollo de IA avanzada hasta que un nuevo regulador federal establezca normas de seguridad.

Fuente: Decrypt