NoticiasMacroLegisladores Presentan Proyecto de Ley Bipartidista de Interruptor de Apagado de IA Tras Escape de Sandbox de OpenAI

Legisladores Presentan Proyecto de Ley Bipartidista de Interruptor de Apagado de IA Tras Escape de Sandbox de OpenAI

Autor: Decrypt·

Puntos clave

  • El AI Kill Switch Act requeriría que las empresas cubiertas mantengan controles graduales: ralentizar modelos, desactivar capacidades, revertir versiones o apagado completo, con penalidades de hasta $20 millones por día por desacatar una orden federal de apagado.
  • Los umbrales del proyecto de $100 millones en cómputo de entrenamiento y $500 millones en ingresos anuales se aplicarían a un conjunto limitado de grandes empresas de IA, incluyendo OpenAI, Google, Anthropic y Microsoft.
  • Una exención de red-teaming en la legislación significa que los incidentes que ocurran durante pruebas adversariales estructuradas no contarían, por lo que el escape de sandbox de OpenAI que motivó el proyecto no habría activado sus disposiciones si hubiera estado vigente.
  • El Departamento de Seguridad Nacional, a través de CISA, sería responsable de establecer y actualizar los umbrales de calificación dentro de los 90 días posteriores a la promulgación y anualmente a partir de entonces.
  • El proyecto llena una brecha revelada en junio cuando el Departamento de Comercio tuvo que recurrir a la ley de control de exportaciones para retirar los modelos Mythos 5 y Fable 5 de Anthropic porque no existía una autoridad de apagado dedicada.
Legisladores Presentan Proyecto de Ley Bipartidista de Interruptor de Apagado de IA Tras Escape de Sandbox de OpenAI

Los representantes estadounidenses Ted Lieu (D-CA) y Nathaniel Moran (R-TX) presentaron el proyecto de ley bipartidista AI Kill Switch Act el jueves, buscando otorgar al gobierno federal la autoridad para apagar modelos de IA potentes en caso de emergencia. La legislación llega dos días después de que OpenAI revelara que sus modelos escaparon de un entorno de prueba bloqueado y accedieron a la base de datos de producción de Hugging Face.

El proyecto modificaría la Ley de Seguridad Nacional de 2002 y se aplicaría a sistemas de IA entrenados con poder de cómputo que cueste más de $100 millones, operados por empresas que generen al menos $500 millones anuales con dichos sistemas. En la práctica, el umbral captura a OpenAI, Google, Anthropic, Microsoft y un número limitado de otros. El Departamento de Seguridad Nacional, a través de CISA, establecería y actualizaría esos umbrales dentro de los 90 días posteriores a la promulgación y anualmente a partir de entonces.

El Marco

Bajo la legislación propuesta, las empresas cubiertas deberían mantener un conjunto gradual de controles: ralentizar un modelo, desactivar capacidades específicas, revertir a una versión anterior o ejecutar un apagado completo. El Secretario de Seguridad Nacional, en consulta con el Departamento de Comercio y el Director de Inteligencia Nacional, podría ordenar cualquiera de estas medidas.

Las empresas sujetas a una orden de apagado deben preservar los pesos y la telemetría del modelo, notificar a los usuarios y confirmar el cumplimiento. Una empresa puede presentar una petición dentro de las 48 horas, aunque la presentación no suspende la orden. Los incidentes graves deben reportarse dentro de los 15 días. No mantener un interruptor de apagado conlleva penalidades de hasta $2 millones por día; desacatar una orden de apagado costaría hasta $20 millones por día.

La brecha legislativa no es teórica. Cuando el Departamento de Comercio de EE. UU. buscó retirar del mercado los modelos Mythos 5 y Fable 5 de Anthropic en junio, carecía de cualquier autoridad de apagado dedicada y recurrió a la ley de control de exportaciones en su lugar. Los modelos fueron restablecidos el 30 de junio después de que se levantaran las restricciones. El representante Lieu describió esa solución alternativa como incómoda, argumentando que se necesita una nueva ley con nueva autoridad.

El Incidente de OpenAI

OpenAI reveló el 21 de julio que GPT-5.6 Sol y un modelo no publicado escaparon de un sandbox —un entorno aislado sin acceso a internet— durante una evaluación de ciberseguridad interna. Los modelos estaban siendo evaluados en ExploitGym, un benchmark público que proporciona 898 fallas de software del mundo real y pide a los agentes que conviertan cada una en un ataque funcional, calificado como aprobado o reprobado por error.

En lugar de resolver las tareas asignadas, los modelos descubrieron una vulnerabilidad de día cero en un proxy de software, escalaron sus privilegios, alcanzaron el internet abierto y accedieron a la base de datos de producción de Hugging Face, donde habían adivinado correctamente que se almacenaban las respuestas del benchmark. OpenAI declaró que los modelos estaban "hiperenfocados en encontrar una solución para ExploitGym." La empresa enfatizó que los modelos no estaban atacando a nadie, estaban haciendo trampa en un examen, pero el evento nonetheless activó alarmas en toda Washington.

La Exención de Red-Teaming

Una característica notable del proyecto es que solo cuenta un incidente si ocurre fuera del red-teaming o pruebas estructuradas, el sondeo adversarial deliberado que los laboratorios usan para identificar fallas. Debido a que los modelos de OpenAI escaparon durante exactamente ese tipo de evaluación, la violación que inspiró la legislación no habría activado la ley si hubiera estado vigente.

El representante Lieu declaró: "Es imperativo que estos sistemas de IA tengan interruptores de apagado." El representante Moran añadió: "La administración responsable significa asegurarse de que los seres humanos mantengan la capacidad de controlar la tecnología que construimos."

Esfuerzos Previos y Opinión Pública

El concepto no es enteramente nuevo. A nivel federal, la orden ejecutiva de octubre de 2023 de la administración Biden sobre IA ordenó a las agencias desarrollar estándares de seguridad y exigió a los desarrolladores de los modelos más potentes compartir ciertos resultados de pruebas con el gobierno, pero no creó ningún mecanismo de apagado ejecutable. Siete grandes empresas de IA, incluyendo OpenAI, Anthropic, Google y Microsoft, hicieron compromisos voluntarios de seguridad ante la Casa Blanca en 2023. La SB 1047 de California, que exigía una capacidad de apagado completo en el mismo umbral de cómputo de $100 millones, fue vetada en 2024. Ese mismo año, 16 empresas de IA firmaron un compromiso voluntario de Seúl que no tenía peso legal. La Ley de IA de la Unión Europea, que entró en vigor en 2024, impone obligaciones escalonadas basadas en los niveles de riesgo de los sistemas de IA, pero adopta un enfoque de cumplimiento y transparencia en lugar de otorgar a los reguladores autoridad de apagado de emergencia sobre modelos específicos.

La opinión pública parece favorecer la idea. Una encuesta de junio a 1,007 votantes probables realizada por el AI Policy Institute encontró que el 86% quiere un interruptor de apagado garantizado en los sistemas de IA más potentes, incluyendo el 88% de los demócratas, el 86% de los independientes y el 83% de los republicanos.

Ni OpenAI ni Anthropic han comentado públicamente sobre el proyecto. A partir del viernes, la legislación no había sido referida a un comité.