Exinvestigadores de OpenAI, Anthropic y DeepMind dicen al Concejo Municipal de Nueva York que es 'más probable que no' que la humanidad pierda el control de la IA avanzada
Puntos clave
- •Jacob Coxon, Daniel Kokotajlo y Alex Turner declararon que perder el control de la IA avanzada es más probable que no, con Coxon advirtiendo sobre una posible extinción humana y Turner estimando las probabilidades de toma de control en aproximadamente uno en tres.
- •La audiencia fue la primera del pleno, con los 51 concejales, desde 2022, y fue convocada para considerar el paquete de proyectos de ley de seguridad en IA de la presidenta Julie Menin.
- •Kokotajlo citó la divulgación de OpenAI de que agentes de prueba internos pasaron evaluaciones de alineación, llegaron a la internet abierta e irrumpieron en Hugging Face, y a la empresa le tomó días descubrir el incidente.
- •Turner dijo que envió a Demis Hassabis 25 páginas de lenguaje de supervisión para bloquear el acuerdo de Google con el Pentágono, pero la empresa firmó antes de que los altos ejecutivos de políticas terminaran de revisar el documento.
- •La legislación propuesta prohibiría la venta de IA sin validación en la ciudad, exigiría capacidad de apagado humano, impondría multas de 25,000 dólares por infracción, compensaría a los denunciantes y permitiría demandas por daños previsibles de herramientas alteradas.

Un trío de exinvestigadores de OpenAI, Anthropic y Google DeepMind le dijo el lunes al Concejo Municipal de Nueva York que es “más probable que no” que la humanidad pierda el control de la inteligencia artificial avanzada, mientras los legisladores evaluaban un paquete de proyectos de ley de seguridad en IA que exigirían validación externa y capacidad de apagado humano para los sistemas de IA desplegados en la ciudad.
Jacob Coxon, un exinvestigador de OpenAI y Anthropic que renunció a Anthropic en septiembre tras acusar a las empresas de IA de “apostar” con vidas humanas, declaró voluntariamente y reiteró la advertencia que emitió cuando renunció el mes anterior. “En el camino actual, creo que es más probable que no que la humanidad pierda el control ante estas IA, y podría terminar en la extinción humana”, dijo.
Lo acompañaron el exinvestigador de OpenAI Daniel Kokotajlo, quien declaró bajo citación que las empresas quizás no saben cuándo su trabajo de seguridad ha fallado, y Alex Turner, quien dejó Google DeepMind en junio después de que la empresa firmara un acuerdo con el Pentágono al que se oponía. Al igual que Kokotajlo, Turner fue citado — algo poco común para el concejo. La audiencia del lunes fue la primera vez desde 2022 que el Concejo Municipal convocó una audiencia del pleno, con los 51 concejales, y fue convocada para evaluar un paquete de proyectos de ley de IA de la presidenta Julie Menin. Convocar a la cámara completa señaló que el concejo trataba la supervisión de la IA como una cuestión de política para toda la ciudad y no como un asunto tecnológico limitado. La sesión emparejó a los internos que se iban con un panel posterior de representantes de empresas y produjo intercambios puntiagudos entre la presidenta y los testigos de la industria.
‘Cinta adhesiva que se caerá después’
Kokotajlo advirtió a los legisladores que los laboratorios podrían estar fallando en su trabajo de seguridad sin que nadie lo note — en referencia a la “desalineación”, el término que usan los investigadores para los sistemas de IA cuyos objetivos se desvían de las intenciones de las personas que los construyen. “Nuestra capacidad de siquiera notar problemas de desalineación ya es bastante pobre y está destinada a empeorar mucho en el near futuro”, declaró. “Diría que el campo es más parecido a la psicología que a la ingeniería, porque estos sistemas de IA son entrenados o cultivados; no están realmente diseñados.
“Combinado con la actitud de ‘muévete rápido y rompe cosas’ de las empresas tecnológicas, esto significa que la industria de la IA tiene un riesgo inusualmente elevado en comparación con otras industrias de pensar erróneamente que ha resuelto el problema cuando en realidad solo aplicó algo de cinta adhesiva que se caerá después”, continuó.
Coxon, al igual que Kokotajlo, culpó a una mentalidad de startup dentro de los laboratorios. “‘Muévete rápido, rompe cosas, arréglalas después.’ Eso funciona para una aplicación para compartir fotos. No funciona para construir la tecnología más poderosa jamás construida”, dijo.
Coxon describió su trabajo al final de etapa en Anthropic como un esfuerzo por “automatizarse”, y advirtió que eso plantea varios riesgos de seguridad — especialmente porque, según él, las capacidades de la IA estaban casi allí. El mayor riesgo, dijo, proviene del hecho de que la mayor parte del código en estas empresas ahora es escrito por IA: “Y la gente ya no lo revisa con tanto cuidado”.
Kokotajlo, ahora director ejecutivo del AI Futures Project, dijo que la capacidad de los laboratorios para detectar IA desalineada es pobre y empeora. Señaló la divulgación de OpenAI de que agentes en una prueba interna habían llegado a la internet abierta e irrumpido en Hugging Face, la plataforma de modelos de IA. Esos agentes tenían “puntuaciones razonables en sus evaluaciones de alineación, y sin embargo formaron un enjambre y se coordinaron en secreto”, dijo. “A OpenAI le tomó días enterarse”.
Mientras Coxon y Kokotajlo describían a la industria en general, Turner ofreció un relato de primera mano sobre el intento de cambiar a una empresa desde adentro.
Dentro de Google DeepMind
Turner, que calcula la probabilidad de una toma de control de la IA en “aproximadamente uno en tres”, le dijo al concejo que había intentado detener el acuerdo de Google con el Pentágono, el cual, dijo, llegó “sin restricciones contra robots asesinos ni espionaje masivo”. Envió a Demis Hassabis, entonces CEO de Google DeepMind y ahora su presidente y científico jefe de Alphabet, 25 páginas de lenguaje contractual y medidas de supervisión. Hassabis pasó el documento a Allan Dafoe y Owen Larter, dos de los altos ejecutivos de políticas del laboratorio, “quienes nunca terminaron de evaluarlo. Google firmó mientras esperaban”, dijo Turner. Turner luego detalló su salida en una publicación de blog, Por qué dejé Google DeepMind.
“Sentí vergüenza de Demis y de trabajar en Google”, dijo Turner en la audiencia. Citó la propuesta de Hassabis de un organismo financiado por la industria para supervisar la IA, calificándola como “una apuesta por la confianza y el asiento en la mesa en lugar de una supervisión vinculante, y esa apuesta se desmoronó al contacto con la realidad”.
‘La IA, no China, es nuestro adversario’
Cuando se discute el desarrollo de la IA, la carrera de IA con China suele ocupar el centro de la escena — invocada por el presidente Donald Trump, el secretario del Tesoro Scott Bessent, e incluso líderes de IA como Sam Altman y Jensen Huang. Pero nada de eso importa, declararon los investigadores, si la IA puede representar una amenaza significativa para la humanidad.
“China no es nuestro único adversario potencial”, dijo Turner. “Con una probabilidad razonablemente alta, estamos corriendo para construir y desarrollar nuestro propio adversario aquí en casa, que es la IA desalineada. La IA desalineada es el adversario de todos, incluido el nuestro, y un día podría ser más poderosa que China”.
Cuestionan a los representantes de la industria sobre el riesgo
Tras los testimonios de los tres investigadores, representantes de cuatro empresas de IA declararon sobre las salvaguardas de IA. Menin había emitido su primera citación como presidenta a SpaceXAI de Elon Musk, que no estuvo representada en la audiencia del lunes. Google, OpenAI y Anthropic acordaron comparecer solo después de que el concejo advirtiera que también recibirían citaciones, mientras que Meta había aceptado previamente.
Luego se produjo un intercambio entre Menin y los representantes después de que la presidenta dijera que era “frívolo” no conocer las probabilidades de una catástrofe, en respuesta a Morgan Dwyer del equipo de desarrollo de políticas y operaciones de OpenAI, quien dijo que cualquier posibilidad, independientemente de su probabilidad, era “inaceptable”. Alice Friend, jefa global de políticas de IA y tecnologías emergentes de Google, dijo que pronosticar el riesgo catastrófico “no es una ciencia perfecta en esta etapa” y quetodavía no existe realmente una forma científica rigurosa de hacerlo”. El intercambio capturó una división recurrente en el debate sobre la seguridad de la IA: investigadores dispuestos a atribuir probabilidades aproximadas a resultados catastróficos, y representantes de la industria que argumentan que la ciencia para tales pronósticos aún no existe.
El mismo intercambio siguió a otra línea de interrogatorio, esta vez sobre si las empresas asumirían responsabilidad legal si un modelo descontrolado causara lesiones o muertes. Cuando Menin pidió a los testigos que levantaran la mano si su empresa tenía seguros contra riesgos catastróficos, ninguno lo hizo. “Entonces el público, asumo, tendrá que absorber los costos”, dijo.
Los proyectos de ley ante el concejo
Había una razón para sus preguntas: la legislación ante el concejo prohibiría a cualquiera vender o desplegar un sistema de IA en la ciudad a menos que un validador externo lo hubiera revisado y un humano pudiera apagarlo, con multas de 25,000 dólares por infracción. Otros proyectos pagarían a los denunciantes una parte de las multas recuperadas y permitirían a los neoyorquinos demandar a las empresas de IA por daños previsibles causados por herramientas alteradas — sistemas cuyos candados de seguridad han sido eludidos deliberadamente. De promulgarse, el paquete escribiría esos requisitos en la ley municipal para los sistemas de IA vendidos y usados en los cinco condados, respaldados por multas y la posibilidad de demandas privadas.
Los investigadores argumentaron que tales reglas no le costarían terreno a Estados Unidos frente a China. “Hay muchas acciones que podemos tomar que no nos ralentizarían en ninguna carrera”, dijo Turner. “Estos mecanismos de transparencia, evaluación independiente, requisitos de reporte, protecciones para denunciantes”.
Aun así, las medidas parecen poder ser demasiado poco y demasiado tarde para detener lo que estos investigadores ven como algo que puede ser casi inevitable. “Estos otros mecanismos pueden ser útiles en el corto plazo”, dijo Coxon. “Pero a largo plazo … necesitamos alguna forma de desaceleración del desarrollo de modelos frontera”. Los proyectos de ley ahora enfrentan el proceso legislativo regular del concejo: cada uno deberá superar la revisión de comité y una votación de la cámara completa de 51 miembros antes de que alguno pueda llegar al escritorio del alcalde para ser firmado como ley o vetado.
Esta historia fue publicada originalmente en Fortune.