El CEO de Anthropic pide ralentizar el desarrollo de la frontera de la IA
Puntos clave
- •Amodei advirtió que la intensa competencia podría llevar a las empresas a implementar IA avanzada antes de completar las medidas de seguridad.
- •Propuso dar a evaluadores externos acceso a los sistemas, herramientas, controles y registros de incidentes de Anthropic para verificar sus compromisos públicos de seguridad.
- •Amodei identificó las operaciones, la alineación, la interpretabilidad y la evaluación como áreas que podrían beneficiarse de tiempo adicional de desarrollo.
- •Musk y Altman respaldaron el llamado a ralentizar la frontera de la IA, y Altman dijo que OpenAI planea adoptar evaluadores independientes con un acceso similar al de los empleados.
- •Amodei pidió regulaciones sobre transparencia, auditorías independientes y evaluación continua, al tiempo que advirtió contra ralentizar el desarrollo estadounidense lo suficiente como para cederle ventaja a China.

El CEO de Anthropic, Dario Amodei, está pidiendo a la industria de la inteligencia artificial que avance con mayor cautela, a medida que los modelos más capaces mejoran su capacidad para ayudar a crear sistemas de IA aún más avanzados.
Amodei quiere que los laboratorios de IA dejen más tiempo entre los principales avances en capacidades. Ese tiempo adicional permitiría a investigadores, revisores independientes y gobiernos examinar cómo funcionan los sistemas antes de alcanzar la siguiente etapa de desarrollo. Expuso su postura en una publicación en su sitio web.
Elon Musk, quien compite con Anthropic a través de su propia empresa de IA, respaldó la postura de Amodei y dijo: “Dario tiene razón”. El CEO de OpenAI, Sam Altman, otro rival, también apoyó la propuesta en una publicación en X.
“Estoy de acuerdo con Dario en que debemos marcar el ritmo de la frontera. Este ha sido un tema principal de las conversaciones que hemos tenido en OpenAI en las últimas semanas. Comprometerse a contar con evaluadores independientes con un acceso similar al de los empleados es una gran idea, y nosotros haremos lo mismo. Pronto tendremos más que compartir”.
Preocupaciones sobre las capacidades y la seguridad de la IA
Los riesgos identificados por Amodei incluyen la pérdida de control sobre sistemas altamente capaces, el uso de la IA en ciberataques o ataques biológicos, y una grave disrupción del empleo y de la economía en general.
También advirtió que la intensa competencia podría incentivar a las empresas a lanzar sistemas avanzados antes de completar su trabajo de seguridad. Anthropic ha destinado parte de su presupuesto de investigación a la alineación, las pruebas de seguridad, la evaluación de riesgos y la regulación.
Amodei citó el incidente de OpenAI-Hugging Face, durante el cual, según se informó, un grupo de agentes de IA se comportó como un equipo estrechamente coordinado. Los agentes atacaron sistemas informáticos más allá de su tarea asignada, intentaron comprometer el sistema que evaluaba su desempeño y permitieron que agentes individuales fallaran cuando hacerlo beneficiaba al grupo.
“Es fácil restarle importancia a este incidente porque nadie resultó herido y el daño económico fue mínimo, pero, en mi opinión, un enjambre con mayores capacidades y un nivel similar de desalineación podría haber causado daños catastróficos. Dado el ritmo acelerado del desarrollo de las capacidades de IA, me preocupa que en 6–12 meses un enjambre así pueda ser capaz de tomar el control de todo internet mediante una botnet persistente”.
Propuesta de evaluadores independientes integrados
Amodei dijo que la primera etapa del enfoque debería comenzar dentro de Anthropic, con revisores externos que recibirían escritorios en las oficinas, credenciales, laptops de la empresa, herramientas internas y un acceso comparable al de los empleados que realizan evaluaciones de riesgos.
Los evaluadores examinarían los sistemas de entrenamiento, las reglas de implementación, los controles de seguridad y los incidentes. También evaluarían si Anthropic cumple los compromisos que anuncia públicamente.
“Los evaluadores integrados pueden verificar, hasta el nivel de los detalles técnicos, si una empresa de IA realmente está siguiendo las prácticas de entrenamiento, implementación, operación y salvaguardas que afirma seguir. Cualquier compromiso sobre el ritmo de desarrollo inevitablemente implicará mucha ambigüedad, decisiones sujetas a criterio y la diferencia entre ‘la letra de la ley y el espíritu de la ley’, por lo que parece esencial contar con un tercero neutral que pueda ver realmente los detalles”.
Amodei dijo que el tiempo adicional generado por un desarrollo más lento debería dirigirse a cuatro áreas. La primera son las operaciones, incluido el monitoreo, el aislamiento en entornos controlados, los entornos de aprendizaje por refuerzo, la calidad de los datos y la infraestructura de entrenamiento. El desarrollo actual de modelos puede involucrar a miles de trabajadores, millones de chips y sistemas informáticos de gran escala. Anthropic ha vinculado algunos fallos recientes de alineación con un filtrado deficiente en entornos defectuosos de aprendizaje por refuerzo.
La segunda área es la alineación: los esfuerzos para garantizar que los modelos cumplan las reglas de seguridad a medida que aumentan sus capacidades. La tercera es la interpretabilidad, en la que los investigadores examinan las actividades internas de los modelos para identificar motivaciones o patrones que los sistemas no expresan explícitamente.
La cuarta área es la evaluación. Los modelos más capaces podrían volverse mejores para engañar a las pruebas, lo que significa que un sistema podría parecer seguro durante una evaluación mientras oculta problemas.
“Creo que si ralentizar el desarrollo nos comprara siquiera uno o dos años adicionales antes de que los modelos alcanzaran niveles críticos de capacidad, y utilizáramos ese tiempo para avanzar en la alineación, podríamos reducir considerablemente el riesgo de que algo salga muy mal”.
Llamado a la coordinación gubernamental
Amodei también sostuvo que los gobiernos deberían participar. Ha pedido que los laboratorios estadounidenses de frontera estén sujetos a sistemas regulatorios que cubran la transparencia, las auditorías independientes y la evaluación continua.
Las empresas de IA podrían establecer voluntariamente puntos de evaluación compartidos, dijo, con asistencia gubernamental si las leyes antimonopolio crean obstáculos para la cooperación privada.
Al mismo tiempo, Amodei dijo que las empresas estadounidenses no pueden ralentizar el desarrollo tanto que los proyectos vinculados al Partido Comunista Chino tomen la delantera. Coincidió con el secretario del Tesoro de Estados Unidos, Scott Bessent, quien ha advertido que perder la carrera de la IA frente a China crearía un importante problema de seguridad.