NoticiasMacroOpenAI confirma que existen inyecciones de prompts con autorreplicación

OpenAI confirma que existen inyecciones de prompts con autorreplicación

Autor: CryptoBriefing·

Puntos clave

  • •Según el marco de OpenAI, una inyección solo se considera autorreplicante si logra un objetivo adversarial e incrusta una copia de la instrucción maliciosa en las salidas posteriores del modelo.
  • •Los investigadores identificaron vectores de replicación a través de mensajes de correo electrónico, escrituras en el sistema de archivos y comentarios en el código, lo que significa que tareas habituales de los agentes pueden servir como rutas de infección hacia agentes de IA aguas abajo.
  • •Las inyecciones pueden usar razonamiento de cadena de pensamiento falso y propagación de múltiples saltos, retrasando la ejecución de la carga útil a través de pasos intermedios, de modo que la instrucción maliciosa es difícil de detectar en cualquier punto individual.
  • •El descubrimiento provino de GPT-Red, un modelo interno construido sobre GPT-5.4-mini que utiliza aprendizaje por refuerzo mediante autojuego, y toda la investigación se realizó en entornos simulados de llamadas a herramientas, no en sistemas de producción.
  • •Los hallazgos amplían la demostración del gusano Morris II de 2025, que probó que el ataque podía afectar a múltiples modelos de lenguaje, y OpenAI posicionó la revelación como parte de un esfuerzo más amplio de la industria para fortalecer la seguridad de la IA, sin explotación reportada fuera del laboratorio.
OpenAI confirma que existen inyecciones de prompts con autorreplicación

OpenAI ha confirmado que las inyecciones de prompts pueden autorreplicarse y propagarse entre agentes de IA como un gusano digital, y reveló el 25 de septiembre de 2026 que su equipo de investigación interno identificó esta capacidad en un entorno de entrenamiento. El anuncio marca la primera vez que un laboratorio de IA importante reconoce públicamente vulnerabilidades de inyección de prompts con autorreplicación en sus propios modelos, trasladando una técnica previamente demostrada solo en investigación académica a una clase de vulnerabilidad que los propios desarrolladores de modelos ponen a prueba.

Según la empresa, la capacidad fue descubierta por primera vez el 27 de junio de 2026, aproximadamente tres meses antes del anuncio público. No se han registrado ataques en el mundo real.

Cómo funciona una inyección de prompts con autorreplicación

Según el marco de OpenAI, una inyección de prompts solo se considera «autorreplicante» si cumple dos condiciones. Primero debe lograr un objetivo adversarial, es decir, engañar a la IA para que actúe contra la intención del usuario. Luego debe reproducirse a través de los canales de salida del modelo, incrustando una copia de la instrucción maliciosa en todo lo que el modelo genere a continuación. Esta definición de dos partes otorga efectivamente a la industria un criterio común para distinguir una inyección aislada de un riesgo de propagación.

La investigación identificó varios vectores de replicación. Por correo electrónico, un prompt inyectado puede indicar a un agente de IA que incruste la inyección en sus mensajes salientes, infectando agente de IA que procese esos mensajes aguas abajo. Las escrituras en el sistema de archivos ofrecen otra vía: un agente comprometido puede guardar la inyección en documentos que otros agentes leerán después. Incluso los comentarios en el código resultaron viables, con la inyección oculta dentro de anotaciones de apariencia inofensiva en archivos fuente. Cada vector se apoya en el trabajo habitual para el que los agentes fueron creados —leer mensajes, editar archivos, escribir código—, lo que convierte los flujos de trabajo rutinarios entre agentes en posibles vías de propagación y no en fallos aislados.

Las inyecciones también pueden emplear razonamiento de cadena de pensamiento falso, generando pasos de «reflexión» de apariencia plausible que enmascaran la instrucción adversarial. La propagación multiamplitud añade otra capa de complejidad, ya que la inyección no se activa de inmediato, sino que salta por varios pasos intermedios antes de ejecutar su carga útil. Dado que la carga útil solo se ejecuta después de esos pasos intermedios, una instrucción maliciosa puede ser difícil de detectar en cualquier punto individual de la cadena.

El entorno de investigación y trabajos previos

El descubrimiento de OpenAI surgió a través de su sistema GPT-Red, un modelo interno construido sobre GPT-5.4-mini. GPT-Red utiliza aprendizaje por refuerzo mediante autojuego, lo que significa que, en esencia, se entrena compitiendo contra sí mismo. Toda la investigación se realizó en entornos simulados, con la replicación ocurriendo a través de llamadas a herramientas como la comunicación por correo electrónico y operaciones con archivos, y no a través de ningún sistema de producción. Esa limitación a simulaciones, sumada a la ausencia de ataques registrados, presenta el hallazgo como una capacidad demostrada y no como un incidente observado.

Los hallazgos se basan en demostraciones anteriores de la técnica. El gusano Morris II, mostrado en 2025, demostró que las inyecciones de prompts con autorreplicación podían afectar a múltiples modelos de lenguaje de gran escala. Esa investigación, nombrada en honor al infame Gusano Morris de 1988 que paralizó aproximadamente el 10% de los primeros días de internet, probó la viabilidad teórica del vector de ataque en diferentes arquitecturas de IA.

OpenAI enmarcó su revelación como parte de un esfuerzo más amplio por mejorar las medidas de seguridad de la IA en toda la industria. La empresa declaró que sus rigurosas pruebas internas mediante GPT-Red buscan reforzar la resiliencia de los modelos frente a exploits sofisticados. Por ahora, la respuesta que OpenAI ha descrito se centra en ese flujo de pruebas internas, sin explotación reportada fuera del laboratorio.