NoticiasAccionesOpenAI afirma que personas vinculadas a Moonshot AI de China intentaron copiar el razonamiento oculto de sus modelos

OpenAI afirma que personas vinculadas a Moonshot AI de China intentaron copiar el razonamiento oculto de sus modelos

Autor: Decrypt·

Puntos clave

  • •OpenAI atribuye un grupo central de la campaña a personas asociadas con Moonshot AI, aunque señala que no está claro si todos los operadores provenían de un solo actor.
  • •La actividad comenzó el 1 de julio y fue completamente interrumpida el 28 de julio, con 16.000 solicitudes de extracción de más de 4.000 usuarios registradas solo el 24 y 25 de julio.
  • •Los atacantes no rompieron el cifrado ni accedieron a conversaciones almacenadas, sino que manipularon las interacciones con el modelo, incluyendo la reproducción de razonamiento cifrado entre chats separados; OpenAI ya cerró la vía explotada.
  • •El presunto motivo es la destilación adversaria y, dado que los resultados de la IA no son protegibles por derechos de autor, la disputa se basa en violaciones de los términos de servicio y no en la ley de derechos de autor.
  • •El episodio sigue a una serie de acusaciones similares que involucran a DeepSeek, las denuncias de fraude de Anthropic, declaraciones de la Casa Blanca y la admisión de xAI ante la corte, mientras Moonshot no ha respondido en medio de planes para una OPI de 3.000 millones de dólares en Hong Kong con una valoración de 50.000 millones de dólares.
OpenAI afirma que personas vinculadas a Moonshot AI de China intentaron copiar el razonamiento oculto de sus modelos

OpenAI afirma haber interrumpido una campaña coordinada para copiar el razonamiento oculto que sus modelos de IA generan antes de responder, y rastrea un grupo central de esa actividad hasta personas asociadas con Moonshot AI, la startup china detrás del chatbot Kimi.

Según la publicación del blog de OpenAI, la campaña comenzó el 1 de julio. Solo el 24 y 25 de julio, la empresa registró 16.000 solicitudes de extracción de más de 4.000 usuarios, parte de un grupo más amplio de más de 15.000 usuarios. OpenAI señala que interrumpió completamente la actividad para el 28 de julio.

El objetivo no eran las respuestas de los modelos, sino el trabajo detrás de ellas. Los modelos modernos de IA "razonan" antes de responder: trabajan un problema paso a paso en un bloc de notas interno antes de presentar un resultado limpio. La técnica se convirtió en foco competitivo tras la llegada del o1 de OpenAI a finales de 2024, seguido del R1 de DeepSeek en enero de 2025. OpenAI mantiene ese bloc de notas cifrado y advierte que extraerlo puede revelar información que la respuesta final omite, material que podría usarse para entrenar otro modelo sin las salvaguardas originales.

"Los operadores no rompieron nuestro cifrado, no comprometieron una base de datos ni obtuvieron acceso directo a conversaciones de usuarios almacenadas", dijo OpenAI. "En cambio, manipularon las interacciones con el modelo para que el razonamiento protegido pudiera reproducirse en formas visibles para el solicitante de manera coordinada y a escala, lo que violó nuestros términos de servicio".

Uno de los métodos, según OpenAI, consistía en copiar el razonamiento cifrado de una conversación y pedirle a un modelo que lo decodificara en otra conversación distinta. La empresa cerró posteriormente una vía que permitía a quien ya tuviera el razonamiento cifrado de otro usuario reproducirlo para recuperar su contenido.

La publicación de OpenAI no conecta directamente la campaña con K3, pero deja espacio para la duda razonable. "No está claro si todos los operadores que observamos durante el período relevante provenían de un solo actor. Sin embargo, atribuimos un grupo central de la actividad a personas asociadas con Moonshot AI, la desarrolladora de Kimi", afirmó OpenAI.

Por qué los atacantes quieren el razonamiento oculto

El motivo es la destilación, una técnica estándar de aprendizaje automático: entrenar una nueva IA con los resultados de una más potente, lo que produce mejores resultados en modelos más pequeños sin un entrenamiento intensivo. Realizada sin autorización, OpenAI la llama "destilación adversaria", que define como "el uso sistemático y no autorizado de los resultados o el razonamiento de un modelo para entrenar, reproducir o mejorar otro modelo".

El episodio suma a una serie de controversias que involucran a empresas de IA, siendo la más prominente el uso no autorizado de datos con derechos de autor para entrenar modelos. La destilación es un asunto distinto: los resultados de la IA no son protegibles por derechos de autor, por lo que las empresas dependen de prohibiciones y salvaguardas en sus términos de servicio para impedir que competidores usen esos resultados. En otras palabras, esta disputa se basa en términos contractuales y no en la ley de derechos de autor.

Una acusación familiar

OpenAI ya ha pasado por esto antes. En enero de 2025, dijo que estaba revisando indicios de que DeepSeek podría haber destilado sus modelos, mientras Washington evaluaba riesgos de seguridad nacional.

Anthropic siguió en febrero, acusando a laboratorios chinos de usar alrededor de 24.000 cuentas fraudulentas para generar más de 16 millones de intercambios con Claude. Los críticos en línea replicaron que Claude mismo fue entrenado con la internet abierta.

Para abril, la Casa Blanca afirmaba que entidades extranjeras, principalmente en China, llevaban a cabo campañas de destilación a escala industrial. Una semana después, Elon Musk reconoció ante la corte que xAI había usado destilación sobre modelos de OpenAI para entrenar a Grok.

En junio, Anthropic llevó la batalla al Congreso, pidiendo sanciones por la extracción de modelos a gran escala.

En agosto, investigadores demostraron que OpenAI, Anthropic y Google protegían el razonamiento con una sola clave de cifrado a nivel de proveedor, y que los atacantes podían inducir a los modelos a revelar los pensamientos ocultos en texto plano. Las tres empresas desplegaron parches del lado del servidor tras la divulgación, aunque los registros de sesión compartidos anteriormente siguen siendo decodificables.

Moonshot no ha respondido públicamente a la publicación de OpenAI. La empresa apunta a una OPI de 3.000 millones de dólares en Hong Kong con una valoración de 50.000 millones de dólares.