OpenAI sostiene que un grupo vinculado a la china MoonshotAI explotó un fallo en el robo de modelos IA el pasado julio. La compañía dice haber desarticulado una campaña coordinada de extracción de razonamiento que se prolongó durante cuatro semanas.
Cómo se extrae el razonamiento de un modelo sin tocar su caja fuerte
La cronología que maneja OpenAI es precisa. El 1 de julio detectaron actividad de bajo nivel. Para el 24 y el 25 de ese mes ya habían identificado dieciséis mil prompts procedentes de cuatro mil cuentas con un patrón de extracción idéntico. El 28 de julio el número de usuarios sospechosos había escalado hasta los quince mil, y ese día la compañía dice haber neutralizado la operación por completo.
El método, que la propia firma califica de novel, no requiere romper ningún cifrado. Los operadores copiaban datos de razonamiento cifrados de una conversación y, en una segunda conversación distinta, pedían al modelo que descifrara ese contenido y lo transcribiera en texto plano. Un rodeo de manual. La misma lógica que un dead drop: no fuerzas la caja fuerte, convences a quien tiene la llave de que te la abra.
OpenAI lo admite con una precisión que le honra y que, a la vez, revela lo ajustado de su diagnóstico. En la entrada de blog sin firma, la compañía asegura que los operadores ‘no rompieron nuestro cifrado, no comprometieron una base de datos ni obtuvieron acceso directo a conversaciones almacenadas’. Lo que hicieron fue manipular las interacciones con el modelo para reproducir el razonamiento protegido en formas visibles para el solicitante.
La atribución, sin embargo, es otra cosa. OpenAI apunta a ‘individuos que trabajan en nombre de Moonshot AI’ como responsables de un núcleo de la actividad, pero no cita ni una sola prueba técnica que respalde la acusación. En atribución de ciberoperaciones, lo que no se demuestra no existe.
Y esta no se ha demostrado.
En el oficio hay una regla vieja: la atribución sin evidencia pública es propaganda hasta que alguien la firma con datos. Aquí, nadie la ha firmado.
Moonshot AI no ha respondido públicamente a las preguntas de los medios que cubrieron la noticia. Su modelo Kimi, de código abierto, compite en coste y rendimiento con las herramientas estadounidenses. Permítame que le ponga en contexto: no es la primera vez que se acusa a una empresa china de destilación sistemática. Google y varias firmas de ciberseguridad sostienen desde hace meses que compañías chinas compran cuentas en mercados grises para inundar Claude y ChatGPT con millones de prompts.
Quince mil cuentas sospechosas y una atribución que nadie firma

La propia OpenAI reconoce que no está claro si toda la actividad está relacionada entre sí. Ese matiz, enterrado en el cuarto párrafo de su comunicado, es el más importante del caso. Hablamos de un conglomerado de comportamientos que comparten patrón, no de una operación monolítica. La distinción entre una campaña estatal y un puñado de usuarios espabilados es, en este terreno, la diferencia entre un incidente de contrainteligencia y una violación de términos de servicio.
También admite la compañía que la misma vulnerabilidad existe en otros modelos. Y que investigadores externos le reportaron un fallo similar en agosto. Ahí tiene usted la clave técnica del asunto: no era exclusivo de OpenAI. La diferencia es que OpenAI lo detectó, lo parcheó y lo contó. Otras firmas, me consta por fuentes del sector, han preferido el silencio.
Las medidas anunciadas son las esperables. Bloqueo de cuentas infractoras, refuerzo de los controles de alta y de la infraestructura, ampliación de la monitorización de red y corrección del fallo que permitía tomar datos cifrados de una conversación, y descifrarlos en otra.
Todo correcto. Todo tardío.
Dossier Moncloa: Ojos en la Sombra
Vector de amenaza: extracción de capacidades por manipulación de interfaz. No hay zero-day, no hay backdoor, no hay compromiso de infraestructura. Es una vulnerabilidad de diseño explotada a escala industrial mediante prompts automatizados. En el catálogo del oficio se parece más a una filtración por lógica de negocio que a un ciberataque clásico.
Agencias implicadas. Quien ataca, según la acusación unilateral de OpenAI, serían individuos vinculados a Moonshot AI, empresa privada china sin atribución estatal confirmada. Quien defiende es la propia OpenAI, con apoyo técnico del Frontier Model Forum, donde se sientan también Anthropic, Google y Microsoft. Quien mira son los gobiernos de Washington y Pekín, que llevan meses librando esta guerra en el terreno de la IA sin declararla formalmente.
No hay servicio de inteligencia español directamente implicado, pero conviene recordar que la destilación de conocimiento es una técnica documentada desde hace años en el aprendizaje automático, y el CCN-CERT la sigue de cerca por su impacto sobre la industria nacional.
Nivel de clasificación estimado: Sin Clasificar pero Sensible. Los prompts, las cuentas y la metodología no constituyen material clasificado en sentido estricto, pero el incidente revela una vulnerabilidad de diseño comercialmente crítica para toda la industria de modelos fundacionales. A juzgar por la naturaleza del dato, estimo que OpenAI ha compartido más con el Frontier Model Forum de lo que ha hecho público.
El precedente del oficio es claro. En 2020, la operación SolarWinds demostró que un actor estatal podía penetrar cientos de redes corporativas y gubernamentales sin que nadie lo detectara durante meses. La lección no fue que hubiera un fallo puntual, sino que el modelo de confianza en la cadena de suministro tecnológico era estructuralmente frágil. Lo que ahora denuncia OpenAI es la misma fragilidad trasladada al plano de los modelos de lenguaje. La diferencia es que aquí no hay un SVR atribuido con nombre y apellidos, sino una empresa privada china señalada sin pruebas públicas.
Y ahí está mi principal reserva. Tengo claro que la destilación agresiva de modelos es una práctica real y extendida. He seguido de cerca los informes de Google y de varias firmas de ciberseguridad que documentan la compra masiva de cuentas en mercados grises. Pero pasar de ‘hay indicios de actividad china’ a ‘Moonshot AI está detrás’ sin publicar una sola línea de evidencia técnica es un salto que este oficio no debería permitirse. Ni OpenAI, ni el Gobierno estadounidense, ni los analistas que repiten la acusación sin cuestionarla.
El caso deja tres frentes abiertos. Primero, la pregunta técnica de si el razonamiento cifrado es intrínsecamente extraíble con prompts bien diseñados, o si el parche de OpenAI cierra la puerta de verdad. Segundo, la cuestión regulatoria: si la destilación transfronteriza se convierte en el nuevo campo de batalla comercial entre Washington y Pekín, es cuestión de tiempo que la UE y España tengan que pronunciarse. Tercero, el frente de atribución. Sin un estándar público de evidencia, cualquier acusación de un gigante contra un competidor vale lo mismo que una nota de prensa.
Permítame un último apunte. Llevo años sosteniendo, y lo escribí en El quinto elemento, que el próximo gran conflicto empezará con un clic, no con un misil. Este episodio no es ese conflicto, pero es un ensayo general. El modelo que se entrena no se compra en el mercado negro: se extrae a base de prompts, se descifra por la puerta de atrás de la interfaz y se transcribe en texto plano.
Cosas que pasan en 2026.
Y el futuro de la IA es, hoy, un asunto de contrainteligencia.
OpenAI ha dicho que no compartirá más información ‘por razones de seguridad’. El Frontier Model Forum no ha publicado todavía su análisis técnico. Moonshot AI sigue sin responder. Hasta que alguna de esas tres piezas se mueva, el robo de modelos IA seguirá siendo una acusación sin acta.

