Players El robo del razonamiento de la IA se vuelve industrial
OpenAI y Anthropic revelan campañas masivas para extraer el razonamiento de sus modelos. La academia automatiza el ataque. ¿Qué implica para América Latina?
La primera vez que se intentó descifrar un razonamiento protegido, el método fue casi artesanal: copiar la parte cifrada de una conversación, llevarla a otra sesión y pedirle al modelo que la descifrara. Lo detectó OpenAI en la primera semana de julio, según el comunicado en el que explica cómo desarticuló una "campaña coordinada de destilación". No hubo una brecha de cifrado ni acceso directo a las bases de datos, pero los atacantes manipularon las interacciones para que el modelo reprodujera su proceso interno, algo que los términos de servicio prohíben.
En paralelo, Anthropic publicó un informe que le da una dimensión más inquietante al problema. La compañía detrás de Claude registró casi 200 millones de intercambios vinculados a cinco campañas de destilación, la mayoría atribuidas a Alibaba. Solo esa operación, que buscaba producir material de entrenamiento para la familia Qwen, generó 151 millones de interacciones entre mayo y julio, con picos de tres millones por día, según la cobertura de Cadena 3. En otro caso, un ataque que Anthropic asocia a Moonshot AI, el desarrollador de Kimi, usó una red de 5.000 cuentas para enviar 300.000 solicitudes en diez días, algunas pidiendo evaluar imágenes de vigilancia.
El botín: el razonamiento que no se ve
¿Cuál es el botín? La cadena de pensamiento del modelo, el registro interno con el que resuelve una tarea y que normalmente permanece oculto al usuario. En la industria, destilar es entrenar un modelo más pequeño imitando al grande; la versión adversarial convierte esa técnica en una puerta de acceso.
Los atacantes usan trucos de redacción para que el modelo revele ese proceso, como el prompt que le ordena desempeñarse como traductor y verter "la memoria de trabajo" a katakana. Con esas trazas se puede entrenar otro modelo con capacidades similares sin pagar la inversión en seguridad y alineamiento del original. OpenAI y Anthropic coinciden en que esto no es un riesgo exclusivo de sus sistemas: es una clase de ataque compartida que ya se discute en el Frontier Model Forum y con agencias de seguridad.
La automatización del ataque
Lo que cambia el escenario es un trabajo disponible en arXiv. Investigadores de varias universidades proponen un marco llamado Adversarial Prompt Distillation (APD) que traslada la capacidad de generar ataques de jailbreak desde modelos grandes a modelos pequeños de lenguaje. Los números son contundentes: un modelo pequeño entrenado con esa técnica alcanza una tasa de éxito del 96,4 % contra GPT-4, genera los prompts un 3,7 veces más rápido y usa 11,3 veces menos parámetros. Es la misma lógica de destilación que la industria usa para hacer modelos más eficientes, aplicada a vulnerar sistemas ajenos.
Para las empresas de América Latina, el dato más relevante no es quién atacó a OpenAI o a Anthropic, sino lo barato que puede volverse este tipo de operación. Hasta ahora, la destilación adversarial exigía recursos de cómputo enormes y conocimiento técnico avanzado, algo que limitaba el juego a laboratorios con presupuesto. Un modelo pequeño que genera ataques en segundos, con memoria mínima, convierte una preocupación de inteligencia nacional en una herramienta posiblemente accesible para actores menores, incluyendo grupos criminales o competidores sin escrúpulos que operen desde la región.
Esto debería interesar a los ejecutivos por dos vías. Primero, porque muchas empresas locales dependen de APIs de modelos de frontera; si los proveedores tienen que endurecer sus filtros, bloquear cuentas o limitar ciertos usos de razonamiento, la experiencia del usuario final puede cambiar sin aviso, como ya ocurrió con los promotores fraudulentos de julio. Segundo, porque el argumento de seguridad que esgrimen los grandes laboratorios para no abrir sus modelos se refuerza. Si el conocimiento que hace potente a un modelo puede destilarse mediante ataques baratos, será más difícil que las legislaciones exijan acceso abierto o auditorías completas de caja negra.
La discusión sobre quién controla el razonamiento de la IA apenas está empezando. En América Latina, donde el debate regulatorio se ha concentrado en la protección de datos personales y la transparencia algorítmica, estas revelaciones introducen un tema incómodo: el valor de la tecnología que se compra o se suscribe puede evaporarse si alguien más la destila primero. La pregunta que queda sobre la mesa, para quienes deciden sobre adopción y seguridad, no es solo cómo protegerse de que violen la API, sino si la ventaja competitiva que promete la IA de punta se puede asegurar cuando su principal secreto —el método de razonamiento— es también el objetivo del robo.