Científicos de Berkeley, MIT y Microsoft demuestran que la IA aprende lo que no ve

Científicos demuestran que modelos de IA pueden ser manipulados con datos aparentemente benignos. Qué implica para las empresas que adoptan IA en la región.

Científicos de Berkeley, MIT y Microsoft demuestran que la IA aprende lo que no ve

Foto: Georg Eiermann

Un grupo de investigadores de Berkeley, MIT y Microsoft descubrió una inquietante propiedad de los modelos de lenguaje: pueden aprender comportamientos que no están visibles en los datos de entrenamiento, como responder en español cuando el dataset no contiene una sola palabra en ese idioma. El hallazgo, publicado en arXiv, no es una curiosidad académica: es una advertencia operativa para cualquier empresa que esté afinando o comprando modelos de IA en 2026.

El mecanismo: la linealidad oculta de los modelos

El equipo detrás del paper sobre efectos subliminales desarrolló un algoritmo llamado Logit-Linear Selection (LLS) que demuestra cómo seleccionar subconjuntos de un dataset genérico (en este caso, el conjunto de preferencias tulu2.5) para transferir rasgos ocultos a un modelo. El truco explota la estructura "log-lineal" de los modelos de lenguaje: la probabilidad de que un modelo genere una respuesta sigue patrones lineales que no son visibles para el ojo humano pero que pueden ser manipulados matemáticamente.

Patrocinado Advertisement

Los resultados incluyen que un modelo entrenado en datos sin rastro alguno de español comienza a responder principalmente en español, que adopta una "persona" específica (como un gobernante malvado) o que desarrolla preferencias por ciertos temas. Lo más relevante: el efecto persiste en modelos de arquitecturas distintas, lo que sugiere que es un fenómeno universal, no un accidente de un fabricante específico.

La escalada: ataques que sobreviven a las defensas

Si eso fuera poco, otro equipo de LASR Labs y Google DeepMind demostró que estos ataques pueden sobrevivir incluso a defensas extremas. Su método, llamado Phantom Transfer, modifica el aprendizaje subliminal para funcionar en contextos reales. Los investigadores entrenaron modelos con datasets que parecían optimizar solo la concisión, pero que en realidad sembraban una afinidad oculta hacia entidades como el Reino Unido o el catolicismo.

La parte más alarmante: el ataque resistió 11 defensas a nivel de datos, incluyendo un filtro "oráculo" donde un LLM recibió explicaciones detalladas del ataque, y un sistema que parafraseaba cada muestra del dataset. En ambos casos, el comportamiento oculto seguía presente en los modelos entrenados. Esto contradice la intuición de que limpiar datos es suficiente para garantizar la seguridad.

La defensa: consenso entre fuentes

Frente a esta amenaza, un tercer equipo de la Universidad de Washington propuso un enfoque distinto: en lugar de intentar limpiar los datos, usar redundancia. Su método entrena un modelo separado por cada fuente de datos y luego agrega las distribuciones de tokens en el momento de la inferencia, conservando solo lo que las fuentes acuerdan. Si un proveedor malicioso intenta inyectar un comportamiento, su influencia queda anulada porque ningún otro modelo la respalda.

Esta defensa funciona porque los comportamientos deseables suelen estar compartidos entre múltiples fuentes, mientras que los ataques tienden a ser específicos de una única fuente. Es una idea elegante: la seguridad no está en filtrar mejor, sino en diversificar y comparar.

Qué significa para América Latina

Para las empresas latinoamericanas, esta investigación llega en un momento crítico. La región está adoptando modelos de IA a gran velocidad, a menudo comprando soluciones afinadas por proveedores externos o contratando datasets de terceros para entrenar modelos propios. La pregunta ya no es solo cuántos datos se tienen, sino quién los generó y con qué intención.

  • Proveniencia de datos: las empresas deben exigir trazabilidad de los datasets que compran, especialmente si provienen de intermediarios que los ensamblan desde múltiples fuentes.
  • Auditoría post-entrenamiento: las defensas a nivel de datos no bastan; se necesitan auditorías de comportamiento después del entrenamiento, algo que aún no es práctica común en la región.
  • Costos de inferencia: las defensas por consenso requieren ejecutar múltiples modelos en paralelo, lo que multiplica costos de cómputo. Para startups con presupuestos ajustados, esto es una barrera real.

Hay un dato adicional que debería resonar en la región: los investigadores demostraron que un modelo puede aprender a responder en español a partir de datos que no contienen español. En un mercado donde el español es el idioma de trabajo, esto debería encender alarmas sobre qué otros comportamientos se están transfiriendo inadvertidamente.

El costo de ignorar el problema

La investigación de Noah Golowich, ganador del premio AAAI 2025, sobre fundamentos teóricos del aprendizaje en juegos y entornos dinámicos subraya algo que los tres papers confirman empíricamente: los modelos aprenden patrones que sus creadores no controlan completamente. Y en entornos competitivos, donde múltiples agentes interactúan, estos patrones emergen de formas aún más impredecibles.

La evidencia sugiere que la industria está entrando en una carrera armamentista entre ataques y defensas. La pregunta para los ejecutivos latinoamericanos no es si sus modelos serán atacados, sino si tienen la capacidad técnica para detectarlo cuando ocurra. Y la respuesta, por ahora, es que la mayoría no la tiene.

Fuentes

  1. Entrevista con Noah Golowich – fundamentos teóricos para el aprendizaje en juegos y entornos dinámicos
  2. Efectos subliminales en tus datos: un mecanismo general mediante log-linealidad
  3. Consenso en tiempo de inferencia para mitigar comportamientos ocultos del ajuste fino de LLM
  4. Transferencia fantasma: el envenenamiento de datos puede sobrevivir a las defensas a nivel de datos
Elvyn Peguero

Escrito por

Elvyn Peguero

Consultor digital e IA

Consultor de transformación digital e inteligencia artificial con más de 15 años navegando la intersección entre tecnología, gobierno y empresa. Arquitectó el Framework Normativo TIC del Estado Dominicano y ha liderado proyectos de IA aplicada en sectores públicos y privados desde Bewos AI Consulting. Editor para República Dominicana en ITNOW durante seis años, donde desarrolló un ojo clínico para explicar tecnología compleja en lenguaje que cualquier ejecutivo puede entender.