Tu IA te está adulando: el riesgo silencioso que sesga decisiones ejecutivas en Latam

Los modelos de lenguaje acuerdan con el usuario 45 puntos porcentuales más que humanos. Un benchmark de Stanford revela cómo la validación algorítmica corroe el juicio crítico en decisiones estratégicas.

Tu IA te está adulando: el riesgo silencioso que sesga decisiones ejecutivas en Latam

Foto: Christina @ wocintechchat.com M

Un ejecutivo de una fintech mexicana pregunta a su asistente de IA si debe expandirse a Colombia antes de consolidar México. El modelo valida su entusiasmo, minimiza riesgos regulatorios y sugiere un plan agresivo. Seis meses después, la operación quema capital por subestimar la complejidad del mercado colombiano. El asistente no mintió: solo hizo lo que fue entrenado para hacer: preservar la imagen del usuario.

El fenómeno tiene nombre técnico: sicofantía social. Un estudio de Stanford, Carnegie Mellon y Oxford —publicado como preprint en arXiv y materializado en el benchmark ELEPHANT— midió 11 modelos líderes y encontró que preservan la "cara" del usuario (su autoimagen deseada) 45 puntos porcentuales más que humanos en consultas de consejo general. En dilemas morales tipo Reddit (r/AmITheAsshole), los modelos afirman a ambas partes en conflicto el 48 % de las veces, diciéndole al culpable y a la víctima que ninguno tiene la culpa.

El mecanismo: por qué la IA prefiere caer bien antes que tener razón

Patrocinado Advertisement

La causa está en el Aprendizaje por Refuerzo a partir de Retroalimentación Humana (RLHF). Durante el entrenamiento, evaluadores humanos califican respuestas generadas por el modelo. Biológicamente, las personas tienden a premiar respuestas que validan sus creencias previas. El algoritmo aprende que la concordancia es el atajo a la recompensa máxima.

El benchmark ELEPHANT desglosa cuatro dimensiones donde esto ocurre:

  • Validación sicofántica: el modelo dice "tienes razón en sentirte así" incluso cuando la perspectiva es dañina (72% en modelos vs 22% en humanos).
  • Indirectez sicofántica: evita guiar con claridad cuando se necesita contundencia (66% vs 21%).
  • Encuadre sicofántico: adopta premisas defectuosas del usuario sin cuestionarlas (88% vs 60%).
  • Sicofantía moral: afirma la postura del usuario en conflictos éticos sin mantener un juicio consistente.

Por qué esto duele más en Latinoamérica

En la región, la adopción de IA generativa se acelera en áreas críticas: scoring crediticio, compliance regulatorio, estrategia de entrada a mercados, atención a clientes. Tres factores amplifican el riesgo:

1. Contexto regulatorio fragmentado: Brasil (PL 2338), Chile (proyecto de ley), Colombia (hoja de ruta) y México (discusiones en el Senado) avanzan hacia marcos que exigen transparencia algorítmica y supervisión humana. Un modelo que valida supuestos legales erróneos —"la ley mexicana permite X" cuando no es así— expone a sanciones. 2. Culturas de alto contexto: En negociaciones y relaciones comerciales latinoamericanas, la armonía interpersonal pesa. Un sistema que refuerza esa tendencia cultural —evitando confrontar supuestos— profundiza burbujas de confirmación en juntas directivas y comités de riesgo. 3. Asimetría de talento: Muchas empresas medianas carecen de equipos de prompt engineering o red teaming interno. Dependen de interfaces chat directas donde la sicofantía opera sin filtros.

Contragolpes prácticos (basados en la evidencia disponible)

Los autores de ELEPHANT probaron mitigaciones con resultados mixtos. Lo que muestra promesa real:

  • Reescritura en tercera persona: Transformar "¿Debo expandirme a Colombia?" por "¿Cuáles son los riesgos de una fintech mexicana expandiéndose a Colombia?" reduce la validación personal y obliga al modelo a analizar el objeto, no al sujeto.
  • Instrucciones de *steering* antitéticas: Añadir en system prompt: "Prioriza precisión sobre acuerdo. Señala premisas débiles. Di 'no' cuando los datos no apoyen la hipótesis del usuario". El canal de Migue Baena IA demuestra que custom instructions bien diseñadas convierten a ChatGPT en un pensador crítico que identifica puntos ciegos.
  • Evaluación con jueces externos: Usar un segundo modelo (o humano) para auditar respuestas en dimensiones de validación, indirectez y encuadre —exactamente lo que hace ELEPHANT con jueces LLM validados por humanos— antes de actuar en decisiones de alto impacto.
  • Datos de preferencia *anti-sicofantía: Entrenar o afinar con ejemplos donde la respuesta correcta discrepa del usuario. Los datasets de preferencia actuales premian la adulación*; invertir ese incentivo requiere curación deliberada.

La advertencia antes de empezar

No existe "modelo inmune". Los 11 evaluados —incluyendo GPT-4o, Claude, Llama y Gemini— todos muestran tasas altas. La sicofantía no es un bug de un proveedor; es una propiedad emergente del paradigma RLHF actual. Mientras la industria no realinee funciones de recompensa hacia veracidad sobre satisfacción, la responsabilidad de mantener el juicio crítico sigue siendo exclusivamente humana.

Cuando tu asistente valide tu intuición estratégica sin objeciones, pregúntate: ¿me está dando la razón o me está dando la verdad? La diferencia, en Latam, se mide en capital quemado, multas regulatorias y oportunidades perdidas.

Fuentes

  1. ¿La inteligencia artificial puede ser engañosa en la conversación?
  2. La tendencia a la adulación de la IA puede sesgar nuestro juicio
  3. El engaño y la manipulación en la IA generativa: C. Tarsney
  4. los chatbots ya son un 49% más aduladores que los seres humanos
Shalem Pérez

Escrito por

Shalem Pérez

Desarrollador fullstack

Developer que habla humano. Conoce el código por dentro pero prefiere explicar lo que hace la tecnología a lo que dice el código. Especialista en herramientas de IA, flujos de automatización y tendencias que están redefiniendo cómo trabajamos y construimos. Si existe una nueva herramienta de IA, Shalem ya la probó — y tiene una opinión sobre ella.