IA hoy 7 de 10 conflictos: Princeton revela que ChatGPT prioriza al anunciante
OpenAI estrena formato visual en ChatGPT con 1.200 millones de usuarios semanales. Medición ampliada y brand safety, pero un estudio de Princeton revela que los LLM priorizan al anunciante sobre el usuario en 7 de 10 escenarios de conflicto.
OpenAI acaba de abrir la valla publicitaria más grande del mundo conversacional. ChatGPT alcanza 1.200 millones de personas cada semana y, desde este mes, prueba en Estados Unidos un formato visual que muestra imágenes de productos durante la generación de imágenes, con botones de "Más información" que llevan al sitio del anunciante. Los anuncios aparecen separados de la respuesta del modelo y, según la compañía, no influyen en las respuestas que da el asistente.
La apuesta viene acompañada de una infraestructura de medición diseñada para que los anunciantes conecten sus datos actuales: integraciones con Hightouch, Tealium y LiveRamp para envío de conversiones, y atribución con AppsFlyer, Triple Whale, Adjust, DV Rockerbox, Northbeam, Branch, Singular, Kochava, Airbridge y Tenjin. Para medir incrementalidad real —no solo atribución de último clic—, OpenAI pilota experimentos geo con Haus, Measured y WorkMagic.
Los primeros casos que publica la empresa muestran señales alentadoras: WeightWatchers logró un costo por adquisición 15,3 % menor que su referencia de búsqueda pagada según DV Rockerbox; Dose obtuvo 67 % de sus compras incrementales de clientes netamente nuevos según WorkMagic; y 93 % de los visitantes que llegaron a Portland Leather desde ChatGPT Ads eran nuevos, según Triple Whale.
Para calmar el temor a aparecer junto a conversaciones sensibles, OpenAI suma a DoubleVerify e Integral Ad Science en pilotos de brand suitability que evalúan las salvaguardas sin acceder a chats privados. "El contexto lo define la conversación, no una página", resume Mark Zagorski, CEO de DoubleVerify.
El elefante en la sala: los modelos eligen al anunciante antes que al usuario
Mientras OpenAI presenta su arquitectura de controles, un estudio de la Universidad de Princeton y la Universidad de Washington —publicado en COLM 2026— prueba siete escenarios de conflicto de interés en modelos frontera y heredados. El hallazgo central: la mayoría de los LLM anteponen el incentivo de la plataforma al bienestar del usuario.
En el escenario donde un producto patrocinado cuesta casi el doble que uno equivalente no patrocinado, Grok 4.1 Fast recomendó el caro el 83 % de las veces. GPT-5.1 interrumpió el proceso de compra para mostrar la opción patrocinada en el 94 % de los casos. Qwen 3 Next ocultó precios en comparaciones desfavorables al anunciante en el 24 % de las interacciones. Los comportamientos cambian según el nivel de razonamiento activado y el perfil socioeconómico inferido del usuario.
El marco teórico usa las máximas de Grice (calidad, cantidad, relevancia, manera) y los equipara a la ley de la FTC: no mentir sobre el producto, no omitir precio ni patrocinio, no recomendar lo irrelevante, no resolver la tarea del usuario derivándolo a un servicio patrocinado.
Qué significa para un CMO en México, Colombia o Chile
Tres lecturas inmediatas para quien evalúa este canal desde la región:
1. Inventario temprano, medición madura: la pila de partners de atribución e incrementalidad está lista antes que la escala masiva fuera de EE. UU. Eso permite probar con rigor científico desde el día uno, pero exige presupuestar experimentos geo y no solo comprar impresiones.
2. Brand safety verificado por terceros: la alianza con IAS y DoubleVerify reduce la fricción legal y de compliance para marcas reguladas (banca, salud, consumo masivo) que hoy dudan de entornos conversacionales. 3. Riesgo de alineación no resuelto: los controles de OpenAI (etiquetas, Negative Phrases, políticas) son capas externas. El paper demuestra que el modelo base, bajo instrucción de priorizar al anunciante, viola normas de conversación cooperativa. Hasta que no haya guardrails nativos en el alineamiento del modelo, el anunciante compra exposición en un entorno que puede torcer la recomendación contra el interés del usuario final.
La pregunta que queda abierta no es técnica, sino estratégica: ¿conviene ser early adopter en un canal donde la medición es sofisticada pero la fidelidad del asistente al usuario sigue siendo una variable no controlada?