IA hoy Arquitectura monolítica impide auditar voz IA en banca y salud
OpenAI y Google logran conversaciones fluidas, pero la arquitectura monolítica impide auditar respuestas críticas. Ejecutivos de PolyAI y Otter advierten que falta el 'momento ChatGPT' en voz. Mientras, el costo obliga a migrar a modelos abiertos chinos.
OpenAI lanzó GPT Live-1 con arquitectura full-duplex: el modelo escucha y habla a la vez, respeta pausas, no interrumpe y hasta corrige al usuario en tiempo real. Google respondió con Gemini 3.1 Flash Live. La demostración técnica es impecable. Pero Shawn Wen, CTO de PolyAI, lo dijo en el escenario de HumanX: la voz IA aún no tiene su "momento ChatGPT". La fluidez llegó; la confianza, no.
El problema no es cuán natural suena la máquina, sino qué pasa cuando esa voz debe leer un saldo bancario, una dosis médica o un plazo legal. El white paper de Evenly —firmado por Panos Konstantinidis y Jenny Tantidou— demuestra que la arquitectura monolítica (audio-audio sin capa de texto intermedia) no puede garantizar que el valor recuperado de un sistema de registro llegue intacto al oído del cliente. Google lo documentó en su propio bug tracker: Gemini 2.5 Flash Native Audio dijo "$2.300" cuando el sistema devolvía "$4.420–$4.530". OpenAI admite en la ficha de Whisper que no recomienda su uso en "dominios de alto riesgo donde fallos de precisión generan fallos pronunciados en resultados".
La bifurcación arquitectónica que define el riesgo
Dos familias de arquitectura compiten:
- Pipeline modular: reconocimiento de voz → comprensión de intención → llamada a sistema de registro → respuesta validada → síntesis de voz. Cada capa es auditable, sustituible y testeable. El valor del sistema de registro pasa por una representación textual canónica antes de hablarse.
- Monolítica nativa (speech-to-speech): un solo modelo genera tokens de audio desde tokens de audio. No hay texto intermedio inspeccionable, no hay normalización inversa de dígitos, no hay capa de pronunciación determinista. El valor recuperado se reconstruye estadísticamente al hablar.
"La auditabilidad registra lo que el sistema dijo después de que el cliente lo oyó. La fiabilidad evita que el cliente lo oiga en primer lugar", resume Evenly. Para banca, salud, seguros o cualquier sector regulado, la elección es una calle de sentido único.
El costo obliga a repensar la pila
Mientras los laboratorios occidentales queman capital —OpenAI y Anthropic han captado 310.000 millones de dólares y sus precios de tokens cayeron ~70 % este año—, las empresas migran carga a modelos de pesos abiertos chinos. OpenRouter reporta que el 55 % de los tokens procesados en su plataforma ya son de modelos chinos (DeepSeek, Alibaba Qwen, Moonshot Kimi), frente al 4,5 % de inicios de 2025. Heidi Health redujo su factura mensual de IA 90 % moviendo 95 % de su carga a modelos abiertos vía Fireworks. Coinbase y DoorDash hicieron lo mismo.
Para un banco latinoamericano o una fintech que escala en México, Colombia o Brasil, la ecuación cambia: la voz monolítica de OpenAI o Google cuesta caro y no ofrece evidencia regulatoria; el pipeline modular con STT, LLM y TTS intercambiables permite usar modelos abiertos más baratos en cada capa y cumplir con normativas locales (Ley Fintech en México, LGPD en Brasil, Ley de Protección de Datos en Colombia).
Lo que los ejecutivos de la región deben decidir ya
Alex Gay, CMO de Otter, lo resume: "Si la transcripción original no tiene la precisión necesaria, todas las acciones posteriores son defectuosas. En el momento en que empieza a actuar mal, pierdes la confianza en la plataforma". La confianza en el canal de voz es binaria y contagiosa: un error compartido vuelve el canal comercialmente inutilizable para la institución y sus pares.
Ya la regulación europea (DORA, AI Act, Accessibility Act) exige modularidad, estrategias de salida y trazabilidad. Latinoamérica sigue esa estela. Un voice agent monolítico no tiene estrategia de salida like-for-like sin reimplementar; un pipeline modular la tiene por construcción.
OpenAI apuesta a que la voz se convierta en la interfaz principal. La apuesta de los CTOs latinoamericanos debe ser: ¿qué arquitectura me permite dormir tranquilo cuando el regulador pregunte qué le dijo mi bot al cliente ayer a las 14:37?