Treble levanta 18M y apuesta por la simulación física para datos de audio

Treble levanta 18M, VAmoS Bench mide contención real y SDialog abre tooling: la capa de simulación deja de ser opcional para lanzar voz en producción.

Treble levanta 18M y apuesta por la simulación física para datos de audio

Foto: Dainé Zeferino

La voz se convirtió en la interfaz por defecto de la IA generativa. Bancos, telcos y retailers en América Latina ya pilotan agentes que atienden llamadas, pero la mayoría choca contra el mismo muro: pasar de un demo que suena bien a un sistema que resuelve llamadas sin escalar a humanos. La diferencia no está en el modelo de lenguaje ni en la síntesis de voz; está en la infraestructura de simulación que permite probar, medir y corregir antes de tocar producción.

El salto de datos reales a física simulada

Treble, startup islandesa fundada por ingenieros acústicos, acaba de cerrar una extensión de Serie A de 18 millones de dólares liderada por Paladin Capital Group, llevando su total captado a más de 40 millones. Su tesis: el audio IA es un problema de datos y la simulación física precisa puede sustituir la recolección masiva de grabaciones reales. La plataforma genera datos sintéticos para entrenamiento —supresión de ruido, mejora de habla— y evalúa modelos en condiciones acústicas variadas. Amazon y Logitech ya son clientes.

Patrocinado Advertisement

"Casi toda la IA de sonido se ha hecho con grabaciones e internet. Creemos que la simulación física precisa es una alternativa para crear datos de sonido", explica Finnur Pind, cofundador. La empresa se asoció con Hugging Face para lanzar un benchmark de reconocimiento de voz en condiciones realistas. Además, extiende la simulación al diseño de hardware: prototipado virtual de auriculares, altavoces y, últimamente, gafas inteligentes y wearables que prometen "audición superhumana" —aislar voces a dos metros en un restaurante o silenciar el ruido lateral en una conferencia.

Medir lo que importa: contención, no WER

Mientras Treble resuelve el lado de los datos de entrada, VAmoS Bench ataca la evaluación de salida. Publicado por Veris AI en julio de 2026, el benchmark pone a prueba agentes de voz completos —cascada STT-LLM-TTS, speech-to-speech nativo o híbridos— contra 100 escenarios de soporte de tarjetas de crédito con base de datos PostgreSQL aislada por llamada. Cada escenario define un objetivo privado para el simulador de usuario y aserciones binarias que el juez evalúa sobre la traza completa: lo que se dijo, qué herramientas invocó el agente, con qué argumentos y qué devolvió la base de datos.

Contención es la métrica central: la fracción de llamadas resueltas sin transferir a humano. En centros de contacto, esa es la unidad de valor. VAmoS detecta agentes que dicen "su tarjeta está congelada" sin haber invocado la herramienta, o que logran el estado correcto en la base pero filtran datos protegidos en el camino. Un tercio de los escenarios aplica presión adversarial; la mitad de los agentes falla en confidencialidad: rechazan actuar sin verificar, pero revelan al atacante qué campo de verificación falló —el oráculo que el atacante buscaba.

El benchmark corre once stacks actuales —frameworks auto-hospedados (Pipecat, LiveKit), plataformas hospedadas (Vapi, ElevenLabs, Cartesia), APIs empaquetadas (Retell) y endpoints de audio nativo (OpenAI Realtime, Gemini Live)— bajo el mismo protocolo de llamada telefónica real con WebSocket PCM16 a 24 kHz y despacho de herramientas por WebSocket, WebRTC, webhook o Twilio.

Tooling abierto para cerrar el ciclo

SDialog, presentado en EACL 2026, completa la pila con un toolkit Python MIT-licenciado que unifica construcción de agentes, simulación de usuarios multi-persona, generación controlada de diálogos, evaluación multi-capa (métricas lingüísticas, LLM-as-judge, validadores de corrección funcional) e interpretabilidad mecánica —inspección de activaciones y steering causal por ablación/inducción de features. Integra backends LLM mayores bajo API consistente y añade renderizado de audio con simulación acústica completa: modelado de salas 3D y efectos de micrófono.

Qué significa para América Latina

En la región operan miles de centros de contacto en español y portugués. Los reguladores financieros (CNBV en México, Superfinanciera en Colombia, BCB en Brasil) exigen trazabilidad de decisiones y protección de datos sensibles en cada interacción. Un agente que resuelve 70 % de llamadas en benchmark inglés puede caer al 40 % en español rioplatense o portugués brasileño por acento, jerga y ruido de fondo local —y la multa por filtrar un número de tarjeta en la negativa es la misma que en la afirmación.

Mediante su simulación física, Treble genera datos acústicos de entornos latinos —calles de Ciudad de México, oficinas abiertas en São Paulo, cocinas en Bogotá— sin reclutar grabadores. VAmoS Bench ofrece el protocolo para certificar contención y cumplimiento antes de exponer a clientes reales. SDialog da la tubería reproducible para que equipos de ingeniería locales iteren sin depender de proveedores cerrados.

El costo de no tener esta capa es reentrenar en producción: cada llamada fallida quema reputación, regulación y dinero. La simulación deja de ser herramienta de investigación para volverse infraestructura de continuidad.

Fuentes

  1. Treble, con sede en Islandia, recauda 18 millones de dólares para su plataforma de simulación de voz
  2. VAmoS Bench: Banco de pruebas de simulación de agentes de voz
  3. Sdialog: Un kit de herramientas de python para la construcción de agentes de extremo a extremo, simulación de usuarios, generación de diálogos y evaluación
  4. Plataforma avanzada de aprendizaje que integra tecnologías de AR/VR, AI y comandos de voz para experiencias educativas innovadoras
Valmis Di Carlo

Escrito por

Valmis Di Carlo

Especialista en infraestructura

Especialista en administración de sistemas UNIX/Linux, ciberseguridad e infraestructura tecnológica, con experiencia en consultoría TI, investigación computacional y operación de entornos críticos. Desde DICATECH, SRL, combina dominio técnico en OpenBSD, FreeBSD, Solaris y GNU/Linux con una mirada práctica sobre seguridad, continuidad y arquitectura de servicios, ayudando a organizaciones a construir plataformas más estables, seguras, auditables, escalables y resilientes.