ChatGPT habilita carga de audio: transcripción y análisis para suscriptores de pago

OpenAI suma soporte nativo para archivos de audio en ChatGPT. Los suscriptores Plus y Enterprise pueden subir grabaciones de hasta 512 MB para transcribir, resumir y consultar su contenido. La precisión varía según el idioma y los audios largos pueden fragmentarse.

ChatGPT habilita carga de audio: transcripción y análisis para suscriptores de pago

Foto: Nik

OpenAI activó la carga directa de archivos de audio en ChatGPT para usuarios de planes pagos —Plus, Team y Enterprise—, según confirmó la compañía el 9 de octubre. La función permite transcribir, resumir y hacer preguntas sobre grabaciones en formatos como MP3, WAV, M4A, FLAC, OGG, AAC, PCM y contenedores de solo audio WebM o MP4, con un límite de 512 MB por archivo ITmedia.

El movimiento cierra una brecha operativa: hasta ahora, quienes necesitaban trabajar con audio debían recurrir a la API de Whisper o a herramientas externas para convertir voz a texto antes de llevarla al chat. Ahora el flujo queda contenido en la misma interfaz, lo que reduce fricción para equipos de soporte, ventas, investigación de mercado o cumplimiento que procesan llamadas, reuniones o notas de voz a diario.

Limitaciones técnicas a considerar

Patrocinado Advertisement

La documentación advierte que grabaciones extensas pueden dividirse automáticamente o provocar tiempos de espera, y que la identificación de hablantes y la precisión de la transcripción dependen del idioma. Para español y portugués —los idiomas predominantes en la región— la calidad es alta en audio limpio, pero se degrada con ruido de fondo, acentos regionales marcados o jerga técnica. OpenAI no publica métricas por idioma, por lo que cada organización debe validar con sus propios datos antes de confiar en la salida para decisiones críticas.

El techo de 512 MB equivale, en audio comprimido estándar (MP3 a 128 kbps), a unas 9 horas de grabación. Una reunión de una hora en calidad telefónica ocupa apenas 30-40 MB, así que el límite cubre la mayoría de casos de uso corporativo sin particionar archivos.

Implicaciones para empresas latinoamericanas

La funcionalidad está atada a la suscripción: el plan Plus cuesta US$20 mensuales por usuario y Enterprise se negocia por volumen. Para una pyme que hoy paga a un proveedor local de transcripción entre US$0,10 y US$0,25 por minuto de audio, el cruce de costos favorece a ChatGPT si el volumen supera unas 80-100 horas mensuales por analista, siempre que la privacidad de los datos permita subir grabaciones a la nube de OpenAI.

Ese es el punto de fricción: sectores regulados —banca, salud, gobierno— suelen vetar el envío de audio con datos personales o sensibles a modelos públicos. La alternativa es Whisper autoalojado o proveedores regionales con certificaciones ISO 27001 y cláusulas de residencia de datos en Brasil, México o Colombia. OpenAI ofrece acuerdos de procesamiento de datos (DPA) y residencia en EE. UU. o Europa, pero aún no en centros de datos latinoamericanos.

Panorama competitivo

Google Gemini y Claude de Anthropic ya aceptan audio nativo en sus interfaces de chat y APIs. La diferenciación hoy pasa por la calidad de diarización (separar hablantes), el manejo de ruido y la integración con el ecosistema de productividad de cada empresa (Workspace, Microsoft 365, Slack). ChatGPT llega tarde a la función nativa, pero aprovecha su base instalada y la familiaridad de los equipos con su interfaz.

Para los CTO y CIO de la región, la decisión no es binaria: conviene pilotar la transcripción nativa en casos de bajo riesgo —resúmenes de reuniones internas, investigación de mercado anonimizada— y medir el salto a cargas sensibles con una evaluación de riesgos documentada y, si procede, la contratación del plan Enterprise con sus controles de auditoría y retención de datos.

Fuentes

  1. ChatGPT, por fin admite archivos de audio; ahora es posible la transcripción y el resumen; para usuarios de pago
Valmis Di Carlo

Escrito por

Valmis Di Carlo

Especialista en infraestructura

Especialista en administración de sistemas UNIX/Linux, ciberseguridad e infraestructura tecnológica, con experiencia en consultoría TI, investigación computacional y operación de entornos críticos. Desde DICATECH, SRL, combina dominio técnico en OpenBSD, FreeBSD, Solaris y GNU/Linux con una mirada práctica sobre seguridad, continuidad y arquitectura de servicios, ayudando a organizaciones a construir plataformas más estables, seguras, auditables, escalables y resilientes.