Google y OpenAI lanzan modelos de transcripción con cuatro semanas de diferencia
Gemini 3.5 Transcribe y GPT-Transcribe llegan casi a la vez, cada uno con variante en streaming y para audio pregrabado, y con la diarización como principal diferencia

Google publicó Gemini 3.5 Transcribe el 26 de agosto de 2026, cuatro semanas después de que OpenAI sacara GPT-Transcribe, el 28 de julio. Los dos llegan partidos igual: un modelo para streaming continuo y otro para audio pregrabado. La coincidencia en el tiempo permite compararlos sin mezclar una generación con la siguiente.
Dos modelos, dos apuestas
Gemini 3.5 Transcribe sustituye a Chirp 3. Google insiste sobre todo en la velocidad: un 70% menos de tiempo hasta la transcripción final, además de mejor precisión. No es un endpoint genérico, son dos identificadores distintos. gemini-3.5-transcribe-live atiende streaming continuo con latencia por debajo del segundo a través de la Live API. gemini-3.5-transcribe se ocupa de audio pregrabado, reuniones y registros de llamadas, por la Interactions API.
Las cifras que cita Google, medidas por Artificial Analysis: 4,0% de tasa de error por palabra en streaming y 2,6% sin streaming. En el benchmark multilingüe FLEURS, 5,50% y 5,04%. Son pruebas distintas y no conviene mezclar los cuatro números en una misma tabla. El modelo de pregrabado trae diarización incorporada, fiable hasta tres hablantes y con más en fase experimental, y marcas de tiempo a nivel de palabra sin necesidad de un modelo aparte. Cubre más de 85 idiomas, admite vocabulario personalizado y puede delegar tareas posteriores a otros modelos de Gemini mediante function calling, de momento en la app de Gemini en macOS.
OpenAI venía de Whisper, luego de gpt-4o-transcribe en marzo de 2025, y ahora coloca GPT-Transcribe por delante de whisper-1 y de los gpt-4o-transcribe para transcribir voz grabada en su idioma original. También tiene hermano en streaming, gpt-live-transcribe. Sus números, sobre su propio benchmark contra Common Voice en 22 idiomas: el WER de whisper-1 baja del 40,37% al 19,27%, más o menos la mitad, y el coste por minuto cae un 25%. Los precios son 0,0045 dólares por minuto de transcripción de archivo y 0,017 dólares por minuto de audio de sesión en streaming. Acepta pistas de palabras clave y de idioma para términos de dominio y cambios de lengua, y devuelve qué idiomas ha detectado.
La diferencia que conviene decir en voz alta: GPT-Transcribe a secas no hace diarización ni marcas de tiempo por palabra. Para lo primero hay que ir a gpt-4o-transcribe-diarize; para lo segundo, al viejo whisper-1.
Qué cambia al integrarlo
En Gemini la diarización sale sin paso extra. Se manda el audio en bytes junto a una instrucción en lenguaje natural y la respuesta ya distingue Speaker 1, Speaker 2 y Speaker 3 con sus marcas de tiempo, algo que un pipeline de analítica posterior al consumo puede tragarse tal cual.
El camino en OpenAI pasa por abrir un WebSocket persistente contra el endpoint de realtime con intención de transcripción y enviar el audio en fragmentos contra un búfer. El texto parcial aparece como eventos delta mientras el hablante sigue hablando, que es justo lo que necesita un sistema de subtitulado en vivo para no desincronizarse.
Ahí está la decisión práctica. Si el flujo necesita saber quién habló y cuándo, el modelo de Google evita mantener un segundo servicio en pie. Si lo que pesa es el coste por minuto y sacar subtítulos en tiempo real, el de OpenAI sale más barato de operar. Lo que no hay, en ninguno de los dos casos, es un modelo único que haga las dos cosas bien.


