Google presenta Gemini 3.5 Transcribe para transcripción de voz en tiempo real

Google DeepMind presenta Gemini 3.5 Transcribe, un modelo de voz que transcribe audio en más de 85 idiomas, elimina muletillas y reconoce vocabulario personalizado para aplicaciones y agentes de voz.

Modelos
Google presenta Gemini 3.5 Transcribe para transcripción de voz en tiempo real

Google DeepMind presentó el 26 de agosto de 2026 Gemini 3.5 Transcribe, su modelo de conversión de voz a texto diseñado para generar transcripciones precisas, formateadas e inteligentes a partir de audio sin procesar. El sistema está orientado a interacciones de voz y puede gestionar ruido de fondo, terminología especializada y autocorrecciones durante el habla.

El modelo está disponible para desarrolladores mediante dos APIs. La Live API, con el modelo gemini-3.5-transcribe-live, ofrece streaming bidireccional continuo y latencia inferior a un segundo. La Interactions API, con gemini-3.5-transcribe, procesa audio pregrabado, reuniones y registros de llamadas, con atribución de hablantes y marcas de tiempo por palabra.

Gemini 3.5 Transcribe elimina palabras de relleno, corrige el formato del texto y reconoce vocabulario personalizado. También puede detectar y transcribir automáticamente más de 85 idiomas, gestionar cambios de idioma en directo e identificar hasta tres hablantes en audio pregrabado; la compatibilidad con más de tres es experimental.

Según mediciones de Artificial Analysis citadas por Google, el modelo alcanza una tasa media de error de palabras del 4,0 % en casos de streaming y del 2,6 % en usos no simultáneos. Frente a Chirp 3, el tiempo hasta la transcripción final mejora un 70 %. En el benchmark FLEURS, registra una tasa de error del 5,50 % en streaming y del 5,04 % en escenarios no simultáneos.

Google indica que Gemini 3.5 Transcribe ya se utiliza en funciones como Rambler, en Gboard para Android y en la aplicación Gemini para macOS. También se integra en Google AI Studio, Google Antigravity y, próximamente, Chrome, donde permitirá dictar texto en campos web. En la aplicación para macOS puede activar comandos de voz para resumir archivos locales, reutilizar texto y generar imágenes mediante otros modelos Gemini.

Para desarrolladores, Gemini 3.5 Transcribe está en vista previa pública en Gemini API mediante Google AI Studio y Google Antigravity. Las empresas pueden probarlo en Gemini Enterprise Agent Platform, mientras que su llegada a Gemini Enterprise for Customer Experience está prevista próximamente. Google también señala que estará disponible para todos en la aplicación Gemini para macOS en inglés y en Rambler para Android en determinados países e idiomas.

Fuente: Google DeepMind.

Compartir

WhatsApp X Telegram Email