Google presenta Gemini 3.5 Transcribe para transcripciones de voz más precisas

Google ha presentado Gemini 3.5 Transcribe, un modelo de voz a texto para transcripción en tiempo real y procesamiento de audio grabado, con limpieza de muletillas, vocabulario personalizado y soporte para más de 85 idiomas.

Modelos
Google presenta Gemini 3.5 Transcribe para transcripciones de voz más precisas

Google presentó el 26 de agosto de 2026 Gemini 3.5 Transcribe, su modelo de voz a texto diseñado para ofrecer transcripciones precisas e inteligentes en interacciones de voz. La compañía afirma que el sistema convierte directamente el audio sin procesar en texto exacto, corregido y con formato, incluso en situaciones con ruido de fondo, terminología compleja o interrupciones al hablar.

El modelo está pensado tanto para las funciones de voz de productos de Google como para que los desarrolladores construyan sus propias aplicaciones. La empresa señala que Gemini 3.5 Transcribe ya se utiliza en nuevas capacidades de voz de la aplicación Gemini y de Android, como Rambler, además de estar disponible para desarrolladores en Gemini API, Google AI Studio y Gemini Enterprise Agent Platform.

Gemini 3.5 Transcribe se ofrece mediante dos APIs. La primera permite transcripción continua y bidireccional en streaming, con una latencia inferior a un segundo, para aplicaciones de voz interactivas a través de Live API y el modelo gemini-3.5-transcribe-live. La segunda procesa audio pregrabado, como reuniones, llamadas y registros, e incorpora identificación de hablantes y marcas de tiempo a nivel de palabra mediante Interactions API y gemini-3.5-transcribe.

Entre sus funciones se encuentra la llamada transcripción inteligente. El modelo puede gestionar autocorrecciones del hablante, como cambiar un día o una palabra durante la frase, eliminar muletillas y aplicar formato automáticamente. También reconoce vocabulario personalizado, lo que permite adaptar las transcripciones a términos especializados, grafías concretas y otros nombres propios proporcionados por el usuario.

Google afirma que el modelo detecta y transcribe automáticamente más de 85 idiomas, incluidos distintos acentos regionales y dialectos. En audio pregrabado puede atribuir las intervenciones y añadir marcas de tiempo para hasta tres hablantes, mientras que la compatibilidad con más de tres participantes continúa en fase experimental. También puede gestionar cambios de idioma durante una conversación y mantener la transcripción en streaming.

Según las mediciones de Artificial Analysis citadas por Google, Gemini 3.5 Transcribe alcanza una tasa media de error de palabras del 4,0% en escenarios de streaming y del 2,6% en los que no utilizan streaming. La compañía destaca su rendimiento en entornos reales y ruidosos, así como su capacidad para registrar entidades alfanuméricas como códigos postales e identificadores de pedidos.

En el benchmark FLEURS, sobre un conjunto de idiomas y regiones, el modelo obtuvo una tasa de error de palabras del 5,50% en streaming y del 5,04% en escenarios no basados en streaming. Google también asegura que representa una mejora frente a su modelo anterior, Chirp 3, tanto en capacidades como en latencia. En concreto, el tiempo hasta la transcripción final se reduce un 70%, según las mediciones de Artificial Analysis.

Además de las APIs, Gemini 3.5 Transcribe se integra en varias superficies de Google. En Gboard para Android, la función Rambler transforma el habla en texto con formato, elimina muletillas y permite realizar correcciones, modificar errores ortográficos y cambiar el estilo de escritura mediante la voz. En Google Antigravity, el modelo puede utilizar, con permiso del usuario, el contexto de la pantalla y el historial del chat para mejorar la transcripción de nombres de archivos, documentos activos y pensamientos del agente.

En Google AI Studio, el modelo está disponible en el modo Build para crear aplicaciones mediante instrucciones de voz. En la aplicación Gemini para macOS, puede convertir el habla natural en texto formateado y ejecutar comandos de voz relacionados con el contexto de la pantalla. Google indica que estas funciones permiten resumir archivos locales, reutilizar texto entre aplicaciones o generar imágenes mediante llamadas a otros modelos Gemini. La compatibilidad con Chrome llegará próximamente para dictar texto en campos de la web, redactar respuestas y escribir instrucciones para Gemini.

Gemini 3.5 Transcribe está en vista previa pública para desarrolladores a través de Gemini API, Google AI Studio y Google Antigravity. Para empresas, se ofrece en vista previa pública mediante Gemini Enterprise Agent Platform y llegará próximamente a Gemini Enterprise for Customer Experience. Para el público general, está disponible en inglés en la aplicación Gemini para macOS y Rambler puede utilizarse en determinados países e idiomas en Android. Google también ha indicado que llegará próximamente a Chrome. La información procede de Google: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/.

Fuente: Google

Compartir

WhatsApp X Telegram Email