Google presenta Gemini 3.5 Transcribe para convertir voz en texto con IA
Google ha anunciado Gemini 3.5 Transcribe, un modelo de voz a texto que elimina muletillas, incorpora correcciones y adapta transcripciones a vocabulario especializado. Ya está disponible en algunos productos y llegará pronto a Chrome.
El 26 de agosto de 2026, Google anunció Gemini 3.5 Transcribe, un modelo de inteligencia artificial diseñado para convertir voz en texto y entregar una transcripción más pulida. La tecnología ya impulsa la función Rambler de Gboard en los Pixel 11 y comenzará a incorporarse a más productos del ecosistema de Google, incluido el navegador Chrome.
Gemini 3.5 Transcribe está orientado a simplificar la entrada de voz. El modelo puede eliminar interjecciones y muletillas como “um” y “uh”, además de modificar el texto cuando el usuario se corrige mientras habla. También puede recurrir a un vocabulario personalizado para reconocer términos especializados, una capacidad pensada para textos que incluyen jerga concreta.
Según Google, el nuevo modelo es aproximadamente un 70 por ciento más rápido que su sistema anterior de conversión de voz a texto, conocido como Chirp 3, al medir el tiempo desde la entrada de voz hasta la transcripción final. La tasa de error en conversaciones en directo se sitúa en el 5,5 por ciento, frente al 7,32 por ciento registrado por Chirp 3 en las mediciones de la compañía.
La herramienta admite 85 idiomas y puede trabajar con audio pregrabado en el que participen hasta tres hablantes. Su objetivo no se limita a identificar las palabras pronunciadas: también intenta determinar la intención del usuario y limpiar tropiezos o correcciones para producir un texto más coherente.
Ese procesamiento introduce una limitación. Al retirar muletillas y reformular partes de la transcripción, Gemini 3.5 Transcribe puede cambiar técnicamente la redacción original del hablante. Ars Technica señala que el resultado puede ser útil en bloques de texto cortos, pero advierte de que esa modificación no resulta adecuada para todas las situaciones en las que sea importante conservar exactamente lo dicho.
Gemini 3.5 Transcribe ya está disponible en Rambler, aunque esta función continúa limitada a los teléfonos Pixel 11. Google afirma que ampliará Rambler a “más dispositivos Gemini Intelligence” a lo largo de este año. Además, la entrada de voz de la aplicación Gemini para macOS comenzará a utilizar el nuevo modelo desde el 26 de agosto de 2026.
Los desarrolladores también pueden acceder a Gemini 3.5 Transcribe. Desde hoy, Antigravity incorpora el modelo con acceso al contexto de pantalla y al historial de chat, siempre con el permiso del usuario. AI Studio también lo ofrece en su modelo de creación, lo que permite generar aplicaciones mediante entrada de voz. Asimismo, el modelo está disponible a través de Gemini API.
Para quienes no utilicen todavía esos dispositivos o aplicaciones, el despliegue será progresivo. Google asegura que llevará la función de transcripción a Chrome “pronto”. Cuando esté disponible, los usuarios podrán introducir texto mediante la voz en cualquier campo de una página web, incluidos formularios, correos electrónicos, comentarios y conversaciones con chatbots de inteligencia artificial.
La información procede de Ars Technica: Google announces Gemini 3.5 Transcribe for AI-powered speech-to-text.
Fuente: Ars Technica