Gemini 3.5 Transcribe
Gemini 3.5 Transcribe es un modelo de voz a texto diseñado para una transcripción precisa en tiempo real que gestiona entornos de audio complejos, muletillas y la atribución de varios interlocutores.
Gemini 3.5 Transcribe es un modelo de voz a texto diseñado para una transcripción precisa en tiempo real que gestiona entornos de audio complejos, muletillas y la atribución de varios interlocutores.
Qué hace el producto y cómo se presenta oficialmente
Gemini 3.5 Transcribe es un modelo inteligente de voz a texto diseñado para convertir audio sin procesar en texto pulido y con formato. Está creado para gestionar eficazmente el ruido de fondo, la jerga especializada y los patrones de habla naturales.
El modelo ayuda a los desarrolladores mediante API de procesamiento de audio grabado previamente y streaming en tiempo real. Se integra en varias superficies de Google para ofrecer transcripción contextual y funciones de comandos de voz.
Casos de uso respaldados por fuentes oficiales
Los desarrolladores utilizan la Live API para crear agentes de voz de alto rendimiento y herramientas de subtitulado en tiempo real.
Las organizaciones procesan reuniones grabadas y registros de llamadas para generar transcripciones con atribución de interlocutores y marcas de tiempo.
Gemini 3.5 Transcribe ofrece mejoras significativas en latencia y precisión en comparación con modelos anteriores. Está optimizado para comprender la intención y reconocer vocabulario personalizado, lo que permite un alto rendimiento en diversos entornos.
Comprobaciones con tus propios materiales y flujo de trabajo
Qué fuentes se revisaron y cuándo
Respuestas basadas en el registro de producto con fuentes verificadas
El modelo admite tanto el streaming continuo en tiempo real para aplicaciones de voz interactivas como el procesamiento de archivos de audio grabados previamente, como reuniones y registros de llamadas.
Gemini 3.5 Transcribe cuenta con funciones de transcripción inteligente que identifican y eliminan automáticamente muletillas como 'eh' o 'mmm', además de limpiar las autocorrecciones.
Sí, el modelo ofrece identificación de hasta tres interlocutores en audio grabado previamente, incluyendo marcas de tiempo a nivel de palabra para cada atribución.
El modelo cuenta con soporte de idiomas global, siendo capaz de detectar y transcribir automáticamente más de 85 idiomas, incluidos varios acentos regionales y dialectos.
Los desarrolladores pueden acceder al modelo en vista previa pública a través de la API de Gemini en Google AI Studio, Gemini Enterprise Agent Platform y Google Antigravity.