Gemini 3.5 Transcribe
Gemini 3.5 Transcribe — это модель преобразования речи в текст, созданная для точной транскрипции в реальном времени, которая эффективно обрабатывает сложную акустическую среду, слова-паразиты и атрибуцию нескольких говорящих.
Gemini 3.5 Transcribe — это модель преобразования речи в текст, созданная для точной транскрипции в реальном времени, которая эффективно обрабатывает сложную акустическую среду, слова-паразиты и атрибуцию нескольких говорящих.
Назначение продукта и его официальное позиционирование
Gemini 3.5 Transcribe — это интеллектуальная модель преобразования речи в текст, разработанная для преобразования необработанного аудио в качественный, отформатированный текст. Она спроектирована для эффективной работы с фоновым шумом, специализированным жаргоном и естественными речевыми паттернами.
Модель поддерживает разработчиков через API для потоковой передачи в реальном времени и обработки записей. Она интегрируется в различные сервисы Google, обеспечивая контекстно-зависимую транскрипцию и возможности голосового управления.
Сценарии, подтверждённые официальными источниками
Разработчики используют Live API для создания высокопроизводительных голосовых агентов и инструментов создания субтитров в реальном времени.
Организации обрабатывают записи встреч и журналы вызовов для создания стенограмм с указанием говорящих и временных меток.
Gemini 3.5 Transcribe предлагает значительные улучшения в задержке и точности по сравнению с предыдущими моделями. Она оптимизирована для понимания намерений и распознавания пользовательского словаря, обеспечивая высокую производительность в различных условиях.
Проверки на собственных материалах и рабочих процессах
Какие источники и когда были проверены
Ответы на основе карточки продукта с проверенными источниками
Модель поддерживает как непрерывную потоковую передачу в реальном времени для интерактивных голосовых приложений, так и обработку предварительно записанных аудиофайлов, таких как записи встреч и журналы вызовов.
Gemini 3.5 Transcribe обладает функциями умной транскрипции, которые автоматически идентифицируют и удаляют слова-паразиты, такие как «эм» и «гм», одновременно исправляя оговорки и повторы.
Да, модель обеспечивает идентификацию до трех говорящих в предварительно записанном аудио, включая временные метки на уровне слов для каждой реплики, что упрощает анализ диалогов.
Модель имеет глобальную языковую поддержку и способна автоматически определять и транскрибировать более 85 языков, включая различные региональные акценты и диалекты по всему миру.
Разработчики могут получить доступ к модели в режиме предварительного просмотра через Gemini API в Google AI Studio, Gemini Enterprise Agent Platform и Google Antigravity.