Gemini 3.5 Transcribe favicon

Gemini 3.5 Transcribe

Gemini 3.5 Transcribe 是一款专为精确、实时转录设计的语音转文字模型,能够处理复杂的音频环境、填充词以及多发言人归属识别。

翻译及抄录实时流式转录用于任务委派的函数调用自定义词汇表适配支持超过 85 种语言的自动语言检测
Gemini 3.5 Transcribe product interface screenshot
预计月访问量
900万
数据月份:
收录于 AIToolly

Gemini 3.5 Transcribe 是什么?产品概览

产品用途与官方定位

Gemini 3.5 Transcribe 是一款智能语音转文字模型,旨在将原始音频转换为经过润色和格式化的文本,能有效处理背景噪音、专业术语和自然语言模式。

该模型通过实时流式传输和预录制音频处理 API 为开发者提供支持,并集成到各种 Google 界面中,以提供上下文感知的转录和语音命令功能。

Gemini 3.5 Transcribe 可以用来做什么?

有官方来源支持的使用场景

语音驱动界面

开发者利用 Live API 构建高性能语音代理和实时字幕工具,为用户提供流畅的交互体验。

通话后分析

机构处理会议录音和通话日志,生成带有发言人归属和时间戳的转录文本,以便进行后续审计。

转录性能与准确率

与之前的模型相比,Gemini 3.5 Transcribe 在延迟和准确率方面有了显著提升。它经过优化,能够理解意图并识别自定义词汇,在各种复杂环境中均能保持高性能表现。

  • 流式传输用例的平均词错率 (WER) 为 4.0%,非流式传输用例为 2.6%。
  • 与之前的 Chirp 3 模型相比,完成最终转录的时间缩短了 70%。
  • 支持超过 85 种语言,具备自动检测功能并能处理地区口音。

选择 Gemini 3.5 Transcribe 前需要测试什么

用自己的素材和工作流完成验证

  • 验证集成环境是否支持所需的 API,即用于流式传输的 Live API 或用于预录制文件的 Interactions API。
  • 检查是否已定义自定义词汇表要求,以确保模型能够准确识别专业术语或独特的拼写方式。

Gemini 3.5 Transcribe 来源与核对时间

核对了哪些信息以及核对时间

最后核对

Gemini 3.5 Transcribe 常见问题

基于已核对产品资料的回答

Gemini 3.5 Transcribe 可以处理哪些类型的音频?

该模型既支持用于交互式语音应用的实时连续流式传输,也支持处理会议记录和通话日志等预录制音频文件,能够灵活满足开发者在不同业务场景下的转录需求。

模型如何处理填充词和语音不流利的情况?

Gemini 3.5 Transcribe 具备智能转录功能,可自动识别并移除“嗯”、“啊”等填充词,同时清理自我纠正的内容,使最终文本更加简洁易读。

模型能否识别录音中的不同发言人?

可以,该模型为预录制音频提供多达三人的多发言人识别功能,并为每个归属的发言内容提供字级时间戳,方便用户快速定位对话。

Gemini 3.5 Transcribe 是否支持英语以外的语言?

该模型提供全球语言支持,能够自动检测并转录超过 85 种语言,包括各种地区口音和方言,确保在全球范围内的高可用性。

开发者如何访问 Gemini 3.5 Transcribe?

开发者可以通过 Google AI Studio 中的 Gemini API、Gemini Enterprise Agent Platform 以及 Google Antigravity 以公开预览版的形式访问该模型。

继续查看同一分类中近期收录的其他工具。