Gemini 3.5 Transcribe
Gemini 3.5 Transcribe 是一款专为精确、实时转录设计的语音转文字模型,能够处理复杂的音频环境、填充词以及多发言人归属识别。
Gemini 3.5 Transcribe 是一款专为精确、实时转录设计的语音转文字模型,能够处理复杂的音频环境、填充词以及多发言人归属识别。
产品用途与官方定位
Gemini 3.5 Transcribe 是一款智能语音转文字模型,旨在将原始音频转换为经过润色和格式化的文本,能有效处理背景噪音、专业术语和自然语言模式。
该模型通过实时流式传输和预录制音频处理 API 为开发者提供支持,并集成到各种 Google 界面中,以提供上下文感知的转录和语音命令功能。
有官方来源支持的使用场景
开发者利用 Live API 构建高性能语音代理和实时字幕工具,为用户提供流畅的交互体验。
机构处理会议录音和通话日志,生成带有发言人归属和时间戳的转录文本,以便进行后续审计。
与之前的模型相比,Gemini 3.5 Transcribe 在延迟和准确率方面有了显著提升。它经过优化,能够理解意图并识别自定义词汇,在各种复杂环境中均能保持高性能表现。
用自己的素材和工作流完成验证
核对了哪些信息以及核对时间
基于已核对产品资料的回答
该模型既支持用于交互式语音应用的实时连续流式传输,也支持处理会议记录和通话日志等预录制音频文件,能够灵活满足开发者在不同业务场景下的转录需求。
Gemini 3.5 Transcribe 具备智能转录功能,可自动识别并移除“嗯”、“啊”等填充词,同时清理自我纠正的内容,使最终文本更加简洁易读。
可以,该模型为预录制音频提供多达三人的多发言人识别功能,并为每个归属的发言内容提供字级时间戳,方便用户快速定位对话。
该模型提供全球语言支持,能够自动检测并转录超过 85 种语言,包括各种地区口音和方言,确保在全球范围内的高可用性。
开发者可以通过 Google AI Studio 中的 Gemini API、Gemini Enterprise Agent Platform 以及 Google Antigravity 以公开预览版的形式访问该模型。