Gemini 3.5 Transcribe
Gemini 3.5 Transcribeは、複雑な音声環境、フィラー、複数話者の特定に対応し、高精度なリアルタイム文字起こしを実現するために設計された音声テキスト変換モデルです。
Gemini 3.5 Transcribeは、複雑な音声環境、フィラー、複数話者の特定に対応し、高精度なリアルタイム文字起こしを実現するために設計された音声テキスト変換モデルです。
製品の機能と公式な位置づけ
Gemini 3.5 Transcribeは、生の音声を推敲および整形されたテキストに変換するために構築された、インテリジェントな音声テキスト変換モデルです。背景ノイズ、専門用語、自然な話し方のパターンを効果的に処理するように設計されています。
このモデルは、リアルタイムストリーミングおよび録音済み音声処理APIを通じて開発者をサポートします。また、文脈を考慮した文字起こしや音声コマンド機能を提供するために、さまざまなGoogleのプラットフォームに統合されています。
公式情報で確認できる活用例
開発者はLive APIを使用して、高性能な音声エージェントやリアルタイムのキャプション作成ツールを構築できます。
組織は録音された会議や通話ログを処理し、話者の特定とタイムスタンプが含まれる文字起こしデータを生成できます。
Gemini 3.5 Transcribeは、以前のモデルと比較してレイテンシと精度が大幅に向上しています。意図の理解とカスタム語彙の認識に最適化されており、多様な環境で高いパフォーマンスを発揮します。
自分の素材とワークフローで確認したい項目
確認した情報源とその日時
情報源を確認した製品情報に基づく回答
このモデルは、対話型音声アプリケーション向けのリアルタイムの連続ストリーミングと、会議や通話ログなどの録音済み音声ファイルの両方の処理をサポートしています。
Gemini 3.5 Transcribeはスマートな文字起こし機能を備えており、「えー」や「あのー」といったフィラーを自動的に特定して削除し、言い直しを整理します。
はい、録音済み音声において最大3人までの複数話者識別が可能であり、各発言に対して単語レベルのタイムスタンプが付与されます。
このモデルはグローバルな言語サポートを備えており、さまざまな地域のアクセントや方言を含む85以上の言語を自動的に検出して文字起こしすることができます。
開発者は、Google AI StudioのGemini API、Gemini Enterprise Agent Platform、およびGoogle Antigravityを通じて、パブリックプレビュー版にアクセスできます。