Gemini 3.5 Transcribe favicon

Gemini 3.5 Transcribe

Gemini 3.5 Transcribeは、複雑な音声環境、フィラー、複数話者の特定に対応し、高精度なリアルタイム文字起こしを実現するために設計された音声テキスト変換モデルです。

翻訳と書き起こしリアルタイムのストリーミング文字起こしタスク委譲のための関数呼び出しカスタム語彙への適応85以上の言語に対応した自動言語検出
Gemini 3.5 Transcribe product interface screenshot
推定月間訪問数
900万
データ期間:
AIToolly 掲載日

Gemini 3.5 Transcribeとは?製品概要

製品の機能と公式な位置づけ

Gemini 3.5 Transcribeは、生の音声を推敲および整形されたテキストに変換するために構築された、インテリジェントな音声テキスト変換モデルです。背景ノイズ、専門用語、自然な話し方のパターンを効果的に処理するように設計されています。

このモデルは、リアルタイムストリーミングおよび録音済み音声処理APIを通じて開発者をサポートします。また、文脈を考慮した文字起こしや音声コマンド機能を提供するために、さまざまなGoogleのプラットフォームに統合されています。

Gemini 3.5 Transcribeで何ができますか?

公式情報で確認できる活用例

音声駆動型インターフェース

開発者はLive APIを使用して、高性能な音声エージェントやリアルタイムのキャプション作成ツールを構築できます。

通話後の分析

組織は録音された会議や通話ログを処理し、話者の特定とタイムスタンプが含まれる文字起こしデータを生成できます。

文字起こしのパフォーマンスと精度

Gemini 3.5 Transcribeは、以前のモデルと比較してレイテンシと精度が大幅に向上しています。意図の理解とカスタム語彙の認識に最適化されており、多様な環境で高いパフォーマンスを発揮します。

  • ストリーミングで4.0%、非ストリーミングで2.6%の平均単語誤り率(WER)を達成しています。
  • 以前のChirp 3モデルと比較して、最終的な文字起こしまでの時間を70%短縮しました。
  • 自動検出と地域アクセントの処理により、85以上の言語をサポートしています。

Gemini 3.5 Transcribeを選ぶ前に確認すること

自分の素材とワークフローで確認したい項目

  • 統合環境が、ストリーミング用のLive APIまたは録音済みファイル用のInteractions APIのいずれか、必要なAPIをサポートしていることを確認してください。
  • モデルが専門用語や独自のスペルを正確に認識できるように、カスタム語彙の要件が定義されているかを確認してください。

Gemini 3.5 Transcribeの情報源と確認日

確認した情報源とその日時

最終確認日

Gemini 3.5 Transcribeのよくある質問

情報源を確認した製品情報に基づく回答

Gemini 3.5 Transcribeはどのような種類の音声を処理できますか?

このモデルは、対話型音声アプリケーション向けのリアルタイムの連続ストリーミングと、会議や通話ログなどの録音済み音声ファイルの両方の処理をサポートしています。

フィラー(言い淀み)や話し間違いはどのように処理されますか?

Gemini 3.5 Transcribeはスマートな文字起こし機能を備えており、「えー」や「あのー」といったフィラーを自動的に特定して削除し、言い直しを整理します。

録音内の異なる話者を識別することはできますか?

はい、録音済み音声において最大3人までの複数話者識別が可能であり、各発言に対して単語レベルのタイムスタンプが付与されます。

英語以外の言語もサポートしていますか?

このモデルはグローバルな言語サポートを備えており、さまざまな地域のアクセントや方言を含む85以上の言語を自動的に検出して文字起こしすることができます。

開発者はどのようにしてGemini 3.5 Transcribeにアクセスできますか?

開発者は、Google AI StudioのGemini API、Gemini Enterprise Agent Platform、およびGoogle Antigravityを通じて、パブリックプレビュー版にアクセスできます。

同じカテゴリーに最近追加されたツールをチェックできます。