Gemini 3.8 & 3.8 Live Extended Thinking
Gemini 3.8 Liveおよび3.8 Live Extended Thinkingは、同時並行推論、バックグラウンドでのツール呼び出し、インタラクティブな音声ワークフロー向けに設計された、リアルタイム音声・マルチモーダル対話モデルです。
Gemini 3.8 Liveおよび3.8 Live Extended Thinkingは、同時並行推論、バックグラウンドでのツール呼び出し、インタラクティブな音声ワークフロー向けに設計された、リアルタイム音声・マルチモーダル対話モデルです。
製品の機能と公式な位置づけ
Gemini 3.8 LiveとGemini 3.8 Live Extended Thinkingは、ほぼリアルタイムの音声対話、視覚的グラウンディング、マルチステップの推論を目的に設計された対話モデルです。
Gemini 3.8 Liveは97言語の自動言語切り替えを備えたスケーラブルな会話インテリジェンスに特化しており、3.8 Live Extended Thinkingは並列推論、迅速な対話応答キュー、継続的なバックグラウンド進捗ナレーションを提供します。
公式情報で確認できる活用例
リアルタイムの視覚的コンテキストを活用して質問に回答することで、従業員のオンボーディングセッションを動的に案内します。
進行中の音声対話を中断することなく、マルチステップの予約処理を進め、バックグラウンドでの関数呼び出しを実行します。
手描きの視覚的スケッチと音声指示を、実際に動作するReactコンポーネントへと変換します。
Gemini 3.8 Live Extended Thinkingは、推論と発話を同時に行うことで、音声ワークフローにおける対話の中断を解消します。複雑なリクエストを処理する際に対話を一時停止するのではなく、口頭での相槌や進捗状況のナレーションといった会話の合図を挟み込みます。
バックグラウンド実行機能により、両モデルはAPI呼び出し、外部ツールの実行、マルチステップアクションを非同期で処理できます。基盤となるバックグラウンドタスクが完了するまでの間も、音声対話が途切れることなく継続します。
自分の素材とワークフローで確認したい項目
確認した情報源とその日時
情報源を確認した製品情報に基づく回答
推論と発話を同時に行い、自然な口頭での相槌やリアルタイムの進捗ナレーションを活用することで、複数ステップのタスクを実行しながらも会話が途切れないように維持します。
モデルは手動で設定を変更することなく、会話の途中でサポートされている97の言語を自動的に検知してスムーズに切り替えることができます。
モデルによって生成されたすべての音声出力には、人間の耳には知覚できないSynthID電子透かしが埋め込まれており、AI生成コンテンツとして識別可能な状態が保たれます。
開発者はGemini APIやGoogle AI Studioを通じて両モデルにアクセスできるほか、サポートされているパートナーのストリーミングプラットフォーム経由でも利用できます。
はい、Gemini 3.8 Liveは視覚入力をほぼリアルタイムで処理できるため、視覚的なコンテキストに基づいて会話をグラウンディングし、質問に回答することが可能です。