Gemini 3.8 & 3.8 Live Extended Thinking favicon

Gemini 3.8 & 3.8 Live Extended Thinking

Gemini 3.8 Liveおよび3.8 Live Extended Thinkingは、同時並行推論、バックグラウンドでのツール呼び出し、インタラクティブな音声ワークフロー向けに設計された、リアルタイム音声・マルチモーダル対話モデルです。

チャットボット同時音声対話およびマルチステップのバックグラウンド推論97言語にわたる自動識別と対話中の言語切り替えライブ対話支援のための視覚的コンテキスト処理非同期バックグラウンドツール実行およびAPI連携
Gemini 3.8 & 3.8 Live Extended Thinking product interface screenshot
推定月間訪問数
880万
データ期間:
AIToolly 掲載日

Gemini 3.8 & 3.8 Live Extended Thinkingとは?製品概要

製品の機能と公式な位置づけ

Gemini 3.8 LiveとGemini 3.8 Live Extended Thinkingは、ほぼリアルタイムの音声対話、視覚的グラウンディング、マルチステップの推論を目的に設計された対話モデルです。

Gemini 3.8 Liveは97言語の自動言語切り替えを備えたスケーラブルな会話インテリジェンスに特化しており、3.8 Live Extended Thinkingは並列推論、迅速な対話応答キュー、継続的なバックグラウンド進捗ナレーションを提供します。

Gemini 3.8 & 3.8 Live Extended Thinkingで何ができますか?

公式情報で確認できる活用例

リアルタイムの従業員オンボーディング

リアルタイムの視覚的コンテキストを活用して質問に回答することで、従業員のオンボーディングセッションを動的に案内します。

非同期予約連携

進行中の音声対話を中断することなく、マルチステップの予約処理を進め、バックグラウンドでの関数呼び出しを実行します。

スケッチからの視覚的コード生成

手描きの視覚的スケッチと音声指示を、実際に動作するReactコンポーネントへと変換します。

並列推論とバックグラウンドでのツール実行

Gemini 3.8 Live Extended Thinkingは、推論と発話を同時に行うことで、音声ワークフローにおける対話の中断を解消します。複雑なリクエストを処理する際に対話を一時停止するのではなく、口頭での相槌や進捗状況のナレーションといった会話の合図を挟み込みます。

バックグラウンド実行機能により、両モデルはAPI呼び出し、外部ツールの実行、マルチステップアクションを非同期で処理できます。基盤となるバックグラウンドタスクが完了するまでの間も、音声対話が途切れることなく継続します。

  • 相槌などの初期の発話キューを利用して、受信したリクエストを自然に確認
  • マルチステップの処理がバックグラウンドで実行されている間、リアルタイムで進捗状況をナレーション
  • 外部ツールの実行やAPI呼び出し中も、中断のない音声会話を維持

Gemini 3.8 & 3.8 Live Extended Thinkingを選ぶ前に確認すること

自分の素材とワークフローで確認したい項目

  • 必要な対話言語が、自動検知される97のサポート言語に含まれているか検証してください。
  • 組織がGemini Enterprise展開のためのプライベートプレビュープログラムへのアクセス権限を有しているか確認してください。
  • 対象となるワークフローが、3.8 Liveによる標準的なライブ会話を求めているのか、3.8 Live Extended Thinkingによる同時マルチステップ推論を求めているのか確認してください。

Gemini 3.8 & 3.8 Live Extended Thinkingの情報源と確認日

確認した情報源とその日時

最終確認日
カテゴリー
チャットボット

Gemini 3.8 & 3.8 Live Extended Thinkingのよくある質問

情報源を確認した製品情報に基づく回答

Gemini 3.8 Live Extended Thinkingは通話中の複雑なタスクをどのように処理しますか?

推論と発話を同時に行い、自然な口頭での相槌やリアルタイムの進捗ナレーションを活用することで、複数ステップのタスクを実行しながらも会話が途切れないように維持します。

これらのモデルはライブ会話中に何言語をサポートしていますか?

モデルは手動で設定を変更することなく、会話の途中でサポートされている97の言語を自動的に検知してスムーズに切り替えることができます。

生成された音声が人工知能による出力であることはどのように検証されますか?

モデルによって生成されたすべての音声出力には、人間の耳には知覚できないSynthID電子透かしが埋め込まれており、AI生成コンテンツとして識別可能な状態が保たれます。

開発者はこれらの音声モデルにどこからアクセスできますか?

開発者はGemini APIやGoogle AI Studioを通じて両モデルにアクセスできるほか、サポートされているパートナーのストリーミングプラットフォーム経由でも利用できます。

Gemini 3.8 Liveは音声とともに視覚コンテキストを処理できますか?

はい、Gemini 3.8 Liveは視覚入力をほぼリアルタイムで処理できるため、視覚的なコンテキストに基づいて会話をグラウンディングし、質問に回答することが可能です。

同じカテゴリーに最近追加されたツールをチェックできます。