Eleven v4 and Eleven v4 Turbo
Eleven v4およびEleven v4 Turboは、90以上の言語に対応し、複数話者の音声生成、スクリプト内での音響・感情指示、音声クローニング、低遅延双方向ストリーミングを備えた音声合成モデルです。
Eleven v4およびEleven v4 Turboは、90以上の言語に対応し、複数話者の音声生成、スクリプト内での音響・感情指示、音声クローニング、低遅延双方向ストリーミングを備えた音声合成モデルです。
製品の機能と公式な位置づけ
Eleven v4およびEleven v4 Turboは、ElevenLabsが開発した音声合成モデルであり、90以上の言語で表情豊かな複数話者音声を生成します。対話の文脈と話者特性を評価するアーキテクチャ上に構築されており、テキスト内の指示タグに従って感情の抑揚や統合された効果音を表現します。
本リリースには、リアルタイムアプリケーションや会話型エージェントパイプライン向けに最適化されたモデルであるEleven v4 Turboが含まれています。双方向ストリーミングをサポートし、上位の大規模言語モデルからテキストを受信しながら、推論遅延の中央値約100ミリ秒で合成音声をストリーミング再生します。
公式情報で確認できる活用例
プロデューサーはコンテキストスティッチングを活用し、長大な原稿全体で均一なペースと話者の一貫性を維持しながら、完全なオーディオブックや音声作品を生成できます。
開発者はEleven v4 Turboを音声エージェントのループに組み込み、双方向ストリーミングによって低遅延の応答時間を実現できます。
クリエイターは、ゲーム、ポッドキャスト、映像制作用に、複数の異なるキャラクター音声とインライン効果音を含むスクリプトを作成できます。
Eleven v4は、クリエイターが感情のトーンを指定し、環境音をテキスト内に直接挿入できるスクリプトレベルの制御機能を導入しています。ユーザーは囁き声、笑い声、物理的な効果音などのタグを会話文内にインラインで配置でき、モデルがそれらを文脈に応じて解釈します。
複雑な制作全体で一貫性を保つため、コンテキストスティッチングによって長文スクリプトでも話者の話し方やペースが維持され、音声再生成機能によりテイク間での声質のブレを防ぎながら安定性を確保します。
Eleven v4 Turboは対話型システム向けに設計されており、報告によると推論遅延の中央値は約100ミリ秒、発話開始までの時間の中央値は約150ミリ秒で動作します。
このモデルは双方向ストリーミングに対応しており、外部の大規模言語モデルによって逐次生成されるテキストを受け取りながら、文全体が完成する前に音声のストリーミング返却を開始できます。
自分の素材とワークフローで確認したい項目
確認した情報源とその日時
情報源を確認した製品情報に基づく回答
Eleven v4は感情豊かな音声合成やスクリプト全体の長文コンテキストスティッチング向けに設計されているのに対し、Eleven v4 Turboはリアルタイムアプリケーションや会話型エージェント向けに最適化されており、推論遅延の中央値約100ミリ秒、発話開始までの時間の中央値約150ミリ秒を提供します。
Eleven v4は90以上の言語での音声合成に対応しており、日本語、スペイン語、ポルトガル語などの言語において、ネイティブアクセントによる自然で流暢な音声生成が可能です。
はい、Eleven v4は10秒の音声から作成できるインスタント音声クローニングと、サポートされているすべての言語でモデルの感情表現の幅を再現可能なプロフェッショナルボイスクローンの両方に対応しています。
笑い声、囁き、効果音などの角括弧付き指示タグをスクリプト内に直接挿入できるほか、発音辞書機能を使用して特定の単語や人名に対するカスタムの表音表記や国際音声記号(IPA)表現を定義することができます。
はい、Eleven v4およびEleven v4 TurboはREST APIエンドポイント、ストリーミングエンドポイント、ならびにPythonおよびTypeScript向けの公式SDKから利用可能であり、専用のモデル識別子を指定して切り替えることができます。