Eleven v4 and Eleven v4 Turbo favicon

Eleven v4 and Eleven v4 Turbo

Eleven v4およびEleven v4 Turboは、90以上の言語に対応し、複数話者の音声生成、スクリプト内での音響・感情指示、音声クローニング、低遅延双方向ストリーミングを備えた音声合成モデルです。

テキスト読み上げ効果音を統合した90以上の言語での複数話者音声生成ペース、感情、効果音に関するインラインタグの解釈表音表記および国際音声記号(IPA)定義による発音カスタマイズ会話型エージェントワークフロー向けの双方向ストリーミング
Eleven v4 and Eleven v4 Turbo product interface screenshot
推定月間訪問数
3360万
データ期間:
AIToolly 掲載日

Eleven v4 and Eleven v4 Turboとは?製品概要

製品の機能と公式な位置づけ

Eleven v4およびEleven v4 Turboは、ElevenLabsが開発した音声合成モデルであり、90以上の言語で表情豊かな複数話者音声を生成します。対話の文脈と話者特性を評価するアーキテクチャ上に構築されており、テキスト内の指示タグに従って感情の抑揚や統合された効果音を表現します。

本リリースには、リアルタイムアプリケーションや会話型エージェントパイプライン向けに最適化されたモデルであるEleven v4 Turboが含まれています。双方向ストリーミングをサポートし、上位の大規模言語モデルからテキストを受信しながら、推論遅延の中央値約100ミリ秒で合成音声をストリーミング再生します。

Eleven v4 and Eleven v4 Turboで何ができますか?

公式情報で確認できる活用例

長編オーディオブックとナレーション

プロデューサーはコンテキストスティッチングを活用し、長大な原稿全体で均一なペースと話者の一貫性を維持しながら、完全なオーディオブックや音声作品を生成できます。

リアルタイム会話型音声エージェント

開発者はEleven v4 Turboを音声エージェントのループに組み込み、双方向ストリーミングによって低遅延の応答時間を実現できます。

複数話者のオーディオドラマとメディア制作

クリエイターは、ゲーム、ポッドキャスト、映像制作用に、複数の異なるキャラクター音声とインライン効果音を含むスクリプトを作成できます。

スクリプトによる指示と音響制御

Eleven v4は、クリエイターが感情のトーンを指定し、環境音をテキスト内に直接挿入できるスクリプトレベルの制御機能を導入しています。ユーザーは囁き声、笑い声、物理的な効果音などのタグを会話文内にインラインで配置でき、モデルがそれらを文脈に応じて解釈します。

複雑な制作全体で一貫性を保つため、コンテキストスティッチングによって長文スクリプトでも話者の話し方やペースが維持され、音声再生成機能によりテイク間での声質のブレを防ぎながら安定性を確保します。

  • 表情豊かな音声表現と組み込み効果音のためのインラインスクリプト指示タグ
  • 長時間の音声全体で聞こえる継ぎ目を軽減するよう設計されたコンテキストスティッチング
  • 複数回の試行にわたって話者の一貫性を維持するよう設計された音声再生成機能
  • 専門用語や人名向けに表音表記やIPA定義を活用した発音辞書のサポート

Eleven v4 Turboによるリアルタイムストリーミング

Eleven v4 Turboは対話型システム向けに設計されており、報告によると推論遅延の中央値は約100ミリ秒、発話開始までの時間の中央値は約150ミリ秒で動作します。

このモデルは双方向ストリーミングに対応しており、外部の大規模言語モデルによって逐次生成されるテキストを受け取りながら、文全体が完成する前に音声のストリーミング返却を開始できます。

  • 推論遅延の中央値約100ミリ秒、発話開始までの時間の中央値約150ミリ秒
  • 会話型エージェントループに直接統合するための双方向ストリーミング
  • 対話のターンをまたいでブランドボイスを維持するプロフェッショナルボイスクローンとの互換性
  • 日本語、スペイン語、ポルトガル語などのネイティブアクセントを含む多言語対応

Eleven v4 and Eleven v4 Turboを選ぶ前に確認すること

自分の素材とワークフローで確認したい項目

  • 囁きや効果音など、必要な角括弧スクリプトタグが、選択した言語で想定通りの抑揚を誘発することを確認する。
  • Eleven v4 Turboを統合する際、推論遅延の中央値と発話開始までの時間がリアルタイム対話の基準を満たしているかを検証する。
  • 発音辞書の設定を見直し、専門用語や固有名詞が表音表記を使用して正確にマッピングされているか確認する。
  • 複数回の再生成や対話のターンにわたって、プロフェッショナルボイスクローンが話者の一貫性を維持しているかをチェックする。

Eleven v4 and Eleven v4 Turboの情報源と確認日

確認した情報源とその日時

最終確認日

Eleven v4 and Eleven v4 Turboのよくある質問

情報源を確認した製品情報に基づく回答

Eleven v4とEleven v4 Turboの違いは何ですか?

Eleven v4は感情豊かな音声合成やスクリプト全体の長文コンテキストスティッチング向けに設計されているのに対し、Eleven v4 Turboはリアルタイムアプリケーションや会話型エージェント向けに最適化されており、推論遅延の中央値約100ミリ秒、発話開始までの時間の中央値約150ミリ秒を提供します。

Eleven v4では何言語がサポートされていますか?

Eleven v4は90以上の言語での音声合成に対応しており、日本語、スペイン語、ポルトガル語などの言語において、ネイティブアクセントによる自然で流暢な音声生成が可能です。

Eleven v4は音声クローニングに対応していますか?

はい、Eleven v4は10秒の音声から作成できるインスタント音声クローニングと、サポートされているすべての言語でモデルの感情表現の幅を再現可能なプロフェッショナルボイスクローンの両方に対応しています。

Eleven v4で話し方、効果音、発音を制御するにはどうすればよいですか?

笑い声、囁き、効果音などの角括弧付き指示タグをスクリプト内に直接挿入できるほか、発音辞書機能を使用して特定の単語や人名に対するカスタムの表音表記や国際音声記号(IPA)表現を定義することができます。

Eleven v4はAPI経由で利用できますか?

はい、Eleven v4およびEleven v4 TurboはREST APIエンドポイント、ストリーミングエンドポイント、ならびにPythonおよびTypeScript向けの公式SDKから利用可能であり、専用のモデル識別子を指定して切り替えることができます。

同じカテゴリーに最近追加されたツールをチェックできます。