Skriptregie und akustische Steuerung
Eleven v4 führt Steuerelemente auf Skriptebene ein, mit denen Kreative den emotionalen Ton steuern und Umgebungsaudio direkt im Text einfügen können. Benutzer können Tags wie Flüstern, Lachen oder physische Soundeffekte direkt in Dialogzeilen platzieren, die das Modell kontextbezogen interpretiert.
Um Konsistenz über komplexe Produktionen hinweg sicherzustellen, bewahrt Context Stitching die Vortragsweise und das Sprechtempo über längere Skripte, während die Stimmregenerierung stimmliche Stabilität ohne Abweichungen zwischen einzelnen Aufnahmen garantiert.
- Inline-Regie-Tags im Skript für ausdrucksstarke Darbietung und integrierte Soundeffekte
- Context Stitching zur Reduzierung hörbarer Schnittkanten bei Langform-Audiodateien
- Stimmregenerierung zur Gewährleistung stabiler Sprecheridentität über mehrere Versuche hinweg
- Unterstützung für Aussprachewörterbücher mittels Lautschrift- und IPA-Definitionen für Fachbegriffe und Eigennamen
Echtzeit-Streaming mit Eleven v4 Turbo
Eleven v4 Turbo wurde für interaktive Dialogsysteme entwickelt und arbeitet mit einer angegebenen medianen Inferenzlatenz von etwa 100 Millisekunden sowie einer medianen Zeit bis zur ersten Sprachausgabe von rund 150 Millisekunden.
Das Modell unterstützt bidirektionales Streaming, sodass schrittweise von einem externen großen Sprachmodell generierter Text übergeben werden kann, während Audio bereits zurückgestreamt wird, noch bevor der vollständige Satz abgeschlossen ist.
- Mediane Inferenzlatenz von etwa 100 ms und Zeit bis zur ersten Sprachausgabe von ca. 150 ms
- Bidirektionales Streaming für die direkte Einbindung in Schleifen dialogorientierter Sprachagenten
- Kompatibilität mit Professional Voice Clones zur Wahrung von Markenstimmen über Dialogrunden hinweg
- Mehrsprachige Unterstützung mit nativen Akzenten in Sprachen wie Japanisch, Spanisch und Portugiesisch