Eleven v4 and Eleven v4 Turbo
Eleven v4 и Eleven v4 Turbo — модели синтеза речи с поддержкой нескольких дикторов, режиссурой эмоций и акустики в сценарии, клонированием голоса и двунаправленной потоковой передачей с низкой задержкой на 90+ языках.
Eleven v4 и Eleven v4 Turbo — модели синтеза речи с поддержкой нескольких дикторов, режиссурой эмоций и акустики в сценарии, клонированием голоса и двунаправленной потоковой передачей с низкой задержкой на 90+ языках.
Назначение продукта и его официальное позиционирование
Eleven v4 и Eleven v4 Turbo — это модели синтетической речи, разработанные ElevenLabs для генерации выразительного аудио с несколькими дикторами на более чем 90 языках. Построенная на архитектуре, оценивающей контекст диалога и идентичность диктора, модель учитывает внутритекстовые теги для эмоциональных интонаций и интегрированных звуковых эффектов.
Релиз включает Eleven v4 Turbo — оптимизированный вариант, созданный для приложений реального времени и конвейеров диалоговых агентов. Он поддерживает двунаправленную потоковую передачу, возвращая синтезированное аудио прямо во время поступления текста из языковой модели с медианной задержкой инференса около 100 миллисекунд.
Сценарии, подтверждённые официальными источниками
Создатели контента могут генерировать полноценные аудиокниги и голосовые проекты, используя сшивание контекста для поддержания единого темпа и стабильности голоса в объемных сценариях.
Разработчики могут интегрировать Eleven v4 Turbo в контуры голосовых агентов для достижения минимального времени отклика благодаря двунаправленной потоковой передаче.
Авторы могут создавать сценарии с несколькими отдельными голосами персонажей и встроенными звуковыми эффектами для игр, подкастов и видеопроизводства.
В Eleven v4 представлены элементы управления на уровне сценария, позволяющие авторам задавать эмоциональный тон и вставлять звуки окружения прямо в текст. Пользователи могут добавлять такие теги, как шепот, смех или физические звуковые эффекты, непосредственно в реплики диалога, и модель интерпретирует их с учетом контекста.
Для поддержания единообразия в сложных проектах сшивание контекста сохраняет подачу диктора и темп на протяжении длинных сценариев, а повторная генерация голоса обеспечивает стабильность звучания без отклонений между дублями.
Eleven v4 Turbo разработана для интерактивных диалоговых систем и работает с заявленной медианной задержкой инференса около 100 миллисекунд и медианным временем до начала речи около 150 миллисекунд.
Модель поддерживает двунаправленную потоковую передачу, позволяя передавать текст, инкрементально генерируемый внешней большой языковой моделью, в то время как аудио возвращается в потоке еще до завершения всей фразы.
Проверки на собственных материалах и рабочих процессах
Какие источники и когда были проверены
Ответы на основе карточки продукта с проверенными источниками
Eleven v4 создана для выразительной эмоциональной речи и сшивания контекста в длинных сценариях, тогда как Eleven v4 Turbo оптимизирована для приложений реального времени и диалоговых агентов, обеспечивая медианную задержку инференса около 100 мс и время до начала речи около 150 мс.
Eleven v4 поддерживает синтез речи на более чем 90 языках, включая естественную генерацию с нативным произношением для таких языков, как японский, испанский и португальский.
Да, Eleven v4 поддерживает мгновенное клонирование голоса по десятисекундному аудиофрагменту, а также Professional Voice Clones, которые передают эмоциональный диапазон модели на всех поддерживаемых языках.
Пользователи могут вставлять теги режиссуры в скобках (смех, шепот, звуковые эффекты) прямо в сценарий, а словарь произношения позволяет настраивать пользовательскую фонетическую транскрипцию и IPA для отдельных слов и имен.
Да, к Eleven v4 и Eleven v4 Turbo можно обращаться через эндпоинты REST API, потоковые эндпоинты и официальные SDK для Python и TypeScript, переключаясь между ними с помощью идентификаторов моделей.