Eleven v4 and Eleven v4 Turbo
Eleven v4 与 Eleven v4 Turbo 是支持 90 多种语言的语音合成模型,具备多说话人生成、剧本内嵌声学与情感指引、声音克隆以及低延迟双向流式传输等核心功能。
Eleven v4 与 Eleven v4 Turbo 是支持 90 多种语言的语音合成模型,具备多说话人生成、剧本内嵌声学与情感指引、声音克隆以及低延迟双向流式传输等核心功能。
产品用途与官方定位
Eleven v4 与 Eleven v4 Turbo 是由 ElevenLabs 开发的合成语音模型,旨在生成支持 90 多种语言且富有表现力的多角色语音音频。该模型建立在评估对话语境和说话人身份的架构之上,能够精准响应文本内嵌的标签,实现情绪抑扬顿挫的语调变化并整合音效。
此次发布包含 Eleven v4 Turbo,这是一个专为实时应用和对话智能体管线设计的优化变体。它支持双向流式传输,在上游大语言模型持续输出文本流的同时返回合成音频,其中位推理延迟约为 100 毫秒。
有官方来源支持的使用场景
制作人员可利用上下文拼接技术生成完整的有声书和口述项目,在冗长的剧本中保持统一的节奏和说话人声音稳定性。
开发者可以将 Eleven v4 Turbo 集成到语音智能体处理链路中,通过双向流式传输实现低延迟响应。
创作者可以为游戏、播客和视频制作编写包含多个鲜明角色声音和内嵌音效的剧本。
Eleven v4 引入了剧本级控制功能,允许创作者直接在文本中指导情感基调并插入环境音效。用户可以在对话中内嵌放置耳语、笑声或肢体动作音效等标签,模型将根据上下文进行智能解析与呈现。
为了在复杂的制作中保持一致性,上下文拼接技术能够在长文本中维持说话人的表达方式与节奏,而语音重新生成功能则能在多次录制尝试中保持声音稳定性,避免声线漂移。
Eleven v4 Turbo 专为交互式对话系统打造,据报告其中位推理延迟约为 100 毫秒,首字发音中位时间约为 150 毫秒。
该模型支持双向流式传输,允许在外部大语言模型增量生成文本的同时提交数据,并在完整句子最终成型之前就流式回传生成的音频。
用自己的素材和工作流完成验证
核对了哪些信息以及核对时间
基于已核对产品资料的回答
Eleven v4 专为富有情感表现力的语音和剧本长文本上下文拼接而设计;而 Eleven v4 Turbo 则针对实时应用和对话智能体进行了优化,其中位推理延迟约为 100 毫秒,首字发音中位时间约为 150 毫秒。
Eleven v4 支持 90 多种语言的语音合成,包括对日语、西班牙语和葡萄牙语等语言的原生口音流利生成。
是的,Eleven v4 支持使用十秒参考音频进行即时声音克隆,同时也支持专业声音克隆(Professional Voice Cloning),可在支持的语言中承载模型的全部情感表现力。
用户可以直接在剧本中插入用括号包裹的指引标签(例如笑声、耳语和音效),同时发音词典允许为特定单词和名称自定义发音拼写或国际音标(IPA)定义。
是的,Eleven v4 和 Eleven v4 Turbo 可以通过 REST API 端点、流式端点以及 Python 和 TypeScript 官方 SDK 进行访问,用户可通过指定模型标识符进行切换。