Aioga
AI资讯 / 行业动态
返回 AI资讯

ElevenLabs 发布最富表现力的 Eleven v4 及低延迟 Turbo 版

ElevenLabs:Blog(网页)Aioga 编辑团队2026-09-28T12:00:00.000Z热度 72

ElevenLabs 发布语音合成模型 Eleven v4 及低延迟变体 Eleven v4 Turbo。

行业动态ElevenLabs:Blog(网页)

今日 AI 情报摘要

ElevenLabs 发布语音合成模型 Eleven v4 及低延迟变体 Eleven v4 Turbo。

中文正文 · AI 翻译

strong]:tw-font-normal tw-text-gray-600"> 介绍 Eleven v4 认识 Eleven v4,我们迄今为止最具情感的模型。在 Creator+ 上可获得 3 倍积分,活动截止至 10 月 12 日

一行文字的表达效果会因说话方式而显著不同。“我需要你保持冷静”这句话应该因说话者不同而听起来不同,无论是医生温柔地对害怕的病人说,还是游戏中的角色在跳入战斗前对小队大喊。

今天我们推出 Eleven v4:/v4,这是我们迄今为止最具情感的文本转语音模型,以及其低延迟版本 Eleven v4 Turbo。

Eleven V4.

根据 Artificial Analysis 排名第一,并在盲测中约 75% 的听众在与竞争模型的正面对比中偏好 Eleven v4,这款模型旨在解读语气、节奏、情感、角色和上下文。它生成的语音可以听起来戏剧化、温柔、紧迫、滑稽或对话化,同时保持说话者的身份。更自然的多说话者动态让对话感觉更具响应性,而非像将独立台词拼接在一起。说话者会根据对话上下文作出反应,产生更自然的对白和角色互动。

Eleven v4 wins 65%–81% of blind head-to-head TTS preference tests.

Eleven v4 基于全新的架构,是我们最具情感的文本转语音:/text-to-speech 模型,被 Artificial Analysis 排名第一。Eleven v4 Turbo 将相同技术应用于低延迟场景,如智能助手。中位推理延迟约为 100 毫秒,它的响应速度比两人对话之间的平均停顿还快。

这两款模型都能生成富有情感的语音,而非机械化声音。基础音频保真度也全面提高,输出更干净、更自然。

早期的文本转语音模型只能朗读文字,而 Eleven v4 为语音提供了更加自然的情感深度。该模型可以解读预期的语气、朗读节奏、文字角色以及文本上下文,从而提供情感共鸣的语音。

用户还可以对输出进行细粒度控制,并可以用自然语言描述一行台词的表达方式。他们还可以添加关于如何说某些短语、表达何种情感,甚至加入声效的具体指令,使用内联标签如 [laughs]、[said angrily in French accent]、[light rain] 或 [phone buzzing]。Eleven v4 对这些音频标签和指令提示的遵循比之前的模型更准确,因此你描述的表达方式就是你得到的效果。这使得指导旁白、丰富角色或对话以及其他需要表达的地方更为容易。

ElevenLabs 开发者文档 /docs 涵盖了完整的标签语法以及如何通过 API 应用这些标签。对国际音标(IPA)音素的支持也得到了显著改进,因此自定义发音表现得更可靠。

Eleven v4 还在多说话人之间的对话一致性和动态性上带来了改进。通过捕捉说话人身份的新方法,Eleven v4 保留了每个声音的独特特质。它能够在代理对话、有声书或广告中保持语音一致性。由于模型理解整个场景的上下文,它会生成自然的对话,使说话人能够回应刚刚说过的话,而不是拼凑孤立的台词。

高质量的语音模型通常生成语音较慢,这意味着用户不得不在速度或富有表现力的语音代理之间做出选择。许多人选择了专业但单调的代理,这种代理在面对只想解决问题而心烦意乱的客户时可能显得机械化。

Eleven v4 Turbo 将速度与情感结合在一起,首字语音生成的中位时间约为 150 毫秒,使得在无数行业中部署强大的代理成为可能,从能够准确发音医疗术语、温暖且具有安抚性的医疗代理,到快速说话、使用俚语的游戏娱乐代理。

Median time to first speech: Eleven v4 Turbo 150ms, fastest; others 262–814ms.

Eleven v4 Turbo 模型专为 ElevenLabs 的对话代理平台 ElevenAgents 设计。其他代理构建者将来自不同厂商的模型和软件拼接在一起,这意味着用户无法针对各自的使用场景优化或改进模型输出。ElevenLabs 的研究和工程团队将 Eleven v4 Turbo 与 ElevenAgents 作为一个系统进行优化,提供更具表现力、可靠且延迟低的代理。

我们的沟通方式会因场景、地点甚至一天中的时间而异。在多语言中构建与之相符的表现力语音仍然是音频 AI 中最难的挑战之一。

Eleven v4 在所有这些方面都有提升,这些改进不仅仅体现在模型的发音上。Eleven v4 更好地捕捉节奏、情感和表达方式,跨语言帮助创作者生成符合语言和场景的自然语音。例如,你在日本与一位陌生老年人交谈的方式,与在意大利交谈的方式就大不相同。

Eleven v4 和 Eleven v4 Turbo 均支持超过 90 种语言。现在,用一种语言录制的声音也可以流利地说其他任何语言,既采用母语者的口音,又保留原始声音的特征。这种口音保持明显比以往更强,因此声音在生成过程中不再回到其原始口音。

对于配音和本地化,这意味着你选择的品牌声音——无论是你合作的名人演员还是最符合公司风格的语调——在 Eleven v4 支持的任何语言中都能听起来非常出色。

语音克隆在 Eleven v4 和 Eleven v4 Turbo 中更加真实、有力且一致,与原始音源的相似度显著提高。即时语音克隆现在只需 10 秒音频便可高保真捕捉声音。

Eleven v4 还能够在多轮生成、对话、旁白和重生成语句中更可靠地保留说话者身份。这意味着在长篇项目中,角色、旁白和克隆声音在整个制作过程中保持一致。Eleven v4 还新增了对专业语音克隆(PVC)的支持,以满足最高保真度的克隆使用场景。

请求拼接——将多代生成内容串联起来以创建更长的内容——在 Eleven v4 中也显著更加可靠,这提升了在 ElevenLabs Studio 和 ElevenLabs Reader 应用中的使用体验。

Eleven v4 和 Eleven v4 Turbo 是我们在表现力语音生成领域最新研究的结晶。它们专为内容呈现同文本本身一样重要的场景而设计,无论是有声书、角色表演、配音、配音或本地化对话代理。

这两款模型现在已可在 ElevenAgents、ElevenCreative 以及通过 ElevenAPI 使用。创建一个免费账户:/app/sign-up,即可开始使用 Eleven v4 或 Eleven v4 Turbo 进行生成。

ElevenLabs 发布最富表现力的 Eleven v4 及低延迟 Turbo 版
v4 turbo

用最高质量的 AI 音频进行创作

情报判断

Aioga 编辑摘要

ElevenLabs发布语音合成模型Eleven v4及低延迟变体Eleven v4 Turbo。来源称,Eleven v4侧重语气、节奏、情绪、角色与上下文理解,Turbo面向低延迟使用场景。

背景分析

来源称,Eleven v4采用全新架构,支持更自然的多说话人互动,并提供自然语言指令和内联音频标签控制表达方式。Eleven v4 Turbo的中位推理延迟约为100毫秒。

Aioga 观点

Aioga 判断:此次发布将语音合成的关注点进一步放在表达控制和对话自然度上。来源中的排名与盲测偏好数据属于ElevenLabs引用的评估结果,仍需结合评测方法理解。

影响与后续

可能影响:开发者可能需要在表达质量、指令控制与响应延迟之间进行场景化选择。相关宣传数据不代表所有应用中的实际体验,也不足以单独证明模型在各类任务中均优于其他方案。 后续观察:应关注Eleven v4与Turbo的实际可用范围、定价与服务条件,以及独立测试对情绪表达、多说话人互动、音频质量和延迟表现的验证结果。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: elevenlabs.io

来源: ElevenLabs:Blog(网页)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-28T12:00:00.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

ElevenLabs 发布语音合成模型 Eleven v4 及低延迟变体 Eleven v4 Turbo。

ElevenLabs:Blog(网页)2026-09-28T12:00:00.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。