从“会说”走向“会创作”| Seed Audio 1.0 音频创作模型发布

对音频创作者而言,生成单一音频要素并不困难,真正困难的是让台词、音效等各类声音在同一场景中自然配合,服务于叙事和情绪表达。长期以来,这类创作往往依赖多个模型分别生成,再通过人工拼接、对齐和混音完成,不仅流程冗长,也难以兼顾整体完成度与控制精度。

今天,我们很高兴向你介绍 音频创作模型 Seed Audio 1.0, 它面向完整声音场景,在统一框架下联合建模人声、音效和环境声等多种音频要素,端到端完成影视级音频创作。声音不再只是画面的补充,而是可以直接参与叙事,在听者脑海中直接形成画面感,做到 “听见” 即 “看见”。

多要素统一编排,支持精细的时间控制: 一条 prompt 即可统一编排带有特定情绪的对白、关键音效和环境声,并可按时间线精准控制声音进场。

音色风格可控,长时稳定: 支持文本与参考音频输入,在长音频和多次延长场景下保持角色一致性,同一音色也能自然呈现不同语气和情绪。

多语种自然生成: 支持 20+ 语种的音频生成,同一角色声音可依据不同语种的特点,呈现更自然的发音、节奏与表达方式。

目前,Seed Audio 1.0 已在火山方舟体验中心上线,欢迎大家体验,用声音表达创意。

https://seed.bytedance.com/zh/seedaudio1_0 :https://seed.bytedance.com/zh/seedaudio1_0

https://ark.volcengine.com/region:cn-beijing/experience/voice?_vtm_=a441938.b28928.0_0.0_0.0.242_7661095862207497779&model=doubao-seed-audio-1-0 :https://ark.volcengine.com/region:cn-beijing/experience/voice?_vtm_=a441938.b28928.0_0.0_0.0.242_7661095862207497779&model=doubao-seed-audio-1-0

过去,完整音频内容的生产通常依赖多环节拼接。要打破这种级联方式,实现完整声音场景的生成,模型至少需要跨越三个门槛:

兼顾多类声音的细节保留 。不同类型音频对表征的要求并不相同:语音看重清晰度和韵律,环境声则要求空间氛围持续稳定。模型需具备足够强的声学细节建模能力。

理解并生成完整声音场景 。一段完整音频里,各音频要素间存在时间关系、情绪关系和声学互动,彼此关联、相互影响,模型要理解的是整个声音场景。

遵循多种指令控制。 模型不仅要有生成质量,还要能够服从文本、参考音频、时间轴和角色设定等多种条件,使声音在合适的时间、以合适的方式出现。

Seed Audio 1.0 的核心思路,是将不同的音频要素放在统一框架下理解与生成,学习更复杂的联合分布。为此,我们训练了一个通用声学编码器,将各类音频要素视为同一声音场景中的组成部分,映射到统一的声学表征中,而非将多类音频作为独立任务编码。

基于这种统一建模方式,模型能够更自然地组织角色语气、背景氛围和声音节奏,让输出更接近一段完整作品,而不是一组拼接起来的素材。 这也是我们更愿意将 Seed Audio 1.0 称为 “音频创作模型” 的原因。

Seed Audio 1.0 可生成兼具角色互动、情绪推进和氛围营造的复杂音频作品,支持专题叙事、剧情对话、主播互动等典型场景。

在真实创作环境中,声音出现的时机同样关键。它会直接影响节奏推进、情绪表达,以及一段内容能否真正成立。

Seed Audio 1.0 能先将创作意图拆解成结构化时间线,明确角色、台词、情绪和音效的进入时机,从而控制不同声音何时出现、如何衔接,以及怎样更自然地服务剧情。

Seed Audio 1.0 支持零样本音频生成。创作者既可以直接用文字描述目标声音,也可以结合参考音频进一步控制生成结果,而无需为每一种声音单独训练模型。

对真实创作来说,这意味着在前期尚未明确最终声音方案时,创作者可以先快速试出方向,再围绕更合适的音色与表达继续细化,从而减少反复试音和后期返工的成本。

与此同时,在长音频创作场景中,有声书、播客、长剧集和多人对话都要求角色声音前后一致,一旦出现明显音色变化,听众很快就会出戏。传统制作中,这通常需要配音演员长时间连续录制,或者依赖后期反复比对和修正。

针对这一问题,Seed Audio 1.0 支持基于参考音频进行延展生成,当前单次可生成约 2 分钟音频,并可在此基础上继续延长,同时保持角色音色与表达方式一致。

不过,稳定并不意味着表达单一。Seed Audio 1.0 在保持角色辨识度的同时,也支持同一音色自然呈现不同情绪、场景和表达方式。它支持“单音色、多角色”能力,同一音色可以通过差异化演绎塑造不同人物,从而拓展配音、叙事类内容和创意音频的创作空间。

多语种创作,不只是内容翻译,而是让声音的节奏、重音、停顿与情绪都更符合目标语言的表达方式。

Seed Audio 1.0 支持同一音色在多种语言中的自然迁移,并已覆盖 20+ 语种,包括中文、英文、日语、韩语、西班牙语、印尼语、德语、法语、泰语、越南语等。

为了更全面地验证 Seed Audio 1.0 在真实创作任务中的表现,我们从文本生成音色、多场景创作和多语种生成三个维度进行了评估。

在文本生成音色能力上,Seed Audio 1.0 在 AB 主观评测中表现出显著优势,可用率和优良率也明显提升。

أصدرت شركة بايت دانس نموذج إنشاء الصوت Seed Audio 1.0، والذي يوحد نمذجة الصوت البشري والمؤثرات الصوتية لتحقيق توليد صوتي بمستوى أفلام من البداية إلى النهاية

Seed Audio 1.0 在文本到音色任务上与其他模型的主观评测结果

在多场景音频生成能力上,我们进一步评测了影视、电视节目、短剧、动漫、播客对话、直播带货、网络创作、话剧和语音合成等场景。结果显示,多数场景中的音频可用率已达到 90% 以上。

Seed Audio 1.0 按场景拆分的条件音频到音频生成评测

针对多语言音频生成能力,我们从指令遵循和音频自然度两个维度进行了人工评测。结果显示,在音频自然度上,大部分语言的 MOS 超过 4 分,音质已达到优秀水准;复杂音频生成的指令遵循能力,除越南语外,其余语言的 MOS 均高于 3.5 分,表明 Seed Audio 1.0 已具备较强的多语言指令遵循能力。

Seed Audio 1.0 在 “文本生成音频” 和 “音频生成音频” 两类任务上的效果

从“会说”到“会创作”,Seed Audio 1.0 迈出了重要一步。

以 Seed Audio 1.0 为起点,我们希望进一步拓展模型在真实创作流程中的能力边界,通过模型框架创新支持视频参考等更多模态输入,并满足长音频、分轨等更复杂的音频生成需求。同时,我们也将探索把 Seed Audio 与可控翻译结合起来,提升模型在多语种场景下对内容表达和时长约束的控制能力。

未来,我们希望音频生成朝着更自然、更可控、更贴近创作流程的方向继续演进,让创作者轻松将脑海中的声音变成可听见的作品。

أصدرت شركة بايت دانس نموذج إنشاء الصوت Seed Audio 1.0، والذي يوحد نمذجة الصوت البشري والمؤثرات الصوتية لتحقيق توليد صوتي بمستوى أفلام من البداية إلى النهاية