字节跳动 Seed 官方今日发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,支持按时间线精准控制声音进场。

该模型支持 20+ 语种音频生成,在文本生成音色能力的 AB 主观评测中表现出显著优势,多数场景音频可用率达 90% 以上。
目前 Seed Audio 1.0 已在火山方舟体验中心上线。
字节跳动 Seed 官方今日发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,支持按时间线精准控制声音进场。该模型支持 20+ 语种音频生...
字节跳动 Seed 官方今日发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,支持按时间线精准控制声音进场。
该模型支持 20+ 语种音频生成,在文本生成音色能力的 AB 主观评测中表现出显著优势,多数场景音频可用率达 90% 以上。 目前 Seed Audio 1.0 已在火山方舟体验中心上线。
字节跳动 Seed 官方今日发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,支持按时间线精准控制声音进场。

该模型支持 20+ 语种音频生成,在文本生成音色能力的 AB 主观评测中表现出显著优势,多数场景音频可用率达 90% 以上。
目前 Seed Audio 1.0 已在火山方舟体验中心上线。
IT之家:https://www.ithome.com/ 7 月 20 日消息,字节跳动 Seed 官方今日发布了音频创作模型 Seed Audio 1.0,面向完整声音场景,在统一框架下联合建模人声、音效和环境声等多种音频要素,端到端完成影视级音频创作。

官方宣称,声音不再只是画面的补充,而是可以直接参与叙事,在听者脑海中直接形成画面感,做到“听见”即“看见”,其核心能力主要体现在以下方面:
多要素统一编排,支持 精细的时间控制 : 一条 prompt 即可统一编排带有特定情绪的对白、关键音效和环境声,并可按时间线精准控制声音进场。
音色风格可控,长时稳定: 支持文本与参考音频输入,在长音频和多次延长场景下保持角色一致性,同一音色也能自然呈现不同语气和情绪。
多语种自然生成: 支持 20+ 语种的音频生成,同一角色声音可依据不同语种的特点,呈现更自然的发音、节奏与表达方式。
据介绍,在文本生成音色能力上,Seed Audio 1.0 在 AB 主观评测中表现出显著优势,可用率和优良率也明显提升。

在多场景音频生成能力上,官方评测了影视、电视节目、短剧、动漫、播客对话、直播带货、网络创作、话剧和语音合成等场景。结果显示, 多数场景中的音频可用率已达到 90% 以上 。

针对多语言音频生成能力,在音频自然度上,大部分语言的 MOS 超过 4 分,音质已达到优秀水准;在复杂音频生成的指令遵循上,除越南语外,其余语言的 MOS 均高于 3.5 分,表明 Seed Audio 1.0 已具备较强的多语言指令遵循能力。

目前,Seed Audio 1.0 已在火山方舟体验中心上线,IT之家附相关链接:
https://seed.bytedance.com/seedaudio1_0 :https://seed.bytedance.com/seedaudio1_0
Aioga 编辑摘要:字节跳动 Seed 官方今日发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,支持按时间线精准控制声音进场。 Aioga 将其归入「模型更新」方向,重点关注它对真实使用和行业竞争的影响。
背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。
Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。
影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。
本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。
抓取通道: RSS · 原始域名: ithome.com
来源: IT之家(RSS)
原文链接: 打开原始来源
Aioga 归档: 查看情报页
Content record: source-page · Updated: 2026-07-20T06:43:25.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。