{"@context":"https://schema.org","@type":"NewsArticle","generatedAt":"2026-07-23T06:40:50.084Z","headline":"字节跳动发布 Seed Audio 1.0 音频创作模型，统一建模人声与音效实现端到端影视级音频生成","description":"字节跳动 Seed 团队发布音频创作模型 Seed Audio 1.0，在统一框架下联合建模人声、音效和环境声，支持 100ms 间隔精度的时间控制、单次约 2 分钟音频的延展生成及 20+ 语种自然生成。该模型已在火山方舟体验中心上线，多数场景音频可用率达 90% 以上，多语言音频自然度 MOS 超 4 分。","url":"https://www.aioga.com/news/cmrsopm9r0b7ubiwmtfvpwkxu/","mainEntityOfPage":"https://www.aioga.com/news/cmrsopm9r0b7ubiwmtfvpwkxu/","datePublished":"2026-07-19T16:00:00.000Z","dateModified":"2026-07-19T16:00:00.000Z","inLanguage":"zh-CN","publisher":{"@type":"NewsMediaOrganization","name":"Aioga","url":"https://www.aioga.com"},"citation":["https://seed.bytedance.com/zh/blog/%E4%BB%8E-%E4%BC%9A%E8%AF%B4-%E8%B5%B0%E5%90%91-%E4%BC%9A%E5%88%9B%E4%BD%9C-seed-audio-1-0-%E9%9F%B3%E9%A2%91%E5%88%9B%E4%BD%9C%E6%A8%A1%E5%9E%8B%E5%8F%91%E5%B8%83","https://aihot.virxact.com/items/cmrsopm9r0b7ubiwmtfvpwkxu"],"canonicalUrl":"https://www.aioga.com/news/cmrsopm9r0b7ubiwmtfvpwkxu/","directAnswer":{"@type":"Answer","text":"字节跳动 Seed 团队发布 Seed Audio 1.0，在统一框架中联合建模人声、音效与环境声，并支持按时间线控制声音进场。模型目前已在火山方舟体验中心上线。","url":"https://www.aioga.com/news/cmrsopm9r0b7ubiwmtfvpwkxu/","dateCreated":"2026-07-19T16:00:00.000Z","author":{"@type":"Organization","@id":"https://www.aioga.com/authors/aioga-editorial/#editorial-team","name":"Aioga Editorial Team","url":"https://www.aioga.com/authors/aioga-editorial/"}},"evidence":[{"@type":"CreativeWork","name":"字节 Seed：Research Feed（网页内嵌数据） source article","url":"https://seed.bytedance.com/zh/blog/%E4%BB%8E-%E4%BC%9A%E8%AF%B4-%E8%B5%B0%E5%90%91-%E4%BC%9A%E5%88%9B%E4%BD%9C-seed-audio-1-0-%E9%9F%B3%E9%A2%91%E5%88%9B%E4%BD%9C%E6%A8%A1%E5%9E%8B%E5%8F%91%E5%B8%83","datePublished":"2026-07-19T16:00:00.000Z","provider":{"@type":"Organization","name":"字节 Seed：Research Feed（网页内嵌数据）","url":"https://seed.bytedance.com/zh/blog/%E4%BB%8E-%E4%BC%9A%E8%AF%B4-%E8%B5%B0%E5%90%91-%E4%BC%9A%E5%88%9B%E4%BD%9C-seed-audio-1-0-%E9%9F%B3%E9%A2%91%E5%88%9B%E4%BD%9C%E6%A8%A1%E5%9E%8B%E5%8F%91%E5%B8%83"}},{"@type":"CreativeWork","name":"AIHot archive record","url":"https://aihot.virxact.com/items/cmrsopm9r0b7ubiwmtfvpwkxu","datePublished":"2026-07-19T16:00:00.000Z","provider":{"@type":"Organization","name":"AIHot","url":"https://aihot.virxact.com/items/cmrsopm9r0b7ubiwmtfvpwkxu"}}],"aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","originalPublisher":{"name":"字节 Seed：Research Feed（网页内嵌数据）","url":"https://seed.bytedance.com/zh/blog/%E4%BB%8E-%E4%BC%9A%E8%AF%B4-%E8%B5%B0%E5%90%91-%E4%BC%9A%E5%88%9B%E4%BD%9C-seed-audio-1-0-%E9%9F%B3%E9%A2%91%E5%88%9B%E4%BD%9C%E6%A8%A1%E5%9E%8B%E5%8F%91%E5%B8%83"},"article":{"id":"cmrsopm9r0b7ubiwmtfvpwkxu","slug":"cmrsopm9r0b7ubiwmtfvpwkxu","url":"https://www.aioga.com/news/cmrsopm9r0b7ubiwmtfvpwkxu/","title":"字节跳动发布 Seed Audio 1.0 音频创作模型，统一建模人声与音效实现端到端影视级音频生成","title_en":"从\"会说\"走向\"会创作\"| Seed Audio 1.0 音频创作模型发布","summary":"字节跳动 Seed 团队发布音频创作模型 Seed Audio 1.0，在统一框架下联合建模人声、音效和环境声，支持 100ms 间隔精度的时间控制、单次约 2 分钟音频的延展生成及 20+ 语种自然生成。该模型已在火山方舟体验中心上线，多数场景音频可用率达 90% 以上，多语言音频自然度 MOS 超 4 分。","source":"字节 Seed：Research Feed（网页内嵌数据）","sourceUrl":"https://seed.bytedance.com/zh/blog/%E4%BB%8E-%E4%BC%9A%E8%AF%B4-%E8%B5%B0%E5%90%91-%E4%BC%9A%E5%88%9B%E4%BD%9C-seed-audio-1-0-%E9%9F%B3%E9%A2%91%E5%88%9B%E4%BD%9C%E6%A8%A1%E5%9E%8B%E5%8F%91%E5%B8%83","aiHotUrl":"https://aihot.virxact.com/items/cmrsopm9r0b7ubiwmtfvpwkxu","publishedAt":"2026-07-19T16:00:00.000Z","category":"产品更新","score":79,"selected":true,"articleBody":["从“会说”走向“会创作”｜ Seed Audio 1.0 音频创作模型发布","对音频创作者而言，生成单一音频要素并不困难，真正困难的是让台词、音效等各类声音在同一场景中自然配合，服务于叙事和情绪表达。长期以来，这类创作往往依赖多个模型分别生成，再通过人工拼接、对齐和混音完成，不仅流程冗长，也难以兼顾整体完成度与控制精度。","今天，我们很高兴向你介绍 音频创作模型 Seed Audio 1.0， 它面向完整声音场景，在统一框架下联合建模人声、音效和环境声等多种音频要素，端到端完成影视级音频创作。声音不再只是画面的补充，而是可以直接参与叙事，在听者脑海中直接形成画面感，做到 “听见” 即 “看见”。","多要素统一编排，支持精细的时间控制： 一条 prompt 即可统一编排带有特定情绪的对白、关键音效和环境声，并可按时间线精准控制声音进场。","音色风格可控，长时稳定： 支持文本与参考音频输入，在长音频和多次延长场景下保持角色一致性，同一音色也能自然呈现不同语气和情绪。","多语种自然生成： 支持 20+ 语种的音频生成，同一角色声音可依据不同语种的特点，呈现更自然的发音、节奏与表达方式。","目前，Seed Audio 1.0 已在火山方舟体验中心上线，欢迎大家体验，用声音表达创意。","https://seed.bytedance.com/zh/seedaudio1_0 ：https://seed.bytedance.com/zh/seedaudio1_0","https://ark.volcengine.com/region:cn-beijing/experience/voice?_vtm_=a441938.b28928.0_0.0_0.0.242_7661095862207497779&model=doubao-seed-audio-1-0 ：https://ark.volcengine.com/region:cn-beijing/experience/voice?_vtm_=a441938.b28928.0_0.0_0.0.242_7661095862207497779&model=doubao-seed-audio-1-0","过去，完整音频内容的生产通常依赖多环节拼接。要打破这种级联方式，实现完整声音场景的生成，模型至少需要跨越三个门槛：","兼顾多类声音的细节保留 。不同类型音频对表征的要求并不相同：语音看重清晰度和韵律，环境声则要求空间氛围持续稳定。模型需具备足够强的声学细节建模能力。","理解并生成完整声音场景 。一段完整音频里，各音频要素间存在时间关系、情绪关系和声学互动，彼此关联、相互影响，模型要理解的是整个声音场景。","遵循多种指令控制。 模型不仅要有生成质量，还要能够服从文本、参考音频、时间轴和角色设定等多种条件，使声音在合适的时间、以合适的方式出现。","Seed Audio 1.0 的核心思路，是将不同的音频要素放在统一框架下理解与生成，学习更复杂的联合分布。为此，我们训练了一个通用声学编码器，将各类音频要素视为同一声音场景中的组成部分，映射到统一的声学表征中，而非将多类音频作为独立任务编码。","基于这种统一建模方式，模型能够更自然地组织角色语气、背景氛围和声音节奏，让输出更接近一段完整作品，而不是一组拼接起来的素材。 这也是我们更愿意将 Seed Audio 1.0 称为 “音频创作模型” 的原因。","Seed Audio 1.0 可生成兼具角色互动、情绪推进和氛围营造的复杂音频作品，支持专题叙事、剧情对话、主播互动等典型场景。","在真实创作环境中，声音出现的时机同样关键。它会直接影响节奏推进、情绪表达，以及一段内容能否真正成立。","Seed Audio 1.0 能先将创作意图拆解成结构化时间线，明确角色、台词、情绪和音效的进入时机，从而控制不同声音何时出现、如何衔接，以及怎样更自然地服务剧情。","Seed Audio 1.0 支持零样本音频生成。创作者既可以直接用文字描述目标声音，也可以结合参考音频进一步控制生成结果，而无需为每一种声音单独训练模型。","对真实创作来说，这意味着在前期尚未明确最终声音方案时，创作者可以先快速试出方向，再围绕更合适的音色与表达继续细化，从而减少反复试音和后期返工的成本。","与此同时，在长音频创作场景中，有声书、播客、长剧集和多人对话都要求角色声音前后一致，一旦出现明显音色变化，听众很快就会出戏。传统制作中，这通常需要配音演员长时间连续录制，或者依赖后期反复比对和修正。","针对这一问题，Seed Audio 1.0 支持基于参考音频进行延展生成，当前单次可生成约 2 分钟音频，并可在此基础上继续延长，同时保持角色音色与表达方式一致。","不过，稳定并不意味着表达单一。Seed Audio 1.0 在保持角色辨识度的同时，也支持同一音色自然呈现不同情绪、场景和表达方式。它支持“单音色、多角色”能力，同一音色可以通过差异化演绎塑造不同人物，从而拓展配音、叙事类内容和创意音频的创作空间。","多语种创作，不只是内容翻译，而是让声音的节奏、重音、停顿与情绪都更符合目标语言的表达方式。","Seed Audio 1.0 支持同一音色在多种语言中的自然迁移，并已覆盖 20+ 语种，包括中文、英文、日语、韩语、西班牙语、印尼语、德语、法语、泰语、越南语等。","为了更全面地验证 Seed Audio 1.0 在真实创作任务中的表现，我们从文本生成音色、多场景创作和多语种生成三个维度进行了评估。","在文本生成音色能力上，Seed Audio 1.0 在 AB 主观评测中表现出显著优势，可用率和优良率也明显提升。","Seed Audio 1.0 在文本到音色任务上与其他模型的主观评测结果","在多场景音频生成能力上，我们进一步评测了影视、电视节目、短剧、动漫、播客对话、直播带货、网络创作、话剧和语音合成等场景。结果显示，多数场景中的音频可用率已达到 90% 以上。","针对多语言音频生成能力，我们从指令遵循和音频自然度两个维度进行了人工评测。结果显示，在音频自然度上，大部分语言的 MOS 超过 4 分，音质已达到优秀水准；复杂音频生成的指令遵循能力，除越南语外，其余语言的 MOS 均高于 3.5 分，表明 Seed Audio 1.0 已具备较强的多语言指令遵循能力。","从“会说”到“会创作”，Seed Audio 1.0 迈出了重要一步。","以 Seed Audio 1.0 为起点，我们希望进一步拓展模型在真实创作流程中的能力边界，通过模型框架创新支持视频参考等更多模态输入，并满足长音频、分轨等更复杂的音频生成需求。同时，我们也将探索把 Seed Audio 与可控翻译结合起来，提升模型在多语种场景下对内容表达和时长约束的控制能力。","未来，我们希望音频生成朝着更自然、更可控、更贴近创作流程的方向继续演进，让创作者轻松将脑海中的声音变成可听见的作品。"],"articleImages":[{"sourceUrl":"https://lf3-static.bytednsdoc.com/obj/eden-cn/lapzild-tss/ljhwZthlaukjlkulzlp/user-upload/4xfa4mrsmgnj9.jpeg","alt":"","afterParagraph":26,"url":"/media/articles/cmrsopm9r0b7ubiwmtfvpwkxu/d18801eaed66091a.jpg"},{"sourceUrl":"https://lf3-static.bytednsdoc.com/obj/eden-cn/lapzild-tss/ljhwZthlaukjlkulzlp/user-upload/4xfa4mrsj9m5l.png","alt":"Seed Audio 1.0 按场景拆分的条件音频到音频生成评测","afterParagraph":28,"url":"/media/articles/cmrsopm9r0b7ubiwmtfvpwkxu/6c4fd484691b99c2.png"},{"sourceUrl":"https://lf3-static.bytednsdoc.com/obj/eden-cn/lapzild-tss/ljhwZthlaukjlkulzlp/user-upload/4xfa4mrsj9mdq.png","alt":"Seed Audio 1.0 在 “文本生成音频” 和 “音频生成音频” 两类任务上的效果","afterParagraph":29,"url":"/media/articles/cmrsopm9r0b7ubiwmtfvpwkxu/83a7ed697c6fb83c.png"},{"sourceUrl":"https://lf-flow-web-cdn.doubao.com/obj/flow-doubao/deploy/flow/ai_official_website/88329/static/image/new_qr_code.fb5e7d6b.png","alt":"","afterParagraph":32,"url":"/media/articles/cmrsopm9r0b7ubiwmtfvpwkxu/bd84ff97250c9d04.png"}],"mediaStatus":"ok","articleBodyZh":[],"translationStatus":"","bodyOrigin":"source-page","editorial":{"summary":"字节跳动 Seed 团队发布 Seed Audio 1.0，在统一框架中联合建模人声、音效与环境声，并支持按时间线控制声音进场。模型目前已在火山方舟体验中心上线。","background":"来源材料称，传统完整声音场景常由多个模型分别生成，再经人工拼接、对齐和混音。Seed Audio 1.0 尝试以单条提示统一编排对白、关键音效和环境声，减少多环节协作。","viewpoint":"Aioga 判断，该产品的主要看点不是单独生成语音或音效，而是将多类声音纳入同一创作流程，并提供时间控制、音色一致性和多语种生成能力，其实际效果仍需结合公开体验验证。","implications":"Aioga 判断，统一生成完整声音场景可能缩短影视、短视频及有声内容的音频制作流程，也可能降低人工对齐与混音负担；但材料未提供与其他方案的直接对比，暂不能据此确认效率优势。","nextStep":"值得关注模型上线后的实际样例与第三方测试，包括约两分钟延展生成中的角色一致性、100ms 间隔控制的稳定性、20余种语言的自然度，以及不同复杂场景下所称可用率的评估口径。","evidenceRefs":["title","summary","articleBody","source"],"status":"published","aiGenerated":true,"autoApproved":true,"generatedBy":"aioga-editorial:gpt-5.6-sol","reviewedBy":"aioga-editorial-review:gpt-5.6-sol","generatedAt":"2026-07-22T18:15:01.056Z","sourceHash":"ca868323051a263a","review":{"approved":true,"groundedness":96,"clarity":93,"duplicationRisk":18,"blockingIssues":[],"notes":["候选内容清楚区分了来源事实与 Aioga 的判断，并对潜在效率优势保留了验证条件。","“减少多环节协作”和“降低人工对齐与混音负担”属于基于端到端生成能力作出的合理推断，当前已使用“尝试”“可能”等限定语，无需阻断。","nextStep 中列出的约两分钟延展生成、100ms 间隔控制、20余种语言和可用率均可由来源摘要支持。"]},"validation":{"passed":true,"mode":"ai-auto","revisions":0,"checks":["schema","length","source-attribution","low-source-overlap","no-html","independent-ai-review"]}},"tags":["产品更新","字节 Seed：Research Feed（网页内嵌数据）"],"translations":{"zh-CN":{"title":"字节跳动发布 Seed Audio 1.0 音频创作模型，统一建模人声与音效实现端到端影视级音频生成","summary":"字节跳动 Seed 团队发布音频创作模型 Seed Audio 1.0，在统一框架下联合建模人声、音效和环境声，支持 100ms 间隔精度的时间控制、单次约 2 分钟音频的延展生成及 20+ 语种自然生成。该模型已在火山方舟体验中心上线，多数场景音频可用率达 90% 以上，多语言音频自然度 MOS 超 4 分。","category":"产品更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"字节跳动发布 Seed Audio 1.0 音频创作模型，统一建模人声与音效实现端到端影视级音频生成 - Aioga AI资讯","description":"字节跳动 Seed 团队发布音频创作模型 Seed Audio 1.0，在统一框架下联合建模人声、音效和环境声，支持 100ms 间隔精度的时间控制、单次约 2 分钟音频的延展生成及 20+ 语种自然生成。该模型已在火山方舟体验中心上线，多数场景音频可用率达 90% 以上，多语言音频自然度 MOS 超 4 分。","url":"https://www.aioga.com/news/cmrsopm9r0b7ubiwmtfvpwkxu/"},"en":{"title":"ByteDance releases Seed Audio 1.0 audio creation model, unifying the modeling of vocals and sound effects to achieve end-to-end film-level audio generation","summary":"ByteDance's Seed team has released the audio creation model Seed Audio 1.0, which jointly models vocals, sound effects, and ambient sounds under a unified framework. It supports time control with 100ms interval precision, extended generation of single audio clips of about 2 minutes, and natural generation in over 20 languages. The model has been launched at the Volcano Ark Experience Center, with audio availability in most scenarios exceeding 90%, and a naturalness MOS score for multilingual audio above 4.","category":"Products","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"ByteDance releases Seed Audio 1.0 audio creation model, unifying the modeling of vocals and sound effects to achieve end-to-end film-level audio generation - Aioga AI News","description":"ByteDance's Seed team has released the audio creation model Seed Audio 1.0, which jointly models vocals, sound effects, and ambient sounds under a unified framework. It supports ti...","url":"https://www.aioga.com/en/news/cmrsopm9r0b7ubiwmtfvpwkxu/","contentTranslated":true,"sourceHash":"16cb69d66e1dc1f9","translatedAt":"2026-07-22T16:45:57.881Z"},"ja":{"title":"バイトダンス、Seed Audio 1.0オーディオ創作モデルを発表、人の声と効果音を統一的にモデリングし、エンドツーエンドの映画レベルの音声生成を実現","summary":"バイトダンスのSeedチームは音声創作モデル「Seed Audio 1.0」を発表しました。統一フレームワークの下で、人の声、効果音、環境音を統合的にモデリングし、100ms間隔の時間制御、約2分の音声の延長生成、20以上の言語での自然な生成をサポートします。このモデルは火山アーク体験センターで公開されており、多くのシーンで音声の使用率は90%以上に達し、多言語音声の自然さMOSは4点を超えています。","category":"製品更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"バイトダンス、Seed Audio 1.0オーディオ創作モデルを発表、人の声と効果音を統一的にモデリングし、エンドツーエンドの映画レベルの音声生成を実現 - Aioga AIニュース","description":"バイトダンスのSeedチームは音声創作モデル「Seed Audio 1.0」を発表しました。統一フレームワークの下で、人の声、効果音、環境音を統合的にモデリングし、100ms間隔の時間制御、約2分の音声の延長生成、20以上の言語での自然な生成をサポートします。このモデルは火山アーク体験センターで公開されており、多くのシーンで音声の使用率は90%以上に達し、多...","url":"https://www.aioga.com/ja/news/cmrsopm9r0b7ubiwmtfvpwkxu/","contentTranslated":true,"sourceHash":"16cb69d66e1dc1f9","translatedAt":"2026-07-22T16:46:09.165Z"},"ko":{"title":"바이트댄스(ByteDance)가 Seed Audio 1.0 오디오 창작 모델을 출시하여, 음성과 음향 효과를 통합 모델링해 엔드투엔드 영화급 오디오 생성을 실현","summary":"바이트댄스 Seed 팀이 오디오 창작 모델 Seed Audio 1.0을 발표했으며, 통합 프레임워크 하에서 음성, 음향 효과 및 환경음을 공동 모델링하고, 100ms 간격 정밀도의 시간 제어, 한 번에 약 2분 오디오의 연장 생성 및 20개 이상의 언어 자연스러운 생성을 지원합니다. 이 모델은 화산 방주 체험 센터에 출시되었으며, 대부분의 시나리오 오디오 사용률이 90% 이상에 달하고, 다국어 오디오 자연도 MOS가 4점 이상입니다.","category":"제품 업데이트","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"바이트댄스(ByteDance)가 Seed Audio 1.0 오디오 창작 모델을 출시하여, 음성과 음향 효과를 통합 모델링해 엔드투엔드 영화급 오디오 생성을 실현 - Aioga AI 뉴스","description":"바이트댄스 Seed 팀이 오디오 창작 모델 Seed Audio 1.0을 발표했으며, 통합 프레임워크 하에서 음성, 음향 효과 및 환경음을 공동 모델링하고, 100ms 간격 정밀도의 시간 제어, 한 번에 약 2분 오디오의 연장 생성 및 20개 이상의 언어 자연스러운 생성을 지원합니다. 이 모델은 화산 방주 체험 센터에 출시...","url":"https://www.aioga.com/ko/news/cmrsopm9r0b7ubiwmtfvpwkxu/","contentTranslated":true,"sourceHash":"16cb69d66e1dc1f9","translatedAt":"2026-07-22T16:46:57.298Z"},"es":{"title":"ByteDance lanza el modelo de creación de audio Seed Audio 1.0, unificando la modelización de la voz humana y efectos de sonido para lograr una generación de audio de nivel cinematográfico de extremo a extremo","summary":"El equipo Seed de ByteDance ha lanzado el modelo de creación de audio Seed Audio 1.0, que bajo un marco unificado modela conjuntamente la voz humana, los efectos de sonido y los sonidos ambientales, soportando control de tiempo con precisión de 100 ms, generación extendida de audio de aproximadamente 2 minutos por vez, y generación natural en más de 20 idiomas. Este modelo ya está disponible en el Centro de Experiencia Volcán Ark, con una tasa de disponibilidad de audio en la mayoría de los escenarios superior al 90% y una puntuación MOS de naturalidad en audio multilingüe por encima de 4.","category":"Productos","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"ByteDance lanza el modelo de creación de audio Seed Audio 1.0, unificando la modelización de la voz humana y efectos de sonido para lograr una generación de audio de nivel cinematográfico de extremo a extremo - Aioga Noticias de IA","description":"El equipo Seed de ByteDance ha lanzado el modelo de creación de audio Seed Audio 1.0, que bajo un marco unificado modela conjuntamente la voz humana, los efectos de sonido y los so...","url":"https://www.aioga.com/es/news/cmrsopm9r0b7ubiwmtfvpwkxu/","contentTranslated":true,"sourceHash":"16cb69d66e1dc1f9","translatedAt":"2026-07-22T16:46:55.839Z"},"fr":{"title":"ByteDance a publié le modèle de création audio Seed Audio 1.0, unifiant la modélisation de la voix humaine et des effets sonores pour réaliser une génération audio de niveau cinématographique de bout en bout","summary":"L'équipe Seed de ByteDance a publié le modèle de création audio Seed Audio 1.0, qui modélise conjointement la voix humaine, les effets sonores et les sons d'environnement dans un cadre unifié, et prend en charge le contrôle temporel avec une précision de 100 ms, la génération prolongée d'environ 2 minutes d'audio par fois, ainsi que la génération naturelle dans plus de 20 langues. Ce modèle est déjà en ligne au centre d'expérience Volcan Ark, avec un taux de disponibilité des audio pour la plupart des scénarios de plus de 90 %, et une naturalité de l'audio multilingue MOS supérieure à 4.","category":"Produits","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"ByteDance a publié le modèle de création audio Seed Audio 1.0, unifiant la modélisation de la voix humaine et des effets sonores pour réaliser une génération audio de niveau cinématographique de bout en bout - Aioga Actualités IA","description":"L'équipe Seed de ByteDance a publié le modèle de création audio Seed Audio 1.0, qui modélise conjointement la voix humaine, les effets sonores et les sons d'environnement dans un c...","url":"https://www.aioga.com/fr/news/cmrsopm9r0b7ubiwmtfvpwkxu/","contentTranslated":true,"sourceHash":"16cb69d66e1dc1f9","translatedAt":"2026-07-22T16:47:47.068Z"},"de":{"title":"ByteDance veröffentlicht das Seed Audio 1.0 Audio-Erstellungsmodell, das menschliche Stimmen und Soundeffekte einheitlich modelliert und eine End-to-End-Filmton-Generierung ermöglicht.","summary":"Das Seed-Team von ByteDance hat das Audio-Kreationsmodell Seed Audio 1.0 veröffentlicht, das unter einem einheitlichen Rahmen menschliche Stimmen, Soundeffekte und Umgebungsgeräusche gemeinsam modelliert. Es unterstützt eine Zeitsteuerung mit 100-ms-Intervallen, die verlängernde Generierung von etwa 2-minütigen Audioaufnahmen pro Durchlauf sowie die natürliche Generierung in über 20 Sprachen. Das Modell ist bereits im Volcano Ark Experience Center verfügbar, wobei die Nutzbarkeit des Audios in den meisten Szenarien über 90 % beträgt und die natürliche Wahrnehmung mehrsprachiger Audios einen MOS von über 4 Punkten erreicht.","category":"产品更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"ByteDance veröffentlicht das Seed Audio 1.0 Audio-Erstellungsmodell, das menschliche Stimmen und Soundeffekte einheitlich modelliert und eine End-to-End-Filmton-Generierung ermöglicht. - Aioga KI-News","description":"Das Seed-Team von ByteDance hat das Audio-Kreationsmodell Seed Audio 1.0 veröffentlicht, das unter einem einheitlichen Rahmen menschliche Stimmen, Soundeffekte und Umgebungsgeräusc...","url":"https://www.aioga.com/de/news/cmrsopm9r0b7ubiwmtfvpwkxu/","contentTranslated":true,"sourceHash":"16cb69d66e1dc1f9","translatedAt":"2026-07-22T16:47:47.183Z"},"pt-BR":{"title":"A ByteDance lançou o modelo de criação de áudio Seed Audio 1.0, unificando a modelagem de voz humana e efeitos sonoros para realizar geração de áudio de nível cinematográfico de ponta a ponta.","summary":"A equipe Seed da ByteDance lançou o modelo de criação de áudio Seed Audio 1.0, que, sob uma estrutura unificada, modela conjuntamente vozes humanas, efeitos sonoros e sons ambientais, suportando controle de tempo com precisão de 100ms, geração estendida de áudio de aproximadamente 2 minutos por vez e produção natural em mais de 20 idiomas. O modelo já está disponível no Centro de Experiência Volcanic Ark, com taxa de disponibilidade de áudio em muitos cenários superior a 90% e naturalidade de áudio multilíngue MOS acima de 4 pontos.","category":"产品更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"A ByteDance lançou o modelo de criação de áudio Seed Audio 1.0, unificando a modelagem de voz humana e efeitos sonoros para realizar geração de áudio de nível cinematográfico de ponta a ponta. - Aioga Notícias de IA","description":"A equipe Seed da ByteDance lançou o modelo de criação de áudio Seed Audio 1.0, que, sob uma estrutura unificada, modela conjuntamente vozes humanas, efeitos sonoros e sons ambienta...","url":"https://www.aioga.com/pt-BR/news/cmrsopm9r0b7ubiwmtfvpwkxu/","contentTranslated":true,"sourceHash":"16cb69d66e1dc1f9","translatedAt":"2026-07-22T16:48:33.155Z"},"ru":{"title":"ByteDance выпустила аудиомодель для создания Seed Audio 1.0, которая объединяет моделирование голоса и звуковых эффектов для реализации сквозного создания аудио уровня кинофильма","summary":"Команда Seed компании ByteDance выпустила модель для создания аудио Seed Audio 1.0, которая в единой структуре объединяет моделирование человеческого голоса, звуковых эффектов и окружающих звуков, поддерживает временное управление с точностью до 100 мс, расширенное создание аудио длительностью около 2 минут за один раз и естественное воспроизведение более чем на 20 языках. Эта модель уже доступна в центре опыта Vulkan Ark, при этом применимость аудио в большинстве сцен достигает более 90%, а MOS для естественности многоязычного аудио превышает 4 балла.","category":"产品更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"ByteDance выпустила аудиомодель для создания Seed Audio 1.0, которая объединяет моделирование голоса и звуковых эффектов для реализации сквозного создания аудио уровня кинофильма - Aioga Новости ИИ","description":"Команда Seed компании ByteDance выпустила модель для создания аудио Seed Audio 1.0, которая в единой структуре объединяет моделирование человеческого голоса, звуковых эффектов и ок...","url":"https://www.aioga.com/ru/news/cmrsopm9r0b7ubiwmtfvpwkxu/","contentTranslated":true,"sourceHash":"16cb69d66e1dc1f9","translatedAt":"2026-07-22T16:48:33.052Z"},"ar":{"title":"أصدرت شركة بايت دانس نموذج إنشاء الصوت Seed Audio 1.0، والذي يوحد نمذجة الصوت البشري والمؤثرات الصوتية لتحقيق توليد صوتي بمستوى أفلام من البداية إلى النهاية","summary":"أصدر فريق Seed في شركة ByteDance نموذج إنشاء الصوتيات Seed Audio 1.0، الذي يدمج النمذجة الموحدة للصوت البشري والمؤثرات الصوتية والأصوات البيئية، ويدعم التحكم الزمني بدقة 100 مللي ثانية، وإنتاج الصوتيات الفردية التي تبلغ حوالي دقيقتين، وإنتاج طبيعي بأكثر من 20 لغة. تم إطلاق هذا النموذج في مركز تجربة Volcano Ark، حيث تصل نسبة قابلية استخدام الصوت في معظم السيناريوهات إلى أكثر من 90%، ويبلغ معدل الطابع الطبيعي للصوت المتعدد اللغات MOS أكثر من 4 نقاط.","category":"产品更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"أصدرت شركة بايت دانس نموذج إنشاء الصوت Seed Audio 1.0، والذي يوحد نمذجة الصوت البشري والمؤثرات الصوتية لتحقيق توليد صوتي بمستوى أفلام من البداية إلى النهاية - Aioga أخبار الذكاء الاصطناعي","description":"أصدر فريق Seed في شركة ByteDance نموذج إنشاء الصوتيات Seed Audio 1.0، الذي يدمج النمذجة الموحدة للصوت البشري والمؤثرات الصوتية والأصوات البيئية، ويدعم التحكم الزمني بدقة 100 مللي ث...","url":"https://www.aioga.com/ar/news/cmrsopm9r0b7ubiwmtfvpwkxu/","contentTranslated":true,"sourceHash":"16cb69d66e1dc1f9","translatedAt":"2026-07-22T16:49:22.432Z"},"hi":{"title":"बाइटडांस ने Seed Audio 1.0 ऑडियो क्रिएशन मॉडल जारी किया, मानव आवाज़ और ध्वनि प्रभावों का एकीकृत मॉडलिंग करके एंड-टू-एंड फिल्म-ग्रेड ऑडियो निर्माण को संभव बनाया।","summary":"बाइटडांस Seed टीम ने ऑडियो क्रिएशन मॉडल Seed Audio 1.0 जारी किया, जो एक एकीकृत ढांचे के तहत मानव आवाज़, ध्वनि प्रभाव और पर्यावरण ध्वनि का संयुक्त मॉडलिंग करता है, 100ms अंतराल की सटीकता के साथ समय नियंत्रण, लगभग 2 मिनट की अवधि वाले ऑडियो की एक बार विस्तारित पीढ़ी और 20+ भाषाओं में प्राकृतिक निर्माण का समर्थन करता है। यह मॉडल वोल्केन अर्कुईव अनुभव केंद्र में लॉन्च किया गया है, अधिकांश परिदृश्यों में ऑडियो उपलब्धता 90% से अधिक है, और बहुभाषी ऑडियो की प्राकृतिकता MOS 4 से अधिक है।","category":"产品更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"बाइटडांस ने Seed Audio 1.0 ऑडियो क्रिएशन मॉडल जारी किया, मानव आवाज़ और ध्वनि प्रभावों का एकीकृत मॉडलिंग करके एंड-टू-एंड फिल्म-ग्रेड ऑडियो निर्माण को संभव बनाया। - Aioga AI समाचार","description":"बाइटडांस Seed टीम ने ऑडियो क्रिएशन मॉडल Seed Audio 1.0 जारी किया, जो एक एकीकृत ढांचे के तहत मानव आवाज़, ध्वनि प्रभाव और पर्यावरण ध्वनि का संयुक्त मॉडलिंग करता है, 100ms अंतराल की स...","url":"https://www.aioga.com/hi/news/cmrsopm9r0b7ubiwmtfvpwkxu/","contentTranslated":true,"sourceHash":"16cb69d66e1dc1f9","translatedAt":"2026-07-22T16:49:21.476Z"},"it":{"title":"ByteDance ha rilasciato il modello di creazione audio Seed Audio 1.0, unificando la modellazione della voce umana e degli effetti sonori per realizzare una generazione audio di livello cinematografico end-to-end","summary":"Il team Seed di ByteDance ha rilasciato il modello di creazione audio Seed Audio 1.0, che modella congiuntamente voce, effetti sonori e suoni ambientali all'interno di un framework unificato, supportando il controllo temporale con precisione di 100 ms, l'estensione della generazione audio di circa 2 minuti per volta e la generazione naturale in oltre 20 lingue. Questo modello è già online presso il Volano Ark Experience Center, con una disponibilità audio superiore al 90% nella maggior parte degli scenari e un punteggio MOS di naturalezza audio multilingue superiore a 4.","category":"产品更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"ByteDance ha rilasciato il modello di creazione audio Seed Audio 1.0, unificando la modellazione della voce umana e degli effetti sonori per realizzare una generazione audio di livello cinematografico end-to-end - Aioga Notizie IA","description":"Il team Seed di ByteDance ha rilasciato il modello di creazione audio Seed Audio 1.0, che modella congiuntamente voce, effetti sonori e suoni ambientali all'interno di un framework...","url":"https://www.aioga.com/it/news/cmrsopm9r0b7ubiwmtfvpwkxu/","contentTranslated":true,"sourceHash":"16cb69d66e1dc1f9","translatedAt":"2026-07-22T16:50:13.542Z"},"nl":{"title":"ByteDance heeft het Seed Audio 1.0-audiocreatiemodel uitgebracht, dat vocale en geluidseffecten uniform modelleert om end-to-end filmkwaliteit audio te genereren.","summary":"Het Seed-team van ByteDance heeft het audiocreatiemodel Seed Audio 1.0 uitgebracht, dat onder een uniform kader spraak, geluidseffecten en omgevingsgeluid gezamenlijk modelleert. Het ondersteunt tijdscontrole met een nauwkeurigheid van 100 ms, de uitgestrekte generatie van audio van ongeveer 2 minuten per keer en natuurlijke generatie in meer dan 20 talen. Dit model is al beschikbaar in het Volcano Ark Experience Center, waarbij de bruikbaarheid van audio in de meeste scenario's meer dan 90% bereikt, en de MOS voor natuurlijke multitalige audio hoger is dan 4 punten.","category":"产品更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"ByteDance heeft het Seed Audio 1.0-audiocreatiemodel uitgebracht, dat vocale en geluidseffecten uniform modelleert om end-to-end filmkwaliteit audio te genereren. - Aioga AI-nieuws","description":"Het Seed-team van ByteDance heeft het audiocreatiemodel Seed Audio 1.0 uitgebracht, dat onder een uniform kader spraak, geluidseffecten en omgevingsgeluid gezamenlijk modelleert. H...","url":"https://www.aioga.com/nl/news/cmrsopm9r0b7ubiwmtfvpwkxu/","contentTranslated":true,"sourceHash":"16cb69d66e1dc1f9","translatedAt":"2026-07-22T16:50:08.060Z"},"tr":{"title":"ByteDance, Seed Audio 1.0 ses yaratım modelini yayınladı; insan sesi ve ses efektlerini tek bir modelde birleştirerek uçtan uca sinema kalitesinde ses üretimi sağlıyor","summary":"ByteDance Seed ekibi, ses yaratım modeli Seed Audio 1.0'i yayımladı; bu model, tek bir çerçeve altında insan sesi, ses efektleri ve çevre seslerini birlikte modelleyebiliyor, 100 ms aralık hassasiyetinde zaman kontrolünü, tek seferde yaklaşık 2 dakika uzunluğunda sesin uzatılarak üretilmesini ve 20'den fazla dilde doğal üretimi destekliyor. Bu model, Volkan Ark Deneyim Merkezi'nde kullanıma sunuldu; çoğu sahnede ses kullanılabilirliği %90'ın üzerinde olup, çok dilli seslerin doğallık MOS değeri 4 puanın üzerinde.","category":"产品更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"ByteDance, Seed Audio 1.0 ses yaratım modelini yayınladı; insan sesi ve ses efektlerini tek bir modelde birleştirerek uçtan uca sinema kalitesinde ses üretimi sağlıyor - Aioga AI Haberleri","description":"ByteDance Seed ekibi, ses yaratım modeli Seed Audio 1.0'i yayımladı; bu model, tek bir çerçeve altında insan sesi, ses efektleri ve çevre seslerini birlikte modelleyebiliyor, 100 m...","url":"https://www.aioga.com/tr/news/cmrsopm9r0b7ubiwmtfvpwkxu/","contentTranslated":true,"sourceHash":"16cb69d66e1dc1f9","translatedAt":"2026-07-22T16:51:09.621Z"},"vi":{"title":"ByteDance phát hành mô hình sáng tạo âm thanh Seed Audio 1.0, thống nhất lập mô hình giọng nói và hiệu ứng âm thanh để thực hiện tạo âm thanh cấp phim từ đầu đến cuối","summary":"Đội ngũ Seed của ByteDance đã phát hành mô hình sáng tạo âm thanh Seed Audio 1.0, mô hình hóa đồng thời giọng nói, hiệu ứng âm thanh và âm thanh môi trường trong cùng một khung, hỗ trợ kiểm soát thời gian với độ chính xác 100ms, mở rộng tạo âm thanh khoảng 2 phút mỗi lần và tự nhiên hóa hơn 20 ngôn ngữ. Mô hình này đã được triển khai tại Trung tâm Trải nghiệm Vulcan Ark, với tỷ lệ khả dụng âm thanh trong hầu hết các kịch bản đạt hơn 90%, độ tự nhiên âm thanh đa ngôn ngữ MOS đạt trên 4 điểm.","category":"产品更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"ByteDance phát hành mô hình sáng tạo âm thanh Seed Audio 1.0, thống nhất lập mô hình giọng nói và hiệu ứng âm thanh để thực hiện tạo âm thanh cấp phim từ đầu đến cuối - Tin tức AI Aioga","description":"Đội ngũ Seed của ByteDance đã phát hành mô hình sáng tạo âm thanh Seed Audio 1.0, mô hình hóa đồng thời giọng nói, hiệu ứng âm thanh và âm thanh môi trường trong cùng một khung, hỗ...","url":"https://www.aioga.com/vi/news/cmrsopm9r0b7ubiwmtfvpwkxu/","contentTranslated":true,"sourceHash":"16cb69d66e1dc1f9","translatedAt":"2026-07-22T16:51:05.879Z"},"id":{"title":"ByteDance merilis model kreasi audio Seed Audio 1.0, memodelkan suara manusia dan efek suara secara terpadu untuk mewujudkan produksi audio tingkat film dari ujung ke ujung","summary":"Tim Seed ByteDance merilis model kreasi audio Seed Audio 1.0, yang dalam kerangka terpadu memodelkan suara manusia, efek suara, dan suara lingkungan secara bersamaan, mendukung kontrol waktu dengan presisi interval 100ms, perluasan pembuatan audio sekitar 2 menit per sesi, serta produksi alami dalam lebih dari 20 bahasa. Model ini telah diluncurkan di Pusat Pengalaman Volcano Ark, dengan tingkat ketersediaan audio di sebagian besar skenario mencapai lebih dari 90%, dan MOS (Mean Opinion Score) untuk kelancaran audio multibahasa lebih dari 4 poin.","category":"产品更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"ByteDance merilis model kreasi audio Seed Audio 1.0, memodelkan suara manusia dan efek suara secara terpadu untuk mewujudkan produksi audio tingkat film dari ujung ke ujung - Berita AI Aioga","description":"Tim Seed ByteDance merilis model kreasi audio Seed Audio 1.0, yang dalam kerangka terpadu memodelkan suara manusia, efek suara, dan suara lingkungan secara bersamaan, mendukung kon...","url":"https://www.aioga.com/id/news/cmrsopm9r0b7ubiwmtfvpwkxu/","contentTranslated":true,"sourceHash":"16cb69d66e1dc1f9","translatedAt":"2026-07-22T16:51:54.501Z"},"th":{"title":"ByteDance เปิดตัวโมเดลการสร้างเสียง Seed Audio 1.0 รวมการสร้างเสียงมนุษย์และเอฟเฟกต์เสียงเข้าด้วยกันเพื่อให้สามารถสร้างเสียงระดับภาพยนตร์จากต้นทางถึงปลายทาง","summary":"ทีม Seed ของ ByteDance เปิดตัวโมเดลการสร้างสรรค์เสียง Seed Audio 1.0 ซึ่งสามารถจำลองเสียงมนุษย์ เสียงเอฟเฟกต์ และเสียงสิ่งแวดล้อมภายใต้กรอบเดียวกัน รองรับการควบคุมเวลาที่มีความแม่นยำ 100 มิลลิวินาที การสร้างเสียงต่อเนื่องประมาณ 2 นาทีต่อครั้ง และการสร้างเสียงตามธรรมชาติในมากกว่า 20 ภาษา โมเดลนี้ได้เปิดใช้งานแล้วที่ศูนย์ประสบการณ์ Volcano Ark โดยอัตราการใช้งานเสียงในหลาย ๆ ฉากเกิน 90% และคุณภาพเสียงตามธรรมชาติหลายภาษามี MOS เกิน 4 คะแนน","category":"产品更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"ByteDance เปิดตัวโมเดลการสร้างเสียง Seed Audio 1.0 รวมการสร้างเสียงมนุษย์และเอฟเฟกต์เสียงเข้าด้วยกันเพื่อให้สามารถสร้างเสียงระดับภาพยนตร์จากต้นทางถึงปลายทาง - ข่าว AI Aioga","description":"ทีม Seed ของ ByteDance เปิดตัวโมเดลการสร้างสรรค์เสียง Seed Audio 1.0 ซึ่งสามารถจำลองเสียงมนุษย์ เสียงเอฟเฟกต์ และเสียงสิ่งแวดล้อมภายใต้กรอบเดียวกัน รองรับการควบคุมเวลาที่มีความแม่น...","url":"https://www.aioga.com/th/news/cmrsopm9r0b7ubiwmtfvpwkxu/","contentTranslated":true,"sourceHash":"16cb69d66e1dc1f9","translatedAt":"2026-07-22T16:52:03.585Z"},"pl":{"title":"ByteDance wprowadza model tworzenia dźwięku Seed Audio 1.0, integrując modelowanie ludzkiego głosu i efektów dźwiękowych w celu realizacji generowania dźwięku na poziomie filmowym od początku do końca","summary":"Zespół Seed ByteDance wydał model do tworzenia audio Seed Audio 1.0, który w ramach jednego spójnego systemu łączy modelowanie ludzkiego głosu, efektów dźwiękowych i dźwięków otoczenia, wspierając kontrolę czasową z dokładnością do 100 ms, wydłużoną generację pojedynczego nagrania do około 2 minut oraz naturalne generowanie w ponad 20 językach. Model został udostępniony w Centrum Doświadczeń Huoshan Ark, a dostępność dźwięku w większości scenariuszy przekracza 90%, przy naturalności dźwięku w wielu językach MOS powyżej 4 punktów.","category":"产品更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"ByteDance wprowadza model tworzenia dźwięku Seed Audio 1.0, integrując modelowanie ludzkiego głosu i efektów dźwiękowych w celu realizacji generowania dźwięku na poziomie filmowym od początku do końca - Aioga Wiadomości AI","description":"Zespół Seed ByteDance wydał model do tworzenia audio Seed Audio 1.0, który w ramach jednego spójnego systemu łączy modelowanie ludzkiego głosu, efektów dźwiękowych i dźwięków otocz...","url":"https://www.aioga.com/pl/news/cmrsopm9r0b7ubiwmtfvpwkxu/","contentTranslated":true,"sourceHash":"16cb69d66e1dc1f9","translatedAt":"2026-07-22T16:52:57.181Z"}}}}