Aioga
AI资讯 / 模型更新
返回 AI资讯

阿里通义实验室发布 Qwen-Audio-3.0-TTS,面向 16 种语言的 Flash 与 Plus 级托管语音合成模型

MarkTechPost(RSS)Aioga 编辑团队2026-07-20T21:14:19.000Z热度 55

阿里通义实验室推出 Qwen-Audio-3.0-TTS,一款面向生产的文本转语音系统,提供 Flash(实时交互)和 Plus(高质量生成)两个版本。该模型通过阿里云 Mod...

模型更新MarkTechPost(RSS)

今日 AI 情报摘要

阿里通义实验室推出 Qwen-Audio-3.0-TTS,一款面向生产的文本转语音系统,提供 Flash(实时交互)和 Plus(高质量生成)两个版本。

该模型通过阿里云 Model Studio 以托管 API 形式交付,不支持权重下载,覆盖 16 种语言。

中文正文 · AI 翻译

阿里巴巴的通义实验室:https://tongyilab.substack.com/p/qwen-audio-30-tts-more-multilingual 发布了 Qwen-Audio-3.0-TTS:https://funaudiollm.github.io/qwen-audio-3.0-tts/,这是一款面向生产的文本转语音(TTS)系统。该模型从同一系列分为两个版本。Flash 面向实时交互。Plus 面向高质量生成。两者都作为阿里云模型工作室:https://www.alibabacloud.com/help/en/model-studio/realtime-tts-user-guide 托管的模型提供,而非可下载的权重文件。

此次发布重点关注开发者在生产中会遇到的四个方面:更广的语言覆盖、自然语言风格控制、细粒度标签控制,以及在参考音频不干净时的鲁棒性。Qwen-Audio-3.0-TTS-Plus 还在独立的 Artificial Analysis:https://artificialanalysis.ai/text-to-speech/models/qwen-audio-3-0-tts-plus 文本转语音排行榜中排名第一。

这两个层级对应不同的任务。Flash 以实时交互为调优目标,首包延迟在 300 毫秒级别。Plus 以高质量生成为调优目标,在这种情况下,自然度和音色保真度比速度更重要。

模型 ID 分别为 qwen-audio-3.0-tts-flash 和 qwen-audio-3.0-tts-plus。两者均通过双向 WebSocket 流协议调用。API 支持 PCM、WAV、MP3 和 Opus,输出采样率最高可达 48 kHz。它提供流式输入和输出、语音克隆、语音设计:https://www.alibabacloud.com/help/en/model-studio/voice-design-user-guide,以及指令控制。阿里巴巴提供 DashScope SDK,以及 Python、Java、Go、C#、PHP 和 Node.js 的原始 WebSocket 示例,覆盖新加坡和北京区域。

系统有两个设计选择作为支柱。

该模型还支持一次性长文本合成(最长 3 分钟)、复杂文本规范化案例以及 48 kHz 输出的声码器超分辨率。

Qwen-Audio-3.0-TTS 支持 16 种语言:阿拉伯语、中文、英语、法语、德语、印尼语、意大利语、日语、韩语、马来语、葡萄牙语、俄语、西班牙语、他加禄语、泰语和越南语。其中 7 种是相比之前系列新增的。它还覆盖了 20 个中文方言地区。

在多语言可理解性方面,该模型系列在16种语言中有10种达到最佳词/字符错误率(WER/CER)。Flash 在平均 WER/CER 上表现最低,为 3.87;Plus 接近,达到 3.96。该指标数值越低越好。

在发音相似性方面,Plus 在所有16种语言中排名第一,平均得分为 82.75,Flash 紧随其后为 80.44。此次发布还增加了一个精心策划的预设语音库,涵盖16种支持语言,因此团队可以在不先克隆语音的情况下使用现成语音。

为了实现精确控制,研究团队将内联标签直接嵌入目标文本。此次发布增加了86个细粒度内联标签,以便在短语和单词层面进行本地化控制。这些标签涵盖了情感转换和非语言事件,如笑声、呼吸、咳嗽和叹息。

Model Studio 文档:https://www.alibabacloud.com/help/en/model-studio/realtime-tts-user-guide 将这些标签分为两类。控制标签如 [excited]、[sad]、[whispers] 和 [asmr] 设置一种情绪或风格,直到下一个标签出现。丰富语言标签如 [laughing]、[gasp] 和 [clears throat] 插入单一的语音效果,而不改变周围语气。示例:[excited]今天多美好的一天啊![laughing]我们一起出去玩吧!这里值得注意的一个限制是:这些情绪和丰富语言标签仅在单向流式模式下支持。

Qwen-Audio-3.0-TTS-Plus 在人工分析:https://x.com/ArtificialAnlys/status/2077140161335631957 Speech Arena 的提供商语音质量评测中获得最高质量位置,其 Elo 值接近 1,236,略高于 Simba 3.2 的 1,234,并明显高于 Gemini 3.1 Flash TTS(1,214)和 Sonic 3.5(1,207)。与 Simba 3.2 的领先位于重叠的置信区间内,因此在最高位置上统计上属于平局。

有两个权衡点值得明确说明。吞吐量适中:Plus 每秒生成约16个字符,低于 Simba 3.2(30.2)、Gemini 3.1 Flash TTS(27)和 Sonic 3.5(120)。价格具有竞争力:标价为每 100 万字符 27.59 美元,大致是 ElevenLabs 和 MiniMax 对其超越等级收费的三分之一。排名和价格经常变化,因此在根据其规划前请确认两者。

早期反响谨慎而热情。最广泛传播的故事是,一款非西方的 TTS 以现有价格的一小部分占据了市场领先地位。最常见的顾虑是该模型仅限托管,其吞吐量落后于竞争对手,并且其名称与开放的 Qwen3-TTS 系列重名。下方仪表板汇总了 X、Reddit 和 Hacker News 上的早期信号。

来源:Qwen-Audio-3.0-TTS 发布博客:https://funaudiollm.github.io/qwen-audio-3.0-tts/ · 同艺实验室公告:https://tongyilab.substack.com/p/qwen-audio-30-tts-more-multilingual · 阿里云 Model Studio 实时 TTS 文档:https://www.alibabacloud.com/help/en/model-studio/realtime-tts-user-guide · Artificial Analysis 排行榜:https://artificialanalysis.ai/text-to-speech/models/qwen-audio-3-0-tts-plus · 同艺实验室在 X:https://x.com/Ali_TongyiLab/status/2079154078517772739

阿里通义实验室发布 Qwen-Audio-3.0-TTS,面向 16 种语言的 Flash 与 Plus 级托管语音合成模型

Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一名有远见的企业家和工程师,Asif 致力于利用人工智能的潜力创造社会价值。他最近的努力是推出人工智能媒体平台 Marktechpost,该平台以对机器学习和深度学习新闻的深入报道而闻名,既技术可靠,又便于广大观众理解。该平台每月浏览量超过 200 万次,显示了其受观众欢迎的程度。

Google Releases Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber

构建智能活动场馆运营商 [完整代码]:https://pxllnk.co/twdn5

感谢!我们的团队将很快与您联系 🙌

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:阿里通义实验室推出 Qwen-Audio-3.0-TTS,一款面向生产的文本转语音系统,提供 Flash(实时交互)和 Plus(高质量生成)两个版本。 Aioga 将其归入「模型更新」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-20T21:14:19.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

阿里通义实验室推出 Qwen-Audio-3.0-TTS,一款面向生产的文本转语音系统,提供 Flash(实时交互)和 Plus(高质量生成)两个版本。该模型通过阿里云 Mod...

MarkTechPost(RSS)2026-07-20T21:14:19.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。