通义实验室发布 Qwen-Audio-3.0-TTS,含 Flash(首包延迟约300ms)和 Plus 两个版本。
Plus 版本在 Artificial Analysis 榜单夺冠,支持16种语言和20种中文方言,平均 WER/CER 低至3.87(Flash),说话人相似度最高达82.75(Plus)。
Tongyi Laboratory released Qwen-Audio-3.0-TTS, which includes two versions: Flash (with a first-packet delay of about 300ms) and Plus. The Plus version top...
Tongyi Laboratory released Qwen-Audio-3.0-TTS, which includes two versions: Flash (with a
first-packet delay of about 300ms) and Plus. The Plus version topped the Artificial Analysis rankings, supports 16 languages and 20 Chinese dialects, with an average WER/CER as low as 3.87 (Flash), and a speaker similarity of up to 82.75 (Plus).
通义实验室发布 Qwen-Audio-3.0-TTS,含 Flash(首包延迟约300ms)和 Plus 两个版本。
Plus 版本在 Artificial Analysis 榜单夺冠,支持16种语言和20种中文方言,平均 WER/CER 低至3.87(Flash),说话人相似度最高达82.75(Plus)。
通义实验室发布 Qwen-Audio-3.0-TTS,提供 Flash 与 Plus 两个版本。材料称 Flash 首包延迟约300ms,Plus 在 Artificial Analysis 榜单夺冠。
公开材料将该产品归为实时语音合成模型,并披露其支持16种语言和20种中文方言。现有摘录未进一步说明发布时间、训练方法、部署条件或榜单评测规则。
Aioga 判断,双版本设计体现了对响应速度与合成表现两类指标的区分。榜单成绩和延迟数据值得关注,但仍需结合完整评测口径与实际应用测试审慎理解。
该模型可能为多语言、中文方言及实时语音合成场景提供新的选择。材料给出的平均 WER/CER 低至3.87和相似度最高82.75,可作为初步比较依据,但不代表所有场景表现。 建议后续关注官方是否披露完整模型文档、Artificial Analysis 评测设置、WER/CER 计算口径、说话人相似度测试条件,以及 Flash 与 Plus 在不同语言和方言中的具体表现。
The readable text on this page was extracted from the public source and organized with attribution, publication time and the original link. Copyright remains with the original author and publisher.
Ingestion channel: Summary aggregation · Source domain: mp.weixin.qq.com
Source: 公众号:通义实验室(千问)
Original link: Open original source
Aioga archive: Open intelligence page
Content record: summary-fallback · Updated: 2026-07-20T08:53:11.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga aggregates global AI updates and preserves source information for verification and citation.