通义实验室发布 Qwen-Audio-3.0-TTS,含 Flash(首包延迟约300ms)和 Plus 两个版本。
Plus 版本在 Artificial Analysis 榜单夺冠,支持16种语言和20种中文方言,平均 WER/CER 低至3.87(Flash),说话人相似度最高达82.75(Plus)。
Tongyi Laboratory merilis Qwen-Audio-3.0-TTS, termasuk dua versi, Flash (paket pertama dengan delay sekitar 300ms) dan Plus. Versi Plus memimpin di peringk...
Tongyi Laboratory merilis Qwen-Audio-3.0-TTS, termasuk dua versi, Flash (paket pertama dengan delay
sekitar 300ms) dan Plus. Versi Plus memimpin di peringkat Artificial Analysis, mendukung 16 bahasa dan 20 dialek Tionghoa, dengan rata-rata WER/CER serendah 3,87 (Flash), dan tingkat kesamaan pembicara hingga 82,75 (Plus).
通义实验室发布 Qwen-Audio-3.0-TTS,含 Flash(首包延迟约300ms)和 Plus 两个版本。
Plus 版本在 Artificial Analysis 榜单夺冠,支持16种语言和20种中文方言,平均 WER/CER 低至3.87(Flash),说话人相似度最高达82.75(Plus)。
通义实验室发布 Qwen-Audio-3.0-TTS,提供 Flash 与 Plus 两个版本。材料称 Flash 首包延迟约300ms,Plus 在 Artificial Analysis 榜单夺冠。
公开材料将该产品归为实时语音合成模型,并披露其支持16种语言和20种中文方言。现有摘录未进一步说明发布时间、训练方法、部署条件或榜单评测规则。
Aioga 判断,双版本设计体现了对响应速度与合成表现两类指标的区分。榜单成绩和延迟数据值得关注,但仍需结合完整评测口径与实际应用测试审慎理解。
该模型可能为多语言、中文方言及实时语音合成场景提供新的选择。材料给出的平均 WER/CER 低至3.87和相似度最高82.75,可作为初步比较依据,但不代表所有场景表现。 建议后续关注官方是否披露完整模型文档、Artificial Analysis 评测设置、WER/CER 计算口径、说话人相似度测试条件,以及 Flash 与 Plus 在不同语言和方言中的具体表现。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: mp.weixin.qq.com
Sumber: 公众号:通义实验室(千问)
原文链接: Buka sumber asli
Aioga 归档: 查看情报页
Content record: summary-fallback · Updated: 2026-07-20T08:53:11.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。