通义实验室发布 Qwen-Audio-3.0-TTS,含 Flash(首包延迟约300ms)和 Plus 两个版本。
Plus 版本在 Artificial Analysis 榜单夺冠,支持16种语言和20种中文方言,平均 WER/CER 低至3.87(Flash),说话人相似度最高达82.75(Plus)。
通義実験室は Qwen-Audio-3.0-TTS を発表し、Flash(初回パック遅延約300ms)と Plus の2つのバージョンを含む。Plus バージョンは Artificial Analysis ランキングで首位を獲得し、16言語と20の中国語方言をサポート、平均 WER/CER は Flash で...
通義実験室は Qwen-Audio-3.0-TTS を発表し、Flash(初回パック遅延約300ms)と Plus の2つのバージョンを含む。
Plus バージョンは Artificial Analysis ランキングで首位を獲得し、16言語と20の中国語方言をサポート、平均 WER/CER は Flash で3.87まで低下、話者の類似度は Plus で最高82.75に達する。
通义实验室发布 Qwen-Audio-3.0-TTS,含 Flash(首包延迟约300ms)和 Plus 两个版本。
Plus 版本在 Artificial Analysis 榜单夺冠,支持16种语言和20种中文方言,平均 WER/CER 低至3.87(Flash),说话人相似度最高达82.75(Plus)。
通义实验室发布 Qwen-Audio-3.0-TTS,提供 Flash 与 Plus 两个版本。材料称 Flash 首包延迟约300ms,Plus 在 Artificial Analysis 榜单夺冠。
公开材料将该产品归为实时语音合成模型,并披露其支持16种语言和20种中文方言。现有摘录未进一步说明发布时间、训练方法、部署条件或榜单评测规则。
Aioga 判断,双版本设计体现了对响应速度与合成表现两类指标的区分。榜单成绩和延迟数据值得关注,但仍需结合完整评测口径与实际应用测试审慎理解。
该模型可能为多语言、中文方言及实时语音合成场景提供新的选择。材料给出的平均 WER/CER 低至3.87和相似度最高82.75,可作为初步比较依据,但不代表所有场景表现。 建议后续关注官方是否披露完整模型文档、Artificial Analysis 评测设置、WER/CER 计算口径、说话人相似度测试条件,以及 Flash 与 Plus 在不同语言和方言中的具体表现。
取得元が提供するタイトル、要約、出典、元記事リンクを掲載しています。記事全文は転載していません。
取得経路: 要約集約 · 元ドメイン: mp.weixin.qq.com
出典: 公众号:通义实验室(千问)
元記事: 元記事を開く
Aioga アーカイブ: 情報ページを開く
Content record: summary-fallback · Updated: 2026-07-20T08:53:11.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga は世界の AI 動向を集約し、確認と引用のため出典情報を保持します。