通义实验室发布 Qwen-Audio-3.0-TTS,含 Flash(首包延迟约300ms)和 Plus 两个版本。
Plus 版本在 Artificial Analysis 榜单夺冠,支持16种语言和20种中文方言,平均 WER/CER 低至3.87(Flash),说话人相似度最高达82.75(Plus)。
통의 실험실에서 Qwen-Audio-3.0-TTS를 발표했으며, Flash(첫 패킷 지연 약 300ms)와 Plus 두 가지 버전이 있습니다. Plus 버전은 Artificial Analysis 순위에서 1위를 차지했으며, 16개 언어와 20개 중국어 방언을 지원하고, 평균 W...
통의 실험실에서 Qwen-Audio-3.0-TTS를 발표했으며, Flash(첫 패킷 지연 약 300ms)와 Plus 두 가지 버전이 있습니다. Plus 버전은 Artificial
Analysis 순위에서 1위를 차지했으며, 16개 언어와 20개 중국어 방언을 지원하고, 평균 WER/CER는 Flash 기준 3.87까지 낮으며, 화자 유사도는 Plus 기준 최고 82.75에 달합니다.
通义实验室发布 Qwen-Audio-3.0-TTS,含 Flash(首包延迟约300ms)和 Plus 两个版本。
Plus 版本在 Artificial Analysis 榜单夺冠,支持16种语言和20种中文方言,平均 WER/CER 低至3.87(Flash),说话人相似度最高达82.75(Plus)。
通义实验室发布 Qwen-Audio-3.0-TTS,提供 Flash 与 Plus 两个版本。材料称 Flash 首包延迟约300ms,Plus 在 Artificial Analysis 榜单夺冠。
公开材料将该产品归为实时语音合成模型,并披露其支持16种语言和20种中文方言。现有摘录未进一步说明发布时间、训练方法、部署条件或榜单评测规则。
Aioga 判断,双版本设计体现了对响应速度与合成表现两类指标的区分。榜单成绩和延迟数据值得关注,但仍需结合完整评测口径与实际应用测试审慎理解。
该模型可能为多语言、中文方言及实时语音合成场景提供新的选择。材料给出的平均 WER/CER 低至3.87和相似度最高82.75,可作为初步比较依据,但不代表所有场景表现。 建议后续关注官方是否披露完整模型文档、Artificial Analysis 评测设置、WER/CER 计算口径、说话人相似度测试条件,以及 Flash 与 Plus 在不同语言和方言中的具体表现。
수집 피드는 제목, 요약, 출처와 원문 링크를 제공합니다. Aioga는 원문 전체를 재게시하지 않습니다.
수집 채널: 요약 집계 · 원본 도메인: mp.weixin.qq.com
출처: 公众号:通义实验室(千问)
원문 링크: 원문 열기
Aioga 아카이브: 정보 페이지 보기
Content record: summary-fallback · Updated: 2026-07-20T08:53:11.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga는 전 세계 AI 동향을 집계하고 확인과 인용을 위해 출처 정보를 보존합니다.