通义实验室发布 Qwen-Audio-3.0-TTS,含 Flash(首包延迟约300ms)和 Plus 两个版本。
Plus 版本在 Artificial Analysis 榜单夺冠,支持16种语言和20种中文方言,平均 WER/CER 低至3.87(Flash),说话人相似度最高达82.75(Plus)。
Tongyi Laboratory lanzó Qwen-Audio-3.0-TTS, con dos versiones: Flash (con un retraso inicial de aproximadamente 300 ms) y Plus. La versión Plus lidera la l...
Tongyi Laboratory lanzó Qwen-Audio-3.0-TTS, con dos versiones: Flash (con un retraso inicial de
aproximadamente 300 ms) y Plus. La versión Plus lidera la lista de Artificial Analysis, soporta 16 idiomas y 20 dialectos chinos, con un WER/CER promedio tan bajo como 3.87 (Flash), y la similitud de orador más alta alcanza 82.75 (Plus).
通义实验室发布 Qwen-Audio-3.0-TTS,含 Flash(首包延迟约300ms)和 Plus 两个版本。
Plus 版本在 Artificial Analysis 榜单夺冠,支持16种语言和20种中文方言,平均 WER/CER 低至3.87(Flash),说话人相似度最高达82.75(Plus)。
通义实验室发布 Qwen-Audio-3.0-TTS,提供 Flash 与 Plus 两个版本。材料称 Flash 首包延迟约300ms,Plus 在 Artificial Analysis 榜单夺冠。
公开材料将该产品归为实时语音合成模型,并披露其支持16种语言和20种中文方言。现有摘录未进一步说明发布时间、训练方法、部署条件或榜单评测规则。
Aioga 判断,双版本设计体现了对响应速度与合成表现两类指标的区分。榜单成绩和延迟数据值得关注,但仍需结合完整评测口径与实际应用测试审慎理解。
该模型可能为多语言、中文方言及实时语音合成场景提供新的选择。材料给出的平均 WER/CER 低至3.87和相似度最高82.75,可作为初步比较依据,但不代表所有场景表现。 建议后续关注官方是否披露完整模型文档、Artificial Analysis 评测设置、WER/CER 计算口径、说话人相似度测试条件,以及 Flash 与 Plus 在不同语言和方言中的具体表现。
La fuente proporciona título, resumen, atribución y enlace original. Aioga no republica el artículo completo.
Canal de ingesta: Agregación de resúmenes · Dominio original: mp.weixin.qq.com
Fuente: 公众号:通义实验室(千问)
Enlace original: Abrir fuente original
Archivo Aioga: Abrir página de inteligencia
Content record: summary-fallback · Updated: 2026-07-20T08:53:11.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga agrega novedades globales de IA y conserva las fuentes para verificación y cita.