阿里通义千问推出最新文本转语音模型Qwen-Audio-3.0-TTS,提供Flash(实时交互)和Plus(高质量生成)两个版本。
新功能包括细粒度内联标签控制(如【whisper】、【angry】)、自然语言风格控制、支持16种语言,以及一次生成长达3分钟的长文本。
该模型目前在Artificial Analysis TTS排行榜上排名第一。
AliTong Yi Qianwen a lancé le dernier modèle de conversion texte-en-voix Qwen-Audio-3.0-TTS, offrant deux versions : Flash (interaction en temps réel) et P...
AliTong Yi Qianwen a lancé le dernier modèle de conversion texte-en-voix Qwen-Audio-3.0-TTS, offrant
deux versions : Flash (interaction en temps réel) et Plus (génération de haute qualité). Les nouvelles fonctionnalités incluent le contrôle des étiquettes intégrées à granularité fine (comme 【whisper】, 【angry】), le contrôle du style en langage naturel, le support de 16 langues, ainsi que la génération d’un texte long pouvant atteindre 3 minutes en une seule fois. Ce modèle est actuellement classé premier dans le classement Artificial Analysis TTS.
阿里通义千问推出最新文本转语音模型Qwen-Audio-3.0-TTS,提供Flash(实时交互)和Plus(高质量生成)两个版本。
新功能包括细粒度内联标签控制(如【whisper】、【angry】)、自然语言风格控制、支持16种语言,以及一次生成长达3分钟的长文本。
该模型目前在Artificial Analysis TTS排行榜上排名第一。
通义千问发布Qwen-Audio-3.0-TTS,分为面向实时交互的Flash版和面向高质量生成的Plus版,并称该模型目前位列Artificial Analysis TTS排行榜第一。
公开材料显示,新模型支持细粒度内联标签与自然语言风格控制,可通过【whisper】、【angry】等标签调整表达;同时支持16种语言,单次可生成最长3分钟的文本语音。
Aioga判断,Flash与Plus的版本划分体现了对实时性和生成质量两类需求的分别覆盖;内联标签和自然语言控制则可能降低用户精细调整语音风格的操作门槛。
Aioga判断,16种语言、最长3分钟生成以及多种风格控制能力,可能扩大该模型在多语言内容和较长语音生成场景中的适用范围,但实际效果仍需结合具体使用结果评估。 值得关注的是,后续公开信息能否进一步说明Flash与Plus在延迟、质量及适用场景上的差异,以及排行榜第一所依据的具体测试维度和评估条件。
La source fournit un titre, un résumé, une attribution et un lien original. Aioga ne republie pas l’article intégral.
Canal de collecte: Agrégation de résumés · Domaine source: x.com
Source: X:通义千问 / Qwen (@Alibaba_Qwen)
Lien original: Ouvrir la source
Archive Aioga: Ouvrir la page de veille
Content record: social-summary · Updated: 2026-07-23T12:33:27.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga agrège l’actualité mondiale de l’IA et conserve les sources pour vérification et citation.