阿里通义千问推出最新文本转语音模型Qwen-Audio-3.0-TTS,提供Flash(实时交互)和Plus(高质量生成)两个版本。
新功能包括细粒度内联标签控制(如【whisper】、【angry】)、自然语言风格控制、支持16种语言,以及一次生成长达3分钟的长文本。
该模型目前在Artificial Analysis TTS排行榜上排名第一。
Ali Tongyi Qianwen has launched the latest text-to-speech model, Qwen-Audio-3.0-TTS, offering two versions: Flash (real-time interaction) and Plus (high-qu...
Ali Tongyi Qianwen has launched the latest text-to-speech model, Qwen-Audio-3.0-TTS, offering two
versions: Flash (real-time interaction) and Plus (high-quality generation). New features include fine-grained inline tag control (such as 【whisper】, 【angry】), natural language style control, support for 16 languages, and the ability to generate long text up to 3 minutes in one go. The model currently ranks first on the Artificial Analysis TTS leaderboard.
阿里通义千问推出最新文本转语音模型Qwen-Audio-3.0-TTS,提供Flash(实时交互)和Plus(高质量生成)两个版本。
新功能包括细粒度内联标签控制(如【whisper】、【angry】)、自然语言风格控制、支持16种语言,以及一次生成长达3分钟的长文本。
该模型目前在Artificial Analysis TTS排行榜上排名第一。
通义千问发布Qwen-Audio-3.0-TTS,分为面向实时交互的Flash版和面向高质量生成的Plus版,并称该模型目前位列Artificial Analysis TTS排行榜第一。
公开材料显示,新模型支持细粒度内联标签与自然语言风格控制,可通过【whisper】、【angry】等标签调整表达;同时支持16种语言,单次可生成最长3分钟的文本语音。
Aioga判断,Flash与Plus的版本划分体现了对实时性和生成质量两类需求的分别覆盖;内联标签和自然语言控制则可能降低用户精细调整语音风格的操作门槛。
Aioga判断,16种语言、最长3分钟生成以及多种风格控制能力,可能扩大该模型在多语言内容和较长语音生成场景中的适用范围,但实际效果仍需结合具体使用结果评估。 值得关注的是,后续公开信息能否进一步说明Flash与Plus在延迟、质量及适用场景上的差异,以及排行榜第一所依据的具体测试维度和评估条件。
The readable text on this page was extracted from the public source and organized with attribution, publication time and the original link. Copyright remains with the original author and publisher.
Ingestion channel: Summary aggregation · Source domain: x.com
Source: X:通义千问 / Qwen (@Alibaba_Qwen)
Original link: Open original source
Aioga archive: Open intelligence page
Content record: social-summary · Updated: 2026-07-23T12:33:27.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga aggregates global AI updates and preserves source information for verification and citation.