阿里通义千问推出最新文本转语音模型Qwen-Audio-3.0-TTS,提供Flash(实时交互)和Plus(高质量生成)两个版本。
新功能包括细粒度内联标签控制(如【whisper】、【angry】)、自然语言风格控制、支持16种语言,以及一次生成长达3分钟的长文本。
该模型目前在Artificial Analysis TTS排行榜上排名第一。
Ali Tongyi Qianwen ra mắt mô hình chuyển văn bản thành giọng nói mới Qwen-Audio-3.0-TTS, cung cấp hai phiên bản Flash (tương tác thời gian thực) và Plus (t...
Ali Tongyi Qianwen ra mắt mô hình chuyển văn bản thành giọng nói mới Qwen-Audio-3.0-TTS, cung cấp
hai phiên bản Flash (tương tác thời gian thực) và Plus (tạo chất lượng cao). Tính năng mới bao gồm kiểm soát thẻ nội tuyến chi tiết (như 【whisper】, 【angry】), kiểm soát phong cách bằng ngôn ngữ tự nhiên, hỗ trợ 16 ngôn ngữ, cũng như tạo văn bản dài lên đến 3 phút một lần. Mô hình này hiện đang đứng đầu bảng xếp hạng TTS của Artificial Analysis.
阿里通义千问推出最新文本转语音模型Qwen-Audio-3.0-TTS,提供Flash(实时交互)和Plus(高质量生成)两个版本。
新功能包括细粒度内联标签控制(如【whisper】、【angry】)、自然语言风格控制、支持16种语言,以及一次生成长达3分钟的长文本。
该模型目前在Artificial Analysis TTS排行榜上排名第一。
通义千问发布Qwen-Audio-3.0-TTS,分为面向实时交互的Flash版和面向高质量生成的Plus版,并称该模型目前位列Artificial Analysis TTS排行榜第一。
公开材料显示,新模型支持细粒度内联标签与自然语言风格控制,可通过【whisper】、【angry】等标签调整表达;同时支持16种语言,单次可生成最长3分钟的文本语音。
Aioga判断,Flash与Plus的版本划分体现了对实时性和生成质量两类需求的分别覆盖;内联标签和自然语言控制则可能降低用户精细调整语音风格的操作门槛。
Aioga判断,16种语言、最长3分钟生成以及多种风格控制能力,可能扩大该模型在多语言内容和较长语音生成场景中的适用范围,但实际效果仍需结合具体使用结果评估。 值得关注的是,后续公开信息能否进一步说明Flash与Plus在延迟、质量及适用场景上的差异,以及排行榜第一所依据的具体测试维度和评估条件。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: x.com
Nguồn: X:通义千问 / Qwen (@Alibaba_Qwen)
原文链接: Mở nguồn gốc
Aioga 归档: 查看情报页
Content record: social-summary · Updated: 2026-07-23T12:33:27.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。