阿里通义千问推出最新文本转语音模型Qwen-Audio-3.0-TTS,提供Flash(实时交互)和Plus(高质量生成)两个版本。
新功能包括细粒度内联标签控制(如【whisper】、【angry】)、自然语言风格控制、支持16种语言,以及一次生成长达3分钟的长文本。
该模型目前在Artificial Analysis TTS排行榜上排名第一。
Ali Tongyi Qianwen ha lanzado su último modelo de texto a voz Qwen-Audio-3.0-TTS, que ofrece dos versiones: Flash (interacción en tiempo real) y Plus (gene...
Ali Tongyi Qianwen ha lanzado su último modelo de texto a voz Qwen-Audio-3.0-TTS, que ofrece dos
versiones: Flash (interacción en tiempo real) y Plus (generación de alta calidad). Las nuevas funciones incluyen control de etiquetas en línea de grano fino (como 【whisper】, 【angry】), control de estilo en lenguaje natural, soporte para 16 idiomas y generación de textos largos de hasta 3 minutos de una sola vez. Actualmente, el modelo ocupa el primer lugar en el ranking de TTS de Artificial Analysis.
阿里通义千问推出最新文本转语音模型Qwen-Audio-3.0-TTS,提供Flash(实时交互)和Plus(高质量生成)两个版本。
新功能包括细粒度内联标签控制(如【whisper】、【angry】)、自然语言风格控制、支持16种语言,以及一次生成长达3分钟的长文本。
该模型目前在Artificial Analysis TTS排行榜上排名第一。
通义千问发布Qwen-Audio-3.0-TTS,分为面向实时交互的Flash版和面向高质量生成的Plus版,并称该模型目前位列Artificial Analysis TTS排行榜第一。
公开材料显示,新模型支持细粒度内联标签与自然语言风格控制,可通过【whisper】、【angry】等标签调整表达;同时支持16种语言,单次可生成最长3分钟的文本语音。
Aioga判断,Flash与Plus的版本划分体现了对实时性和生成质量两类需求的分别覆盖;内联标签和自然语言控制则可能降低用户精细调整语音风格的操作门槛。
Aioga判断,16种语言、最长3分钟生成以及多种风格控制能力,可能扩大该模型在多语言内容和较长语音生成场景中的适用范围,但实际效果仍需结合具体使用结果评估。 值得关注的是,后续公开信息能否进一步说明Flash与Plus在延迟、质量及适用场景上的差异,以及排行榜第一所依据的具体测试维度和评估条件。
La fuente proporciona título, resumen, atribución y enlace original. Aioga no republica el artículo completo.
Canal de ingesta: Agregación de resúmenes · Dominio original: x.com
Fuente: X:通义千问 / Qwen (@Alibaba_Qwen)
Enlace original: Abrir fuente original
Archivo Aioga: Abrir página de inteligencia
Content record: social-summary · Updated: 2026-07-23T12:33:27.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga agrega novedades globales de IA y conserva las fuentes para verificación y cita.