阿里巴巴今日发布实时语音交互对话模型 Qwen-Audio-3.0-Realtime,包含推理更强的 Plus 版本和速度更快的 Flash 版本。
该模型在 S2S 语音指令遵循基准 VStyle 上取得 SOTA 效果,并在 Artificial Analysis 子项中综合排名第一,超越 OpenAI GPT-Realtime-2。
阿里巴巴今日发布实时语音交互对话模型 Qwen-Audio-3.0-Realtime,包含推理更强的 Plus 版本和速度更快的 Flash 版本。该模型在 S2S 语音指令遵...
阿里巴巴今日发布实时语音交互对话模型 Qwen-Audio-3.0-Realtime,包含推理更强的 Plus 版本和速度更快的 Flash 版本。
该模型在 S2S 语音指令遵循基准 VStyle 上取得 SOTA 效果,并在 Artificial Analysis 子项中综合排名第一,超越 OpenAI GPT-Realtime-2。
阿里巴巴今日发布实时语音交互对话模型 Qwen-Audio-3.0-Realtime,包含推理更强的 Plus 版本和速度更快的 Flash 版本。
该模型在 S2S 语音指令遵循基准 VStyle 上取得 SOTA 效果,并在 Artificial Analysis 子项中综合排名第一,超越 OpenAI GPT-Realtime-2。
IT之家:https://www.ithome.com/ 7 月 15 日消息,阿里巴巴实时语音交互对话模型 Qwen-Audio-3.0-Realtime 今天(15 日)正式发布,在智商、Agent 工具调用、共情对话和双工交互流畅度四条主线上同步升级,力求“又快又聪明”。
模型包括推理更强的 Plus 版本和速度更快的 Flash 版本,适用于智能客服、教育培训、娱乐互动与情感陪伴等场景。官方表示,该模型将让语音交互“ 懂倾听,更聪明 ”。
针对自定义音色需求,也提供了音色克隆能力配置用于实际业务应用。在 S2S 语音指令遵循公开 Benchmark VStyle 上取得 SOTA 效果。

内置多模态双工控制模型,支持声纹级背景过滤,嘈杂环境下对话依然流畅,不易被打断;
Artificial Analysis 子项中综合排名第一,超越 OpenAI GPT-Realtime-2。
模型能够根据对话语境 动态调整语气、节奏、音调和情感表达 ,实现真正拟人化的语音交互。
在激烈的辩论场景中,准确理解对方论点、快速组织反驳逻辑,同时保持口语化表达和适当的语气强度。
角色扮演时,能根据设定的角色(如历史人物、职业身份等)调整说话风格、用词习惯和情感表达,并响应显式指令进行风格切换。
在情感陪伴中,当你倾诉烦恼或分享喜悦时,通过语调、节奏和内容表达共情,提供温暖的情感支持。
韵律动态调整:根据语义重点与对话节奏,自动调整语速、停顿、重音等韵律特征。
副语言信息处理:能够理解和生成笑声、叹息、犹豫等非语言声音信号,还原真人交流的细腻。
嘈杂背景环境下的双工对话:在餐厅、开放工区等嘈杂环境中,不受干扰,精准锁定你的声音。
多说话人智能切换:根据上下文和语义线索,智能判断当前对话对象,在不同说话人间自然切换。
qwen-audio-3.0-realtime-plus API: 点此前往:https://bailian.console.aliyun.com/cn-beijing/?spm=a2c4g.11186623.0.0.4ab7695bvInrXr#/model-market/detail/qwen-audio-3.0-realtime-plus?serviceSite=asia-pacific-china
qwen-audio-3.0-realtime-flash API: 点此前往:https://bailian.console.aliyun.com/cn-beijing/?spm=a2c4g.11186623.0.0.4ab7695bvInrXr&tab=model#/model-market/detail/qwen-audio-3.0-realtime-flash?serviceSite=asia-pacific-china
Qwen-Audio-3.0-Realtime 文档:点此前往:https://bailian.console.aliyun.com/ cn-beijing/?spm=a2c4g.11186623.0.0.4ab7695bvInrXr&tab=doc#/doc/?type=model&url=3041584
Demo:点此前往:https://github.com/aliyun/alibabacloud-bailian-speech-demo/tree/master/samples/conversation/fun-audiochat-realtime
Aioga 编辑摘要:阿里巴巴今日发布实时语音交互对话模型 Qwen-Audio-3.0-Realtime,包含推理更强的 Plus 版本和速度更快的 Flash 版本。 Aioga 将其归入「模型更新」方向,重点关注它对真实使用和行业竞争的影响。
背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。
Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。
影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。
本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。
抓取通道: RSS · 原始域名: ithome.com
来源: IT之家(RSS)
原文链接: 打开原始来源
Aioga 归档: 查看情报页
Content record: source-page · Updated: 2026-07-15T03:00:22.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。