IT之家:https://www.ithome.com/ 7 月 15 日消息,阿里巴巴实时语音交互对话模型 Qwen-Audio-3.0-Realtime 今天(15 日)正式发布,在智商、Agent 工具调用、共情对话和双工交互流畅度四条主线上同步升级,力求“又快又聪明”。
模型包括推理更强的 Plus 版本和速度更快的 Flash 版本,适用于智能客服、教育培训、娱乐互动与情感陪伴等场景。官方表示,该模型将让语音交互“ 懂倾听,更聪明 ”。
针对自定义音色需求,也提供了音色克隆能力配置用于实际业务应用。在 S2S 语音指令遵循公开 Benchmark VStyle 上取得 SOTA 效果。

内置多模态双工控制模型,支持声纹级背景过滤,嘈杂环境下对话依然流畅,不易被打断;
Artificial Analysis 子项中综合排名第一,超越 OpenAI GPT-Realtime-2。
模型能够根据对话语境 动态调整语气、节奏、音调和情感表达 ,实现真正拟人化的语音交互。
在激烈的辩论场景中,准确理解对方论点、快速组织反驳逻辑,同时保持口语化表达和适当的语气强度。
角色扮演时,能根据设定的角色(如历史人物、职业身份等)调整说话风格、用词习惯和情感表达,并响应显式指令进行风格切换。
在情感陪伴中,当你倾诉烦恼或分享喜悦时,通过语调、节奏和内容表达共情,提供温暖的情感支持。
韵律动态调整:根据语义重点与对话节奏,自动调整语速、停顿、重音等韵律特征。
副语言信息处理:能够理解和生成笑声、叹息、犹豫等非语言声音信号,还原真人交流的细腻。
嘈杂背景环境下的双工对话:在餐厅、开放工区等嘈杂环境中,不受干扰,精准锁定你的声音。
多说话人智能切换:根据上下文和语义线索,智能判断当前对话对象,在不同说话人间自然切换。
qwen-audio-3.0-realtime-plus API: 点此前往:https://bailian.console.aliyun.com/cn-beijing/?spm=a2c4g.11186623.0.0.4ab7695bvInrXr#/model-market/detail/qwen-audio-3.0-realtime-plus?serviceSite=asia-pacific-china
qwen-audio-3.0-realtime-flash API: 点此前往:https://bailian.console.aliyun.com/cn-beijing/?spm=a2c4g.11186623.0.0.4ab7695bvInrXr&tab=model#/model-market/detail/qwen-audio-3.0-realtime-flash?serviceSite=asia-pacific-china
Qwen-Audio-3.0-Realtime 文档:点此前往:https://bailian.console.aliyun.com/ cn-beijing/?spm=a2c4g.11186623.0.0.4ab7695bvInrXr&tab=doc#/doc/?type=model&url=3041584
Demo:点此前往:https://github.com/aliyun/alibabacloud-bailian-speech-demo/tree/master/samples/conversation/fun-audiochat-realtime
