{"@context":"https://schema.org","@type":"NewsArticle","generatedAt":"2026-07-23T07:21:26.498Z","headline":"阿里通义实验室发布 Qwen-Audio-3.0-TTS，面向 16 种语言的 Flash 与 Plus 级托管语音合成模型","description":"阿里通义实验室推出 Qwen-Audio-3.0-TTS，一款面向生产的文本转语音系统，提供 Flash（实时交互）和 Plus（高质量生成）两个版本。该模型通过阿里云 Model Studio 以托管 API 形式交付，不支持权重下载，覆盖 16 种语言。","url":"https://www.aioga.com/news/cmrtqb3i01f3gbihzjwf1l6yb/","mainEntityOfPage":"https://www.aioga.com/news/cmrtqb3i01f3gbihzjwf1l6yb/","datePublished":"2026-07-20T21:14:19.000Z","dateModified":"2026-07-20T21:14:19.000Z","inLanguage":"zh-CN","publisher":{"@type":"NewsMediaOrganization","name":"Aioga","url":"https://www.aioga.com"},"citation":["https://www.marktechpost.com/2026/07/20/alibabas-tongyi-lab-releases-qwen-audio-3-0-tts-a-hosted-text-to-speech-model-in-flash-and-plus-tiers-across-16-languages","https://aihot.virxact.com/items/cmrtqb3i01f3gbihzjwf1l6yb"],"canonicalUrl":"https://www.aioga.com/news/cmrtqb3i01f3gbihzjwf1l6yb/","directAnswer":{"@type":"Answer","text":"Aioga 编辑摘要：阿里通义实验室推出 Qwen-Audio-3.0-TTS，一款面向生产的文本转语音系统，提供 Flash（实时交互）和 Plus（高质量生成）两个版本。 Aioga 将其归入「模型更新」方向，重点关注它对真实使用和行业竞争的影响。","url":"https://www.aioga.com/news/cmrtqb3i01f3gbihzjwf1l6yb/","dateCreated":"2026-07-20T21:14:19.000Z","author":{"@type":"Organization","@id":"https://www.aioga.com/authors/aioga-editorial/#editorial-team","name":"Aioga Editorial Team","url":"https://www.aioga.com/authors/aioga-editorial/"}},"evidence":[{"@type":"CreativeWork","name":"marktechpost.com source article","url":"https://www.marktechpost.com/2026/07/20/alibabas-tongyi-lab-releases-qwen-audio-3-0-tts-a-hosted-text-to-speech-model-in-flash-and-plus-tiers-across-16-languages","datePublished":"2026-07-20T21:14:19.000Z","provider":{"@type":"Organization","name":"marktechpost.com","url":"https://www.marktechpost.com/2026/07/20/alibabas-tongyi-lab-releases-qwen-audio-3-0-tts-a-hosted-text-to-speech-model-in-flash-and-plus-tiers-across-16-languages"}},{"@type":"CreativeWork","name":"AIHot archive record","url":"https://aihot.virxact.com/items/cmrtqb3i01f3gbihzjwf1l6yb","datePublished":"2026-07-20T21:14:19.000Z","provider":{"@type":"Organization","name":"AIHot","url":"https://aihot.virxact.com/items/cmrtqb3i01f3gbihzjwf1l6yb"}}],"aggregationSource":"MarkTechPost（RSS）","originalPublisher":{"name":"marktechpost.com","url":"https://www.marktechpost.com/2026/07/20/alibabas-tongyi-lab-releases-qwen-audio-3-0-tts-a-hosted-text-to-speech-model-in-flash-and-plus-tiers-across-16-languages"},"article":{"id":"cmrtqb3i01f3gbihzjwf1l6yb","slug":"cmrtqb3i01f3gbihzjwf1l6yb","url":"https://www.aioga.com/news/cmrtqb3i01f3gbihzjwf1l6yb/","title":"阿里通义实验室发布 Qwen-Audio-3.0-TTS，面向 16 种语言的 Flash 与 Plus 级托管语音合成模型","title_en":"Alibaba's Tongyi Lab Releases Qwen-Audio-3.0-TTS， a Hosted Text-to-Speech Model in Flash and Plus Tiers Across 16 Languages","summary":"阿里通义实验室推出 Qwen-Audio-3.0-TTS，一款面向生产的文本转语音系统，提供 Flash（实时交互）和 Plus（高质量生成）两个版本。该模型通过阿里云 Model Studio 以托管 API 形式交付，不支持权重下载，覆盖 16 种语言。","source":"MarkTechPost（RSS）","sourceUrl":"https://www.marktechpost.com/2026/07/20/alibabas-tongyi-lab-releases-qwen-audio-3-0-tts-a-hosted-text-to-speech-model-in-flash-and-plus-tiers-across-16-languages","aiHotUrl":"https://aihot.virxact.com/items/cmrtqb3i01f3gbihzjwf1l6yb","publishedAt":"2026-07-20T21:14:19.000Z","category":"模型更新","score":55,"selected":false,"articleBody":["Alibaba’s Tongyi Lab：https://tongyilab.substack.com/p/qwen-audio-30-tts-more-multilingual has released Qwen-Audio-3.0-TTS：https://funaudiollm.github.io/qwen-audio-3.0-tts/ , a production-oriented text-to-speech (TTS) system. The model ships in two variants from the same lineage. Flash targets real-time interaction. Plus targets high-quality generation. Both are delivered as hosted models through Alibaba Cloud Model Studio：https://www.alibabacloud.com/help/en/model-studio/realtime-tts-user-guide, not as downloadable weights.","The release focuses on four things developers hit in production: broader language coverage, natural-language style control, fine-grained tag control, and robustness when the reference audio is not clean. Qwen-Audio-3.0-TTS-Plus also ranks first on the independent Artificial Analysis：https://artificialanalysis.ai/text-to-speech/models/qwen-audio-3-0-tts-plus Text-to-Speech leaderboard.","The two tiers map to different jobs. Flash is tuned for real-time interaction, with first-packet latency at the 300 ms level. Plus is tuned for high-quality generation, where naturalness and timbre fidelity matter more than speed.","The model IDs are qwen-audio-3.0-tts-flash and qwen-audio-3.0-tts-plus . Both are called over a bidirectional WebSocket streaming protocol. The API supports PCM, WAV, MP3, and Opus, with sample-rate output up to 48 kHz. It exposes streaming input and output, voice cloning, Voice Design：https://www.alibabacloud.com/help/en/model-studio/voice-design-user-guide, and instruction control. Alibaba provides the DashScope SDK plus raw WebSocket examples in Python, Java, Go, C#, PHP, and Node.js, across its Singapore and Beijing regions.","Two design choices anchor the system.","The model also handles one-pass long-form synthesis up to 3 minutes, hard text-normalization cases, and vocoder super-resolution for 48 kHz output.","Qwen-Audio-3.0-TTS supports 16 languages : Arabic, Chinese, English, French, German, Indonesian, Italian, Japanese, Korean, Malay, Portuguese, Russian, Spanish, Tagalog, Thai, and Vietnamese. Seven of these are newly added versus the prior line. It also covers 20 Chinese dialect regions.","On multilingual intelligibility, the model family posts the best word/character error rate (WER/CER) in 10 of the 16 languages. Flash delivers the lowest average WER/CER at 3.87 ; Plus is close at 3.96 . Lower is better on this metric.","On speaker similarity, Plus ranks first across all 16 languages with an average of 82.75 , and Flash follows at 80.44 . The release also adds a curated preset voice library spanning the 16 supported languages, so teams can ship a voice without cloning one first.","For precise control, the research team embed inline tags directly in the target text. The release adds 86 fine-grained inline tags for localized control at the phrase and word level. These cover expressive transitions and non-verbal events such as laughter, breathing, coughing, and sighing.","The Model Studio documentation：https://www.alibabacloud.com/help/en/model-studio/realtime-tts-user-guide splits these into two groups. Control tags such as [excited] , [sad] , [whispers] , and [asmr] set an emotion or style until the next tag. Rich-language tags such as [laughing] , [gasp] , and [clears throat] insert a single vocal effect without changing surrounding tone. A worked example: [excited]What a beautiful day today![laughing]Let's go out and have fun together! One limitation is worth noting here: these emotion and rich-language tags are supported only in unidirectional streaming mode.","Qwen-Audio-3.0-TTS-Plus took the top quality spot on the Artificial Analysis：https://x.com/ArtificialAnlys/status/2077140161335631957 Speech Arena for Provider Voices. It posts an Elo near 1,236, narrowly ahead of Simba 3.2 at 1,234, and clear of Gemini 3.1 Flash TTS (1,214) and Sonic 3.5 (1,207). The lead over Simba 3.2 sits inside overlapping confidence intervals, so it is a statistical tie at the very top.","Two trade-offs are worth stating plainly. Throughput is modest: Plus generates about 16 characters per second, below Simba 3.2 (30.2), Gemini 3.1 Flash TTS (27), and Sonic 3.5 (120). Price is competitive: the listed rate is $27.59 per 1M characters , roughly a third of what ElevenLabs and MiniMax charge for the tiers it outranks. Rank and price move often, so confirm both before planning around them.","The early reception is cautiously enthusiastic. The most-shared story is that a non-Western TTS topped the arena at a fraction of incumbent pricing. The most common reservations are that the model is hosted-only, that its throughput trails rivals, and that its name overlaps with the open Qwen3-TTS line. The dashboard below aggregates that early signal across X, Reddit, and Hacker News.","Sources: Qwen-Audio-3.0-TTS release blog：https://funaudiollm.github.io/qwen-audio-3.0-tts/ · Tongyi Lab announcement：https://tongyilab.substack.com/p/qwen-audio-30-tts-more-multilingual · Alibaba Cloud Model Studio real-time TTS docs：https://www.alibabacloud.com/help/en/model-studio/realtime-tts-user-guide · Artificial Analysis leaderboard：https://artificialanalysis.ai/text-to-speech/models/qwen-audio-3-0-tts-plus · Tongyi Lab on X：https://x.com/Ali_TongyiLab/status/2079154078517772739","Asif Razzaq is the CEO of Marktechpost Media Inc.. As a visionary entrepreneur and engineer, Asif is committed to harnessing the potential of Artificial Intelligence for social good. His most recent endeavor is the launch of an Artificial Intelligence Media Platform, Marktechpost, which stands out for its in-depth coverage of machine learning and deep learning news that is both technically sound and easily understandable by a wide audience. The platform boasts of over 2 million monthly views, illustrating its popularity among audiences.","Build an Agentic Event Venue Operator [Full Codes]：https://pxllnk.co/twdn5","Thanks! Our team will contact you soon 🙌"],"articleImages":[{"sourceUrl":"https://www.marktechpost.com/wp-content/uploads/2019/06/Screen-Shot-2021-09-14-at-9.02.24-AM-300x300.png","alt":"","afterParagraph":14,"url":"/media/articles/cmrtqb3i01f3gbihzjwf1l6yb/787a6d54564e8e19.webp"},{"sourceUrl":"https://www.marktechpost.com/wp-content/uploads/2026/07/blog19132-1-8-100x70.png","alt":"Google Releases Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber","afterParagraph":15,"url":"/media/articles/cmrtqb3i01f3gbihzjwf1l6yb/39896896ab8c8014.webp"}],"mediaStatus":"ok","articleBodyZh":["阿里巴巴的通义实验室：https://tongyilab.substack.com/p/qwen-audio-30-tts-more-multilingual 发布了 Qwen-Audio-3.0-TTS：https://funaudiollm.github.io/qwen-audio-3.0-tts/，这是一款面向生产的文本转语音（TTS）系统。该模型从同一系列分为两个版本。Flash 面向实时交互。Plus 面向高质量生成。两者都作为阿里云模型工作室：https://www.alibabacloud.com/help/en/model-studio/realtime-tts-user-guide 托管的模型提供，而非可下载的权重文件。","此次发布重点关注开发者在生产中会遇到的四个方面：更广的语言覆盖、自然语言风格控制、细粒度标签控制，以及在参考音频不干净时的鲁棒性。Qwen-Audio-3.0-TTS-Plus 还在独立的 Artificial Analysis：https://artificialanalysis.ai/text-to-speech/models/qwen-audio-3-0-tts-plus 文本转语音排行榜中排名第一。","这两个层级对应不同的任务。Flash 以实时交互为调优目标，首包延迟在 300 毫秒级别。Plus 以高质量生成为调优目标，在这种情况下，自然度和音色保真度比速度更重要。","模型 ID 分别为 qwen-audio-3.0-tts-flash 和 qwen-audio-3.0-tts-plus。两者均通过双向 WebSocket 流协议调用。API 支持 PCM、WAV、MP3 和 Opus，输出采样率最高可达 48 kHz。它提供流式输入和输出、语音克隆、语音设计：https://www.alibabacloud.com/help/en/model-studio/voice-design-user-guide，以及指令控制。阿里巴巴提供 DashScope SDK，以及 Python、Java、Go、C#、PHP 和 Node.js 的原始 WebSocket 示例，覆盖新加坡和北京区域。","系统有两个设计选择作为支柱。","该模型还支持一次性长文本合成（最长 3 分钟）、复杂文本规范化案例以及 48 kHz 输出的声码器超分辨率。","Qwen-Audio-3.0-TTS 支持 16 种语言：阿拉伯语、中文、英语、法语、德语、印尼语、意大利语、日语、韩语、马来语、葡萄牙语、俄语、西班牙语、他加禄语、泰语和越南语。其中 7 种是相比之前系列新增的。它还覆盖了 20 个中文方言地区。","在多语言可理解性方面，该模型系列在16种语言中有10种达到最佳词/字符错误率（WER/CER）。Flash 在平均 WER/CER 上表现最低，为 3.87；Plus 接近，达到 3.96。该指标数值越低越好。","在发音相似性方面，Plus 在所有16种语言中排名第一，平均得分为 82.75，Flash 紧随其后为 80.44。此次发布还增加了一个精心策划的预设语音库，涵盖16种支持语言，因此团队可以在不先克隆语音的情况下使用现成语音。","为了实现精确控制，研究团队将内联标签直接嵌入目标文本。此次发布增加了86个细粒度内联标签，以便在短语和单词层面进行本地化控制。这些标签涵盖了情感转换和非语言事件，如笑声、呼吸、咳嗽和叹息。","Model Studio 文档：https://www.alibabacloud.com/help/en/model-studio/realtime-tts-user-guide 将这些标签分为两类。控制标签如 [excited]、[sad]、[whispers] 和 [asmr] 设置一种情绪或风格，直到下一个标签出现。丰富语言标签如 [laughing]、[gasp] 和 [clears throat] 插入单一的语音效果，而不改变周围语气。示例：[excited]今天多美好的一天啊！[laughing]我们一起出去玩吧！这里值得注意的一个限制是：这些情绪和丰富语言标签仅在单向流式模式下支持。","Qwen-Audio-3.0-TTS-Plus 在人工分析：https://x.com/ArtificialAnlys/status/2077140161335631957 Speech Arena 的提供商语音质量评测中获得最高质量位置，其 Elo 值接近 1,236，略高于 Simba 3.2 的 1,234，并明显高于 Gemini 3.1 Flash TTS（1,214）和 Sonic 3.5（1,207）。与 Simba 3.2 的领先位于重叠的置信区间内，因此在最高位置上统计上属于平局。","有两个权衡点值得明确说明。吞吐量适中：Plus 每秒生成约16个字符，低于 Simba 3.2（30.2）、Gemini 3.1 Flash TTS（27）和 Sonic 3.5（120）。价格具有竞争力：标价为每 100 万字符 27.59 美元，大致是 ElevenLabs 和 MiniMax 对其超越等级收费的三分之一。排名和价格经常变化，因此在根据其规划前请确认两者。","早期反响谨慎而热情。最广泛传播的故事是，一款非西方的 TTS 以现有价格的一小部分占据了市场领先地位。最常见的顾虑是该模型仅限托管，其吞吐量落后于竞争对手，并且其名称与开放的 Qwen3-TTS 系列重名。下方仪表板汇总了 X、Reddit 和 Hacker News 上的早期信号。","来源：Qwen-Audio-3.0-TTS 发布博客：https://funaudiollm.github.io/qwen-audio-3.0-tts/ · 同艺实验室公告：https://tongyilab.substack.com/p/qwen-audio-30-tts-more-multilingual · 阿里云 Model Studio 实时 TTS 文档：https://www.alibabacloud.com/help/en/model-studio/realtime-tts-user-guide · Artificial Analysis 排行榜：https://artificialanalysis.ai/text-to-speech/models/qwen-audio-3-0-tts-plus · 同艺实验室在 X：https://x.com/Ali_TongyiLab/status/2079154078517772739","Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一名有远见的企业家和工程师，Asif 致力于利用人工智能的潜力创造社会价值。他最近的努力是推出人工智能媒体平台 Marktechpost，该平台以对机器学习和深度学习新闻的深入报道而闻名，既技术可靠，又便于广大观众理解。该平台每月浏览量超过 200 万次，显示了其受观众欢迎的程度。","构建智能活动场馆运营商 [完整代码]：https://pxllnk.co/twdn5","感谢！我们的团队将很快与您联系 🙌"],"translationStatus":"translated","bodyOrigin":"source-page","editorial":{"summary":"Aioga 编辑摘要：阿里通义实验室推出 Qwen-Audio-3.0-TTS，一款面向生产的文本转语音系统，提供 Flash（实时交互）和 Plus（高质量生成）两个版本。 Aioga 将其归入「模型更新」方向，重点关注它对真实使用和行业竞争的影响。","background":"背景分析：模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断，单项指标领先不等于已经形成稳定采用。","viewpoint":"Aioga 判断：这条动态更适合作为行业观察信号，当前信息足以建立线索，但不足以推导长期结论。","implications":"影响分析：对相关团队而言，短期应先核对来源、可用范围和实际成本，再判断是否值得接入或跟进。","nextStep":"后续观察：继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。","evidenceRefs":["title","summary","articleBody"],"confidence":"medium","status":"published","aiGenerated":false,"autoApproved":true,"generatedBy":"rule-safe-fallback","generatedAt":"2026-07-23T07:30:40.516Z","sourceHash":"22b32f4927479613","validation":{"passed":true,"mode":"rule-safe-fallback","checks":["schema","length","source-attribution","no-html"]}},"tags":["模型更新","MarkTechPost（RSS）"],"translations":{"zh-CN":{"title":"阿里通义实验室发布 Qwen-Audio-3.0-TTS，面向 16 种语言的 Flash 与 Plus 级托管语音合成模型","summary":"阿里通义实验室推出 Qwen-Audio-3.0-TTS，一款面向生产的文本转语音系统，提供 Flash（实时交互）和 Plus（高质量生成）两个版本。该模型通过阿里云 Model Studio 以托管 API 形式交付，不支持权重下载，覆盖 16 种语言。","category":"模型更新","source":"marktechpost.com","aggregationSource":"MarkTechPost（RSS）","pageTitle":"阿里通义实验室发布 Qwen-Audio-3.0-TTS，面向 16 种语言的 Flash 与 Plus 级托管语音合成模型 - Aioga AI资讯","description":"阿里通义实验室推出 Qwen-Audio-3.0-TTS，一款面向生产的文本转语音系统，提供 Flash（实时交互）和 Plus（高质量生成）两个版本。该模型通过阿里云 Model Studio 以托管 API 形式交付，不支持权重下载，覆盖 16 种语言。","url":"https://www.aioga.com/news/cmrtqb3i01f3gbihzjwf1l6yb/"},"en":{"title":"AliTongyi Lab releases Qwen-Audio-3.0-TTS, managed speech synthesis models of Flash and Plus levels for 16 languages","summary":"Ali Tongyi Laboratory has launched Qwen-Audio-3.0-TTS, a production-oriented text-to-speech system, offering two versions: Flash (real-time interaction) and Plus (high-quality generation). This model is delivered through Alibaba Cloud Model Studio as a managed API and does not support weight downloads, covering 16 languages.","category":"Models","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"AliTongyi Lab releases Qwen-Audio-3.0-TTS, managed speech synthesis models of Flash and Plus levels for 16 languages - Aioga AI News","description":"Ali Tongyi Laboratory has launched Qwen-Audio-3.0-TTS, a production-oriented text-to-speech system, offering two versions: Flash (real-time interaction) and Plus (high-quality gene...","url":"https://www.aioga.com/en/news/cmrtqb3i01f3gbihzjwf1l6yb/","contentTranslated":true,"sourceHash":"336ffcfda10f885c","translatedAt":"2026-07-23T02:02:24.096Z"},"ja":{"title":"アリ通義実験室は Qwen-Audio-3.0-TTS を公開、16 言語対応の Flash と Plus レベルのホスティング音声合成モデルを提供","summary":"アリババ通義実験室は Qwen-Audio-3.0-TTS を発表しました。これは生産向けのテキスト読み上げシステムで、Flash（リアルタイムインタラクション）と Plus（高品質生成）の2つのバージョンを提供します。このモデルはアリババクラウド Model Studio を通じてホストされる API 形式で提供され、重みのダウンロードはサポートしておらず、16言語に対応しています。","category":"モデル更新","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"アリ通義実験室は Qwen-Audio-3.0-TTS を公開、16 言語対応の Flash と Plus レベルのホスティング音声合成モデルを提供 - Aioga AIニュース","description":"アリババ通義実験室は Qwen-Audio-3.0-TTS を発表しました。これは生産向けのテキスト読み上げシステムで、Flash（リアルタイムインタラクション）と Plus（高品質生成）の2つのバージョンを提供します。このモデルはアリババクラウド Model Studio を通じてホストされる API 形式で提供され、重みのダウンロードはサポートしておらず...","url":"https://www.aioga.com/ja/news/cmrtqb3i01f3gbihzjwf1l6yb/","contentTranslated":true,"sourceHash":"336ffcfda10f885c","translatedAt":"2026-07-23T02:02:53.331Z"},"ko":{"title":"알리통의 실험실이 Qwen-Audio-3.0-TTS를 발표했으며, 16가지 언어를 대상으로 하는 Flash 및 Plus 등급의 관리형 음성 합성 모델입니다","summary":"알리통의 실험실에서 Qwen-Audio-3.0-TTS를 출시했으며, 이는 생산용 텍스트 음성 변환 시스템으로 Flash(실시간 상호작용)와 Plus(고품질 생성) 두 가지 버전을 제공합니다. 이 모델은 알리클라우드 Model Studio를 통해 호스팅 API 형태로 제공되며, 가중치 다운로드는 지원하지 않고 16개 언어를 커버합니다.","category":"모델 업데이트","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"알리통의 실험실이 Qwen-Audio-3.0-TTS를 발표했으며, 16가지 언어를 대상으로 하는 Flash 및 Plus 등급의 관리형 음성 합성 모델입니다 - Aioga AI 뉴스","description":"알리통의 실험실에서 Qwen-Audio-3.0-TTS를 출시했으며, 이는 생산용 텍스트 음성 변환 시스템으로 Flash(실시간 상호작용)와 Plus(고품질 생성) 두 가지 버전을 제공합니다. 이 모델은 알리클라우드 Model Studio를 통해 호스팅 API 형태로 제공되며, 가중치 다운로드는 지원하지 않고 16개 언어를...","url":"https://www.aioga.com/ko/news/cmrtqb3i01f3gbihzjwf1l6yb/","contentTranslated":true,"sourceHash":"336ffcfda10f885c","translatedAt":"2026-07-23T02:03:39.859Z"},"es":{"title":"El Laboratorio Ali Tongyi lanza Qwen-Audio-3.0-TTS, un modelo de síntesis de voz alojado de nivel Flash y Plus para 16 idiomas","summary":"El laboratorio Ali Tongyi lanzó Qwen-Audio-3.0-TTS, un sistema de texto a voz orientado a la producción, que ofrece dos versiones: Flash (interacción en tiempo real) y Plus (generación de alta calidad). Este modelo se entrega en forma de API alojada a través de Aliyun Model Studio, no admite la descarga de pesos y cubre 16 idiomas.","category":"Modelos","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"El Laboratorio Ali Tongyi lanza Qwen-Audio-3.0-TTS, un modelo de síntesis de voz alojado de nivel Flash y Plus para 16 idiomas - Aioga Noticias de IA","description":"El laboratorio Ali Tongyi lanzó Qwen-Audio-3.0-TTS, un sistema de texto a voz orientado a la producción, que ofrece dos versiones: Flash (interacción en tiempo real) y Plus (genera...","url":"https://www.aioga.com/es/news/cmrtqb3i01f3gbihzjwf1l6yb/","contentTranslated":true,"sourceHash":"336ffcfda10f885c","translatedAt":"2026-07-23T02:03:36.449Z"},"fr":{"title":"Le laboratoire Ali Tongyi a publié Qwen-Audio-3.0-TTS, un modèle de synthèse vocale hébergé de niveau Flash et Plus pour 16 langues","summary":"Le laboratoire Ali Tongyi a lancé Qwen-Audio-3.0-TTS, un système de synthèse vocale destiné à la production, offrant deux versions : Flash (interaction en temps réel) et Plus (génération de haute qualité). Ce modèle est distribué sous forme d'API hébergée via Alibaba Cloud Model Studio, ne prend pas en charge le téléchargement des poids et couvre 16 langues.","category":"Modèles","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"Le laboratoire Ali Tongyi a publié Qwen-Audio-3.0-TTS, un modèle de synthèse vocale hébergé de niveau Flash et Plus pour 16 langues - Aioga Actualités IA","description":"Le laboratoire Ali Tongyi a lancé Qwen-Audio-3.0-TTS, un système de synthèse vocale destiné à la production, offrant deux versions : Flash (interaction en temps réel) et Plus (géné...","url":"https://www.aioga.com/fr/news/cmrtqb3i01f3gbihzjwf1l6yb/","contentTranslated":true,"sourceHash":"336ffcfda10f885c","translatedAt":"2026-07-23T02:04:26.775Z"},"de":{"title":"Das Ali Tongyi Laboratory hat Qwen-Audio-3.0-TTS veröffentlicht, ein Flash- und Plus-Stufen-Hosting-Text-to-Speech-Modell für 16 Sprachen.","summary":"Das Ali Tongyi Lab hat Qwen-Audio-3.0-TTS auf den Markt gebracht, ein für die Produktion konzipiertes Text-zu-Sprache-System, das zwei Versionen anbietet: Flash (Echtzeit-Interaktion) und Plus (hochwertige Generierung). Dieses Modell wird über Aliyun Model Studio in Form einer gehosteten API bereitgestellt und unterstützt keinen Download der Gewichte. Es deckt 16 Sprachen ab.","category":"模型更新","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"Das Ali Tongyi Laboratory hat Qwen-Audio-3.0-TTS veröffentlicht, ein Flash- und Plus-Stufen-Hosting-Text-to-Speech-Modell für 16 Sprachen. - Aioga KI-News","description":"Das Ali Tongyi Lab hat Qwen-Audio-3.0-TTS auf den Markt gebracht, ein für die Produktion konzipiertes Text-zu-Sprache-System, das zwei Versionen anbietet: Flash (Echtzeit-Interakti...","url":"https://www.aioga.com/de/news/cmrtqb3i01f3gbihzjwf1l6yb/","contentTranslated":true,"sourceHash":"336ffcfda10f885c","translatedAt":"2026-07-23T02:04:25.791Z"},"pt-BR":{"title":"O Laboratório Ali Tongyi lançou o Qwen-Audio-3.0-TTS, um modelo de síntese de fala hospedado nos níveis Flash e Plus para 16 idiomas","summary":"O Laboratório Ali Tongyi lançou o Qwen-Audio-3.0-TTS, um sistema de conversão de texto em fala voltado para produção, oferecendo duas versões: Flash (interação em tempo real) e Plus (geração de alta qualidade). Esse modelo é disponibilizado através do Model Studio da Alibaba Cloud como uma API hospedada, não suportando download de pesos, e cobre 16 idiomas.","category":"模型更新","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"O Laboratório Ali Tongyi lançou o Qwen-Audio-3.0-TTS, um modelo de síntese de fala hospedado nos níveis Flash e Plus para 16 idiomas - Aioga Notícias de IA","description":"O Laboratório Ali Tongyi lançou o Qwen-Audio-3.0-TTS, um sistema de conversão de texto em fala voltado para produção, oferecendo duas versões: Flash (interação em tempo real) e Plu...","url":"https://www.aioga.com/pt-BR/news/cmrtqb3i01f3gbihzjwf1l6yb/","contentTranslated":true,"sourceHash":"336ffcfda10f885c","translatedAt":"2026-07-23T02:05:08.291Z"},"ru":{"title":"Лаборатория Alibaba Tongyi выпустила Qwen-Audio-3.0-TTS, модель синтеза речи уровня Flash и Plus для 16 языков","summary":"Лаборатория AliTongyi представила Qwen-Audio-3.0-TTS, производственную систему преобразования текста в речь, предлагающую две версии: Flash (реальное взаимодействие) и Plus (высококачественная генерация). Эта модель предоставляется через Alibaba Cloud Model Studio в виде API с управлением, загрузка весов не поддерживается, поддерживает 16 языков.","category":"模型更新","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"Лаборатория Alibaba Tongyi выпустила Qwen-Audio-3.0-TTS, модель синтеза речи уровня Flash и Plus для 16 языков - Aioga Новости ИИ","description":"Лаборатория AliTongyi представила Qwen-Audio-3.0-TTS, производственную систему преобразования текста в речь, предлагающую две версии: Flash (реальное взаимодействие) и Plus (высоко...","url":"https://www.aioga.com/ru/news/cmrtqb3i01f3gbihzjwf1l6yb/","contentTranslated":true,"sourceHash":"336ffcfda10f885c","translatedAt":"2026-07-23T02:05:11.246Z"},"ar":{"title":"أطلقت مختبرات علي تونغيي نموذج Qwen-Audio-3.0-TTS، وهو نموذج تحويل النص إلى كلام مُدار من فئة Flash وPlus يدعم 16 لغة","summary":"أطلقت مختبرات علي تونغ يي نظام Qwen-Audio-3.0-TTS، وهو نظام تحويل النص إلى كلام موجه للإنتاج، ويقدم نسختين: Flash (تفاعل فوري) وPlus (إنتاج عالي الجودة). يتم تسليم هذا النموذج من خلال Aliyun Model Studio على شكل API مُدار، ولا يدعم تنزيل الوزن، ويغطي 16 لغة.","category":"模型更新","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"أطلقت مختبرات علي تونغيي نموذج Qwen-Audio-3.0-TTS، وهو نموذج تحويل النص إلى كلام مُدار من فئة Flash وPlus يدعم 16 لغة - Aioga أخبار الذكاء الاصطناعي","description":"أطلقت مختبرات علي تونغ يي نظام Qwen-Audio-3.0-TTS، وهو نظام تحويل النص إلى كلام موجه للإنتاج، ويقدم نسختين: Flash (تفاعل فوري) وPlus (إنتاج عالي الجودة). يتم تسليم هذا النموذج من خ...","url":"https://www.aioga.com/ar/news/cmrtqb3i01f3gbihzjwf1l6yb/","contentTranslated":true,"sourceHash":"336ffcfda10f885c","translatedAt":"2026-07-23T02:06:03.668Z"},"hi":{"title":"अलीटॉन्गयी प्रयोगशाला ने Qwen-Audio-3.0-TTS जारी किया, 16 भाषाओं के लिए फ़्लैश और प्लस स्तर के होस्ट किए गए वॉइस सिंथेसिस मॉडल के साथ","summary":"अलीटॉन्ग यी प्रयोगशाला ने Qwen-Audio-3.0-TTS लॉन्च किया, एक उत्पादन-उन्मुख टेक्स्ट-टू-स्पीच सिस्टम, जो Flash (रीयल-टाइम इंटरैक्शन) और Plus (उच्च गुणवत्ता निर्माण) दो संस्करण प्रदान करता है। यह मॉडल अलीक्लाउड मॉडल स्टूडियो के माध्यम से होस्टेड API के रूप में वितरित किया जाता है, वजन डाउनलोड को सपोर्ट नहीं करता, और 16 भाषाओं को कवर करता है।","category":"模型更新","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"अलीटॉन्गयी प्रयोगशाला ने Qwen-Audio-3.0-TTS जारी किया, 16 भाषाओं के लिए फ़्लैश और प्लस स्तर के होस्ट किए गए वॉइस सिंथेसिस मॉडल के साथ - Aioga AI समाचार","description":"अलीटॉन्ग यी प्रयोगशाला ने Qwen-Audio-3.0-TTS लॉन्च किया, एक उत्पादन-उन्मुख टेक्स्ट-टू-स्पीच सिस्टम, जो Flash (रीयल-टाइम इंटरैक्शन) और Plus (उच्च गुणवत्ता निर्माण) दो संस्करण प्रदान...","url":"https://www.aioga.com/hi/news/cmrtqb3i01f3gbihzjwf1l6yb/","contentTranslated":true,"sourceHash":"336ffcfda10f885c","translatedAt":"2026-07-23T02:05:57.682Z"},"it":{"title":"Il laboratorio Ali Tongyi ha rilasciato Qwen-Audio-3.0-TTS, un modello di sintesi vocale gestito di livello Flash e Plus per 16 lingue","summary":"Il laboratorio Ali Tongyi ha lanciato Qwen-Audio-3.0-TTS, un sistema di sintesi vocale da testo a voce per la produzione, disponibile in due versioni: Flash (interazione in tempo reale) e Plus (generazione di alta qualità). Questo modello viene consegnato sotto forma di API gestita tramite Aliyun Model Studio, non supporta il download dei pesi e copre 16 lingue.","category":"模型更新","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"Il laboratorio Ali Tongyi ha rilasciato Qwen-Audio-3.0-TTS, un modello di sintesi vocale gestito di livello Flash e Plus per 16 lingue - Aioga Notizie IA","description":"Il laboratorio Ali Tongyi ha lanciato Qwen-Audio-3.0-TTS, un sistema di sintesi vocale da testo a voce per la produzione, disponibile in due versioni: Flash (interazione in tempo r...","url":"https://www.aioga.com/it/news/cmrtqb3i01f3gbihzjwf1l6yb/","contentTranslated":true,"sourceHash":"336ffcfda10f885c","translatedAt":"2026-07-23T02:06:54.269Z"},"nl":{"title":"Alibaba Tongyi Lab heeft Qwen-Audio-3.0-TTS uitgebracht, een Flash- en Plus-niveau gehost spraaksynthesemodel voor 16 talen","summary":"Ali Tongyi Laboratory heeft Qwen-Audio-3.0-TTS gelanceerd, een op productie gericht tekst-naar-spraak systeem, dat twee versies biedt: Flash (realtime interactie) en Plus (hoogwaardige generatie). Het model wordt via Alibaba Cloud Model Studio geleverd in de vorm van een beheerde API, ondersteunt het downloaden van gewichten niet, en dekt 16 talen.","category":"模型更新","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"Alibaba Tongyi Lab heeft Qwen-Audio-3.0-TTS uitgebracht, een Flash- en Plus-niveau gehost spraaksynthesemodel voor 16 talen - Aioga AI-nieuws","description":"Ali Tongyi Laboratory heeft Qwen-Audio-3.0-TTS gelanceerd, een op productie gericht tekst-naar-spraak systeem, dat twee versies biedt: Flash (realtime interactie) en Plus (hoogwaar...","url":"https://www.aioga.com/nl/news/cmrtqb3i01f3gbihzjwf1l6yb/","contentTranslated":true,"sourceHash":"336ffcfda10f885c","translatedAt":"2026-07-23T02:06:41.284Z"},"tr":{"title":"Ali Tongyi Laboratuvarı, 16 dil için Flash ve Plus seviyesinde barındırılan konuşma sentezi modeli olan Qwen-Audio-3.0-TTS'yi yayımladı","summary":"Alibaba Tongyi Laboratuvarı, üretime yönelik bir metinden sese dönüştürme sistemi olan Qwen-Audio-3.0-TTS'yi tanıttı ve iki sürüm sunuyor: Flash (gerçek zamanlı etkileşim) ve Plus (yüksek kaliteli üretim). Bu model, Alibaba Cloud Model Studio aracılığıyla yönetilen bir API olarak sunulmakta olup, ağırlık indirmeyi desteklememekte ve 16 dili kapsamaktadır.","category":"模型更新","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"Ali Tongyi Laboratuvarı, 16 dil için Flash ve Plus seviyesinde barındırılan konuşma sentezi modeli olan Qwen-Audio-3.0-TTS'yi yayımladı - Aioga AI Haberleri","description":"Alibaba Tongyi Laboratuvarı, üretime yönelik bir metinden sese dönüştürme sistemi olan Qwen-Audio-3.0-TTS'yi tanıttı ve iki sürüm sunuyor: Flash (gerçek zamanlı etkileşim) ve Plus...","url":"https://www.aioga.com/tr/news/cmrtqb3i01f3gbihzjwf1l6yb/","contentTranslated":true,"sourceHash":"336ffcfda10f885c","translatedAt":"2026-07-23T02:07:36.026Z"},"vi":{"title":"Phòng thí nghiệm Ali Tongyi phát hành Qwen-Audio-3.0-TTS, mô hình tổng hợp giọng nói mức Flash và Plus dành cho 16 ngôn ngữ","summary":"Phòng thí nghiệm Tongyi của Alibaba ra mắt Qwen-Audio-3.0-TTS, một hệ thống chuyển đổi văn bản thành giọng nói hướng tới sản xuất, cung cấp hai phiên bản Flash (tương tác thời gian thực) và Plus (tạo chất lượng cao). Mô hình này được cung cấp dưới dạng API được quản lý thông qua Alibaba Cloud Model Studio, không hỗ trợ tải xuống trọng số, bao phủ 16 ngôn ngữ.","category":"模型更新","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"Phòng thí nghiệm Ali Tongyi phát hành Qwen-Audio-3.0-TTS, mô hình tổng hợp giọng nói mức Flash và Plus dành cho 16 ngôn ngữ - Tin tức AI Aioga","description":"Phòng thí nghiệm Tongyi của Alibaba ra mắt Qwen-Audio-3.0-TTS, một hệ thống chuyển đổi văn bản thành giọng nói hướng tới sản xuất, cung cấp hai phiên bản Flash (tương tác thời gian...","url":"https://www.aioga.com/vi/news/cmrtqb3i01f3gbihzjwf1l6yb/","contentTranslated":true,"sourceHash":"336ffcfda10f885c","translatedAt":"2026-07-23T02:07:39.385Z"},"id":{"title":"Laboratorium AliTongyi merilis Qwen-Audio-3.0-TTS, model sintesis suara tingkat Flash dan Plus untuk 16 bahasa","summary":"Laboratorium Ali Tongyi meluncurkan Qwen-Audio-3.0-TTS, sebuah sistem teks-ke-suara yang ditujukan untuk produksi, menyediakan dua versi: Flash (interaksi real-time) dan Plus (generasi berkualitas tinggi). Model ini disampaikan melalui Aliyun Model Studio dalam bentuk API terkelola, tidak mendukung pengunduhan bobot, dan mencakup 16 bahasa.","category":"模型更新","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"Laboratorium AliTongyi merilis Qwen-Audio-3.0-TTS, model sintesis suara tingkat Flash dan Plus untuk 16 bahasa - Berita AI Aioga","description":"Laboratorium Ali Tongyi meluncurkan Qwen-Audio-3.0-TTS, sebuah sistem teks-ke-suara yang ditujukan untuk produksi, menyediakan dua versi: Flash (interaksi real-time) dan Plus (gene...","url":"https://www.aioga.com/id/news/cmrtqb3i01f3gbihzjwf1l6yb/","contentTranslated":true,"sourceHash":"336ffcfda10f885c","translatedAt":"2026-07-23T02:08:19.560Z"},"th":{"title":"ห้องปฏิบัติการ Ali Tongyi เปิดตัว Qwen-Audio-3.0-TTS เป็นโมเดลสังเคราะห์เสียงที่มีการโฮสต์แบบ Flash และ Plus สำหรับ 16 ภาษา","summary":"ห้องปฏิบัติการ Alibaba Tongyi เปิดตัว Qwen-Audio-3.0-TTS ระบบแปลงข้อความเป็นเสียงที่มุ่งเน้นการใช้งานเชิงผลิต มีสองเวอร์ชันคือ Flash (การโต้ตอบแบบเรียลไทม์) และ Plus (การสร้างคุณภาพสูง) โมเดลนี้ถูกส่งมอบผ่าน Alibaba Cloud Model Studio ในรูปแบบ API ที่โฮสต์ ไม่รองรับการดาวน์โหลดน้ำหนัก และรองรับ 16 ภาษา","category":"模型更新","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"ห้องปฏิบัติการ Ali Tongyi เปิดตัว Qwen-Audio-3.0-TTS เป็นโมเดลสังเคราะห์เสียงที่มีการโฮสต์แบบ Flash และ Plus สำหรับ 16 ภาษา - ข่าว AI Aioga","description":"ห้องปฏิบัติการ Alibaba Tongyi เปิดตัว Qwen-Audio-3.0-TTS ระบบแปลงข้อความเป็นเสียงที่มุ่งเน้นการใช้งานเชิงผลิต มีสองเวอร์ชันคือ Flash (การโต้ตอบแบบเรียลไทม์) และ Plus (การสร้างคุณภา...","url":"https://www.aioga.com/th/news/cmrtqb3i01f3gbihzjwf1l6yb/","contentTranslated":true,"sourceHash":"336ffcfda10f885c","translatedAt":"2026-07-23T02:08:26.980Z"},"pl":{"title":"Laboratorium Ali Tongyi wypuściło Qwen-Audio-3.0-TTS, model syntezy mowy na poziomie Flash i Plus dla 16 języków","summary":"Laboratorium Ali Tongyi wprowadziło Qwen-Audio-3.0-TTS, system konwersji tekstu na mowę przeznaczony do produkcji, oferujący dwie wersje: Flash (interaktywna w czasie rzeczywistym) i Plus (wysokiej jakości generowanie). Model jest dostarczany w formie hostowanego API przez Aliyun Model Studio, nie obsługuje pobierania wag, obejmuje 16 języków.","category":"模型更新","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"Laboratorium Ali Tongyi wypuściło Qwen-Audio-3.0-TTS, model syntezy mowy na poziomie Flash i Plus dla 16 języków - Aioga Wiadomości AI","description":"Laboratorium Ali Tongyi wprowadziło Qwen-Audio-3.0-TTS, system konwersji tekstu na mowę przeznaczony do produkcji, oferujący dwie wersje: Flash (interaktywna w czasie rzeczywistym)...","url":"https://www.aioga.com/pl/news/cmrtqb3i01f3gbihzjwf1l6yb/","contentTranslated":true,"sourceHash":"336ffcfda10f885c","translatedAt":"2026-07-23T02:09:12.635Z"}}}}