Aioga
AI资讯 / 行业动态
返回 AI资讯

Gradium 发布 Voice Design:写一段描述文字,几秒生成全新合成语音

MarkTechPost(RSS)Aioga 编辑团队2026-09-09T07:29:13.000Z热度 58

巴黎语音 AI 公司 Gradium(从 Kyutai 研究实验室分拆)推出 Voice Design,输入 1 到 500 字符的描述即可在 3 到 5 秒内生成 1 到 5...

行业动态MarkTechPost(RSS)

今日 AI 情报摘要

巴黎语音 AI 公司 Gradium(从 Kyutai 研究实验室分拆)推出 Voice Design,输入 1 到 500 字符的描述即可在 3 到 5 秒内生成 1 到 5

个候选语音,无需参考音频,支持英法西葡德 5 种语言,已在 Gradium API 和 Studio 全部套餐免费开放。

中文正文 · AI 翻译

语音代理团队不断碰到同样的障碍。目录中有400个声音,而简报要求的是目录中没有的:蒙特利尔经销商的一位魁北克女接待员,一位六十多岁的叙述员,拥有讲堂般的权威感。简报的数量超过任何目录,而克隆则以每次一个说话者的方式弥合差距,每个都拥有来源、同意和许可。

Gradium:https://gradium.ai/,这家总部位于巴黎的语音AI公司由Kyutai研究实验室分拆出来,已经提供了另一种解决方案。Voice Design:https://gradium.ai/voice-design 可以读取书面描述,并在几秒钟内返回完整的新声音。无需参考音频,无需说话者,无需权利清除。

它可以部署吗?可以,Voice Design 已在 Gradium API 和 Studio:https://studio.gradium.ai/voices/design 上上线,包括免费套餐在内的每个计划都可使用,保留的声音在与目录声音相同的流式文本转语音端点运行,具有相同的延迟和输出格式。

描述是模型获得的唯一输入。Gradium 的文档:https://docs.gradium.ai/guides/voices/voice-design 列出了模型可以响应的属性,它们读起来像是选角通知:性别、年龄段、口音或出处、音高、语速、能量、音色和共鸣、声域和方式,以及声音正在执行的工作。描述长度为1到500个字符,可以使用英语、法语、西班牙语、葡萄牙语或德语。Gradium 建议以预期用途结尾,因为这会引导语音的表现和声域,而不仅仅是声音的颜色。

一次请求返回1到5个候选,通常在3到5秒内准备就绪。它们是单一角色的变体,因此不同的角色意味着不同的描述,而不是更多的样本。

流程包含四次调用。POST /voice-generator/generate 会生成候选 id 并设置 ready: false。GET /voice-generator/embeddings 会轮询直到状态改变。每个候选通过普通 TTS 端点进行试听,使用候选 id 作为 voice_id。POST /voices/from-embedding 会提升你选择保留的那个声音。

候选人有三项限制,而已转换的语音没有:试听文本限制为100个字符,他们仅能通过REST使用,且TTS WebSocket和语音对语音功能不支持他们。未转换的候选人在30天后会被删除。转换是免费的,可以清除过期时间,并使用一个与克隆共享的自定义语音槽。免费套餐可存放5个,自付套餐可存放1,000个。

采样是故意非确定性的。Gradium团队会首先扩展描述,这个扩展在每次请求中都不同,因此相同的提示即使使用固定种子仍会生成不同的语音。

Gradium对六种通过公共API可访问的语音设计系统和五种语言的口音提示进行了盲对比听力测试。母语者听两个未标记的音频片段,并选择更接近的匹配,或者判定为平局。在7,627次对比中,Gradium报告胜率为72.6%,比ElevenLabs的eleven_ttv_v3的59.0%高出13.6个百分点,随后是Inworld的44.8%、Fish Audio的36.7%和MiniMax的31.7%。胜率计算为胜利加半数平局,因此50%为基准。Gradium在五种语言中均位居第一。最显著的优势出现在多数目录处理过的区域口音:魁北克法语97%,里约拉普拉塔西班牙语86%,巴伐利亚德语85%,哥伦比亚西班牙语及非洲葡萄牙语83%。

基于相同提示集的模型评审结果一致。Gemini 3.1 Pro对每个未标记音频片段进行1到5的评分,并得出相同排序:Gradium 4.06,ElevenLabs 3.86,Inworld 3.64,Fish Audio 3.51。另据产品页面称,InstructTTSEval英文分集的提示遵循率为83.4%:https://arxiv.org/abs/2506.16381,这是TTS中遵循指令的学术基准。(注:所有这些数据均由供应商设计并运行。)

需要与我们合作推广您的GitHub仓库或Hugging Face页面或产品发布或网络研讨会等?请联系我们: https://forms.gle/wbash1wF6efRj8G58

Gradium 发布 Voice Design:写一段描述文字,几秒生成全新合成语音

Michal Sutter是一名数据科学专业人士,拥有帕多瓦大学数据科学硕士学位。凭借统计分析、机器学习和数据工程的扎实基础,Michal擅长将复杂的数据集转化为可操作的洞见。

以实践者为先的AI/ML新闻与分析,每月有超过100万开发者和研究人员阅读。

情报判断

Aioga 编辑摘要

巴黎语音 AI 公司 Gradium 推出 Voice Design。用户输入 1 至 500 字符的文字描述,可在约 3 至 5 秒生成 1 至 5 个候选合成语音,无需参考音频,支持英语、法语、西班牙语、葡萄牙语和德语。

背景分析

Gradium 从 Kyutai 研究实验室分拆,Voice Design 已在 Gradium API 和 Studio 的全部套餐开放,包括免费层。候选语音可通过普通文本转语音接口试听,选定后可转换为自定义语音;未转换候选保留 30 天。

Aioga 观点

Aioga 判断:Voice Design 将语音选择从既有目录匹配扩展到文字描述生成,重点不只是音色,还包括年龄段、口音、音高、语速、能量、共鸣、表达方式和使用场景等维度。

影响与后续

可能影响:需要快速测试定制语音的团队可能获得更灵活的筛选方式,但候选语音存在 REST-only、试听文本不超过 100 字符等限制,也不支持 TTS WebSocket 和 Speech-to-Speech,因此不足以视为所有场景的通用替代方案。 后续观察:应关注文字描述对目标音色、口音和表达方式的稳定呈现,也需要留意候选语音转换后的使用边界、30 天保留期限,以及自定义语音槽位限制对实际部署的影响。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-09T07:29:13.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

巴黎语音 AI 公司 Gradium(从 Kyutai 研究实验室分拆)推出 Voice Design,输入 1 到 500 字符的描述即可在 3 到 5 秒内生成 1 到 5...

MarkTechPost(RSS)2026-09-09T07:29:13.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。