Aioga
AI资讯 / 模型更新
返回 AI资讯

Inflect-Micro-v2 发布:仅 936 万参数实现完整语音模型

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-07-26T07:38:53.861Z热度 46

Inflect-Micro-v2 以仅 936 万个参数实现了完整的语音模型功能。该模型在 HuggingFace 上发布,参数规模远小于主流语音模型,展示了极低参数量下仍能保...

模型更新Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

Inflect-Micro-v2 以仅 936 万个参数实现了完整的语音模型功能。

该模型在 HuggingFace 上发布,参数规模远小于主流语音模型,展示了极低参数量下仍能保持语音生成能力的可行性。

中文正文 · AI 翻译

:/owensong/Inflect-Micro-v2/blob/main/assets/inflect-v2-repository-hero.png

Inflect-Micro-v2 发布:仅 936 万参数实现完整语音模型
Inflect-Micro-v2 release cover

在不到10M参数下完成本地文本到波形语音合成。固定音色的英语TTS,具有确定性随机种子、长文本处理能力,并支持CPU或CUDA推理。

我独立构建并资助了Inflect v2。如果此版本能够得到真正的受众,我希望能继续开发更广泛的v3版本,可能包括更多语言、声音和稳定性改进。如果这个模型对你有用,在Hugging Face上点个赞真的可以帮助更多人发现它。

:https://huggingface.co/spaces/owensong/Inflect-v2:https://github.com/owenawsong/Inflect:https://huggingface.co/owensong/Inflect-Nano-v2:https://discord.gg/CVJYedvzvp:https://huggingface.co/owensong/Inflect-Micro-v2/blob/main/docs/EVALUATION.md

9,356,513 可部署参数 · 37.53 MB FP32 · 24 kHz 单声道输出

Inflect v2在两个规模中使用同一个公共API:Micro优先考虑10M参数以下的质量;Nano优先考虑低于4M参数的占用空间。

这些是保留的文本生成,而非训练音频的重建。每个转录内容都完全按照传递给公共前端的文本显示。

没有单一指标可以衡量TTS质量。Inflect v2分别报告人工偏好、预测自然度、多-ASR可懂度、完整占用空间和运行时间,而不是将它们压缩成一个无法验证的分数。

标题行始终指Inflect-Micro-v2。详细的竞争者结果和协议界限保留在下方可见。

对比集。结果包括KittenTTS Nano:https://huggingface.co/KittenML/kitten-tts-nano-0.8,Piper Low:https://huggingface.co/rhasspy/piper-voices,以及Supertonic 3:https://huggingface.co/Supertone/supertonic-3,这些是已建立的紧凑或本地TTS基线,其可部署权重规模均大于两个Inflect版本。权重大小在软件包级别进行比较,不将单一指标视为整体优越性的证明。

:/owensong/Inflect-Micro-v2/blob/main/assets/evidence/human-preference.svg

Inflect-Micro-v2 在最终匿名社区研究中记录了 66.2% 的偏好率(21 胜 · 10 负 · 3 平)。系统被隐藏,左右顺序随机,平局计作半场胜利。这是描述性社区证据,而非正式 MOS。

:/owensong/Inflect-Micro-v2/blob/main/assets/evidence/quality-vs-footprint.svg

UTMOS22 测试每个声音使用 500 个相同的未见提示。KittenTTS 和 Piper 是等权重的双声道均值;它们观察到的声音范围显示为须状线。Supertonic 三步法报告在绘图范围下方,而不是对每个其他系统进行拉平处理。

Inflect-Micro-v2:4.395 UTMOS22,95% 自助法置信区间 4.381–4.408。UTMOS22 是学习预测器,而非人工 MOS。

:/owensong/Inflect-Micro-v2/blob/main/assets/evidence/asr-consensus.svg

报表分数为每个系统 Qwen3-ASR 和 Nemotron 3.5 语料 WER 的等权重平均值。Whisper 一直被排除在报表之外,因为它在一部分可理解的 Supertonic 八步法剪辑中产生了大量插入性幻觉。它并未删除:完整的三-ASR 证据仍然保留在下方。

:/owensong/Inflect-Micro-v2/blob/main/assets/evidence/modern400-three-asr.svg

对于 Inflect-Micro-v2,单项结果为 2.52% Qwen3-ASR、5.45% Nemotron 3.5 和 2.73% Whisper large-v3。前述三模型均值 3.57% 仅作为描述性审计值保留,并未用作报表分数。

:/owensong/Inflect-Micro-v2/blob/main/assets/evidence/asr-robustness.svg

:/owensong/Inflect-Micro-v2/blob/main/assets/evidence/category-semantic-wer.svg

这些视图是诊断工具,而非额外的排行榜。它们显示了识别器的分歧位置以及哪些提示类别仍会产生可恢复的转录错误。

两个 Inflect 版本在 CPU 上合成速度均高于实时。管理参考运行使用 Hugging Face CPU 升级实例(8 vCPU,32 GB RAM),配备四个框架线程,端到端文本到波形的计时和 100 个固定 Modern400 提示。记录了三次完整运行;第一次缓存构建运行被排除,表格汇总了第二次和第三次运行。

这些是来自公共 PyTorch 运行时的包级别结果,并不是声称 Inflect 是最快的紧凑型 TTS 系统。硬件、前端行为、框架、编译和线程策略都会影响小模型的测量结果。

相同的托管 CPU 和四线程策略被用于较短的比较运行:相同的 50 条提示前缀,重复两次。KittenTTS 和 Piper 的工作量在它们测试的两个语音之间平均分配。

由于 Inflect 使用较大的 100 条提示稳态运行,而比较行使用较短的 50 条提示确认运行,因此此表展示的是部署环境,而非完美匹配的速度排行榜。几个比较模型还使用了优化过的 ONNX 运行时,而上面发布的 Inflect 基准使用的是标准的 PyTorch 运行时。单独发布的 Inflect ONNX 路径尚未替换到那些基准数据中。

:/owensong/Inflect-Micro-v2/blob/main/assets/evidence/model-footprint.svg

共享相同权重的语音变体已合并。Inflect 总计包括集成的波形解码器。

Inflect-Micro-v2 是该系列注重质量的成员。两个模型都使用相同的公共 API 并完成文本到波形的打包。

这使用了 Hub 的版本感知下载器并检索完整的仓库。Git 克隆同样可行,但 hf 下载是普通模型安装推荐路径。

结果是一个 24 kHz 的单声道 float32 波形。长输入在标点感知的边界处分割,逐块合成,并通过控制的停顿拼接。

官方验证的 FP32 导出单独发布为 Inflect-Micro-v2-ONNX:https://huggingface.co/owensong/Inflect-Micro-v2-ONNX。它支持动态长度、CPU/CUDA/DirectML 提供者选择、确定性种子,以及相同的长文本包装器而无需导入 PyTorch:

神经模型被拆分为 duration.onnx 和 decode.onnx;它们共同包含完整的学习文本到波形路径。英语 eSpeak-ng 前端仍然是 CPU 端代码。查看 ONNX 仓库:https://huggingface.co/owensong/Inflect-Micro-v2-ONNX 以获取图表契约、来源、等效性测量、浏览器部署和再导出说明。

Inflect v2 是一个参数高效的 VITS 系列端到端文本到波形生成器,具有英文音素前端、单调对齐、随机潜在合成、残差耦合流和集成化降别名神经波形解码器。

该发布描述了可部署的架构。私有语料库构建和优化细节不属于此开源权重包的一部分。

长文本是按标点符号分段的块,而不是一次无限自动回归处理。块边界会有短暂停顿和边缘渐隐。请参阅 docs/API.md:https://huggingface.co/owensong/Inflect-Micro-v2/blob/main/docs/API.md 了解波形协议和并发使用说明。

该发布包含一个固定的合成英文语音。该包不重新分发真实说话者录音语料库,不将该语音宣称为真实人物的身份,并且推理时无需参考音频或外部模型。

此版本以推理为首要目标。目前尚未验证或支持新语音和新语言的适配。新语音将替换固定的说话者,而不是添加可选择的说话者;语言适配还需要重建归一化、音素、符号、嵌入和训练数据。请参阅 docs/DATA_AND_VOICE.md:https://huggingface.co/owensong/Inflect-Micro-v2/blob/main/docs/DATA_AND_VOICE.md 和 docs/FINETUNING.md:https://huggingface.co/owensong/Inflect-Micro-v2/blob/main/docs/FINETUNING.md。

请勿使用包含的语音冒充真实人物、欺骗听众或制作欺诈内容。在可能导致误导的情况下披露合成语音。用户需遵守适用法律及 Apache-2.0 许可证。

原始 Inflect 代码和权重以 Apache-2.0 发布。捆绑的第三方组件在 THIRD_PARTY_NOTICES.md 中保留其自身声明:https://huggingface.co/owensong/Inflect-Micro-v2/blob/main/THIRD_PARTY_NOTICES.md。release_manifest.json 记录了打包文件大小和 SHA-256 哈希值。

Inflect v2 是开源权重发布版本。可部署权重、推理代码、前端代码、评测提示和发布报告均为公开。训练语料生成流程、私有过滤基础设施和完整优化方案不属于公开包的一部分。

Owen Song 可能会在请求具有明确目的且不违反许可或数据来源限制的情况下,就可信的研究、协作、可重现性或部署相关问题私下分享额外的技术背景。

由 Owen Song 独立设计和开发 · 开源权重 · Apache-2.0 · 完整本地文本到波形推理

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:Inflect-Micro-v2 以仅 936 万个参数实现了完整的语音模型功能。 Aioga 将其归入「模型更新」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: huggingface.co

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-26T07:38:53.861Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Inflect-Micro-v2 以仅 936 万个参数实现了完整的语音模型功能。该模型在 HuggingFace 上发布,参数规模远小于主流语音模型,展示了极低参数量下仍能保...

Hacker News 热门(buzzing.cc 中文翻译)2026-07-26T07:38:53.861Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。