Aioga
AI资讯 / 行业动态
返回 AI资讯

IBM 发布 Granite Time Series PatchTST-FM-r2,采用 Apache 2.0 与 OpenMDW 1.0 双许可

Hugging Face:Blog(RSS)Aioga 编辑团队2026-09-09T15:36:24.000Z热度 58

IBM 发布 Granite Time Series PatchTST-FM-r2,约 385M 参数,支持最长 8,192 上下文、99 分位数概率预测和缺失值插补。

行业动态Hugging Face:Blog(RSS)

今日 AI 情报摘要

IBM 发布 Granite Time Series PatchTST-FM-r2,约 385M 参数,支持最长 8,192 上下文、99 分位数概率预测和缺失值插补。

中文正文 · AI 翻译

简要总结:#tldr 在 GIFT-Eval 上实现强大的零样本预测 #strong-zero-shot-forecasting-on-gift-eval 即使与获准使用基准训练数据的模型相比,也具有竞争力 #competitive-even-against-models-allowed-to-use-benchmark-training-data 架构:与 PatchTST-FM-r1 相比有哪些变化? #architecture-what-changed-from-patchtst-fm-r1 训练数据 #training-data 开放用于研究实验,也可用于商业用途 #open-for-research-experimentation--and-for-commercial-use 只需几行 Python 代码即可试用 PatchTST-FM-r2 #try-patchtst-fm-r2-in-a-few-lines-of-python 从笔记本到流式时间序列 #from-notebooks-to-streaming-time-series 采用对商业友好的开放许可协议,实现高性能零样本预测。

IBM 发布 Granite Time Series PatchTST-FM-r2,采用 Apache 2.0 与 OpenMDW 1.0 双许可
IBM 发布 Granite Time Series PatchTST-FM-r2,采用 Apache 2.0 与 OpenMDW 1.0 双许可
IBM 发布 Granite Time Series PatchTST-FM-r2,采用 Apache 2.0 与 OpenMDW 1.0 双许可

时间序列基础模型正在改变预测系统的构建方式。用户无需为每个数据集训练和维护单独的模型,而是可以使用预训练模型并进行零样本预测。

IBM 发布了 Granite Time Series PatchTST-FM-r2:https://huggingface.co/ibm-granite/granite-timeseries-patchtst-fm-r2,这是 Granite TSFM 系列的最新模型(GitHub:https://github.com/ibm-granite/granite-tsfm,博客:https://research.ibm.com/blog/time-series-ai-enterprise)。PatchTST-FM-r2 是其前身 PatchTST-FM-r1 的新版本:https://huggingface.co/ibm-granite/granite-timeseries-patchtst-fm-r1,结合了更新的架构、更大的预训练语料库、概率预测、缺失值插补支持,以及在约 3.85 亿参数模型中实现的强大零样本性能。

截至 2026 年 9 月 8 日,该模型是 GIFT-Eval 排行榜上可复现的零样本模型中性能最顶尖、且基于宽松商业友好开源许可(Apache 2.0 和 OpenMDW 1.0)发布的模型。GIFT-Eval 是一个综合的时间序列预测基准,用于评估模型在各种预测场景中的表现;该模型在可复现零样本模型中整体排名第二。

模型权重、架构、推理管道以及复现基准结果所需的代码均可获得。

在本博客中,我们将描述模型,深入探讨基准测试结果和模型架构,讨论训练数据和许可问题,并提供代码示例说明如何使用该模型。最后,我们还将强调 Granite 时间序列系列模型如何在生产环境中利用 Confluent 产品用于流处理应用:https://events.confluent.io/early-access-flink-features。

准备好尝试了吗?在 Hugging Face 上打开 Granite 时间序列 PatchTST-FM-r2:https://huggingface.co/ibm-granite/granite-timeseries-patchtst-fm-r2

一个基础模型最有用的情况是其能够泛化到未被专门训练的时间序列。出于这个原因,我们首先关注零样本性能。

GIFT-Eval 提供了对异构数据集和预测场景下的预测模型的广泛评估。在将排行榜限制为零样本、可复现且在无测试泄漏情况下评估的模型时,截至 2026 年 9 月 8 日,PatchTST-FM-r2 在 CRPS 和 MASE 上均排名第二,如图 1 和图 2 所示(两个指标的值越低越好)。重要的是,PatchTST-FM-r2 在具有宽松、商业友好许可的同类别模型中表现最佳。

图 1. GIFT-Eval 可复现零样本模型的 CRPS。PatchTST-FM-r2 的几何平均 CRPS 为 0.467,在此比较中紧随 TimesFM-3 之后,并在具有宽松许可的模型中排名第一。

图 2. GIFT-Eval 可复现零样本模型的 MASE。PatchTST-FM-r2 的几何平均 MASE 为 0.6846。蓝色柱表示由 IBM 时间序列基础模型团队发布的模型。

GIFT-Eval 上的一些模型被归类为预训练模型,而非严格的零样本模型。这些模型被允许在其预训练语料中包含 GIFT-Eval 评估数据集的训练部分。

即使这些预训练模型被加入比较,PatchTST-FM-r2 仍然位居前列,如图 3 和图 4 所示:在可复现模型中 CRPS 排名第 3,MASE 排名第 4。它优于多个预训练模型,包括 Chronos-2、Timer-S1 及 Toto 变体,尽管一些竞争模型规模更大。

图3. 在同时考虑零样本和预训练可复现模型时的 GIFT-Eval CRPS。

图4. 在同时考虑零样本和预训练可复现模型时的 GIFT-Eval MASE。

PatchTST-FM-r2 保留了使 PatchTST 系列有效的基于 patch 的表示,但内部架构经过重新设计,以高效捕捉长短期关系并平滑补丁间的预测——这两者都显著改善了误差指标。

一个变化是从标准 transformer 层转向结合卷积和多头自注意力的层。这些层被称为 conformer 层,其起源:https://arxiv.org/pdf/2005.08100,最初用于语音处理应用。

:https://cdn-uploads.huggingface.co/production/uploads/64b01b5252349201f972ba17/gYPoFfbdOqaT9nZmABON1.png

图 5. 从 PatchTST-FM-r1 到基于 Conformer 的 PatchTST-FM-r2 的架构演进。

一个 PatchTST-FM-r1 模块将多头自注意力与前馈网络结合。在 r2 中,我们用一个 conformer 风格的模块替换了它,该模块包含两个半步前馈层,包围多头自注意力层和一个时序卷积层。

这为模型提供了两种互补的时间序列推理机制。自注意力可以建模 patch 之间的长程关系,而卷积为局部时间结构提供归纳偏置。因此,卷积部分可以捕捉短期交互,同时允许注意力集中于较长时间跨度的关系。这一现象可以在 transformer 和 conformer 版本的注意力模式中观察到(见下图使用 ETTh1 数据集的真实样本举例)。虽然 transformer 的大部分自注意力(图中左侧)集中在对角线附近,即捕捉局部关系,但在 conformer 模块中的注意力(图中右侧)显示出远距离(对角线之外)的关注,这归功于卷积层覆盖了短距离。骨干网络中的 conformer 模块使用 3 和 5 的交替卷积核尺寸,以重复模式 {5, 5, 3, 3} 进行交替。

图 6. 使用来自 ETTh1 数据集的真实样本比较变压器(左)和卷积变体(右)捕获的注意力模式。

此外,PatchTST-FM-r2 使用 50% 重叠的补丁,配合汉明窗加权和重叠相加预测方法,以平滑补丁边界并提高预测准确性。最后,该架构增加了归一化以增强稳定性,并将块数从 20 增加到 30 块。

通过这些更改,得到的模型大约有 3.85 亿参数,支持最长 8,192 步的长上下文,并预测灵活预测长度下的 99 个分位数。该模型同时提供点预测和分位数输出,用于预测分布和不确定区间。

对于面向实际应用的基础模型,模型质量只是考虑的一个方面。开发者越来越需要了解模型使用了哪些数据,基准数据是否可能泄露到训练中,以及部署该模型的潜在影响。

PatchTST-FM-r2 使用了记录明确的预训练语料库,包含四个来源:来自 GiftEvalPretrain 的精选数据集;基于 KernelSynth 修改周期核和有限增强生成的自定义合成数据;使用 Chronos 描述的方法生成的 TSMixup 语料,但仅限于 GIFT-Eval 评估集之外的数据集;以及大约 50 万个长度为 4,096 的合成 CauKer 序列。

对于企业用户来说,这种透明度可能和在排行榜上多获得几分同样重要。这并不消除组织自身进行模型治理和许可审查的必要性,但与不透明的预训练语料库相比,它为用户提供了更多信息以进行该审查。

为了为社区提供更多选择,Granite 时间序列 PatchTST-FM-r2 采用 Apache 2.0 许可证(https://www.apache.org/licenses/LICENSE-2.0.txt)和 OpenMDW 1.0 许可证(https://raw.githubusercontent.com/OpenMDW/OpenMDW/refs/heads/main/1.0/LICENSE.openmdw)双重授权。用户可以选择任一许可证,这两种许可证都提供广泛、宽松的使用、修改和分发模型的权利,其中 Linux 基金会的 OpenMDW 提供了专为 AI 模型及相关材料设计的许可框架。通过在宽松的开源许可证下提供模型,IBM 旨在降低采纳门槛,使组织、研究人员和开发者能够在不受使用限制的许可证下放心地基于技术构建。该架构实现同样通过 Granite-TSFM 仓库提供(https://github.com/ibm-granite/granite-tsfm),并向后兼容 PatchTST-FM-r1 检查点。

评估基础模型最简单的方法是使用您自己的时间序列数据。

然后直接从 Hugging Face Hub 加载 PatchTST-FM-r2:

如您所见,无需微调,也无需针对特定任务进行模型拟合。该流水线只使用时间序列的近期历史并生成未来预测,包括所需的分位数。

上述示例基于公开数据——您可以用自己的数据替换示例输入数据,包括需求、传感器遥测、CPU 利用率、能耗、交易量、交通量、价格或其他定期采样的时间序列。

在您自己的数据上试试:在 Hugging Face Hub 上打开 PatchTST-FM-r2:https://huggingface.co/ibm-granite/granite-timeseries-patchtst-fm-r2

此次发布连接到 IBM Granite 时间序列模型的更广泛努力,为更广泛的组合增加了新模型:https://research.ibm.com/blog/time-series-ai-enterprise

对于数据连续到达而非静态 DataFrame 的应用,IBM 和 Confluent 最近通过 Confluent Cloud 的提前访问计划提供了多个 Granite 时间序列模型。初始组合包括 PatchTST-FM-r1、FlowState-r1.1、TTM-r3 和 TSPulse。

该集成通过 Confluent Cloud 上的 Apache Flink 将基础模型推理直接引入流式应用程序。预测和异常检测结果可以从实时流中生成,而无需团队设置并将数据移动到单独的机器学习环境中。

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:IBM 发布 Granite Time Series PatchTST-FM-r2,约 385M 参数,支持最长 8,192 上下文、99 分位数概率预测和缺失值插补。 Aioga 将其归入「行业动态」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:公司与行业类动态需要放在竞争格局、商业化路径、资本信号和监管环境中观察,单条公告不能代表最终结果。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文件、合作落地、收入或用户信号、竞品动作和监管后续。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: huggingface.co

来源: Hugging Face:Blog(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-09T15:36:24.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

IBM 发布 Granite Time Series PatchTST-FM-r2,约 385M 参数,支持最长 8,192 上下文、99 分位数概率预测和缺失值插补。

Hugging Face:Blog(RSS)2026-09-09T15:36:24.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。