Aioga
AI资讯 / 产品更新
返回 AI资讯

Prime Intellect 发布 Verifiers v1:用于智能体强化学习训练与评估的可组合任务集、Harness 与运行时

MarkTechPost(RSS)Aioga 编辑团队2026-07-13T07:40:18.000Z热度 66

Prime Intellect 推出 verifiers 0.2.0 版本,并在新命名空间 verifiers.v1 下重构核心架构。v1 将环境拆分为三个可组合部分:task...

产品更新MarkTechPost(RSS)

今日 AI 情报摘要

Prime Intellect 推出 verifiers 0.2.0 版本,并在新命名空间 verifiers.v1 下重构核心架构。

v1 将环境拆分为三个可组合部分:taskset(定义数据、工具与评分)、harness(执行任务并生成 rollout)和 runtime(运行 rollout)。 verifiers 管理的拦截服务器代理 harness 与推理服务器之间的请求,实时记录轨迹,并支持重写工具响应以缓解训练中的奖励攻击。 线性消息图轨迹取代了 v0 的二次方提示-补全对,支持长程训练。 v1 支持 OpenAI Chat Completions、OpenAI Responses 和 Anthropic Messages 三种协议方言,Harbor 数据集及 Codex、Terminus 2 等 harness 可直接使用。 在内部测试中,verifiers 在相同任务上匹配了 Harbor 的性能。 GLM-4.5-Air 在 ScaleSWE 上训练两天,在 SWE-Bench-Verified 上评估,展示了稳定的智能体训练效果。

中文正文 · AI 翻译

Prime Intellect 发布了 0.2.0 验证器:https://www.primeintellect.ai/blog/verifiers-v1。它预览了一个重写的核心,发布时使用新的 verifiers.v1:https://www.primeintellect.ai/blog/verifiers-v1 命名空间。现代评估现在运行编码代理和工具、压缩和子代理。因此,v1 重建了环境以大规模运行这些代理工作负载。

首先,考虑什么是验证者:Prime Intellect用于智能强化学习和评估的环境栈。此前,环境会将其数据、代理逻辑和基础设施捆绑在一起。相比之下,v1 将该捆绑拆分为三个可组合的部分。

任务集定义了工作内容:数据、工具和评分。安全带解决了任务并产生了滚动。这个线束可以是ReAct环路、CLI代理,或者你自己的。部署随后在运行时内运行,运行时可以是本地的,也可以是在沙盒中。由于这些部件是解耦的,任何任务集都运行在任何兼容的束带下。

定义完这些部件后,接下来的问题是它们如何交流。核心部分是由验证者管理的拦截服务器。它位于代理运行时和推理服务器之间。具体来说,它代理推理的请求和响应。同时,它记录轨迹,设置采样参数,并可重写工具响应。这种重写有助于减少培训中的奖励技巧。

为了规模化,每台服务器会多路复用固定数量的部署,默认为32次。池随后随着观察到的并发性进行弹性扩展。服务器还拥有一个客户端来转发这些请求。在评估过程中,评估客户端作为盲HTTP代理。在培训过程中,TrainClient 会包裹渲染器,实现忠实的 RL 令牌训练。

由于线束使用不同的方言,验证者目前支持三种。这些包括OpenAI聊天完成、OpenAI回复和拟人性消息。方言适配器将每种线格式归一化为规范的vf类型。因此,你的评分逻辑与被测试的药剂保持独立。

架构明确后,考虑团队如何使用它。比如,你可以在Terminal-Bench 2的Codex下运行Nemotron 3 Ultra。

同样,团队可以重复使用 Harbor 数据集而无需重写奖励逻辑。Prime Intellect 仅用一个小类就将 Terminal Bench 2 移植到 v1。在内部测试中,验证器在相同任务上的表现与 Harbor 相匹配。Harbor 是第一个获得全面支持的第三方格式;NeMo Gym 和 OpenEnv 仅处于 Alpha 支持阶段。

在训练方面,相同的环境可以直接接入 prime-rl。在一次长度惩罚消融实验中,GLM-4.5-Air 在六个 H200 节点上使用 ScaleSWE 进行了训练。该运行用时两天,并在 SWE-Bench-Verified 上进行了评估,显示了稳定的智能体训练表现。

每次运行都从定义数据和评分的任务集开始,与任何运行框架无关:

然后,任何任务集都可以通过 TOML 和 CLI 在选定的运行框架下运行:

需要与我们合作推广您的 GitHub 仓库或 Hugging Face 页面或产品发布或网络研讨会等吗?请联系我们:https://forms.gle/wbash1wF6efRj8G58

Prime Intellect 发布 Verifiers v1:用于智能体强化学习训练与评估的可组合任务集、Harness 与运行时

Michal Sutter 是一名数据科学专业人士,拥有帕多瓦大学的数据科学理学硕士学位。凭借在统计分析、机器学习和数据工程方面的扎实基础,Michal 擅长将复杂的数据集转化为可操作的洞见。

Perplexity AI Releases WANDR
10 Open-Source No-Code Platforms for Building LLM Apps, RAG Systems, and AI Agents
Kimi K3 vs DeepSeek V4 Pro vs GLM-5.2
Fine-Tuning Qwen3 with LoRA Using NVIDIA NeMo AutoModel
NVIDIA Released DeepStream 9.1

构建一个智能事件场地运营系统 [完整代码]:https://pxllnk.co/twdn5

谢谢!我们的团队将很快与您联系

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:Prime Intellect 推出 verifiers 0.2.0 版本,并在新命名空间 verifiers.v1 下重构核心架构。 Aioga 将其归入「产品更新」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:产品与工具类动态的价值取决于它是否解决明确场景、能否进入工作流,以及交付、价格和数据安全是否可接受。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察产品是否开放使用、用户反馈、定价、集成能力和后续版本更新。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-13T07:40:18.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Prime Intellect 推出 verifiers 0.2.0 版本,并在新命名空间 verifiers.v1 下重构核心架构。v1 将环境拆分为三个可组合部分:task...

MarkTechPost(RSS)2026-07-13T07:40:18.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。