Aioga
AI资讯 / 技巧观点
返回 AI资讯

4B开源模型经Castform后训练,检索任务超越GPT-5.6 Sol且成本低100倍

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-08-05T20:39:47.435Z热度 63

一个4B开源模型经Castform后训练后,在检索任务中达到与GPT-5.6 Sol相当的准确率,而每次请求成本仅为后者的百分之一。典型多轮搜索请求调用gpt-5.6-sol耗...

技巧观点Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

一个4B开源模型经Castform后训练后,在检索任务中达到与GPT-5.6 Sol相当的准确率,而每次请求成本仅为后者的百分之一。

典型多轮搜索请求调用gpt-5.6-sol耗时超10秒、端到端成本约0.03美元,而小规模开源权重模型便宜100倍。 Castform通过RL后训练弥合差距,并利用Neon的Lakebase Search实现训练与推理。

中文正文 · AI 翻译

“多数团队最好的训练数据就存放在他们的数据库里。问题在于,将原始数据转化为可用数据很困难,而让智能体在大规模下低成本地读取、搜索和修改数据则需要先进的基础设施。将 Castform 指向 Neon 可以跳过这两个问题。”

Comparison of Castform fine-tune and frontier models by inference cost and mean evaluation reward

一个“优秀的智能体”需要在两个方面很强:

Neon:https://neon.com/(Lakebase Postgres)及其新的搜索功能:https://neon.com/blog/lakebase-search-on-neon 扩展解决了第一个问题;Castform:https://castform.com/ 解决了第二个问题。

大约在2022年,整个行业都在全力推进嵌入式搜索。每个数据库提供商都增加了此功能,而 pgvector 是 Neon 下载量最高的扩展。为了向大语言模型提供上下文,工程师们手工设计了 RAG 流程,本质上是一种嵌入相似度搜索形式。

大约在2025年,智能体开始获得更多关注。开发者开始创建多跳搜索工作流,将大问题分解成更小的问题。检索方式从一次性搜索系统转向智能体式检索。模型不再只发出单个查询,而是在循环中多次进行计划和搜索。每次循环迭代都意味着调用最前沿模型一次,从而增加了每次用户请求的整体成本和延迟。

Comparison of a traditional RAG pipeline and an agentic search workflow

具体来说,用 gpt-5.6-sol 进行一次典型的多轮搜索请求需要超过10秒,端到端成本约为0.03美元,使其速度过慢且费用过高。

与此同时,小型开源权重模型的成本便宜 100 倍。但开箱即用时,它们的能力落后于封闭 API 模型。RL 后训练有助于弥补这一差距。在诸如搜索等特定任务上,经过后训练的开源模型可以匹配甚至超越最前沿模型,同时每次请求的成本低几个数量级。

这就是我们构建 Castform 的原因:让开发者能够对模型进行 RL 后训练,而无需处理机器学习和 GPU 内部操作。目标是让后训练像提示工程一样易于上手。

Castform 的管道通过 Lakebase 搜索在 Neon 上运行:

要有效地进行 RL 后训练,你需要一个任务(例如回答用户问题)、智能体运行的环境(例如你的语料库搜索工具),以及奖励函数(例如答案是否正确?)。

当所有三个部分就绪后,强化学习后训练就是一个试错循环:模型在给定工具的情况下尝试任务,奖励函数对尝试进行评分,反馈信号指导模型如何逐步爬升以达到最佳性能。

然而,大多数公司并没有一份干净的任务与奖励函数数据集可供后训练使用。

企业确实拥有大量的专有数据:

这些数据包含代理所需的知识,但将其转化为有效的训练数据集通常需要大量的数据工程和人工标注。

这导致许多团队出于以下两种原因之一而放弃后训练:

Castform 解决了两者问题。它将现有语料库转化为训练任务:https://castform.com/blog/rag-to-riches/,然后管理教导开源模型如何有效使用这些数据所需的强化学习循环。

通过 Castform,你可以将公司的知识库转化为一个模型:

通过生成的问题-答案数据集,Castform 允许你通过指定代理可访问的工具和奖励函数来构建训练流程。

奖励函数指定了你希望模型擅长的内容。在我们的例子中,我们希望模型能够检索正确的内容块,引用正确的来源,并提供正确的最终答案。

在这里可以看到全面的代码示例:https://github.com/castform-ai/benchmax/tree/main/examples/neon_rag。

Castform 提供了对强化学习运行的完全可观察性。你可以监控每一步的奖励攀升,更重要的是,你可以进入单独的任务/提示中观察模型的定性表现,从而调试如工具损坏或奖励作弊等问题。

关于如何监控你的训练运行的更多细节,你可以查看 Castform 博客:https://castform.com/blog/monitoring-rl-runs/。你也可以查看我们的训练示例:https://app.castform.com/train/a7a898f6-d802-4908-b044-acb812f14a48?tab=train。

Average reward over training steps

在训练期间,代理会重复调用 Lakebase 搜索,直到它获得足够的上下文来回答问题。在数千次并行展开中,每次可能进行数十次调用,这会产生高度突发的工作负载。

Neon CPU allocation and usage during a Castform training run

Neon 的动态计算扩展能够吸收这些峰值,而无需 Castform 全天候为最大容量进行准备。当需求激增时,训练运行可以进行低延迟搜索,而在空闲期间计算资源会自动缩减。

当代理从搜索扩展到修改数据时,这种基础设施变得更加有价值。训练有状态代理需要隔离环境,这些环境可以廉价地创建和重置,从而防止一次投放的操作影响另一次投放或接触到生产环境。

Neon 分支:https://neon.com/docs/introduction/branching 可以为每次投放提供隔离的数据库状态,而时间旅行查询使得重建和检查代理所遇到的状态成为可能。结合自动扩展和归零扩展,这为训练成千上万个有状态代理投放开辟了道路,而无需维护数千个持续运行的环境。

Castform 让任何开发者轻松地对开源模型进行后训练,使其比前沿技术更便宜、更快、更优。今天就在 castform.com:https://castform.com 对你的第一个模型进行后训练。

仅接收我们的最新更新。保证无垃圾信息。

4B开源模型经Castform后训练,检索任务超越GPT-5.6 Sol且成本低100倍

情报判断

Aioga 编辑摘要

材料称,一个4B开源权重模型经Castform强化学习后训练后,在特定检索任务上可达到或超过前沿模型表现;典型多轮搜索中,相关小模型成本约低100倍,而GPT-5.6 Sol请求耗时超过10秒、端到端成本约0.03美元。

背景分析

文章将检索演进分为嵌入相似度搜索与智能体式多跳检索两个阶段。后者会让模型循环规划并多次搜索,每轮都可能调用前沿模型,从而增加整体延迟和成本。Castform负责强化学习后训练,Neon的Lakebase Search用于训练与推理所需的数据检索。

Aioga 观点

Aioga 判断,这项材料的价值在于展示了针对单一任务进行后训练的成本潜力,但标题所称“超越”与摘要所称“相当”并不完全一致。现有摘录也未提供数据集、样本量、准确率数值、评测方法及重复实验结果,因此不足以独立确认性能领先。

影响与后续

如果相关结果能在公开基准和真实业务负载中复现,专用小模型可能降低多轮检索的调用成本与等待时间,并减少对闭源前沿模型的依赖。值得关注的是,这一结论目前仅适用于材料所述的特定搜索任务,不能外推为通用模型能力优势。 后续应核查完整实验报告,重点确认4B模型名称与版本、GPT-5.6 Sol的具体配置、准确率口径、测试集构成、硬件与推理成本算法,并比较相同延迟和质量约束下的结果。在这些信息公开前,应将“低100倍”和“超越”视为来源方主张。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: neon.com

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-05T20:39:47.435Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

一个4B开源模型经Castform后训练后,在检索任务中达到与GPT-5.6 Sol相当的准确率,而每次请求成本仅为后者的百分之一。典型多轮搜索请求调用gpt-5.6-sol耗...

Hacker News 热门(buzzing.cc 中文翻译)2026-08-05T20:39:47.435Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。