arXivLabs 是一个框架,允许合作者直接在我们的网站上开发和分享新的 arXiv 功能。
有一个可以为 arXiv 社区增加价值的项目想法吗?了解更多关于 arXivLabs 的信息:https://info.arxiv.org/labs/index.html。



一项新研究以国际象棋为受控实验平台,系统探究了预训练与强化学习(RL)在推理任务中的交互关系。研究发现,给定RL计算量下的后训练性能可由预训练损失准确预测,且RL奖励曲线的斜率...
一项新研究以国际象棋为受控实验平台,系统探究了预训练与强化学习(RL)在推理任务中的交互关系。
研究发现,给定RL计算量下的后训练性能可由预训练损失准确预测,且RL奖励曲线的斜率随预训练token数近似线性提升。 在1B参数数学语言模型上,更长预训练的检查点在RL下性能更高、提升更快。
arXivLabs 是一个框架,允许合作者直接在我们的网站上开发和分享新的 arXiv 功能。
有一个可以为 arXiv 社区增加价值的项目想法吗?了解更多关于 arXivLabs 的信息:https://info.arxiv.org/labs/index.html。



arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.
Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs :https://info.arxiv.org/labs/index.html.



研究以国际象棋为受控实验平台,考察预训练与强化学习在推理任务中的关系。摘要称,给定强化学习计算量时,后训练性能可由预训练损失预测,奖励曲线斜率随预训练token数近似线性提升。
该材料关注推理能力从预训练延伸至强化学习后训练时的缩放规律。除国际象棋实验外,摘要还提到1B参数数学语言模型:预训练更久的检查点在强化学习阶段表现更高,提升也更快。
Aioga 判断,这项研究的价值在于尝试用预训练损失连接后训练表现,为选择进入强化学习阶段的检查点提供可检验线索。不过,现有材料未提供实验配置、误差范围及跨任务结果,结论边界仍需核对论文。
值得关注的是,如果论文中的预测关系能在更多任务和模型规模上复现,团队可能更容易评估预训练投入与强化学习收益之间的关系。但材料不足以证明该规律可直接推广到其他推理任务或更大模型。 下一步应查阅论文完整方法与实验结果,重点核验预训练损失的预测精度、奖励曲线斜率的拟合方式、国际象棋与数学任务的评测设计,以及不同计算预算和模型规模下是否保持一致。
本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。
抓取通道: 摘要聚合 · 原始域名: arxiv.org
来源: HuggingFace Daily Papers(社区热门论文)
原文链接: 打开原始来源
Aioga 归档: 查看情报页
Content record: source-page · Updated: 2026-07-17T00:00:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。