Aioga
AI资讯 / 论文研究
返回 AI资讯

Microsoft 的 SkillOpt 证明优化后的智能体技能工件可在不同模型规模及 Codex 与 Claude Code 之间迁移

MarkTechPost(RSS)Aioga 编辑团队2026-08-06T00:37:42.000Z热度 70

Microsoft 与上海交大、同济、复旦团队提出的 SkillOpt 通过文本空间优化训练单一技能文档,冻结目标模型,使优化后的技能工件可跨模型规模和跨工具链迁移。在 Cod...

论文研究MarkTechPost(RSS)

今日 AI 情报摘要

Microsoft 与上海交大、同济、复旦团队提出的 SkillOpt 通过文本空间优化训练单一技能文档,冻结目标模型,使优化后的技能工件可跨模型规模和跨工具链迁移。

在 Codex 上优化的 SpreadsheetBench 技能部署到 Claude Code 后得分 81.8,超过后者自行训练技能得到的 80.4。 全部 4 项跨模型、4 项跨工具链和 3 项跨基准迁移结果均高于目标的无技能基线。

中文正文 · AI 翻译

SkillOpt:https://github.com/microsoft/SkillOpt 是一个文本空间优化器,由来自微软、上海交通大学、同济大学和复旦大学的研究团队开发。

SkillOpt 在目标模型保持冻结的情况下训练单个自然语言技能文档。优化器模型读取评分回合并提出有限的添加/删除/替换编辑。只有当评分严格提高时,保留的选择划分才会接受编辑。导出的产物是一个文件,best_skill.md。

迁移表格报告三列。Baseline 是目标模型的无技能分数。Direct 是在该目标域内训练的 SkillOpt。Transferred 应用在其他地方训练的技能,没有进一步优化。

有用的比较不是 transferred 与 direct 的对比,而是域内增益在迁移后能保留多少。

技能在 GPT-5.4 上训练,并部署到较小的变体上。

两行值得关注。GPT-5.4-mini 上的 SpreadsheetBench 保留了 82% 的域内增益。这接近于免费复用。GPT-5.4-nano 上的 LiveMath 行更奇怪:迁移的技能得分为 28.8,而域内 SkillOpt 结果为 27.2。论文将其解读为某些学习的程序与目标模型无关的证据。

GPT-5.4-nano 上的 SpreadsheetBench 行较弱,仅为 16%。保留效果并不均匀,论文也没有声称均匀。其声明的界限更窄:没有任何一行低于目标模型的无技能基线。

注意范围。所有四行都在同一 GPT 系列内。跨系列迁移,例如 GPT 到 Qwen:https://qwen.ai/blog?id=qwen3.5,尚未测试。

这是部署中最重要的部分。所有行均使用 GPT-5.5。

第一行是重点。在 Codex:https://openai.com/index/introducing-codex/ 内优化的技能将 Claude Code:https://www.anthropic.com/claude-code 从 22.1 提升到 81.8。略高于 Claude Code 通过从头训练自身技能达到的 80.4。

这两种工具架构暴露出不同的工具和文件 API 以及不同的命令界面。能够在这种变化下仍然生存的技能,并不是编码命令配方。研究论文:https://arxiv.org/pdf/2605.23904 将 SpreadsheetBench 的可移植性归因于工作簿级的过程:先结构化检查、识别公式的验证、以及静态值物化。这些内容不受运行 Python 的 CLI 类型影响。

LiveMath 展示了相反的情况。Codex → Claude Code 只保留了领域内提升的 10%。这种不对称值得关注。流程型技能——如何检查、验证和格式化——似乎是可移植的类别。依赖推理的技能则更依赖于其训练环境。

这里没有“直接”列。没有报告 Omni-MATH 上的领域内 SkillOpt 运行,因此比较对象仅为无技能情况。三种模型规模的增益都是正的,但很小。研究论文得出的结论是,技能在测试实例和答案格式规范变化之后,仍能保留可复用的数学过程。

研究论文中明确说明了机制。三种执行模式:直接聊天、Codex、Claude Code——都使用相同的 best_skill.md 文件格式。正是这种共享契约,使跨工具架构实验成为可能。

Codex 架构将当前技能渲染到每个任务的 SKILL.md 文件中,与任务文件一起,然后读取紧凑的执行痕迹。Claude Code 架构通过 claude CLI 反映相同的工作空间契约。两种工具架构都没有使用定制的技能格式。

该成果的形式也支持可移植性。最终技能在六个基准测试中运行时长度在 379 到 1,995 个 token 之间,中位数约 920。它们由 1 到 4 次通过审核的编辑组合而成。论文的图 4 从每个基准测试中抽取了一条学习规则,且全部为流程型,而非特定实例的规则。SpreadsheetBench 规则逐字原文:检查工作簿结构和公式,然后在整个请求的目标范围内写入评估后的静态值,而不是依赖 Excel 的重新计算。

训练成本一次性支付,离线计算,并且可测量。研究论文报告每个绝对测试点的训练标记数为0.6M到46.4M,取决于基准。SpreadsheetBench为每点0.6M;DocVQA为46.4M。优化器模型仅在训练期间运行,在部署时不会增加推理调用。

如果在一个环境中训练的技能在另一个环境中也能发挥作用,那么一次性成本就可以分摊到多个环境中。Codex → Claude Code SpreadsheetBench的结果就是存在性证明。这也意味着你可以在工具成本最低的地方进行优化,并在产品所在的地方部署。

审计角度是独立且被低估的。部署的产物是一个文本文件,领域从业者可以在几分钟内阅读。对其每一次的修改都是可追踪的:每一步都会记录一个 edit_apply_report.json,其中包含每次编辑的接受和跳过状态。可迁移性加上可检查性,是与仅发布微调权重不同的操作态度。

资源:论文:https://arxiv.org/abs/2605.23904,GitHub:https://github.com/microsoft/SkillOpt,项目页面:https://microsoft.github.io/SkillOpt/,文档:https://github.com/microsoft/SkillOpt/blob/main/docs/index.md,PyPI:https://pypi.org/project/skillopt/,演示视频:https://youtu.be/JUBMDTCiM0M

参考的基线:GEPA:https://arxiv.org/abs/2507.19457,TextGrad:https://arxiv.org/abs/2406.07496,EvoSkill:https://arxiv.org/abs/2603.02766 以及 Trace2Skill:https://arxiv.org/abs/2603.25158

参考的基准:SearchQA:https://arxiv.org/abs/1704.05179, SpreadsheetBench:https://arxiv.org/abs/2406.14991, DocVQA:https://arxiv.org/abs/2007.00398, LiveMathematicianBench:https://arxiv.org/abs/2604.01754 和 ALFWorld:https://openreview.net/forum?id=0IOX0YcCdTn

Microsoft 的 SkillOpt 证明优化后的智能体技能工件可在不同模型规模及 Codex 与 Claude Code 之间迁移

Asif Razzaq是Marktechpost Media Inc.的首席执行官。作为一位富有远见的企业家和工程师,Asif致力于利用人工智能的潜力造福社会。他最近的工作是推出人工智能媒体平台Marktechpost,该平台以其对机器学习和深度学习新闻的深入覆盖而脱颖而出,内容既技术可靠又易于广大受众理解。该平台每月访问量超过200万,显示了其在受众中的受欢迎程度。

End-to-End Bayesian Marketing Mix Modeling with Google Meridian: Media Measurement, ROI Analysis, and Budget Optimization
Meta AI Releases Muse Code
NVIDIA Releases Alpamayo 2 Super
Pixel-Native RAG: A Practical Guide to Visual Document Indexing

[免费指南] 保护 AI 代理、MCP 服务器和 LLM 应用程序:https://pxllnk.co/lxn88m

情报判断

Aioga 编辑摘要

SkillOpt 以冻结目标模型、优化单一自然语言技能文档的方式提升任务表现。材料显示,其技能可在同一 GPT 系列的不同规模间迁移,也可从 Codex 迁移至 Claude Code,且所列迁移结果均未低于目标的无技能基线。

背景分析

该方法由 Microsoft、上海交大、同济和复旦研究团队提出。优化器读取带评分的运行结果,对技能文档执行受限的增删改;只有在留出选择集上得分严格提升时才接受编辑,最终导出单一的 best_skill.md 文件。

Aioga 观点

Aioga 判断,这项研究的重点不是迁移成绩能否超过目标端直接优化,而是原有增益在迁移后保留多少。部分结果显示技能可能包含与特定目标模型无关的程序性经验,但不同任务和模型规模间的保留率并不一致。

影响与后续

对智能体开发而言,可迁移的文本技能工件可能降低针对每个模型或工具链重复优化的需求。值得关注的是,SpreadsheetBench 技能从 Codex 部署到 Claude Code 后得分为 81.8,高于后者自行训练技能的 80.4。 后续应重点验证跨模型家族迁移,因为现有跨规模测试仍局限于同一 GPT 家族,尚未测试 GPT 到 Qwen。也应继续比较不同任务的增益保留率,解释 GPT-5.4-nano 上 SpreadsheetBench 仅保留 16% 的情况。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-06T00:37:42.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Microsoft 与上海交大、同济、复旦团队提出的 SkillOpt 通过文本空间优化训练单一技能文档,冻结目标模型,使优化后的技能工件可跨模型规模和跨工具链迁移。在 Cod...

MarkTechPost(RSS)2026-08-06T00:37:42.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。