腾讯推出 WorkBuddy Bench,一个覆盖 Code、Web、Office、Security 四个工作领域的编码智能体评测套件。
每个任务均从真实 commit、PR 或业务场景逆向工程而来,改写为口语化角色扮演请求,从构造上抵抗数据污染。
该基准在 CodeBuddy Code 和 Claude Code 上运行,所有任务目录、环境镜像、评分工具和参考方案均开源发布。
テンセントは WorkBuddy Bench を発表しました。これは Code、Web、Office、Security の4つの作業分野をカバーするコーディングインテリジェンス評価スイートです。各タスクは実際のコミット、PR、あるいは業務シナリオから逆行的に設計され、口語的なロールプレイのリクエストに書き換え...
テンセントは WorkBuddy Bench を発表しました。
これは Code、Web、Office、Security の4つの作業分野をカバーするコーディングインテリジェンス評価スイートです。 各タスクは実際のコミット、PR、あるいは業務シナリオから逆行的に設計され、口語的なロールプレイのリクエストに書き換えられており、構造的にデータ汚染に耐性があります。 このベンチマークは CodeBuddy Code と Claude Code 上で実行され、すべてのタスクディレクトリ、環境イメージ、評価ツール、参照ソリューションがオープンソースで公開されています。
腾讯推出 WorkBuddy Bench,一个覆盖 Code、Web、Office、Security 四个工作领域的编码智能体评测套件。
每个任务均从真实 commit、PR 或业务场景逆向工程而来,改写为口语化角色扮演请求,从构造上抵抗数据污染。
该基准在 CodeBuddy Code 和 Claude Code 上运行,所有任务目录、环境镜像、评分工具和参考方案均开源发布。
腾讯发布 WorkBuddy Bench,用于评测编码智能体在 Code、Web、Office 与 Security 四类工作领域中的表现。材料称,该套件已在 CodeBuddy Code 和 Claude Code 上运行,并公开发布相关评测资源。
该基准的任务由真实 commit、PR 或业务场景逆向工程而来,再改写成口语化的角色扮演请求。材料明确将这一设计描述为从构造上抵抗数据污染,试图减少模型因见过原始材料而获得的优势。
Aioga 判断,WorkBuddy Bench 的重点不只在覆盖多个任务领域,也在于公开任务目录、环境镜像、评分工具和参考方案。这可能让外部研究者更容易复现任务环境,并检验评测结果的可比性。
值得关注的是,材料仅说明该基准已在两种编码智能体上运行,并未提供具体得分、任务数量或两者优劣结论。因此,现阶段不应据此推导任何模型能力排序,后续比较仍需依赖完整实验结果。 后续可关注公开资源中各领域任务的具体定义、评分方式与参考方案,以及是否披露 CodeBuddy Code 和 Claude Code 的完整运行结果。Aioga 判断,这些信息将决定该基准是否适合用于跨系统的稳定比较。
取得元が提供するタイトル、要約、出典、元記事リンクを掲載しています。記事全文は転載していません。
取得経路: 要約集約 · 元ドメイン: arxiv.org
出典: HuggingFace Daily Papers(社区热门论文)
元記事: 元記事を開く
Aioga アーカイブ: 情報ページを開く
Content record: summary-fallback · Updated: 2026-07-23T00:00:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga は世界の AI 動向を集約し、確認と引用のため出典情報を保持します。