腾讯推出 WorkBuddy Bench,一个覆盖 Code、Web、Office、Security 四个工作领域的编码智能体评测套件。
每个任务均从真实 commit、PR 或业务场景逆向工程而来,改写为口语化角色扮演请求,从构造上抵抗数据污染。
该基准在 CodeBuddy Code 和 Claude Code 上运行,所有任务目录、环境镜像、评分工具和参考方案均开源发布。
Tencent ha lanciato WorkBuddy Bench, una suite di valutazione per agenti intelligenti di codifica che copre quattro aree di lavoro: Code, Web, Office e Sec...
Tencent ha lanciato WorkBuddy Bench, una suite di valutazione per agenti intelligenti di codifica
che copre quattro aree di lavoro: Code, Web, Office e Security. Ogni compito deriva da commit reali, PR o scenari aziendali ricostruiti, riscritto come richieste di gioco di ruolo in linguaggio colloquiale, per resistere alla contaminazione dei dati nella sua struttura. Questo benchmark è eseguito su CodeBuddy Code e Claude Code, e tutte le directory dei compiti, le immagini ambientali, gli strumenti di valutazione e le soluzioni di riferimento sono rilasciati open source.
腾讯推出 WorkBuddy Bench,一个覆盖 Code、Web、Office、Security 四个工作领域的编码智能体评测套件。
每个任务均从真实 commit、PR 或业务场景逆向工程而来,改写为口语化角色扮演请求,从构造上抵抗数据污染。
该基准在 CodeBuddy Code 和 Claude Code 上运行,所有任务目录、环境镜像、评分工具和参考方案均开源发布。
腾讯发布 WorkBuddy Bench,用于评测编码智能体在 Code、Web、Office 与 Security 四类工作领域中的表现。材料称,该套件已在 CodeBuddy Code 和 Claude Code 上运行,并公开发布相关评测资源。
该基准的任务由真实 commit、PR 或业务场景逆向工程而来,再改写成口语化的角色扮演请求。材料明确将这一设计描述为从构造上抵抗数据污染,试图减少模型因见过原始材料而获得的优势。
Aioga 判断,WorkBuddy Bench 的重点不只在覆盖多个任务领域,也在于公开任务目录、环境镜像、评分工具和参考方案。这可能让外部研究者更容易复现任务环境,并检验评测结果的可比性。
值得关注的是,材料仅说明该基准已在两种编码智能体上运行,并未提供具体得分、任务数量或两者优劣结论。因此,现阶段不应据此推导任何模型能力排序,后续比较仍需依赖完整实验结果。 后续可关注公开资源中各领域任务的具体定义、评分方式与参考方案,以及是否披露 CodeBuddy Code 和 Claude Code 的完整运行结果。Aioga 判断,这些信息将决定该基准是否适合用于跨系统的稳定比较。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: arxiv.org
Fonte: HuggingFace Daily Papers(社区热门论文)
原文链接: Apri la fonte originale
Aioga 归档: 查看情报页
Content record: summary-fallback · Updated: 2026-07-23T00:00:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。