腾讯推出 WorkBuddy Bench,一个覆盖 Code、Web、Office、Security 四个工作领域的编码智能体评测套件。
每个任务均从真实 commit、PR 或业务场景逆向工程而来,改写为口语化角色扮演请求,从构造上抵抗数据污染。
该基准在 CodeBuddy Code 和 Claude Code 上运行,所有任务目录、环境镜像、评分工具和参考方案均开源发布。
A Tencent lançou o WorkBuddy Bench, um conjunto de avaliação de inteligência para codificação que cobre quatro áreas de trabalho: Code, Web, Office e Secur...
A Tencent lançou o WorkBuddy Bench, um conjunto de avaliação de inteligência para codificação que
cobre quatro áreas de trabalho: Code, Web, Office e Security. Cada tarefa é derivada de commits reais, PRs ou cenários de negócios através de engenharia reversa e reescrita como pedidos de interpretação de papel em linguagem coloquial, projetados para resistir à contaminação de dados. Este benchmark é executado no CodeBuddy Code e no Claude Code, e todos os diretórios de tarefas, imagens de ambiente, ferramentas de avaliação e soluções de referência são disponibilizados como código aberto.
腾讯推出 WorkBuddy Bench,一个覆盖 Code、Web、Office、Security 四个工作领域的编码智能体评测套件。
每个任务均从真实 commit、PR 或业务场景逆向工程而来,改写为口语化角色扮演请求,从构造上抵抗数据污染。
该基准在 CodeBuddy Code 和 Claude Code 上运行,所有任务目录、环境镜像、评分工具和参考方案均开源发布。
腾讯发布 WorkBuddy Bench,用于评测编码智能体在 Code、Web、Office 与 Security 四类工作领域中的表现。材料称,该套件已在 CodeBuddy Code 和 Claude Code 上运行,并公开发布相关评测资源。
该基准的任务由真实 commit、PR 或业务场景逆向工程而来,再改写成口语化的角色扮演请求。材料明确将这一设计描述为从构造上抵抗数据污染,试图减少模型因见过原始材料而获得的优势。
Aioga 判断,WorkBuddy Bench 的重点不只在覆盖多个任务领域,也在于公开任务目录、环境镜像、评分工具和参考方案。这可能让外部研究者更容易复现任务环境,并检验评测结果的可比性。
值得关注的是,材料仅说明该基准已在两种编码智能体上运行,并未提供具体得分、任务数量或两者优劣结论。因此,现阶段不应据此推导任何模型能力排序,后续比较仍需依赖完整实验结果。 后续可关注公开资源中各领域任务的具体定义、评分方式与参考方案,以及是否披露 CodeBuddy Code 和 Claude Code 的完整运行结果。Aioga 判断,这些信息将决定该基准是否适合用于跨系统的稳定比较。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: arxiv.org
Fonte: HuggingFace Daily Papers(社区热门论文)
原文链接: Abrir fonte original
Aioga 归档: 查看情报页
Content record: summary-fallback · Updated: 2026-07-23T00:00:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。