腾讯推出 WorkBuddy Bench,一个覆盖 Code、Web、Office、Security 四个工作领域的编码智能体评测套件。
每个任务均从真实 commit、PR 或业务场景逆向工程而来,改写为口语化角色扮演请求,从构造上抵抗数据污染。
该基准在 CodeBuddy Code 和 Claude Code 上运行,所有任务目录、环境镜像、评分工具和参考方案均开源发布。
เทนเซ็นต์เปิดตัว WorkBuddy Bench ชุดทดสอบเอเจนต์อัจฉริยะสำหรับการเขียนโค้ด ครอบคลุมสี่สาขางาน ได้แก่ Code, Web, Office และ Security งานแต่ละชิ้นถูกสร้างขึ้...
เทนเซ็นต์เปิดตัว WorkBuddy Bench ชุดทดสอบเอเจนต์อัจฉริยะสำหรับการเขียนโค้ด ครอบคลุมสี่สาขางาน ได้แก่
Code, Web, Office และ Security งานแต่ละชิ้นถูกสร้างขึ้นจาก commit, PR หรือสถานการณ์ทางธุรกิจจริง ๆ แล้วนำมาวิศวกรรมย้อนกลับและเขียนใหม่เป็นคำขอในรูปแบบบทบาทสมมติแบบพูด เพื่อป้องกันการปนเปื้อนของข้อมูล ชุดมาตรฐานนี้ทำงานบน CodeBuddy Code และ Claude Code ทุกไดเรกทอรีของงาน, อิมเมจสภาพแวดล้อม, เครื่องมือการให้คะแนน และ方案อ้างอิงทั้งหมดถูกเปิดเผยเป็นโอเพนซอร์ส
腾讯推出 WorkBuddy Bench,一个覆盖 Code、Web、Office、Security 四个工作领域的编码智能体评测套件。
每个任务均从真实 commit、PR 或业务场景逆向工程而来,改写为口语化角色扮演请求,从构造上抵抗数据污染。
该基准在 CodeBuddy Code 和 Claude Code 上运行,所有任务目录、环境镜像、评分工具和参考方案均开源发布。
腾讯发布 WorkBuddy Bench,用于评测编码智能体在 Code、Web、Office 与 Security 四类工作领域中的表现。材料称,该套件已在 CodeBuddy Code 和 Claude Code 上运行,并公开发布相关评测资源。
该基准的任务由真实 commit、PR 或业务场景逆向工程而来,再改写成口语化的角色扮演请求。材料明确将这一设计描述为从构造上抵抗数据污染,试图减少模型因见过原始材料而获得的优势。
Aioga 判断,WorkBuddy Bench 的重点不只在覆盖多个任务领域,也在于公开任务目录、环境镜像、评分工具和参考方案。这可能让外部研究者更容易复现任务环境,并检验评测结果的可比性。
值得关注的是,材料仅说明该基准已在两种编码智能体上运行,并未提供具体得分、任务数量或两者优劣结论。因此,现阶段不应据此推导任何模型能力排序,后续比较仍需依赖完整实验结果。 后续可关注公开资源中各领域任务的具体定义、评分方式与参考方案,以及是否披露 CodeBuddy Code 和 Claude Code 的完整运行结果。Aioga 判断,这些信息将决定该基准是否适合用于跨系统的稳定比较。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: arxiv.org
แหล่งที่มา: HuggingFace Daily Papers(社区热门论文)
原文链接: เปิดแหล่งต้นฉบับ
Aioga 归档: 查看情报页
Content record: summary-fallback · Updated: 2026-07-23T00:00:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。