腾讯推出 WorkBuddy Bench,一个覆盖 Code、Web、Office、Security 四个工作领域的编码智能体评测套件。
每个任务均从真实 commit、PR 或业务场景逆向工程而来,改写为口语化角色扮演请求,从构造上抵抗数据污染。
该基准在 CodeBuddy Code 和 Claude Code 上运行,所有任务目录、环境镜像、评分工具和参考方案均开源发布。
텐센트가 WorkBuddy Bench를 출시했으며, 이는 코드(Code), 웹(Web), 오피스(Office), 보안(Security) 등 네 가지 업무 영역을 아우르는 코딩 인텔리전스 평가 키트입니다. 각 과제는 실제 커밋(commit), PR 또는 비즈니스 시나리오를 역공학...
텐센트가 WorkBuddy Bench를 출시했으며, 이는 코드(Code), 웹(Web), 오피스(Office), 보안(Security) 등 네 가지 업무 영역을 아우르는 코딩
인텔리전스 평가 키트입니다. 각 과제는 실제 커밋(commit), PR 또는 비즈니스 시나리오를 역공학하여, 구어체 역할극 요청으로 재작성되어 데이터 오염에 구조적으로 저항할 수 있습니다. 이 벤치마크는 CodeBuddy Code와 Claude Code에서 실행되며, 모든 과제 디렉토리, 환경 이미지, 평가 도구 및 참조 솔루션은 오픈소스로 공개되었습니다.
腾讯推出 WorkBuddy Bench,一个覆盖 Code、Web、Office、Security 四个工作领域的编码智能体评测套件。
每个任务均从真实 commit、PR 或业务场景逆向工程而来,改写为口语化角色扮演请求,从构造上抵抗数据污染。
该基准在 CodeBuddy Code 和 Claude Code 上运行,所有任务目录、环境镜像、评分工具和参考方案均开源发布。
腾讯发布 WorkBuddy Bench,用于评测编码智能体在 Code、Web、Office 与 Security 四类工作领域中的表现。材料称,该套件已在 CodeBuddy Code 和 Claude Code 上运行,并公开发布相关评测资源。
该基准的任务由真实 commit、PR 或业务场景逆向工程而来,再改写成口语化的角色扮演请求。材料明确将这一设计描述为从构造上抵抗数据污染,试图减少模型因见过原始材料而获得的优势。
Aioga 判断,WorkBuddy Bench 的重点不只在覆盖多个任务领域,也在于公开任务目录、环境镜像、评分工具和参考方案。这可能让外部研究者更容易复现任务环境,并检验评测结果的可比性。
值得关注的是,材料仅说明该基准已在两种编码智能体上运行,并未提供具体得分、任务数量或两者优劣结论。因此,现阶段不应据此推导任何模型能力排序,后续比较仍需依赖完整实验结果。 后续可关注公开资源中各领域任务的具体定义、评分方式与参考方案,以及是否披露 CodeBuddy Code 和 Claude Code 的完整运行结果。Aioga 判断,这些信息将决定该基准是否适合用于跨系统的稳定比较。
수집 피드는 제목, 요약, 출처와 원문 링크를 제공합니다. Aioga는 원문 전체를 재게시하지 않습니다.
수집 채널: 요약 집계 · 원본 도메인: arxiv.org
출처: HuggingFace Daily Papers(社区热门论文)
원문 링크: 원문 열기
Aioga 아카이브: 정보 페이지 보기
Content record: summary-fallback · Updated: 2026-07-23T00:00:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga는 전 세계 AI 동향을 집계하고 확인과 인용을 위해 출처 정보를 보존합니다.