{"@context":"https://schema.org","@type":"NewsArticle","generatedAt":"2026-07-28T05:20:57.982Z","headline":"腾讯发布 WorkBuddy Bench：多领域编码智能体评测套件","description":"腾讯推出 WorkBuddy Bench，一个覆盖 Code、Web、Office、Security 四个工作领域的编码智能体评测套件。每个任务均从真实 commit、PR 或业务场景逆向工程而来，改写为口语化角色扮演请求，从构造上抵抗数据污染。该基准在 CodeBuddy Code 和 Claude Code 上运行，所有任务目录、环境镜像、评分工具和参考方案均开源发布。","url":"https://www.aioga.com/news/cmrycf0kz000broxsd74zlwqf/","mainEntityOfPage":"https://www.aioga.com/news/cmrycf0kz000broxsd74zlwqf/","datePublished":"2026-07-23T00:00:00.000Z","dateModified":"2026-07-23T00:00:00.000Z","inLanguage":"zh-CN","publisher":{"@type":"NewsMediaOrganization","name":"Aioga","url":"https://www.aioga.com"},"citation":["https://arxiv.org/abs/2607.20911","https://aihot.virxact.com/items/cmrycf0kz000broxsd74zlwqf"],"canonicalUrl":"https://www.aioga.com/news/cmrycf0kz000broxsd74zlwqf/","directAnswer":{"@type":"Answer","text":"腾讯发布 WorkBuddy Bench，用于评测编码智能体在 Code、Web、Office 与 Security 四类工作领域中的表现。材料称，该套件已在 CodeBuddy Code 和 Claude Code 上运行，并公开发布相关评测资源。","url":"https://www.aioga.com/news/cmrycf0kz000broxsd74zlwqf/","dateCreated":"2026-07-23T00:00:00.000Z","author":{"@type":"Organization","@id":"https://www.aioga.com/authors/aioga-editorial/#editorial-team","name":"Aioga Editorial Team","url":"https://www.aioga.com/authors/aioga-editorial/"}},"evidence":[{"@type":"CreativeWork","name":"arXiv source article","url":"https://arxiv.org/abs/2607.20911","datePublished":"2026-07-23T00:00:00.000Z","provider":{"@type":"Organization","name":"arXiv","url":"https://arxiv.org/abs/2607.20911"}},{"@type":"CreativeWork","name":"AIHot archive record","url":"https://aihot.virxact.com/items/cmrycf0kz000broxsd74zlwqf","datePublished":"2026-07-23T00:00:00.000Z","provider":{"@type":"Organization","name":"AIHot","url":"https://aihot.virxact.com/items/cmrycf0kz000broxsd74zlwqf"}}],"aggregationSource":"HuggingFace Daily Papers（社区热门论文）","originalPublisher":{"name":"arXiv","url":"https://arxiv.org/abs/2607.20911"},"article":{"id":"cmrycf0kz000broxsd74zlwqf","slug":"cmrycf0kz000broxsd74zlwqf","url":"https://www.aioga.com/news/cmrycf0kz000broxsd74zlwqf/","title":"腾讯发布 WorkBuddy Bench：多领域编码智能体评测套件","title_en":"Tencent WorkBuddy Bench： A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","summary":"腾讯推出 WorkBuddy Bench，一个覆盖 Code、Web、Office、Security 四个工作领域的编码智能体评测套件。每个任务均从真实 commit、PR 或业务场景逆向工程而来，改写为口语化角色扮演请求，从构造上抵抗数据污染。该基准在 CodeBuddy Code 和 Claude Code 上运行，所有任务目录、环境镜像、评分工具和参考方案均开源发布。","source":"HuggingFace Daily Papers（社区热门论文）","sourceUrl":"https://arxiv.org/abs/2607.20911","aiHotUrl":"https://aihot.virxact.com/items/cmrycf0kz000broxsd74zlwqf","publishedAt":"2026-07-23T00:00:00.000Z","category":"论文研究","score":73,"selected":true,"articleBody":["腾讯推出 WorkBuddy Bench，一个覆盖 Code、Web、Office、Security 四个工作领域的编码智能体评测套件。","每个任务均从真实 commit、PR 或业务场景逆向工程而来，改写为口语化角色扮演请求，从构造上抵抗数据污染。","该基准在 CodeBuddy Code 和 Claude Code 上运行，所有任务目录、环境镜像、评分工具和参考方案均开源发布。"],"articleImages":[],"mediaStatus":"none","articleBodyZh":[],"translationStatus":"","bodyOrigin":"summary-fallback","editorial":{"summary":"腾讯发布 WorkBuddy Bench，用于评测编码智能体在 Code、Web、Office 与 Security 四类工作领域中的表现。材料称，该套件已在 CodeBuddy Code 和 Claude Code 上运行，并公开发布相关评测资源。","background":"该基准的任务由真实 commit、PR 或业务场景逆向工程而来，再改写成口语化的角色扮演请求。材料明确将这一设计描述为从构造上抵抗数据污染，试图减少模型因见过原始材料而获得的优势。","viewpoint":"Aioga 判断，WorkBuddy Bench 的重点不只在覆盖多个任务领域，也在于公开任务目录、环境镜像、评分工具和参考方案。这可能让外部研究者更容易复现任务环境，并检验评测结果的可比性。","implications":"值得关注的是，材料仅说明该基准已在两种编码智能体上运行，并未提供具体得分、任务数量或两者优劣结论。因此，现阶段不应据此推导任何模型能力排序，后续比较仍需依赖完整实验结果。","nextStep":"后续可关注公开资源中各领域任务的具体定义、评分方式与参考方案，以及是否披露 CodeBuddy Code 和 Claude Code 的完整运行结果。Aioga 判断，这些信息将决定该基准是否适合用于跨系统的稳定比较。","evidenceRefs":["title","summary","articleBody","source"],"status":"published","aiGenerated":true,"autoApproved":true,"generatedBy":"aioga-editorial:gpt-5.6-sol","reviewedBy":"aioga-editorial-review:gpt-5.6-sol","generatedAt":"2026-07-26T08:29:32.797Z","sourceHash":"2cb3efcd5484c50e","review":{"approved":true,"groundedness":96,"clarity":94,"duplicationRisk":12,"blockingIssues":[],"notes":["“试图减少模型因见过原始材料而获得的优势”是对“从构造上抵抗数据污染”的合理解释，但并非来源材料的直接表述。","“这些信息将决定该基准是否适合用于跨系统的稳定比较”略显绝对；可选地改为“这些信息将影响对该基准是否适合跨系统稳定比较的判断”。该句已明确标注为 Aioga 的判断，不构成阻断问题。"]},"validation":{"passed":true,"mode":"ai-auto","revisions":0,"checks":["schema","length","source-attribution","low-source-overlap","no-html","independent-ai-review"]}},"tags":["论文研究","HuggingFace Daily Papers（社区热门论文）"],"translations":{"zh-CN":{"title":"腾讯发布 WorkBuddy Bench：多领域编码智能体评测套件","summary":"腾讯推出 WorkBuddy Bench，一个覆盖 Code、Web、Office、Security 四个工作领域的编码智能体评测套件。每个任务均从真实 commit、PR 或业务场景逆向工程而来，改写为口语化角色扮演请求，从构造上抵抗数据污染。该基准在 CodeBuddy Code 和 Claude Code 上运行，所有任务目录、环境镜像、评分工具和参考方案均开源发布。","category":"论文研究","source":"arXiv","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"腾讯发布 WorkBuddy Bench：多领域编码智能体评测套件 - Aioga AI资讯","description":"腾讯推出 WorkBuddy Bench，一个覆盖 Code、Web、Office、Security 四个工作领域的编码智能体评测套件。每个任务均从真实 commit、PR 或业务场景逆向工程而来，改写为口语化角色扮演请求，从构造上抵抗数据污染。该基准在 CodeBuddy Code 和 Claude Code 上运行，所有任务目录、环境镜像、评分工具和参考...","url":"https://www.aioga.com/news/cmrycf0kz000broxsd74zlwqf/"},"en":{"title":"Tencent releases WorkBuddy Bench: Multi-domain Coding Intelligence Agent Evaluation Suite","summary":"Tencent has launched WorkBuddy Bench, an evaluation suite for intelligent coding agents covering four work domains: Code, Web, Office, and Security. Each task is reverse-engineered from real commits, PRs, or business scenarios and rewritten as conversational role-playing requests, structurally resisting data contamination. This benchmark runs on CodeBuddy Code and Claude Code, with all task directories, environment images, scoring tools, and reference solutions released as open source.","category":"Research","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Tencent releases WorkBuddy Bench: Multi-domain Coding Intelligence Agent Evaluation Suite - Aioga AI News","description":"Tencent has launched WorkBuddy Bench, an evaluation suite for intelligent coding agents covering four work domains: Code, Web, Office, and Security. Each task is reverse-engineered...","url":"https://www.aioga.com/en/news/cmrycf0kz000broxsd74zlwqf/","contentTranslated":true,"sourceHash":"354536021f8ac773","translatedAt":"2026-07-26T02:25:11.599Z"},"ja":{"title":"テンセント、WorkBuddy Benchを発表：複数分野のコーディングAI評価スイート","summary":"テンセントは WorkBuddy Bench を発表しました。これは Code、Web、Office、Security の4つの作業分野をカバーするコーディングインテリジェンス評価スイートです。各タスクは実際のコミット、PR、あるいは業務シナリオから逆行的に設計され、口語的なロールプレイのリクエストに書き換えられており、構造的にデータ汚染に耐性があります。このベンチマークは CodeBuddy Code と Claude Code 上で実行され、すべてのタスクディレクトリ、環境イメージ、評価ツール、参照ソリューションがオープンソースで公開されています。","category":"論文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"テンセント、WorkBuddy Benchを発表：複数分野のコーディングAI評価スイート - Aioga AIニュース","description":"テンセントは WorkBuddy Bench を発表しました。これは Code、Web、Office、Security の4つの作業分野をカバーするコーディングインテリジェンス評価スイートです。各タスクは実際のコミット、PR、あるいは業務シナリオから逆行的に設計され、口語的なロールプレイのリクエストに書き換えられており、構造的にデータ汚染に耐性があります。こ...","url":"https://www.aioga.com/ja/news/cmrycf0kz000broxsd74zlwqf/","contentTranslated":true,"sourceHash":"354536021f8ac773","translatedAt":"2026-07-26T02:25:21.980Z"},"ko":{"title":"텐센트, WorkBuddy Bench 발표: 다분야 코딩 인텔리전트 에이전트 평가 세트","summary":"텐센트가 WorkBuddy Bench를 출시했으며, 이는 코드(Code), 웹(Web), 오피스(Office), 보안(Security) 등 네 가지 업무 영역을 아우르는 코딩 인텔리전스 평가 키트입니다. 각 과제는 실제 커밋(commit), PR 또는 비즈니스 시나리오를 역공학하여, 구어체 역할극 요청으로 재작성되어 데이터 오염에 구조적으로 저항할 수 있습니다. 이 벤치마크는 CodeBuddy Code와 Claude Code에서 실행되며, 모든 과제 디렉토리, 환경 이미지, 평가 도구 및 참조 솔루션은 오픈소스로 공개되었습니다.","category":"연구","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"텐센트, WorkBuddy Bench 발표: 다분야 코딩 인텔리전트 에이전트 평가 세트 - Aioga AI 뉴스","description":"텐센트가 WorkBuddy Bench를 출시했으며, 이는 코드(Code), 웹(Web), 오피스(Office), 보안(Security) 등 네 가지 업무 영역을 아우르는 코딩 인텔리전스 평가 키트입니다. 각 과제는 실제 커밋(commit), PR 또는 비즈니스 시나리오를 역공학하여, 구어체 역할극 요청으로 재작성되어 데이...","url":"https://www.aioga.com/ko/news/cmrycf0kz000broxsd74zlwqf/","contentTranslated":true,"sourceHash":"354536021f8ac773","translatedAt":"2026-07-26T02:25:58.673Z"},"es":{"title":"Tencent lanza WorkBuddy Bench: Suite de evaluación de agentes inteligentes de codificación en múltiples campos","summary":"Tencent lanzó WorkBuddy Bench, un conjunto de evaluación de agentes inteligentes de codificación que abarca los cuatro campos de trabajo: Code, Web, Office y Security. Cada tarea se deriva de commits reales, PRs o escenarios de negocio mediante ingeniería inversa, y se reescribe en forma de solicitudes de juego de rol conversacionales, diseñadas para resistir la contaminación de datos desde su construcción. Este benchmark se ejecuta en CodeBuddy Code y Claude Code, y todos los directorios de tareas, imágenes de entorno, herramientas de evaluación y soluciones de referencia se publican como código abierto.","category":"Investigación","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Tencent lanza WorkBuddy Bench: Suite de evaluación de agentes inteligentes de codificación en múltiples campos - Aioga Noticias de IA","description":"Tencent lanzó WorkBuddy Bench, un conjunto de evaluación de agentes inteligentes de codificación que abarca los cuatro campos de trabajo: Code, Web, Office y Security. Cada tarea s...","url":"https://www.aioga.com/es/news/cmrycf0kz000broxsd74zlwqf/","contentTranslated":true,"sourceHash":"354536021f8ac773","translatedAt":"2026-07-26T02:25:57.475Z"},"fr":{"title":"Tencent publie WorkBuddy Bench : Suite d'évaluation des agents intelligents de codage multi-domaines","summary":"Tencent a lancé WorkBuddy Bench, une suite d'évaluation des agents intelligents de codage couvrant quatre domaines de travail : Code, Web, Office et Sécurité. Chaque tâche est dérivée d'un commit, d'une PR ou d'un scénario métier réel, réécrite sous forme de demandes de jeu de rôle conversationnel, afin de résister à la pollution des données dès sa conception. Ce benchmark est exécuté sur CodeBuddy Code et Claude Code, et tous les répertoires de tâches, images d'environnement, outils de notation et solutions de référence sont publiés en open source.","category":"Recherche","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Tencent publie WorkBuddy Bench : Suite d'évaluation des agents intelligents de codage multi-domaines - Aioga Actualités IA","description":"Tencent a lancé WorkBuddy Bench, une suite d'évaluation des agents intelligents de codage couvrant quatre domaines de travail : Code, Web, Office et Sécurité. Chaque tâche est déri...","url":"https://www.aioga.com/fr/news/cmrycf0kz000broxsd74zlwqf/","contentTranslated":true,"sourceHash":"354536021f8ac773","translatedAt":"2026-07-26T02:26:34.246Z"},"de":{"title":"Tencent veröffentlicht WorkBuddy Bench: Bewertungs-Toolkit für intelligente Agenten im Bereich der Codierung in mehreren Domänen","summary":"Tencent hat WorkBuddy Bench vorgestellt, ein Bewertungsset für intelligente Codierungsagenten, das die vier Arbeitsbereiche Code, Web, Office und Sicherheit abdeckt. Jede Aufgabe wird aus echten Commits, PRs oder Geschäftsszenarien rückentwickelt und in gesprächsartige Rollenspielanfragen umgeschrieben, um Datenverschmutzung strukturell zu verhindern. Dieses Benchmark wird auf CodeBuddy Code und Claude Code ausgeführt, und alle Aufgabenverzeichnisse, Umwelt-Images, Bewertungstools und Referenzlösungen werden Open Source veröffentlicht.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Tencent veröffentlicht WorkBuddy Bench: Bewertungs-Toolkit für intelligente Agenten im Bereich der Codierung in mehreren Domänen - Aioga KI-News","description":"Tencent hat WorkBuddy Bench vorgestellt, ein Bewertungsset für intelligente Codierungsagenten, das die vier Arbeitsbereiche Code, Web, Office und Sicherheit abdeckt. Jede Aufgabe w...","url":"https://www.aioga.com/de/news/cmrycf0kz000broxsd74zlwqf/","contentTranslated":true,"sourceHash":"354536021f8ac773","translatedAt":"2026-07-26T02:26:34.504Z"},"pt-BR":{"title":"Tencent lança WorkBuddy Bench: suíte de avaliação de agentes inteligentes de codificação para múltiplos domínios","summary":"A Tencent lançou o WorkBuddy Bench, um conjunto de avaliação de inteligência para codificação que cobre quatro áreas de trabalho: Code, Web, Office e Security. Cada tarefa é derivada de commits reais, PRs ou cenários de negócios através de engenharia reversa e reescrita como pedidos de interpretação de papel em linguagem coloquial, projetados para resistir à contaminação de dados. Este benchmark é executado no CodeBuddy Code e no Claude Code, e todos os diretórios de tarefas, imagens de ambiente, ferramentas de avaliação e soluções de referência são disponibilizados como código aberto.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Tencent lança WorkBuddy Bench: suíte de avaliação de agentes inteligentes de codificação para múltiplos domínios - Aioga Notícias de IA","description":"A Tencent lançou o WorkBuddy Bench, um conjunto de avaliação de inteligência para codificação que cobre quatro áreas de trabalho: Code, Web, Office e Security. Cada tarefa é deriva...","url":"https://www.aioga.com/pt-BR/news/cmrycf0kz000broxsd74zlwqf/","contentTranslated":true,"sourceHash":"354536021f8ac773","translatedAt":"2026-07-26T02:27:09.612Z"},"ru":{"title":"Tencent выпустила WorkBuddy Bench: набор для оценки интеллектуальных агентов программирования в различных областях","summary":"Tencent представила WorkBuddy Bench, комплект для оценки интеллектуальных агентов в области программирования, охватывающий четыре рабочих направления: Code, Web, Office и Security. Каждое задание создается методом обратного проектирования на основе реальных коммитов, PR или бизнес-сценариев и преобразуется в разговорную форму с ролевой игрой, что конструктивно защищает от загрязнения данных. Этот бенчмарк запускается на CodeBuddy Code и Claude Code, все каталоги заданий, образы среды, инструменты оценки и эталонные решения публикуются в открытом доступе.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Tencent выпустила WorkBuddy Bench: набор для оценки интеллектуальных агентов программирования в различных областях - Aioga Новости ИИ","description":"Tencent представила WorkBuddy Bench, комплект для оценки интеллектуальных агентов в области программирования, охватывающий четыре рабочих направления: Code, Web, Office и Security....","url":"https://www.aioga.com/ru/news/cmrycf0kz000broxsd74zlwqf/","contentTranslated":true,"sourceHash":"354536021f8ac773","translatedAt":"2026-07-26T02:27:17.454Z"},"ar":{"title":"تنسنت تصدر WorkBuddy Bench: مجموعة تقييم لوكلاء الذكاء الاصطناعي المبرمجين في مجالات متعددة","summary":"أطلقت شركة تينسنت WorkBuddy Bench، وهو مجموعة تقييم لوكلاء البرمجة الذكية تغطي أربعة مجالات عمل: البرمجة، الويب، المكتب، والأمن. كل مهمة مستخرجة من commit أو PR حقيقي أو من سيناريوهات العمل الفعلية وتحويلها إلى طلبات تمثيل أدوار بأسلوب محادثة، وذلك لمنع تلوث البيانات من حيث البنية. يتم تشغيل هذا المعيار على CodeBuddy Code و Claude Code، وجميع دلائل المهام، وصور البيئة، وأدوات التقييم، والحلول المرجعية منشورة كمصدر مفتوح.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"تنسنت تصدر WorkBuddy Bench: مجموعة تقييم لوكلاء الذكاء الاصطناعي المبرمجين في مجالات متعددة - Aioga أخبار الذكاء الاصطناعي","description":"أطلقت شركة تينسنت WorkBuddy Bench، وهو مجموعة تقييم لوكلاء البرمجة الذكية تغطي أربعة مجالات عمل: البرمجة، الويب، المكتب، والأمن. كل مهمة مستخرجة من commit أو PR حقيقي أو من سيناريو...","url":"https://www.aioga.com/ar/news/cmrycf0kz000broxsd74zlwqf/","contentTranslated":true,"sourceHash":"354536021f8ac773","translatedAt":"2026-07-26T02:27:58.536Z"},"hi":{"title":"टेनसेंट ने WorkBuddy Bench जारी किया: बहु-क्षेत्रीय कोडिंग इंटेलिजेंट एजेंट मूल्यांकन सूट","summary":"टेनसेंट ने WorkBuddy Bench लॉन्च किया, जो Code, Web, Office और Security चार कार्य क्षेत्रों को कवर करने वाला एक कोडिंग इंटेलिजेंस एजेंट मूल्यांकन सूट है। प्रत्येक कार्य वास्तविक commit, PR या व्यवसाय परिदृश्य से रिवर्स इंजीनियरिंग करके लिया गया है, और इसे मौखिक रूप में रोल-प्ले अनुरोध में लिखा गया है, जिससे डेटा दूषित होने से संरचनात्मक रूप से बचाव होता है। यह बेंचमार्क CodeBuddy Code और Claude Code पर चलता है, और सभी कार्य निर्देशिका, पर्यावरण इमेज, स्कोरिंग टूल और रेफरेंस समाधान ओपन-सोर्स के रूप में प्रकाशित किए गए हैं।","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"टेनसेंट ने WorkBuddy Bench जारी किया: बहु-क्षेत्रीय कोडिंग इंटेलिजेंट एजेंट मूल्यांकन सूट - Aioga AI समाचार","description":"टेनसेंट ने WorkBuddy Bench लॉन्च किया, जो Code, Web, Office और Security चार कार्य क्षेत्रों को कवर करने वाला एक कोडिंग इंटेलिजेंस एजेंट मूल्यांकन सूट है। प्रत्येक कार्य वास्तविक co...","url":"https://www.aioga.com/hi/news/cmrycf0kz000broxsd74zlwqf/","contentTranslated":true,"sourceHash":"354536021f8ac773","translatedAt":"2026-07-26T02:28:01.884Z"},"it":{"title":"Tencent lancia WorkBuddy Bench: Suite di valutazione per agenti intelligenti di codifica in più settori","summary":"Tencent ha lanciato WorkBuddy Bench, una suite di valutazione per agenti intelligenti di codifica che copre quattro aree di lavoro: Code, Web, Office e Security. Ogni compito deriva da commit reali, PR o scenari aziendali ricostruiti, riscritto come richieste di gioco di ruolo in linguaggio colloquiale, per resistere alla contaminazione dei dati nella sua struttura. Questo benchmark è eseguito su CodeBuddy Code e Claude Code, e tutte le directory dei compiti, le immagini ambientali, gli strumenti di valutazione e le soluzioni di riferimento sono rilasciati open source.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Tencent lancia WorkBuddy Bench: Suite di valutazione per agenti intelligenti di codifica in più settori - Aioga Notizie IA","description":"Tencent ha lanciato WorkBuddy Bench, una suite di valutazione per agenti intelligenti di codifica che copre quattro aree di lavoro: Code, Web, Office e Security. Ogni compito deriv...","url":"https://www.aioga.com/it/news/cmrycf0kz000broxsd74zlwqf/","contentTranslated":true,"sourceHash":"354536021f8ac773","translatedAt":"2026-07-26T02:28:38.662Z"},"nl":{"title":"Tencent lanceert WorkBuddy Bench: beoordelingssuite voor slimme agents voor programmeren in meerdere domeinen","summary":"Tencent lanceerde WorkBuddy Bench, een beoordelingssuite voor intelligente code-agenten die vier werkgebieden beslaat: Code, Web, Office en Security. Elke taak is achterwaarts ontworpen vanuit echte commits, PR's of zakelijke scenario's en herschreven als mondelinge rollenspelverzoeken, wat structureel bestand is tegen datavervuiling. Deze benchmark wordt uitgevoerd op CodeBuddy Code en Claude Code, waarbij alle taakmappen, omgevingsbeelden, beoordelingshulpmiddelen en referentieoplossingen open source worden vrijgegeven.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Tencent lanceert WorkBuddy Bench: beoordelingssuite voor slimme agents voor programmeren in meerdere domeinen - Aioga AI-nieuws","description":"Tencent lanceerde WorkBuddy Bench, een beoordelingssuite voor intelligente code-agenten die vier werkgebieden beslaat: Code, Web, Office en Security. Elke taak is achterwaarts ontw...","url":"https://www.aioga.com/nl/news/cmrycf0kz000broxsd74zlwqf/","contentTranslated":true,"sourceHash":"354536021f8ac773","translatedAt":"2026-07-26T02:28:38.421Z"},"tr":{"title":"Tencent, WorkBuddy Bench'i Yayınladı: Çok Alanlı Kodlama Zekâ Değerlendirme Seti","summary":"Tencent, Code, Web, Office ve Security olmak üzere dört iş alanını kapsayan bir kodlama zeka ajanı değerlendirme paketi olan WorkBuddy Bench'i tanıttı. Her görev, gerçek commit, PR veya iş senaryolarından tersine mühendislik ile ortaya çıkmış ve konuşma diline uygun rol oynama taleplerine dönüştürülmüştür; yapısal olarak veri kirlenmesine karşı dayanıklıdır. Bu benchmark, CodeBuddy Code ve Claude Code üzerinde çalıştırılmış olup, tüm görev dizinleri, ortam görüntüleri, değerlendirme araçları ve referans çözümler açık kaynak olarak yayınlanmıştır.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Tencent, WorkBuddy Bench'i Yayınladı: Çok Alanlı Kodlama Zekâ Değerlendirme Seti - Aioga AI Haberleri","description":"Tencent, Code, Web, Office ve Security olmak üzere dört iş alanını kapsayan bir kodlama zeka ajanı değerlendirme paketi olan WorkBuddy Bench'i tanıttı. Her görev, gerçek commit, PR...","url":"https://www.aioga.com/tr/news/cmrycf0kz000broxsd74zlwqf/","contentTranslated":true,"sourceHash":"354536021f8ac773","translatedAt":"2026-07-26T02:29:17.187Z"},"vi":{"title":"Tencent phát hành WorkBuddy Bench: Bộ đánh giá tác nhân thông minh mã hóa đa lĩnh vực","summary":"Tencent ra mắt WorkBuddy Bench, một bộ đánh giá trí tuệ nhân tạo lập trình bao quát bốn lĩnh vực công việc gồm Code, Web, Office và Security. Mỗi nhiệm vụ đều được đảo ngược từ commit, PR hoặc bối cảnh kinh doanh thực tế, sau đó được viết lại thành các yêu cầu nhập vai kiểu hội thoại, từ cấu trúc giúp chống ô nhiễm dữ liệu. Bộ chuẩn này chạy trên CodeBuddy Code và Claude Code, tất cả thư mục nhiệm vụ, hình ảnh môi trường, công cụ đánh giá và phương án tham khảo đều được phát hành mã nguồn mở.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Tencent phát hành WorkBuddy Bench: Bộ đánh giá tác nhân thông minh mã hóa đa lĩnh vực - Tin tức AI Aioga","description":"Tencent ra mắt WorkBuddy Bench, một bộ đánh giá trí tuệ nhân tạo lập trình bao quát bốn lĩnh vực công việc gồm Code, Web, Office và Security. Mỗi nhiệm vụ đều được đảo ngược từ com...","url":"https://www.aioga.com/vi/news/cmrycf0kz000broxsd74zlwqf/","contentTranslated":true,"sourceHash":"354536021f8ac773","translatedAt":"2026-07-26T02:29:16.896Z"},"id":{"title":"Tencent merilis WorkBuddy Bench: Paket Penilaian Agen Cerdas Pengkodean Multi-Bidang","summary":"Tencent meluncurkan WorkBuddy Bench, sebuah paket penilaian agen cerdas pemrograman yang mencakup empat bidang kerja: Code, Web, Office, dan Security. Setiap tugas berasal dari rekayasa balik commit, PR, atau skenario bisnis yang nyata, diubah menjadi permintaan peran percakapan yang bersifat santai, dirancang untuk melawan kontaminasi data secara struktural. Benchmark ini dijalankan pada CodeBuddy Code dan Claude Code, dengan semua direktori tugas, image lingkungan, alat penilaian, dan solusi referensi dirilis secara open source.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Tencent merilis WorkBuddy Bench: Paket Penilaian Agen Cerdas Pengkodean Multi-Bidang - Berita AI Aioga","description":"Tencent meluncurkan WorkBuddy Bench, sebuah paket penilaian agen cerdas pemrograman yang mencakup empat bidang kerja: Code, Web, Office, dan Security. Setiap tugas berasal dari rek...","url":"https://www.aioga.com/id/news/cmrycf0kz000broxsd74zlwqf/","contentTranslated":true,"sourceHash":"354536021f8ac773","translatedAt":"2026-07-26T02:29:54.655Z"},"th":{"title":"เทนเซ็นต์เปิดตัว WorkBuddy Bench: ชุดทดสอบประสิทธิภาพตัวแทนอัจฉริยะด้านการเขียนโค้ดหลายสาขา","summary":"เทนเซ็นต์เปิดตัว WorkBuddy Bench ชุดทดสอบเอเจนต์อัจฉริยะสำหรับการเขียนโค้ด ครอบคลุมสี่สาขางาน ได้แก่ Code, Web, Office และ Security งานแต่ละชิ้นถูกสร้างขึ้นจาก commit, PR หรือสถานการณ์ทางธุรกิจจริง ๆ แล้วนำมาวิศวกรรมย้อนกลับและเขียนใหม่เป็นคำขอในรูปแบบบทบาทสมมติแบบพูด เพื่อป้องกันการปนเปื้อนของข้อมูล ชุดมาตรฐานนี้ทำงานบน CodeBuddy Code และ Claude Code ทุกไดเรกทอรีของงาน, อิมเมจสภาพแวดล้อม, เครื่องมือการให้คะแนน และ方案อ้างอิงทั้งหมดถูกเปิดเผยเป็นโอเพนซอร์ส","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"เทนเซ็นต์เปิดตัว WorkBuddy Bench: ชุดทดสอบประสิทธิภาพตัวแทนอัจฉริยะด้านการเขียนโค้ดหลายสาขา - ข่าว AI Aioga","description":"เทนเซ็นต์เปิดตัว WorkBuddy Bench ชุดทดสอบเอเจนต์อัจฉริยะสำหรับการเขียนโค้ด ครอบคลุมสี่สาขางาน ได้แก่ Code, Web, Office และ Security งานแต่ละชิ้นถูกสร้างขึ้นจาก commit, PR หรือสถานก...","url":"https://www.aioga.com/th/news/cmrycf0kz000broxsd74zlwqf/","contentTranslated":true,"sourceHash":"354536021f8ac773","translatedAt":"2026-07-26T02:30:06.355Z"},"pl":{"title":"Tencent wypuszcza WorkBuddy Bench: zestaw narzędzi do oceny inteligentnych agentów kodowania w wielu dziedzinach","summary":"Tencent uruchomiło WorkBuddy Bench, zestaw narzędzi do oceny inteligentnych agentów programistycznych obejmujący cztery obszary pracy: Code, Web, Office i Security. Każde zadanie jest odwzorowane z prawdziwych commitów, PR lub scenariuszy biznesowych i przekształcone w prośby w formie rozmównej roli, co od strony konstrukcyjnej chroni przed zanieczyszczeniem danych. Benchmark działa na CodeBuddy Code i Claude Code, a wszystkie katalogi z zadaniami, obrazy środowiskowe, narzędzia oceny i rozwiązania referencyjne są dostępne w open source.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Tencent wypuszcza WorkBuddy Bench: zestaw narzędzi do oceny inteligentnych agentów kodowania w wielu dziedzinach - Aioga Wiadomości AI","description":"Tencent uruchomiło WorkBuddy Bench, zestaw narzędzi do oceny inteligentnych agentów programistycznych obejmujący cztery obszary pracy: Code, Web, Office i Security. Każde zadanie j...","url":"https://www.aioga.com/pl/news/cmrycf0kz000broxsd74zlwqf/","contentTranslated":true,"sourceHash":"354536021f8ac773","translatedAt":"2026-07-26T02:30:48.827Z"}}}}