Aioga
AI资讯 / 模型更新
返回 AI资讯

快手KwaiKAT团队发布KAT-Coder-V2.5:基于10万+可验证仓库环境训练的智能体编程模型

MarkTechPost(RSS)Aioga 编辑团队2026-07-26T10:46:19.000Z热度 55

快手KwaiKAT团队推出KAT-Coder-V2.5,一个在真实可执行仓库环境中训练的智能体编程模型,开源变体KAT-Coder-V2.5-Dev已在Hugging Face...

模型更新MarkTechPost(RSS)

今日 AI 情报摘要

快手KwaiKAT团队推出KAT-Coder-V2.5,一个在真实可执行仓库环境中训练的智能体编程模型,开源变体KAT-Coder-V2.5-Dev已在Hugging Face以Apache-2.0协议发布。

中文正文 · AI 翻译

快手的 KwaiKAT 团队推出了 KAT-Coder-V2.5:https://arxiv.org/abs/2607.05471。它是一个经过训练,可以在真实可执行仓库中操作的编码模型,而不是生成单轮代码。可通过 StreamLake 使用该服务模型:https://streamlake.com/product/kat-coder。一个开源权重版本 KAT-Coder-V2.5-Dev:https://huggingface.co/Kwaipilot/KAT-Coder-V2.5-Dev,已在 Hugging Face 上以 Apache-2.0 许可单独发布。

该研究将可验证任务定义为三元组。它需要一个精确的任务描述、一个可执行仓库环境以及一组验证测试。补丁只有在通过所有这些测试时才被认为是正确的。

任务从真实的拉取请求和提交中挖掘,遵循 SWE-bench 系列:https://arxiv.org/abs/2509.16941。合并的代码更改提供黄金补丁,随附的测试更改提供测试补丁。原始问题文本被舍弃,不作为规范。相反,描述被重新生成为三个部分:基于黄金补丁的问题陈述、由测试补丁派生的需求,以及从两者推断的接口约束。随后进行清晰度检查,删除任何模糊、不完整、未充分说明或内部不一致的内容。

AutoBuilder 负责环境端。构建代理分析仓库并编写配置脚本,从干净的检出开始安装依赖并运行测试。验证代理在隔离的沙箱环境中执行该脚本。

验收规则是关键部分。验证不读取退出代码或 grep 日志模式。它解析结构化测试框架输出,仅当收集到超过 90% 的预期测试并且运行结果在不同执行中可复现时,才接受环境。失败结果会作为结构化信息反馈,用于迭代修复。

通过结合预配置的基础环境、构建系统模板以及可检索的精炼构建方案库,构建成功率从 16.5% 提升到 57.2%。最终得到超过 100,000 个可验证环境,覆盖 12 种语言。Git 历史、提交元数据及其他可利用痕迹被剥离,以确保代理无法从仓库中读取参考解决方案。

仅根据最终测试成功来筛选轨迹具有误导性。一些通过测试的运行依赖硬编码、机制绕过或面向测试的捷径。一些失败的运行包含有价值的搜索、本地化和修复行为。

KwaiKAT 处理这两个方向。对于接近通过的情况,有针对性的过程级提示指示需要检查或验证的内容,而不泄露解决方案。仅这一点就能将以前零通过任务的通过率提升到约 20%。由于提示轨迹包含推理时不可用的信息,经验证的补丁随后被修复,并从原始任务上下文重新生成无提示轨迹。仅保留通过验证、不泄露提示且与补丁一致的样本。

对于通过的运行,基于规则的门控机制会移除无效、不稳定或剥削性的轨迹。评分阶段随后对探索、本地化、预编辑推理、规范遵守、仓库惯例、补丁最小性、验证质量、恢复行为和诚信进行评分。

第三种机制针对测试框架过拟合。工具名称、参数约定、输出格式和提示模板在功能保持不变的情况下被随机化。由于验证是基于测试结果而非测试框架痕迹,一个任务可以在多种测试框架配置下重新提供。还注入了现实的扰动:缺失依赖、瞬时命令失败、输出截断和日志噪声。

在 KAT-Coder-V2:https://arxiv.org/abs/2603.27703 训练期间,奖励曲线缓慢最初被归咎于RL算法。然而,审计发现约16%的轨迹失败是由于沙箱基础设施问题,而非模型策略,边界错位有时导致约40步的观测为空并破坏奖励。

随后进行了三项基础设施修复。首先,早期释放的镜像驱逐策略将磁盘使用率从95%降低到60%,将因超时导致的无效上线从6–7%降低到不到1%。其次,在远程沙箱初始化期间纠正环境变量,停止了会翻转6–7%样本奖励的系统覆盖,错误率降至1%以下。第三,网关服务器绕过了主流聊天端点(通过重新应用 apply_chat_template 并重新分词,导致约200轮交互时标记漂移达40%),直接调用 /generate 以确保上线标记对齐。

这些更新共同将沙箱反馈错误率从约16%降至不到2%,并将训练崩溃次数减少了一个数量级。

研究团队选择使用 PPO:https://arxiv.org/abs/1707.06347 并结合 GAE,而非无评论者轨迹方法,因为生产环境将会话拆分为结构上不同的样本,这使得分组基线变得复杂。

使用非对称 Actor–Critic:https://arxiv.org/abs/1710.06542 时,Critic 获取特权训练上下文(奖励、测试、覆盖、补丁、元数据、未来轮次),而 Actor 仅看到 rollout 状态。推理时,Critic 和额外上下文会被丢弃。

奖励分为三层:核心任务评分要求所有 fail_to_pass 和 pass_to_pass 测试通过;标准行为约束对重复、错误工具调用和调试残留进行惩罚;失败轨迹激励通过 F2 对文件检索打分,并给予部分测试积分。

五位专家通过使用逆 KL 的多教师在策略蒸馏(Multi-Teacher On-Policy Distillation)、离策略起点以及 Prune-OPD:https://arxiv.org/abs/2605.07804 的漂移感知截断来融合。

在统一的 Claude Code 训练环境下,KAT-Coder-V2.5 在 PinchBench:https://pinchbench.com/ 上以94.9领先其面板,超过 Opus 4.8 的93.5。在 SWE-Bench Pro 上排名第二(65.2 对 69.2),在内部 KAT Code Bench 上也排名第二(53.1 对 57.3)。

然而,它在 Terminal-Bench 2.1 上表现落后,最终以60.7 排名末位,低于 GLM-5.1(61.8)和 Opus 4.8(84.6)。在 SciCode 上得分为50.3,与 GLM-5.2 持平。

值得注意的是,开源权重 KAT-Coder-V2.5-Dev:https://huggingface.co/collections/Kwaipilot/kat 是一个独立的 35B 总量 / 3B 活跃 MoE 模型,在 Qwen3.6-35B-A3B 上使用 127K SFT 示例进行后训练,然后进行 RL。在单独的内部评估协议上评估,其结果无法与主要旗舰表进行比较。

查看论文:https://arxiv.org/abs/2607.05471,Hugging Face 上的模型权重:https://huggingface.co/Kwaipilot/KAT-Coder-V2.5-Dev,以及产品页面:https://streamlake.com/product/kat。所有研究成果的功劳归项目的研究人员所有。

快手KwaiKAT团队发布KAT-Coder-V2.5:基于10万+可验证仓库环境训练的智能体编程模型

Michal Sutter 是一名数据科学专业人士,拥有帕多瓦大学的数据科学硕士学位。凭借统计分析、机器学习和数据工程的坚实基础,Michal 擅长将复杂的数据集转化为可操作的洞察。

FAIRChem v2 UMA for Multidomain Atomistic Simulation across Molecules, Catalysts, Materials, Vibrations, and Molecular Dynamics
Designing High-Performance GPU Kernels with TileLang: Tensor-Core GEMM, Fused Softmax, FlashAttention, and Autotuning

构建一个自主代理活动场地运营者 [完整代码]:https://pxllnk.co/twdn5

谢谢!我们的团队将很快与您联系 🙌

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:快手KwaiKAT团队推出KAT-Coder-V2.5,一个在真实可执行仓库环境中训练的智能体编程模型,开源变体KAT-Coder-V2.5-Dev已在Hugging Face以Apache-2.0协议发布。 Aioga 将其归入「模型更新」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-26T10:46:19.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

快手KwaiKAT团队推出KAT-Coder-V2.5,一个在真实可执行仓库环境中训练的智能体编程模型,开源变体KAT-Coder-V2.5-Dev已在Hugging Face...

MarkTechPost(RSS)2026-07-26T10:46:19.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。