Aioga
AI资讯 / 行业动态
返回 AI资讯

Berkeley RDI 发布开源平台 CUA-Lite,统一计算机使用智能体的环境、数据与训练流程

Berkeley RDI:Blog(AI 安全与评测)Aioga 编辑团队2026-09-06T16:00:00.000Z热度 72

Berkeley RDI 发布开源平台 CUA-Lite,面向计算机使用智能体(CUA)提供三套标准化抽象。

行业动态Berkeley RDI:Blog(AI 安全与评测)

今日 AI 情报摘要

Berkeley RDI 发布开源平台 CUA-Lite,面向计算机使用智能体(CUA)提供三套标准化抽象。

中文正文 · AI 翻译

介绍 CUA-Lite,这是一个用于开发计算机使用代理的开放平台。它围绕三个标准化抽象构建——Lite.Gym 用于环境,Lite.Sample 用于监督数据,以及跨评估(eval)、监督微调(SFT)和强化学习(RL)的每个模型的一个接口。已有 15+ 个基准测试、10+ 个数据集和 30k+ 可验证任务接入。

代码 ↗:https://github.com/cua-lite/cua-lite · 项目网站 ↗:https://cua-lite.github.io

计算机使用代理可以操作桌面、浏览器和移动应用,而开发一个代理需要具备可验证任务的环境、监督数据和模型,以及在环境中运行模型的接口。开源项目已经涵盖了这三方面,但它们仍然分散:每个环境都有自己的接口和运行时;每个监督数据集都有自己的格式;每个模型都有自己的动作空间、提示格式和回滚(rollout)代码。

如果没有共享标准,将模型连接到环境意味着要重写相同的代码:动作映射、上下文窗口和回滚循环——因此资源无法整合和扩展,评估、SFT 和 RL 也无法共享一个基础设施。

CUA-Lite 将这三者整合在一个平台上:

任何代理都可以通过一个接口接入任何环境。lite.gym 将环境暴露为 Gym 风格的 reset / step / close 循环。该循环在环境间标准化一种观察格式——每次工具调用返回截图、文本或两者结合——以及每个平台的统一 GUI 动作空间,以工具调用形式发出:在桌面和浏览器上点击和输入,在移动端上点击和滑动,并为每个环境提供额外工具,例如我们桌面沙箱中的 bash。它封装了环境自身的运行时:虚拟机(VM)、浏览器或移动模拟器。

CUA-Lite 还提供了可选的轻量级无虚拟机桌面沙箱:Docker 容器,以更低成本复现 OSWorld 的桌面,并包含 30k+ 可验证任务用于训练。它们无需 /dev/kvm,这是基于硬件虚拟化的 VM 基准测试所需的,因此可以在任何支持 Docker 的主机上运行——Lite.OSWorld(我们的版本)能够运行 OSWorld 自身的任务和评估器,完全不变。

无虚拟机容器不仅用于 OSWorld——它是 CUA-Lite 沙箱家族的基础。相同的基础已经运行浏览器和桌面任务,以及真实科学桌面:GMAT 飞行航天器,PyMOL 翻转蛋白质。

呼吁沙盒贡献者。沙盒只有在有人运行时才有意义。将你的沙盒添加到 CUA-Lite,每个代理都会在其上进行训练和基准测试——现在和未来。一次集成,全领域都可以建立在其之上。

Lite.* 环境 ↗:https://github.com/cua-lite/cua-lite/tree/main/lite/gym/envs/lite · 环境指南 ↗:https://github.com/cua-lite/cua-lite/blob/main/docs/envs.md · 排行榜 ↓:#lb

数据集只需转换一次,每个代理都可以在其上进行训练。LiteSample 是统一的模式,在每个环境、代理和任务类型间共享,Hugging Face 免费提供。

统一格式,无论来源:消息的工具调用是界面的操作,工具结果是其观察——从 GUI 基础标签到完整的执行。

CUA-Lite 为每个模型提供一个适配器,将统一的 LiteSample 打包成每个模型所需的训练格式。上图显示了一个示例,并展示了添加你自己模块的构建块。

已有 10+ 数据集在 Hugging Face 上:现有 CUA 语料库——基础标签 · 理解 · 使用——已预处理为 Lite.Sample,以及前沿 CUA 的新执行。浏览语料库:https://huggingface.co/collections/cua-lite/corpora 和执行:https://huggingface.co/collections/cua-lite/rollouts;下面是其中之一,WebGym:

呼吁数据贡献者。数据只有在模型可以训练时才有意义。将你的数据分享给 CUA-Lite,每个代理都可以在其上训练——即使是尚不存在的模型。一次转换,全社区都可以训练。

预处理指南 ↗:https://github.com/cua-lite/cua-lite/blob/main/lite/data/preproc/AGENTS.md · 代理适配器 ↗:https://github.com/cua-lite/cua-lite/tree/main/lite/agents · SFT 指南 ↗:https://github.com/cua-lite/cua-lite/blob/main/docs/sft.md

每个模型都有一个适配器,用于将模型适配到接口和格式。通过适配器,模型可以在每个已集成环境中运行,评估和强化学习使用它生成的执行结果;使用相同的适配器,任何存储的 LiteSample 都可以转换为模型自己的 SFT 训练格式——这里展示了 Qwen3.5 的示例:

为代理设置 --model-id,为基准测试设置 --env-id:

已经集成了15+个基准测试——我们的重点是无虚拟机的运行时、接口和集成,而不是任务套件——无虚拟机的桌面沙箱是一个补充,而不是替代:原始的OSWorld虚拟机与Lite.OSWorld并排存在,移动基准测试仍然需要虚拟机或模拟器:

在CUA-Lite的语料库上进行SFT,然后在其环境中强化——GRPO及以后,在Slime上:https://github.com/THUDM/slime 训练器。可以在任何数据和任何环境中训练任何开放代理:

Lite.Sample,适配每个模型——选择一个数据集和一个学生:

在环境中评分的回滚驱动GRPO更新——选择一个模型和环境:

带上一个数据集、一个环境或一个代理——每一个都会累加。或者直接告诉我们缺少什么——GitHub:https://github.com/cua-lite/cua-lite · Hugging Face:https://huggingface.co/cua-lite · 邮箱:mailto:zhanhui@berkeley.edu。

情报判断

Aioga 编辑摘要

Berkeley RDI 发布开源平台 CUA-Lite,围绕环境、监督数据和模型运行分别提供 Lite.Gym、Lite.Sample 与统一 harness 三种标准化抽象;材料称其已接入 15+ 个基准、10+ 个数据集和 30k+ 个可验证任务。

背景分析

来源称,计算机使用智能体需要环境、可验证任务、监督数据、模型及运行模型的 harness,但现有开源工作接口、数据格式、动作空间和运行代码各异。CUA-Lite以统一接口连接桌面、浏览器和移动端环境,并提供容器化桌面沙箱。

Aioga 观点

Aioga 判断:该项目的编辑价值在于把环境接口、监督数据格式和模型 harness 纳入同一平台,可能减少跨组件整合时的重复适配;但材料只说明已接入相关基准、数据集和任务,尚不足以据此判断实际评测效果或训练收益。

影响与后续

可能影响:若接口和数据格式能按材料所述复用,相关工作流可能减少环境接入、数据转换和训练评测之间的重复适配;但这些标准化能力不代表模型性能、任务成功率或实际采用范围已经得到证明,仍需要更多公开评测结果。 后续观察:应关注 Lite.Gym、Lite.Sample 与模型 harness 的接口说明、已接入基准和数据集的可复现情况,以及 30k+ 任务在不同环境中的验证结果;材料目前未给出统一性能对比或采用数据。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: rdi.berkeley.edu

来源: Berkeley RDI:Blog(AI 安全与评测)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-06T16:00:00.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Berkeley RDI 发布开源平台 CUA-Lite,面向计算机使用智能体(CUA)提供三套标准化抽象。

Berkeley RDI:Blog(AI 安全与评测)2026-09-06T16:00:00.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。