Aioga
AI资讯 / 行业动态
返回 AI资讯

智能体真的会用电脑吗?a16z 用数据给出答案

a16z:News(RSS)Aioga 编辑团队2026-08-10T14:00:46.000Z热度 72

a16z 数据显示,计算机操作智能体在 OSWorld-Verified 基准上的最佳成绩已从一年前的 42% 升至 85%,超过人类测试者约 72% 的水平,Claude F...

行业动态a16z:News(RSS)

今日 AI 情报摘要

a16z 数据显示,计算机操作智能体在 OSWorld-Verified 基准上的最佳成绩已从一年前的 42% 升至 85%,超过人类测试者约 72% 的水平,Claude Fable 5 以 85% 领先。

🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsnbzkyr01qjrohfmjqlmjk5

中文正文 · AI 翻译

美国:https://www.a16z.news/t/america | 技术:https://www.a16z.news/t/technology | 观点:https://www.a16z.news/t/opinion | 文化:https://www.a16z.news/t/culture | 图表:https://www.a16z.news/t/charts

a16z

说出来似乎很显而易见,但如果你离开硅谷,走到世界其他地方,告诉他们:“有一些叫做代理的东西,它们相当聪明,可以与你一起完成任务,并自动化你工作中的一些重复部分”,那么你很可能首先得到的问题是:“它们会用电脑吗?”

这是一个好问题!它们真的会吗?我们在未来几十年中将在真实经济中解锁的生产力潜力,很大程度上涉及非常日常的工作:一个代理能否(比喻地)24/7坐在办公桌前,并被信任使用网页浏览器、填写表格、点击正确的按钮,并且不出错?这是业务流程外包(BPO)的领域,历史上意味着“这项工作能外包吗?”,但现在有了新的代理前沿。我们在去年写过相关内容:https://a16z.com/the-rise-of-computer-use-and-agentic-coworkers/,当时计算机使用的场景仍主要是一些演示。从那时起已经发生了很多变化。

模型的改进速度几乎超过了所有人的预期。会用电脑的代理开始在大规模、狭窄且可重复的工作流程中表现稳定:更新记录系统、通过门户传输数据、处理工单、检查记录以及处理没有干净API的软件长尾部分。有了合适的基础设施,计算机使用能力现在可以部署来应对大规模的端到端任务,而以前这些任务需要人工监督或直接人工完成。

今天,利用计算机的工作流程还远未完美:当工作偏离操作手册时,代理容易出错,而且对于某些缓存无法处理的用例(稍后详细说明),它们的成本高到无法在任何地方都可行。但是我们已经看到标准化后台工作的生产部署,特别是那些原本需要人工点击遗留系统的工作;考虑到利用计算机的工作流程提供了结构性优势,比如全天候可用性,并且最重要的是,可以按需扩展,成本曲线开始变得有吸引力。

第一波计算机使用基础设施是为了让代理具备能力:观察、点击、输入、从错误中恢复。下一波则是让它们在实际公司中变得有用。随着原始界面导航成为模型层的商品,模型不再是主要瓶颈,持久的优势上移到堆栈之上:上下文、权限、流程知识、验证、升级、错误处理、缓存,以及如何在特定客户组织内实际完成工作的宝贵经验,以实现工作流程的端到端映射。换句话说,前沿正在从“代理能否使用计算机?”转向“它能否可靠地完成这项工作?”

一年前,最擅长使用计算机的模型在 OSWorld-Verified 上的得分为 42%;而今天的最佳模型得分为 85%,高于人类在相同任务中大约达到的 72%(这意味着它们在 100 个任务中成功完成了 85 个)。在实际应用中,这些先进的通用模型的运行方式与基准测试中类似:实验室将计算机使用作为 API 暴露——模型接收屏幕截图,返回点击和按键操作,OpenAI 的 CUA 还会在可用时叠加可访问性树或 DOM 数据——而构建者则将这一循环封装在自己的环境中:一个沙盒的虚拟机或浏览器,以及围绕它的编排、验证和重试逻辑。值得注意的是,几乎没有人将消费级产品(如 Claude、ChatGPT 代理模式)用于此用途——创始人和企业直接使用原始 API 构建,或者从将其打包的供应商处购买。而这种能力的跃升正是使这些设置可行的原因——正如一位在该领域构建产品的创始人所说:“在 2026 年 2 月 Opus 4.6 之前,这些模型的能力还不足以单独在生产中使用。”在过去的十八个月里,计算机使用能力从演示阶段跨越到了可在现场部署的阶段。

当然,基准测试并不总是衡量实际部署可行性的最佳指标。OSWorld 统计完成的任务数量,因此 85% 仍意味着 100 个任务中有 15 个失败,而业务流程只有在每个步骤都完成时才算完成。后台工作不会按照曲线评分:如果每个输出都需要人工审核,那么并没有节省任何人力。(这与当前代码编写的情况类似:稀缺资源不再是写代码,而是为代码的正确性担保。)

我们发现,思考什么最重要的最佳方式是超越基准测试,关注核心问题:业务流程能否可靠地通过计算机使用能力实现自动化?在这个视角下,最大区别在于模型之外的所有环节——也就是说:验证、升级,以及当零售商门户网站一夜之间改变布局时的错误处理。

也许最清楚的迹象是,我们采访的一位运营者,他每月运行数百万个自动化任务,却无法告诉我们是哪种模型在执行这些任务;他并不需要去知道。供应商会像云服务提供商更换硬件那样在他不知情的情况下更换模型。但他确实信任使用计算机的代理来运行这些任务。总结来说:当你的最活跃用户不再查看排行榜时,排行榜已经不再是故事的核心了。

因此,上图解释了为什么2026年会有生产部署,而2024年没有。从那时起,决定它们是否有效的是其他一切——这也是本文余下部分讨论的内容。

我们与在生产中运行利用计算机使用能力的工作流的团队进行了各种对话,并从他们的经验中了解到,遵循协议的任务效果最佳。不出意外,计算机使用代理在更复杂、难以验证准确性的工作流中容易失败。总体结论是,计算机使用代理在标准化、可重复且路径清晰明确定义的任务上最为强大。真正的突破在于长尾的软件场景,在这些场景中没有干净的 API,否则人们需要手动点击 UI 执行操作。实际上,工作内容包括在 CRM 中更新记录、质量检查、登录政府和保险门户、从数据库及监管页面提取数据、零售订单处理、合同处理,或 ServiceNow 中的 IT 工单处理。

我们相信,用户的声音讲述这个故事要比任何理论都更有力。一些例子:一家消费品数据平台向我们展示了他们如何每月运行约1500-2000万次自动化门户交互,使用代理作为手动编码爬虫的自我修复备选方案——当零售商门户更改其用户界面时,代理会诊断故障,修复自动化,并在工程师看到错误之前保持数据流动。他们告诉我们,一旦实施,他们将专门用于爬虫维护的工程团队人数减半,并将员工容量重新分配到其他工作流程。另一个例子,来自一家全球系统集成商,我们了解到他们有27个实时工作流程利用计算机使用代理每天处理约1500-2100个IT工单,最终目标是在低利润的托管服务合同上重新部署20%-25%的员工数量。最后,一家机构向我们展示了他们如何从头到尾自动化招聘工作流程,以便在候选人面试结束后立即在申请者跟踪平台中填充数据。为此,他们运行一个便宜的非前沿模型,因为它“能完成我们所需的一切,并且做得很好”。

对于我们交谈过的买家来说,模型本身很少是决定因素,因为“今天的模型已经足够好了”。在实际操作中,他们评估并为模型周围的一切付费:可靠大规模运行的基础设施、安全审查的通过以及投资回报的证明。用户不关心解决方案是否使用某个前沿模型;他们关注的是解决方案是否真的能够大规模可靠地完成任务。仅此而已。

因此,失败模式比任何基准测试都更重要,从一开始就需要将防故障设计作为首要关注点,因为一个无法良好处理失败的解决方案永远不会被生产环境采用。实际中的一个例子,以及我们多次遇到的模式是:代理运行工作流程一次,系统将其缓存为确定性代码,然后从此以廉价可重复代码执行,并且模型只有在出现问题时才返回——用于诊断、修复和重新缓存。通过这种方法,工作流程的每次运行成本会随着时间下降,而更便宜的模型只会进一步降低费用。有趣的是它如何处理不确定性。过去,确定性代码会直接失败,或者需要人工检查和修复每一次中断,而在这里,代理可以自主吸收这种不确定性。这是一种防故障设计方式,并且展示了买家实际上在奖励和大规模使用的内容。

在我们交谈过的用户中,并未遇到更复杂的用例,这告诉我们市场仍在逐步解决低悬果实的问题。也就是说,在任何人需求更困难任务之前,还有很长的工作流程清单可以通过这种方式实现自动化。

对于创始人而言,更重要的变化是哪些正在被商品化。构建使用计算机的代理过去意味着需要处理 Selenium 或 Playwright,或者最近的 Stagehand,并拼接 DOM 或视频记录以捕获工作流程。整个执行层正在被抽象化,就像 Claude Code 将编码代理周围的脚手架抽象化一样。如果点击正确按钮不再是难点,那么它也不再是护城河。

不足为奇的是,工作流的上下文和知识是持久的。困难的部分不在于一个代理能否在 SAP 界面中导航,而在于它是否理解某个公司实际如何完成工作:部落知识、内部术语、偏好的格式、向谁以及何时升级、如何处理故障、如何可靠地验证输出。实际上,这些上下文存在于操作手册、访问权限和凭证、测试用例以及当工作流偏离脚本时的防护措施中,而且越来越多地存在于一段记录了某人完成该工作的单次视频里。没有任何东西是通用的。所有内容都是针对特定公司的,有时甚至针对某个团队。话虽如此,这正是那种专注型创业公司往往比模型提供者解决得更好的具体、平凡的问题,这也是我们认为下一代智能同事将在应用层和上下文层构建,而不是在模型层构建的原因。

我们交谈过的买家明确证实了这一点。他们选择供应商的标准在于产品是否报告了节省的工时而无需额外工作,以及初级工程师是否能操作它。就目前而言,护城河不在于前沿能力——而在于成为企业可以、能够在生产环境中大规模使用的供应商。

成本数据也令人鼓舞。上面的数字应作为数量级参考,而非精确报价。运行一个代理目前大约花费每小时 $6-8 的推理成本,但实际上根据执行框架的构建方式可能在 $3 到 $15 之间——包括截图频率、所携带的上下文量以及可以交给确定性代码处理的工作量。这些数据描述的是代理用前沿模型逐屏操作 UI 的情况——这是最昂贵的模式。构建良好的执行框架会将这种模式保留给真正需要它的部分,让廉价的确定性代码处理可重复的部分——并不是每个工作流都能这样优化,但在可行的情况下,综合成本会迅速下降。因此,把比较看作最坏情况,即便如此,以完全加载约 $10/小时的离岸 BPO 比较,代理大致能够达到收支平衡,相对于美国后台劳动力(约 $30-45/小时),毛利率可达到 70-80%。在生产中,执行框架对实际成本的影响与模型本身一样重要。

速度方面的警告同样适用。在自主模式下,智能体仍然比人类慢,而且差距很大——一个人能在两到三分钟完成的任务,智能体可能需要八到十分钟,而学术基准测试显示差距甚至更大。确定性运行则相反:代码的执行速度比任何人类都快——但对于自主工作的讨论焦点不是速度。关键在于,智能体全天候运行,成本只是美国人工的一小部分,并且无需招聘即可扩展。

这种比较适用于BPO的买家和运营团队,但如果你是在销售智能体小时数,单位经济性看起来就不同,因为现实中的成本不可预测。销售成本是推理成本加上重试(即失败的运行仍然消耗令牌),随着上下文增加或截图频率提高,利润会被压缩。供应商通过按任务、按小时或按结果定价来管理这些风险,每种方式对应的风险取决于工作流的差异。此外,还有监控、维护和人工升级等实际问题的成本需要计入,这和人工劳动力的定价方式类似。目前还没有通用的商业模式,答案因行业而异。

而且数学上情况只会越来越好——推理成本不断降低,开源模型已经足够好,可以处理越来越多的工作流。对于任何智能体能够可靠解决的任务,嵌入计算机使用很可能要比人力更方便。因此,真正的问题不再是经济性是否可行,而是能可靠解决的任务范围有多广,这正是未来的发展方向。

在过去一年里,各实验室和一波初创公司在计算机使用的强化学习环境上投入了数亿资金——这些沙箱让模型练习实际任务,并在完成任务后获得奖励——像Mechanize、Habitat、Fleet、Chakra、Deeptune、Matrices和Originator这样的公司正在前沿模型下搭建训练和评估的基础设施。这些投入带来了更好的推理能力、更好的状态跟踪,以及更高的容忍度用于那些表现异常的应用。这些模型在生产中仍需小心把控——运行缓存是最明显的例子——但其原始能力是通过这一训练基础设施刻意获得的,并且随着时间推移只会越来越强。

然而,架构是另一回事。今天在生产中部署的大多数计算机使用系统都是单代理的:一个模型、一个任务、一个会话。随着工作流程变得更加复杂且延迟成为限制条件,多代理架构开始显得重要。例如,规划器分解工作流程,执行代理并行处理子任务,而长期运行的代理带来自己的问题:内存、信任和随时间累积的失败率。在这一领域做有趣工作的团队都在构建定制的编排,因为目前还不存在标准框架。Claude Code 的类比很有启发性:当编码代理成熟时,出现了一个支架层来抽象编排。同样的情况很可能会出现在利用计算机使用能力的工作流程中,而这个抽象层是该领域尚未解决的更有趣的基础设施问题之一。

从这里看,未来的发展沿着三条路线进行:准确性、延迟和成本。准确性最为重要,正如我们上面解释的,它代表了炫酷演示与实际解决问题之间的区别——捕捉异常、检查自身工作、仅在真正需要时升级。延迟是最可能让人惊讶的:一些团队今天已经通过基于可访问性树而不是截图来减少延迟。Standard Intelligence 的通用计算机操作模型在一个1100万小时的视频数据集上训练,运行速度为30帧每秒,这是一个早期信号,表明缓慢的逐步截图循环是可以解决的问题,而不是永久的负担。随着推理成本下降,成本持续降低,而较小的非前沿模型接管常规点击任务。这三个向量除了安全性和治理(例如凭据、审计日志、数据保留、提示注入以及问责、权限管理)之外。

企业可以并且确实正在从计算机使用代理中受益,特别是对于高量、重复步骤、业务规则稳定、使用遗留接口或缺少 API 的狭窄工作流程。目前,它们最适合用于有立即可机器观测的成功证据、可容忍的失败后果以及清晰升级路径的任务。但随着上述发展,改进真实且快速,使计算机使用代理对更多类型的工作更为可行。

可以说——计算机使用能力的未来非常光明!

情报判断

Aioga 编辑摘要

a16z称,计算机操作智能体在OSWorld-Verified基准上的最佳成绩已从一年前的42%升至85%,高于人类测试者约72%的成绩。文章同时强调,真实业务部署仍受失败率、成本和流程偏离等问题限制。

背景分析

文章将计算机操作智能体置于后台办公和业务流程外包场景中,涉及更新系统记录、跨门户传递数据、处理工单及操作缺少标准API的软件。当前常见部署方式是模型API配合浏览器或虚拟机、编排、验证和重试机制。

Aioga 观点

Aioga判断,基准成绩的跃升说明智能体已具备处理部分标准化、可重复流程的基础,但不能直接等同于稳定完成复杂岗位。文章显示,竞争重点可能从界面操作能力转向权限、上下文、校验、升级和组织流程知识。

影响与后续

值得关注的是,OSWorld中85%的完成率仍意味着每100项任务约有15项失败,而实际业务流程通常要求每一步都正确。若必须由人工检查全部结果,自动化带来的劳动节省可能有限;成本和异常处理能力也将影响落地范围。 Aioga建议后续观察企业是否披露可复核的生产数据,包括任务完成率、人工介入比例、异常升级方式和单位成本,并将这些指标与具体流程边界对应起来,避免仅以单一基准分数判断产品成熟度。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: a16z.news

来源: a16z:News(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-10T14:00:46.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

a16z 数据显示,计算机操作智能体在 OSWorld-Verified 基准上的最佳成绩已从一年前的 42% 升至 85%,超过人类测试者约 72% 的水平,Claude F...

a16z:News(RSS)2026-08-10T14:00:46.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。