Claude 终于敢把“电脑操作”转正了:没 API 的网站,AI 也开始能直接干活
Anthropic 已将 Computer Use、Skills API 和 Files API 推至 GA,并新增能结合截图与网页结构定位元素的 Browser Use。它正在把文件、SOP 和无 API 系统的操作拼成生产 Agent,但 32→13 分钟、成本降约 30% 和 100% completion 都只是官方客户案例,稳定性仍需独立验证。
先说结论
Claude 终于把“会用电脑”从演示厅搬进了产品目录。
2026 年 8 月 20 日,Anthropic 宣布 Claude Platform 的 Computer Use、Skills API、Files API 正式 GA,并新增 Browser Use。组合起来,它不只是回答“应该怎么填”,而是可以读文件、按公司的 SOP 做判断,再去操作一个根本没有 API 的网页后台。
Anthropic 引用的早期客户案例很抓眼:一条保险理赔流程从 32 分钟降到 13 分钟,单任务成本约降 30%,完成率为 100%。但这组数字来自 Anthropic 的客户故事,不是独立 Benchmark。真正值得写的,不是 Claude 已经替代 RPA,而是“没有 API”这个企业自动化借口,第一次被一个通用 Agent 正面撞上了。
以前 AI 会告诉你怎么做,现在它试着把最后一步也做了
过去你把一份理赔材料交给 Claude,它可以读 PDF、抽字段、告诉你下一步填什么。可打开保险公司的老后台、找到 Claim 页面、填完几十个字段、提交并下载回执,仍然得人自己动手。
Computer Use 负责这件“动手”:看屏幕、点击、输入、滚动、按键。Anthropic 这次让一次模型调用连续执行多个动作,不必每点一下都回来问一次“接下来呢”。官方说法是,这会减少调用轮次和等待时间。
这听起来像工程细节,实际上决定 Agent 有没有机会进入生产:任务如果能完成,却要来回调用几十次,速度和账单会先把老板劝退。
Browser Use 的关键:不再只靠猜坐标
纯 Computer Use 很像给模型一张截图,让它猜“提交按钮大概在右下角”。页面挪一下,坐标就失灵。
Browser Use 还把网页结构交给 Claude。它能知道哪个是输入框、哪个元素叫 Submit、哪个控件是下拉菜单,再结合视觉理解去操作具体元素。视觉负责看懂页面,结构负责更准确地落手,这比纯像素点击更像能维护的浏览器 Agent。
但“更可靠”不等于“不会翻车”。登录态、验证码、弹窗、多标签页、网络波动和网页改版,仍然是现实里的坑。付款、删除、发邮件、提交订单和修改客户资料,也不能因为多了一个 API 就完全无人审批。
Skills 和 Files:把老员工脑中的 SOP 变成可调用模块
Skills API 解决的是“公司到底应该怎么做”。一套 Skill 可以装进指令、脚本和模板,并且可以版本管理。比如收到询盘后先判定国家,再核对产品和 MOQ,最后套用批准的报价格式。规则改了,更新 Skill,而不是每次重新写一大段 Prompt。
Files API 解决的是“资料不要每轮搬家”。PDF、Excel 和模板上传一次,之后用 ID 引用;Agent 读完再把新文件交回来。Anthropic 同时给出了自动过期、5 倍更高的速率限制和每个组织 1 TB 存储等 GA 更新。
四块拼在一起,才像企业真正想买的东西:Files 给资料,Skills 给规矩,Computer/Browser Use 去执行,最后把结果文件交回去。它更像一个数字员工的底层零件,而不只是聊天窗口里多了一个按钮。
32 分钟变 13 分钟,先别把客户故事当定律
Anthropic 引用一家医疗保险客户:系统没有 API,最长 claims workflow 从 32 分钟缩到 13 分钟,任务成本下降约 30%,并称测试完成率为 100%,还没有调整 Prompt。
这个故事说明新版本可能真的解决了“来回调用太多”的瓶颈,但公开材料没有交代测试规模、失败重试怎么算、网页难度和人工介入次数。因此更准确的写法是:官方客户案例显示出潜力,不能写成 Computer Use 已经 100% 稳定。
独立研究也提醒我们,通用 Computer Use 还没毕业。ICLR 2026 的 Web Agent 论文把 Claude Computer Use 作为基线,专门优化的 WALT 方法在 WebArena / VisualWebArena 上平均达到 52.9%,明显高于该基线。通用模型很灵活,但专门为网页任务设计的方法仍能超过它。
我们的判断:RPA 的饭碗被端上桌了,但还没被吃掉
企业自动化最难啃的,往往不是新系统,而是老 ERP、供应商后台、保险平台、政府网站和内部表单。它们没有 API,也没有人愿意为了某个 Agent 重写接口。Computer Use 的反向路线很直接:你不给机器开后门,我就尝试走人类每天走的前门。
这也是它比“又一个 MCP 演示”更接地气的地方。MCP 和 API Agent 需要软件主动开门;Browser Use 面对的是已经存在的网页。
现在最适合试的任务是:步骤固定、规则明确、重复很多、没有 API、结果容易验收。后台录数据、下载报表、从 PDF 抽字段再填系统,都比开放式的“替我处理一切”靠谱。
仍然要观察三件事:连续任务的真实成功率,失败后能否自行恢复,以及每次人工审批和重试到底花多少钱。以后 Agent 的 Benchmark 不该只问“会不会点按钮”,而该问:给它一件真实工作跑 100 次,能完成多少次,坏了能不能收回来。
Claude Computer Use 正式 GA,至少说明 Agent 正在离开 Demo 展台,走向生产车间。它还不是数字员工,但已经开始领取工牌了。
仍需观察
- 独立团队能否复现 32→13 分钟、约 30% 成本下降和客户完成率;
- Browser Use 面对网页改版、验证码和长链路任务的稳定性;
- 付款、发信和数据修改等高风险动作的审批边界;
- 价格、延迟与重试成本是否足以击败传统 RPA。