AI Radar先替你读,再把 AI 变化讲明白
EN
Claude 数字员工

Claude 终于敢把“电脑操作”转正了:没 API 的网站,AI 也开始能直接干活

最后更新 2026-08-22编辑综合:多条来源拼接后再下判断不是快讯搬运;事实、判断和未知分开写
没有 API 的旧企业系统被 Claude 通过文件、SOP 和浏览器操作串成完整工作流的原创信息图
编辑绘图:Computer Use、Browser Use、Skills API 与 Files API 已进入正式可用阶段;32→13 分钟和成本下降约 30% 来自 Anthropic 引用的早期客户案例,不是独立基准。
一句话结论

Anthropic 已将 Computer Use、Skills API 和 Files API 推至 GA,并新增能结合截图与网页结构定位元素的 Browser Use。它正在把文件、SOP 和无 API 系统的操作拼成生产 Agent,但 32→13 分钟、成本降约 30% 和 100% completion 都只是官方客户案例,稳定性仍需独立验证。

先说结论

Claude 终于把“会用电脑”从演示厅搬进了产品目录。

2026 年 8 月 20 日,Anthropic 宣布 Claude Platform 的 Computer Use、Skills API、Files API 正式 GA,并新增 Browser Use。组合起来,它不只是回答“应该怎么填”,而是可以读文件、按公司的 SOP 做判断,再去操作一个根本没有 API 的网页后台。

Anthropic 引用的早期客户案例很抓眼:一条保险理赔流程从 32 分钟降到 13 分钟,单任务成本约降 30%,完成率为 100%。但这组数字来自 Anthropic 的客户故事,不是独立 Benchmark。真正值得写的,不是 Claude 已经替代 RPA,而是“没有 API”这个企业自动化借口,第一次被一个通用 Agent 正面撞上了。

以前 AI 会告诉你怎么做,现在它试着把最后一步也做了

过去你把一份理赔材料交给 Claude,它可以读 PDF、抽字段、告诉你下一步填什么。可打开保险公司的老后台、找到 Claim 页面、填完几十个字段、提交并下载回执,仍然得人自己动手。

Computer Use 负责这件“动手”:看屏幕、点击、输入、滚动、按键。Anthropic 这次让一次模型调用连续执行多个动作,不必每点一下都回来问一次“接下来呢”。官方说法是,这会减少调用轮次和等待时间。

这听起来像工程细节,实际上决定 Agent 有没有机会进入生产:任务如果能完成,却要来回调用几十次,速度和账单会先把老板劝退。

Browser Use 的关键:不再只靠猜坐标

纯 Computer Use 很像给模型一张截图,让它猜“提交按钮大概在右下角”。页面挪一下,坐标就失灵。

Browser Use 还把网页结构交给 Claude。它能知道哪个是输入框、哪个元素叫 Submit、哪个控件是下拉菜单,再结合视觉理解去操作具体元素。视觉负责看懂页面,结构负责更准确地落手,这比纯像素点击更像能维护的浏览器 Agent。

但“更可靠”不等于“不会翻车”。登录态、验证码、弹窗、多标签页、网络波动和网页改版,仍然是现实里的坑。付款、删除、发邮件、提交订单和修改客户资料,也不能因为多了一个 API 就完全无人审批。

Skills 和 Files:把老员工脑中的 SOP 变成可调用模块

Skills API 解决的是“公司到底应该怎么做”。一套 Skill 可以装进指令、脚本和模板,并且可以版本管理。比如收到询盘后先判定国家,再核对产品和 MOQ,最后套用批准的报价格式。规则改了,更新 Skill,而不是每次重新写一大段 Prompt。

Files API 解决的是“资料不要每轮搬家”。PDF、Excel 和模板上传一次,之后用 ID 引用;Agent 读完再把新文件交回来。Anthropic 同时给出了自动过期、5 倍更高的速率限制和每个组织 1 TB 存储等 GA 更新。

四块拼在一起,才像企业真正想买的东西:Files 给资料,Skills 给规矩,Computer/Browser Use 去执行,最后把结果文件交回去。它更像一个数字员工的底层零件,而不只是聊天窗口里多了一个按钮。

32 分钟变 13 分钟,先别把客户故事当定律

Anthropic 引用一家医疗保险客户:系统没有 API,最长 claims workflow 从 32 分钟缩到 13 分钟,任务成本下降约 30%,并称测试完成率为 100%,还没有调整 Prompt。

这个故事说明新版本可能真的解决了“来回调用太多”的瓶颈,但公开材料没有交代测试规模、失败重试怎么算、网页难度和人工介入次数。因此更准确的写法是:官方客户案例显示出潜力,不能写成 Computer Use 已经 100% 稳定。

独立研究也提醒我们,通用 Computer Use 还没毕业。ICLR 2026 的 Web Agent 论文把 Claude Computer Use 作为基线,专门优化的 WALT 方法在 WebArena / VisualWebArena 上平均达到 52.9%,明显高于该基线。通用模型很灵活,但专门为网页任务设计的方法仍能超过它。

我们的判断:RPA 的饭碗被端上桌了,但还没被吃掉

企业自动化最难啃的,往往不是新系统,而是老 ERP、供应商后台、保险平台、政府网站和内部表单。它们没有 API,也没有人愿意为了某个 Agent 重写接口。Computer Use 的反向路线很直接:你不给机器开后门,我就尝试走人类每天走的前门。

这也是它比“又一个 MCP 演示”更接地气的地方。MCP 和 API Agent 需要软件主动开门;Browser Use 面对的是已经存在的网页。

现在最适合试的任务是:步骤固定、规则明确、重复很多、没有 API、结果容易验收。后台录数据、下载报表、从 PDF 抽字段再填系统,都比开放式的“替我处理一切”靠谱。

仍然要观察三件事:连续任务的真实成功率,失败后能否自行恢复,以及每次人工审批和重试到底花多少钱。以后 Agent 的 Benchmark 不该只问“会不会点按钮”,而该问:给它一件真实工作跑 100 次,能完成多少次,坏了能不能收回来。

Claude Computer Use 正式 GA,至少说明 Agent 正在离开 Demo 展台,走向生产车间。它还不是数字员工,但已经开始领取工牌了。

仍需观察

  • 独立团队能否复现 32→13 分钟、约 30% 成本下降和客户完成率;
  • Browser Use 面对网页改版、验证码和长链路任务的稳定性;
  • 付款、发信和数据修改等高风险动作的审批边界;
  • 价格、延迟与重试成本是否足以击败传统 RPA。