Computer Use(计算机操控)
Computer Use 让 AI 模型「看屏幕截图 → 规划动作 → 模拟键鼠」来操作任意软件,而不是靠 API。它把 Agent 的能力从「有接口的软件」扩展到「任何带界面的软件」,是 GUI 自动化 / RPA 的下一形态;代价是延迟、精度与权限安全。
发布 2026-09-06更新 2026-09-25核实 2026-09-25AI 之家 推荐结论:Computer Use 是「没有接口」时的最后手段,不是首选方案。 能用 API / MCP 的地方一律走接口——更快、更准、更便宜;只有当目标软件是 legacy 系统、内网后台或根本没有接口时,才值得付出截图闭环的延迟与误差代价。
什么是 Computer Use
Computer Use(计算机操控)是指 AI 模型直接操作图形界面:它接收屏幕截图,理解当前界面,然后输出「点击坐标 / 键入文本 / 滚动」等动作,由宿主模拟键鼠执行。本质上,模型在操作人用的那个「界面」,而不是调用软件的 API。
一句话区分:
- API / MCP / Function Calling——软件把能力「喂」给模型(有结构化接口)。
- Computer Use——模型自己「看」界面、自己「动手」(没有接口也能用)。
解决什么问题
很多企业内部系统、 legacy 软件、网页后台根本没有开放 API,但又需要自动化。传统 RPA 靠「写死的坐标 / 选择器」脆弱易碎。Computer Use 用视觉理解 + 规划取代写死的脚本:
- 换个按钮位置,模型看截图仍能找到;
- 不依赖后端接口,能操作任何带界面的程序;
- Agent 形态从「只会调工具」扩展到「会用电脑的人」。
工作原理
截图 → 多模态模型理解界面 → 规划下一步动作 → 模拟键鼠执行 → 再截图 → 循环
典型动作空间:
click(x, y)/double_clicktype("文本")scroll(方向)key(组合键)/move(坐标)
模型每步都基于最新截图做决策,形成「感知—决策—执行」闭环。这要求模型具备强视觉理解 + 空间定位 + 多步规划能力,因此通常由旗舰多模态模型驱动。
这条闭环的成本结构值得先算清楚:每执行一个动作,至少要付出 一次截图(图像 token) + 一次模型调用(含全部历史截图)。也就是说,一个 30 步的界面流程,代价是 30 次串行模型调用,且上下文里塞满了历史截图——这既慢又贵,还是误差累积的。这也是为什么它永远竞争不过同任务的 API 调用。
2026-09 更新:Anthropic 的 computer use 工具集已强制换版
这是近期最容易让老代码突然报错的一处变更,值得单独记:
自 Claude Opus 5.5(2026-09-22) 起,Claude API 上的 computer use 必须使用 computer_toolset_20260801 工具集;旧的 computer_20251124 在 Claude API 与 Google Cloud 上会直接返回 400,目前仅 Amazon Bedrock 仍可继续使用。
| 平台 | computer_20251124(旧) | computer_toolset_20260801(新) |
|---|---|---|
| Claude API | 返回 400 | 必须 |
| Google Cloud | 返回 400 | 必须 |
| Amazon Bedrock | 仍可用 | 可用 |
实践含义:如果你的 Agent 在 2026-09-22 之后突然开始报 computer use 相关错误,先查工具集版本号,而不是先怀疑模型或提示词——这类「工具集强制换版」的报错信息通常不会点名原因。跨云部署的团队尤其要注意:同一份代码在 Bedrock 上还能跑、在 Claude API 上已经 400 了。
什么时候该用它:一张决策表
| 情况 | 该用什么 | 理由 |
|---|---|---|
| 目标有稳定 API | API | 快、准、可重试、可并发 |
| 目标有 MCP 服务器 | MCP | 结构化、可审计、生态通用 |
| 目标是内网 legacy 系统、无接口 | Computer Use | 只有界面可操作 |
| 流程是一次性、低频的人工操作 | Computer Use | 写脚本不划算 |
| 高并发 / 低延迟 / 强一致 | 都不是——先做接口 | 截图闭环天生不适合 |
| 涉及资金或不可逆操作 | Computer Use + 人工确认 | 见下方围栏 |
一句话:Computer Use 买的是「覆盖面」,付的是「速度与确定性」。
和 Agent 的关系
Computer Use 是 Agentic Coding 与桌面 Agent 的关键能力之一:
- 桌面 Agent(Claude Desktop 等)借此操作本地应用;
- RPA 替代:把「截图驱动」的柔性自动化带进企业流程。
但它和 MCP 不是替代关系——能走结构化接口(MCP / API)时优先走接口,更稳更快;只有「纯界面、无接口」的场景才上 Computer Use。
常见误区
- 以为比 API 快——截图理解 + 模拟操作的闭环天然慢,且每步都有误差累积,不适合延迟敏感场景。
- 以为百分百可靠——小按钮、重叠弹窗、动态布局都可能点错,生产必须加「确认 / 回滚 / 权限围栏」。
- 忽视安全——模型拿到的是「能操作你电脑」的权限,必须限定作用域(只给某个浏览器 / 某个窗口),避免越权。
适用与不适用
没有 API 的 legacy 系统 / 网页后台自动化 一次性、低频、人工也会点流程的任务 桌面 Agent 操作本地应用 高并发、低延迟、强一致性的服务调用——走 API / MCP 涉及资金 / 不可逆操作的步骤——必须人工确认
怎么用:三步上手
- 圈定作用域——只给模型一个隔离环境(专用浏览器 profile / 虚拟机),别给它全系统权限。
- 加确认围栏——不可逆动作(删除、付款、发信)前强制人工确认。
- 配失败兜底——截图异常 / 连续 miss 时停止并告警,别让它「盲操作」。
- 限定凭证作用域——给 Computer Use 会话用的账号只给最小权限;别拿你自己的主账号登录。
- 把它放进沙箱——Computer Use 本质是「让模型动你的电脑」,应与 Agent 沙箱 配合使用:限定可访问域名、可读写路径,并关掉逃逸口。
这三步的顺序不能颠倒:先隔离作用域,再加确认,最后才谈自动化。 反过来做的话,一旦模型被界面上的恶意内容注入(网页里的提示注入是真实存在的攻击面),它会带着你的完整权限去执行。
哪些工具支持
- Claude 系列(computer use 能力)经 Claude Desktop / Claude Code 暴露。
- GPT 系列的 operator 形态提供网页端计算机操控。
- 大量 Agent 平台把它作为「无接口软件」的兜底执行器。
FAQ
Computer Use 和 RPA 有什么区别? 传统 RPA 依赖写死的坐标或选择器,界面一改就崩;Computer Use 靠视觉理解找元素,换位置、换文案仍能找到。代价是 RPA 确定性高、成本极低,而 Computer Use 每步都有误差与调用成本。高稳定的重复流程仍应选 RPA 或 API。
为什么它比 API 慢这么多? 因为它是串行感知—决策闭环:一个动作 = 一次截图 + 一次含全部历史图像的模型调用。API 是一次请求拿结果,Computer Use 是几十次往返。
2026 年哪些模型在这一项上强?Claude Opus 5.5 官方给出的 OSWorld 2.0(partial)为 81.8%、图表识别 Chartography 89.0%,属当前公开口径的第一梯队。这些是厂商自报数字,跨厂商横向比较请连同测试条件一起引用。
能让它自己付款 / 发邮件吗? 技术上能,工程上不该。不可逆操作必须保留人工确认环节,这是 Computer Use 落地时唯一没有商量余地的红线。
延伸阅读
- Agent 基础:Agentic Coding · AI Agent
- 协议层:MCP · Function Calling
- 安全:Agent 沙箱
- 上下文:Long Context · 上下文压缩
- 模型:Claude Opus 5.5 · Claude Opus 5 · GPT-6 Astra
来源
相关工具
Aider vs Claude Code:终端 AI 编程双雄怎么选
Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。
Alice vs Claude Desktop:全局快捷键买断 vs MCP 桌面旗舰(2026 实测选型)
Alice vs Claude Desktop 2026 选型对比:heyalice.app 桌面快捷键助手(BYO API + 一次买断) vs Anthropic 官方 MCP 桌面旗舰(Opus 推理 + .mcpb 扩展)。从定位、核心能力、模型支持、价格、国内可用性 6 个维度帮你选对桌面 AI Agent。
AutoGLM vs Claude Desktop:国产桌面 Agent vs Anthropic 桌面旗舰(2026 实测选型)
AutoGLM 和 Claude Desktop 都是桌面 AI Agent,但一个是智谱开源 GUI Agent(操作手机 / 浏览器界面),一个是 Anthropic 官方 MCP 旗舰客户端。本文从定位、能力、价格、国内可用性帮你选对工具。
Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比
Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。
Claude Code vs Codex CLI:终端 AI Agent 双雄对比
Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。
Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)
Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。