2026 年 7 月,Meta Muse Spark 1.1 凭三端 computer use 登顶两大 Agent 基准;Claude、OpenAI 的同类能力也已进入产品。这篇讲清它的工作机制:模型怎么「看见」屏幕、怎么决定点哪里、为什么它同时是自动化的终极形态和安全的头号难题。
Computer Use(计算机使用)是让大模型直接操作图形界面的能力:给模型一张屏幕截图,它回答「接下来该点哪里、输什么」;你的程序替它执行,再截一张新图给它看结果——如此循环,直到任务完成。它不走 API、不解析网页代码,而是像人一样「看屏幕 + 动鼠标键盘」。
为什么重要:世界上大量软件没有 API——老旧的企业内部系统、只有图形界面的桌面软件、被厂商锁死的 SaaS 后台。Computer use 是唯一能通吃这些场景的自动化方式,也因此被视为企业自动化「最后一公里」的钥匙。2026 年它从演示走向产品:Anthropic 把它放进 Claude API(beta)和 Cowork(research preview),Meta Muse Spark 1.1 靠它登顶 JobBench 和 Finance Agent V2,OpenAI 的 Operator/CUA 走同一路线。
在它出现之前,想让软件自动干活只有两条路。一条是 API 集成:两个程序之间约好数据格式直接对话——这是最好的方式,但前提是对方提供了 API,而现实里无数系统没有。另一条是 RPA(机器人流程自动化):录一段「在坐标 (312, 480) 点一下、等 2 秒、输入文本」的脚本回放——不要求 API,但脚本是「瞎的」,按钮挪个位置、弹出一个意外对话框,整条流程就断了,维护成本极高。
Computer use 的思路是把「看懂界面」这一步交给多模态大模型:模型接到截图后,靠视觉理解找到「蓝色的提交按钮」在哪,哪怕它今天挪到了右下角。适应性来自理解,而不是硬编码——这正是 RPA 缺的那块。2024 年 10 月 Anthropic 首发这个能力时还是个不太可靠的演示;到 2026 年,它已经是 Claude API 的正式 beta 工具、Cowork 的 research preview 功能,以及 Meta/OpenAI 旗舰 Agent 模型的标配能力。
整个 computer use 只有一个核心循环,官方称之为 agent loop。关键点:模型自己不碰电脑——它只输出「意图」,真正执行动作的是你的应用程序。官方文档把流程写得很清楚:
stop_reason 是 tool_use。tool_result 发回去。官方工具(最新版 computer_20251124,配 beta 头 computer-use-2025-11-24)的动作分三档:
| 档位 | 动作 | 说明 |
|---|---|---|
| 基础(所有版本) | screenshot / left_click / type / key / mouse_move | 截图、点击、打字、按快捷键、移动光标 |
| 增强(20250124+) | scroll / left_click_drag / right_click / double_click / triple_click / left_mouse_down·up / hold_key / wait | 滚动、拖拽、多种点击、细粒度按住/松开、等待 |
| 最新(20251124) | zoom(需 enable_zoom: true) | 按区域坐标放大查看屏幕局部——解决「侧栏文件名、状态栏小字看不清」的老大难 |
官方参考实现是一个 Docker 容器,里面装着一整套「给模型用的桌面」:虚拟显示器(Xvfb)渲染画面、轻量桌面环境(Mutter 窗口管理器 + Tint2 面板)、预装应用(Firefox、LibreOffice、文本编辑器、文件管理器),再加上把模型抽象请求翻译成真实操作的工具实现代码和 agent loop 程序。模型「看到」的桌面,就是这个容器里的虚拟屏幕。
实践中 computer use 很少单独出现——官方 Quick start 就演示了三件套:computer use 管界面、bash 管命令行、text_editor 管文件编辑。能用命令行三秒办完的事(比如下载文件),不必让模型对着浏览器点十次。
最快路径是官方参考实现(含 Docker 容器、工具实现、agent loop、Web 界面,GitHub: anthropic-quickstarts/computer-use-demo),clone 下来填 API key 就能玩。核心 API 调用长这样(官方文档原例,Python):
response = client.beta.messages.create(
model="claude-opus-4-8",
max_tokens=1024,
tools=[
{
"type": "computer_20251124",
"name": "computer",
"display_width_px": 1024,
"display_height_px": 768,
"display_number": 1,
},
{"type": "text_editor_20250728", "name": "str_replace_based_edit_tool"},
{"type": "bash_20250124", "name": "bash"},
],
messages=[{"role": "user", "content": "Save a picture of a cat to my desktop."}],
betas=["computer-use-2025-11-24"],
)
自建环境要自己实现四件事:① 一个可控的虚拟桌面;② 各动作的处理函数(把 left_click 翻译成真实点击);③ agent loop(带最大迭代次数上限,防止无限循环烧 API 费);④ 启动入口。官方文档对每一步都给了代码骨架。
display_width_px/height_px 设成缩放后的尺寸、拿到坐标后按比例放大回去。macOS Retina 屏截图是 2 倍分辨率,同理要除以 2。(官方文档明示)不写代码的用户:Cowork 的「计算机使用」(Pro/Max research preview)就是这套能力的产品化——Claude 直接操作你桌面上的应用,浏览器场景则交给更快的 Claude in Chrome。
官方文档的提示词建议,浓缩成五条(全部来自一手文档):
enable_zoom 后,问「侧栏里那个文件叫什么」这类具体区域的问题,模型会主动放大查看。模型与推理力度的选择,官方内部基准的建议是:Opus 4.7 默认 high effort;Sonnet 4.6 / Opus 4.6 默认 medium(性价比最佳),max 在 UI 任务上只烧钱不涨分。点击精度上,Sonnet 4.6 比 Opus 4.6 更「手稳」,Opus 4.7 基本追平且支持更高分辨率。点击总是偏一个方向?几乎一定是 display_width_px 和实际发送的图片尺寸不一致。
Computer use 的安全模型和普通 API 调用完全不同,因为模型的「眼睛」现在对着开放的互联网。官方文档直白承认:某些情况下,Claude 会执行内容里发现的指令,即使它们与你的指令冲突——网页上或图片里藏的一句话,可能覆盖你的系统提示。这就是提示注入(prompt injection)在 GUI 场景的形态:恶意内容不再需要进入对话,只要出现在屏幕上。
官方给出的纵深防御是四层,外加一个自动防线:
自动防线:Anthropic 训练了模型抵抗注入,并在 computer use 请求上自动运行注入检测分类器——在截图里发现疑似注入时,会引导模型停下来请求用户确认后再继续(可联系支持关闭,但官方强调关闭后上述四层预防依然重要)。
这个方向的标准评测是 OSWorld(真实桌面任务:导航文件系统、开应用、填表、跨应用工作流)。两点可以确认:一是跨应用工作流仍是最难的部分(如「从邮件取数 → 更新表格 → 发 Slack」,多个第三方评测均报告成功率远低于单应用任务);二是 2026 年各家分数口径严重不一——不同第三方对同一模型给出的 OSWorld 分数可以相差数倍(有评测称 Claude 72.5%,另一些口径下给出完全不同的数字),且部分高分报告来自有直接利益的厂商自评。本文选择不给出任何「某家 X%」的结论性排名,横向对比请以论文原文和可复现榜单为准。此外,arXiv 上的 OSWorld-Human 提出了新维度:不止看做没做成,还看比人类多绕了多少步——效率是当前 Agent 与人的另一道差距。
| 你的情况 | 建议 |
|---|---|
| 目标系统有 API / MCP 连接器 | 永远优先 API——快一个数量级、便宜、可靠。computer use 只兜底没有接口的部分 |
| 纯网页操作 | 用浏览器专用通道(如 Claude in Chrome、各家 browser use),DOM 感知比截图点击快得多 |
| 桌面软件 / 无 API 系统 | computer use,配沙箱 + 白名单 + 人类确认 |
| 自己搭 Agent 产品 | 从官方参考实现起步;评估 Muse Spark、CUA 等时用自己的真实任务测,别信单一榜单 |