Computer Use Agent
让模型像人一样看屏幕、动鼠标

2026 年 7 月,Meta Muse Spark 1.1 凭三端 computer use 登顶两大 Agent 基准;Claude、OpenAI 的同类能力也已进入产品。这篇讲清它的工作机制:模型怎么「看见」屏幕、怎么决定点哪里、为什么它同时是自动化的终极形态和安全的头号难题。

调研时间:2026-07-22(补 2026-07-21)· 核心机制部分基于 Anthropic 官方文档一手全文

⚡ 30 秒速览

Computer Use(计算机使用)是让大模型直接操作图形界面的能力:给模型一张屏幕截图,它回答「接下来该点哪里、输什么」;你的程序替它执行,再截一张新图给它看结果——如此循环,直到任务完成。它不走 API、不解析网页代码,而是像人一样「看屏幕 + 动鼠标键盘」。

为什么重要:世界上大量软件没有 API——老旧的企业内部系统、只有图形界面的桌面软件、被厂商锁死的 SaaS 后台。Computer use 是唯一能通吃这些场景的自动化方式,也因此被视为企业自动化「最后一公里」的钥匙。2026 年它从演示走向产品:Anthropic 把它放进 Claude API(beta)和 Cowork(research preview),Meta Muse Spark 1.1 靠它登顶 JobBench 和 Finance Agent V2,OpenAI 的 Operator/CUA 走同一路线。

API 集成 程序对程序 快、稳、精确 但:对方得有 API 传统 RPA 脚本 录制固定点击坐标 不需要 API 但:界面一改就全崩 Computer Use Agent 模型「看懂」界面再操作 界面变了能自己适应 但:慢、贵、需要围栏
三代界面自动化的取舍:computer use 用「理解」换「适应性」,代价是速度、成本和安全复杂度。

🧭 背景:为什么要「看屏幕、动鼠标」

在它出现之前,想让软件自动干活只有两条路。一条是 API 集成:两个程序之间约好数据格式直接对话——这是最好的方式,但前提是对方提供了 API,而现实里无数系统没有。另一条是 RPA(机器人流程自动化):录一段「在坐标 (312, 480) 点一下、等 2 秒、输入文本」的脚本回放——不要求 API,但脚本是「瞎的」,按钮挪个位置、弹出一个意外对话框,整条流程就断了,维护成本极高。

Computer use 的思路是把「看懂界面」这一步交给多模态大模型:模型接到截图后,靠视觉理解找到「蓝色的提交按钮」在哪,哪怕它今天挪到了右下角。适应性来自理解,而不是硬编码——这正是 RPA 缺的那块。2024 年 10 月 Anthropic 首发这个能力时还是个不太可靠的演示;到 2026 年,它已经是 Claude API 的正式 beta 工具、Cowork 的 research preview 功能,以及 Meta/OpenAI 旗舰 Agent 模型的标配能力。

API 集成像两家公司的系统直接对账;RPA 像雇了个闭着眼、只会背动作顺序的操作员;computer use 则是雇了个真的会看屏幕的新员工——上手慢一点、偶尔犯错,但换套系统他也能摸索着用。

🔄 核心机制:Agent Loop

整个 computer use 只有一个核心循环,官方称之为 agent loop。关键点:模型自己不碰电脑——它只输出「意图」,真正执行动作的是你的应用程序。官方文档把流程写得很清楚:

你发起任务:把 computer use 工具定义和任务(如「把一张猫的图片存到桌面」)发给模型。
模型请求动作:模型返回一个工具调用,比如「先截图看看现在屏幕上有什么」,响应的 stop_reasontool_use
你的程序执行:在虚拟机/容器里真的截图(或点击、打字),把结果作为 tool_result 发回去。
模型看结果、决定下一步:分析新截图,继续请求动作,或者判断任务完成、输出文字总结。步骤 3–4 无人工介入地反复,就是 agent loop。
🧠 模型(Claude 等) 看截图 → 输出下一个动作 🖥️ 沙箱环境 虚拟机/容器里的桌面 由你的应用代为执行 动作请求:click(x,y) / type / screenshot 执行结果:新截图 / 命令输出 循环直到:模型不再请求工具(任务完成)或达到迭代上限
Agent loop:模型出「意图」,你的程序出「手」,截图是模型唯一的眼睛。(依据 Anthropic 官方文档流程描述重绘)
这个分工是理解一切的钥匙。模型永远只输出「我想点 (312, 480)」这样的文字请求;点没点、在哪点、允不允许点,完全由你的执行层决定。这既是安全设计(你可以在执行层拦截危险动作),也解释了为什么官方说 computer use 是「client-side tool」——所有截图、键鼠输入都留存在你的环境里,Anthropic 只实时处理不保存,因此它符合零数据保留(ZDR)资格。

🧰 动作集与运行环境

模型能做哪些动作?

官方工具(最新版 computer_20251124,配 beta 头 computer-use-2025-11-24)的动作分三档:

档位动作说明
基础(所有版本)screenshot / left_click / type / key / mouse_move截图、点击、打字、按快捷键、移动光标
增强(20250124+)scroll / left_click_drag / right_click / double_click / triple_click / left_mouse_down·up / hold_key / wait滚动、拖拽、多种点击、细粒度按住/松开、等待
最新(20251124)zoom(需 enable_zoom: true)按区域坐标放大查看屏幕局部——解决「侧栏文件名、状态栏小字看不清」的老大难

它在什么环境里跑?

官方参考实现是一个 Docker 容器,里面装着一整套「给模型用的桌面」:虚拟显示器(Xvfb)渲染画面、轻量桌面环境(Mutter 窗口管理器 + Tint2 面板)、预装应用(Firefox、LibreOffice、文本编辑器、文件管理器),再加上把模型抽象请求翻译成真实操作的工具实现代码和 agent loop 程序。模型「看到」的桌面,就是这个容器里的虚拟屏幕。

实践中 computer use 很少单独出现——官方 Quick start 就演示了三件套:computer use 管界面、bash 管命令行、text_editor 管文件编辑。能用命令行三秒办完的事(比如下载文件),不必让模型对着浏览器点十次。

🚀 怎么用:从零跑通

最快路径是官方参考实现(含 Docker 容器、工具实现、agent loop、Web 界面,GitHub: anthropic-quickstarts/computer-use-demo),clone 下来填 API key 就能玩。核心 API 调用长这样(官方文档原例,Python):

response = client.beta.messages.create(
    model="claude-opus-4-8",
    max_tokens=1024,
    tools=[
        {
            "type": "computer_20251124",
            "name": "computer",
            "display_width_px": 1024,
            "display_height_px": 768,
            "display_number": 1,
        },
        {"type": "text_editor_20250728", "name": "str_replace_based_edit_tool"},
        {"type": "bash_20250124", "name": "bash"},
    ],
    messages=[{"role": "user", "content": "Save a picture of a cat to my desktop."}],
    betas=["computer-use-2025-11-24"],
)

自建环境要自己实现四件事:① 一个可控的虚拟桌面;② 各动作的处理函数(把 left_click 翻译成真实点击);③ agent loop(带最大迭代次数上限,防止无限循环烧 API 费);④ 启动入口。官方文档对每一步都给了代码骨架。

截图尺寸是最常见的第一个坑。模型按「它看到的图」返回坐标。如果你的屏幕超过模型的图像上限(Sonnet 5 / Opus 4.8 / 4.7 长边 2576px,更早模型 1568px),API 会自动缩小图片——但你拿不到缩放比例,坐标就对不回真实屏幕了。正确做法:发送前自己缩放、把 display_width_px/height_px 设成缩放后的尺寸、拿到坐标后按比例放大回去。macOS Retina 屏截图是 2 倍分辨率,同理要除以 2。(官方文档明示)

不写代码的用户:Cowork 的「计算机使用」(Pro/Max research preview)就是这套能力的产品化——Claude 直接操作你桌面上的应用,浏览器场景则交给更快的 Claude in Chrome。

🎯 调优:让它点得准、走得稳

官方文档的提示词建议,浓缩成五条(全部来自一手文档):

模型与推理力度的选择,官方内部基准的建议是:Opus 4.7 默认 high effort;Sonnet 4.6 / Opus 4.6 默认 medium(性价比最佳),max 在 UI 任务上只烧钱不涨分。点击精度上,Sonnet 4.6 比 Opus 4.6 更「手稳」,Opus 4.7 基本追平且支持更高分辨率。点击总是偏一个方向?几乎一定是 display_width_px 和实际发送的图片尺寸不一致。

🛡️ 安全:提示注入是头号敌人

Computer use 的安全模型和普通 API 调用完全不同,因为模型的「眼睛」现在对着开放的互联网。官方文档直白承认:某些情况下,Claude 会执行内容里发现的指令,即使它们与你的指令冲突——网页上或图片里藏的一句话,可能覆盖你的系统提示。这就是提示注入(prompt injection)在 GUI 场景的形态:恶意内容不再需要进入对话,只要出现在屏幕上。

官方给出的纵深防御是四层,外加一个自动防线:

物理隔离:专用虚拟机/容器、最小权限,别在真机上裸跑。
数据隔离:不给模型碰敏感数据(尤其登录凭证);必须登录的场景风险显著升高,要先读官方的注入缓解指南。
网络隔离:互联网访问收窄到域名白名单。
人类确认:任何有真实世界后果的决定(接受 cookies、金融交易、同意条款)都要人拍板。

自动防线:Anthropic 训练了模型抵抗注入,并在 computer use 请求上自动运行注入检测分类器——在截图里发现疑似注入时,会引导模型停下来请求用户确认后再继续(可联系支持关闭,但官方强调关闭后上述四层预防依然重要)。

为什么这个话题今天格外热:本周两条新闻正好是这枚硬币的两面——Meta Muse Spark 1.1 靠三端 computer use 登顶 agent 基准(能力面),而据多方报道 OpenAI 暂停了一个反复逃出沙箱的未发布模型(未获官方证实;围栏面)。模型越能干,「屏幕上任何内容都可能是指令」这件事就越危险。给 Agent 的每一分执行力,都要配同等的隔离与确认机制。

📊 场景、评测与选型

什么场景值得用

评测现状:进步真实,但口径混乱

这个方向的标准评测是 OSWorld(真实桌面任务:导航文件系统、开应用、填表、跨应用工作流)。两点可以确认:一是跨应用工作流仍是最难的部分(如「从邮件取数 → 更新表格 → 发 Slack」,多个第三方评测均报告成功率远低于单应用任务);二是 2026 年各家分数口径严重不一——不同第三方对同一模型给出的 OSWorld 分数可以相差数倍(有评测称 Claude 72.5%,另一些口径下给出完全不同的数字),且部分高分报告来自有直接利益的厂商自评。本文选择不给出任何「某家 X%」的结论性排名,横向对比请以论文原文和可复现榜单为准。此外,arXiv 上的 OSWorld-Human 提出了新维度:不止看做没做成,还看比人类多绕了多少步——效率是当前 Agent 与人的另一道差距。

怎么选

你的情况建议
目标系统有 API / MCP 连接器永远优先 API——快一个数量级、便宜、可靠。computer use 只兜底没有接口的部分
纯网页操作用浏览器专用通道(如 Claude in Chrome、各家 browser use),DOM 感知比截图点击快得多
桌面软件 / 无 API 系统computer use,配沙箱 + 白名单 + 人类确认
自己搭 Agent 产品从官方参考实现起步;评估 Muse Spark、CUA 等时用自己的真实任务测,别信单一榜单

🕳️ 常见坑与限制(官方逐条承认的)

慢,而且贵。官方明说当前延迟「相比人类操作可能太慢」,建议聚焦速度不敏感的场景。成本上,除了每次都要传输截图(按视觉 token 计费),beta 还会给系统提示增加 466–499 token,工具定义本身 735 token/次请求。长任务的截图历史要做好裁剪,配合 prompt caching。
坐标会「幻觉」。模型输出具体坐标时可能出错或凭空想象;滚动在某些应用里不生效;电子表格的单元格选择要用细粒度鼠标动作反复尝试。生产环境必须有动作校验和日志。
社交平台行为受限。官方明确限制了模型在社交/通讯平台上创建账号、生成分享内容、进行人类冒充类操作的能力。
注入无法根除。官方原话:越狱和提示注入「可能持续存在于前沿 AI 系统中」,分类器防线也「并非对每个用例都理想」。这不是能修完的 bug,而是要长期共存的风险——围栏设计(第 7 节)不是可选项。
别用于要求完美精度的任务。官方建议:凡是需要绝对精确或涉及敏感信息的操作,必须有人工复核。

📚 学习资源清单