Claude 可以操作你的电脑了。OpenAI 的 Agent 可以浏览网页了。但它们在"看"什么?
当前所有主流 Computer-Use Agent 的核心方案是:截图 → 视觉模型理解 → 输出点击坐标。这是一个被验证有效的路径,但它有一个根本性的问题:用像素来理解界面状态,就像用照片来理解一栋建筑的电路图。信息密度极低,噪声极大。
7 月 28 日,HuggingFace Daily Papers 上两篇高票论文——一篇来自 Salesforce AI Research,一篇来自 26 位作者的合作——分别从两个方向回答了同一个问题:GUI Agent 应该"看"什么?
答案指向两个截然不同的未来。

〇、元问题:GUI Agent 的"感知层"之争
想象你要教一个盲人操作 Photoshop。你有两个选择:
方案 A:每秒拍一张屏幕照片给他描述。“左上角有一个蓝色按钮,往下 20 像素有一个下拉菜单……” 这就是当前大多数 Computer-Use Agent 做的事情。
方案 B:直接告诉他程序的内部状态。“当前选中了图层 3,画笔工具已激活,颜色是 #FF5500,画布尺寸 1920×1080……” 这就是 StateAct 想做的事情。
方案 A 的优势是通用——任何软件都能截图。方案 B 的优势是精确——不会把"按钮被遮挡"误判为"按钮不存在"。
但方案 B 有一个巨大的前提:你需要访问程序的内部状态。 对于 Web 应用,这是 DOM(文档对象模型)和无障碍树(accessibility tree)。对于桌面应用,这是操作系统级别的 UI 自动化接口。对于创意工具(Photoshop、Figma),这是画布对象模型。
两篇论文恰好覆盖了这个光谱的两端:StateAct 走"程序状态"路线,JarvisHub 走"画布原生"路线。
一、StateAct:先读代码,再看屏幕
论文信息
| 项目 | 详情 |
|---|---|
| 标题 | StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents |
| 机构 | Salesforce AI Research |
| 票数 | 53 upvotes |
| 核心思想 | 用程序状态(DOM/无障碍树)替代或优先于像素作为 Agent 的感知输入 |
为什么这个思路重要?
当前的 Computer-Use Agent 有一个众所周知但很少被正面讨论的问题:它们在"长程任务"(long-horizon tasks)上表现糟糕。
所谓长程任务,指的是需要 10 步以上操作才能完成的复杂流程——比如"帮我在 Jira 里把上周所有 assigned to me 的 bug 状态改为 resolved,然后发一封汇总邮件给项目经理"。
截图方案在 2-3 步的简单任务上工作良好,但在长程任务上会遇到三个致命问题:
- 状态漂移:第 5 步的截图和第 1 步的截图在视觉上可能非常相似(同一个页面、同样的按钮),Agent 会迷失"我到底做完了没有"
- 遮挡问题:弹窗、下拉菜单、加载动画——任何遮挡都会让基于像素的 Agent 误读界面状态
- 信息瓶颈:一张 1080p 的截图包含 200 万像素,但关于"当前正在编辑的文件名是什么"这个问题的答案,只占其中的大约 400 个像素(文件名文本区域)
StateAct 的核心洞察是:程序状态是一个远比像素信息密度高的感知通道。
DOM 可以直接告诉你"当前页面上有 3 个按钮,分别是’保存’、‘取消’和’删除’",而不需要模型从像素中做目标检测。无障碍树可以直接告诉你"当前焦点在用户名输入框",而不需要推理光标位置。
这对工程实践意味着什么
如果 StateAct 的方法被验证有效,Computer-Use Agent 的开发将发生两个变化:
短期:Agent 框架需要增加"状态提取层"——在截图之前,先获取 DOM/无障碍树/UI 自动化接口返回的结构化数据。
长期:软件本身需要考虑为 Agent 提供"可机器读取"的状态接口。就像今天的网站提供 API 给前端一样,未来的应用可能需要提供"Agent API"——一个供 AI 读取的、结构化程度高于像素、但不需要理解全部业务逻辑的状态描述。
“程序的内部状态,在像素到达屏幕之前,已经是 Agent 最好的感知输入。”
二、JarvisHub:创意 Agent 的开放测试台
论文信息
| 项目 | 详情 |
|---|---|
| 标题 | JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents |
| 作者 | 26 位作者(多机构合作) |
| 票数 | 106 upvotes(当日第 2) |
| 核心思想 | 构建一个开放的测试平台,专门评估能在画布上直接操作的创意 Agent |
什么是"Canvas-Native"?
Canvas-Native Agent 不是仅仅"操作软件",而是"在画布上创作"。
当前主流 Agent 的能力范围集中在操作型任务(点击、填写、导航)和分析型任务(阅读、总结、分类)。但有一类任务几乎完全被忽视:创意型任务——在画布上画图、排版、设计、编辑多媒体内容。
这类任务需要的能力与传统 GUI Agent 完全不同:
| 维度 | 操作型 GUI Agent | Canvas-Native Agent |
|---|---|---|
| 输入 | 截图/DOM | 画布状态 + 像素 |
| 输出 | 点击坐标/文本 | 绘图指令/对象操作 |
| 评估标准 | 任务完成率 | 美学质量 + 意图匹配 |
| 典型场景 | 填表、导航、数据录入 | 设计、绘画、视频编辑 |
JarvisHub 要做的是为这个方向提供一个标准化的测试平台——就像 SWE-bench 之于编程 Agent,或者 WebArena 之于 Web Agent。
为什么是"开放"的
论文标题中"Open Harness"这个词是关键。在 AI 领域,“开放测试台"意味着三件事:
- 标准化任务集:一组被社区认可的任务,可以用来横向比较不同 Agent 的能力
- 可复现的评估:同样的环境、同样的任务、同样的指标
- 社区共建:不是一家公司的内部基准,而是可以被所有人使用和改进的公共资源
JarvisHub 对创意 Agent 的意义,相当于 ImageNet 对计算机视觉的意义:把散落的能力评估统一到一个公共平台上。
多模态的含义
“Canvas-Native Multimodal Creative Agents"中的 Multimodal 有两层含义:
- 输入多模态:Agent 接收文本指令 + 参考图像 + 当前画布状态
- 输出多模态:Agent 产出的不是文本,而是图形、设计稿、视频片段
这要求 Agent 同时具备语言理解、视觉感知和空间操作能力——这是当前通用模型的最弱项。
三、两条路线的交汇与分歧
StateAct 和 JarvisHub 看起来在讨论不同的事情——一个是企业级 GUI 自动化,一个是创意工具 Agent。但它们在底层共享一个核心假设:
像素不是 Agent 最好的感知通道。
StateAct 的模式是:用程序状态(结构化的、符号化的)补充或替代像素。
JarvisHub 的模式是:用画布对象模型(结构化的、空间化的)来理解创意界面。
两条路线在同一个光谱上只是位置不同:
纯像素 ────────────── 像素 + DOM ───── 画布对象模型 ───── 纯程序状态
(当前主流) (短期优化) (JarvisHub) (StateAct 理想)
谁更需要哪种方案?
| 场景 | 推荐方案 | 原因 |
|---|---|---|
| Web 自动化(表单填写、数据采集) | StateAct(程序状态优先) | DOM 提供了几乎完美的结构化感知 |
| 桌面应用自动化(ERP、CRM) | 像素 + 无障碍树 | 许多桌面应用没有 DOM 但有 UI 自动化接口 |
| 创意工具(设计、绘画) | JarvisHub(画布原生) | 画布操作不能简化为点击坐标 |
| 通用 Agent(什么都能做) | 持续叠加:先程序状态,找不到再像素 | 最高信息效率,最宽覆盖 |
四、这对开发者的实际影响
如果你在做 GUI Agent
立即可以做的事:
给你的 Agent 框架加一个"状态提取层”。在截图之前,先尝试通过 DOM/无障碍树/UI 自动化获取结构化状态。代码上的改动不大,但对长程任务的改进可能是数量级的。
不要只用"任务完成率"评估 Agent。StateAct 暗示的是:长程任务中,Agent 的"状态意识”(它知道自己做到哪了)比单步准确率更重要。在你的评估中加入"状态追踪准确率"指标。
如果你在做 SaaS 产品
值得提前考虑的事:
JarvisHub 的出现意味着:未来会有 Agent 专门为"在你的产品里创作内容"而设计。 如果你的产品是一个设计工具、文档编辑器或多媒体平台,现在就应该思考:
- 你的画布/编辑器有没有可以被 Agent 读取的对象模型?
- 如果没有,你是否愿意让 Agent 通过截图来操作你的产品?(截图的信息瓶颈会导致体验极差)
- 你的产品是否需要为 Agent 提供"创作 API"?
这不是科幻——Claude 和 OpenAI 已经可以通过 Computer Use 操作各类软件。当它们开始进入创意领域,有没有原生 Agent 接口将决定你的产品是"适合 AI 使用"还是"对 AI 不友好"。
总结
| 论文 | 路线 | 核心创新 | 影响力 |
|---|---|---|---|
| StateAct | 程序状态优先 | 用 DOM/无障碍树替代像素感知 | 重新定义 GUI Agent 的感知架构 |
| JarvisHub | 画布原生 | 创意 Agent 开放测试平台 | 为设计/创意 Agent 建立标准化评估 |
Computer-Use Agent 正在经历一场"感知层"的范式转移。 从"截图+点击"到"程序状态+画布对象",这个变化将决定下一代 Agent 是只能做填表导航,还是能真正操作复杂软件、完成长程任务、甚至进行创意工作。
而这场转移的核心问题只有一个:你是愿意让 Agent 通过一个 200 万像素的照片来理解你的界面,还是直接告诉它你的界面里有什么?
🎨 如果你在做 GUI Agent 或创意工具——
- 你的 Agent 现在用的是纯像素方案吗?试一下加上程序状态提取层
- 你的产品有"Agent 友好的"对象模型吗?如果没有,未来 12 个月内这可能成为竞争劣势
- 创意 Agent 的标准化时代已经开始——JarvisHub 值得关注
📬 关注梦兽编程,获取更多 AI Agent 前沿研究解读。
参考来源:
- HuggingFace Daily Papers (July 28, 2026): StateAct — Salesforce AI Research
- HuggingFace Daily Papers (July 28, 2026): JarvisHub — 26 authors
- AI News: Opus 5 + Agent tools coverage

