电脑操作(computer use)曾经像一场不太可靠的魔术:模型看一张截图,猜一个坐标,点击后再祈祷页面没有变化。Kyle Jeong 这篇拆解认为,Astra 的进步来自三件事同时到位:输入从像素升级为语义结构,动作从单次函数调用升级为可持续的代码循环,安全则由独立的 Guardian 策略在动作落地前把关。
#从“看像素”到“读界面”
早期电脑操作模型主要走视觉路线。模型接收截图,再返回点击、输入或按键的坐标,驱动层负责把坐标翻译成浏览器或桌面动作。这条路线直观,却有一个致命前提:训练时的视口尺寸和实际使用时必须足够接近。按钮位置、窗口比例和页面布局一变,模型就可能错过目标。
更复杂的应用还会把真正重要的状态藏在视觉层下面。只靠“眼睛”看到的像素,模型很难稳定区分元素角色、层级关系和当前是否可交互。
Astra 借用了浏览器和操作系统的无障碍(Accessibility)机制。网页会自动生成 Accessibility Tree(a11y tree),把界面元素表达成带有角色、名称、状态和层级的语义结构。它去掉了大部分 CSS 和样式细节,通常比截图消耗更少 Token,却能提供相同甚至更清晰的操作上下文。
这也解释了为什么 a11y tree 比“让模型学会点击像素”更有泛化潜力:只要应用正确暴露无障碍信息,模型面对不同窗口大小时不必重新猜坐标。视觉仍然有用,但它从唯一输入变成了文本语义和截图之间的互补证据。
#模型能力只是半边答案
文章把电脑操作定义为一个“模型问题 + Harness 问题”。模型负责决定下一步做什么,Harness 负责观察环境、执行动作、保存状态、处理工具和确认结果。只提高模型而不改 Harness,动作仍会被延迟、状态漂移和权限边界拖垮。
这正是 Astra 与 Codex 电脑操作体验的共同基础:会话启动时,Harness 建立一个持久的 Node REPL,并绑定浏览器或原生桌面操作能力。Agent 根据任务选择合适的绑定,既可以读取页面文本,也可以请求截图,必要时还可以调用其他工具或执行代码。
#电脑操作现在更像一个闭环
一次动作不再是“模型输出点击,然后流程结束”,而是一个持续循环:
- 观察当前页面或桌面状态,使用 a11y tree、截图,或两者的组合。
- 根据语义元素和当前任务,用代码选择并执行动作。
- 由本地 IPC 服务把元素选择转换成原生元素 ID,必要时退回坐标,再通过 JSON-RPC 等方式完成调用。
- 再次观察结果,确认页面是否真的进入预期状态。
- 如果状态不对,修正动作并继续循环,直到任务完成。
这里最重要的变化是“动作成功”与“任务成功”被分开了。点击请求被服务执行,只能说明调用送达;只有下一次观察确认目标状态出现,才算这一步真的完成。持久 REPL 则让整个过程保留上下文,不会每次动作都从一张孤立截图重新开始。
#Guardian 把安全审查插进动作链
Astra 的额外审查并不是另一个让用户反复点确认的弹窗,而是一套 Guardian Policy。它先用一个后台分类器评估当前工作流和潜在风险,输出高风险或低风险;一旦进入高风险状态,后续动作会交给阻塞式审查器,在执行前结合更多上下文做完整判断。
审查器看的不只是“要点击哪个按钮”,还包括动作参数、对话中用户是否明确授权、父级环境和权限、已有 REPL 证据与图片,以及这次请求本身的理由。常见拦截边界包括权限授予、登录和账户关键操作、敏感数据提交、后果明确的点击、限制绕过、破坏性动作,以及超出任务范围的私有数据访问。
这套设计的价值在于,安全不是任务结束后的审计报告,而是动作执行前的门。对于电脑操作 Agent,最危险的往往不是“不会点”,而是“点对了一个不该点的按钮”。
#为什么增加审查反而更快
如果每一步都多一个审查环节,为什么总体速度还能提升?文章给出的答案很朴素:Astra 更聪明,所以需要的轮次更少。
Astra 在大量 GPU 上进行后训练,并在电脑操作环境中经历了大量强化学习。对于这类任务,推理吞吐超过一定水平后,瓶颈通常不在模型生成 Token 的速度,而在浏览器和桌面动作的真实执行速度。因此,减少试错轮次比单纯提升 TPS 更直接。
Harness 侧也有优化,例如预热 WebSocket、复用连接和沿用前序响应上下文。这些措施主要减少工具启动和请求准备时间,不能替代更好的任务规划。
#仍未解决的地方
Astra 仍可能拿到不完整的 a11y tree、细节不足的截图或已经过期的观察结果。观察与动作之间如果发生状态变化,原本正确的元素选择也可能失效;某些应用的 a11y tree 变化过于频繁,更会放大这个问题。
更大的挑战是长时任务。上下文压缩让 Agent 可以稳定运行更久,但“连续运行很久”不等于“连续几天或几周都能无人值守地完成任务”。长期状态漂移、异常恢复和权限变化,仍然需要更成熟的 Harness 设计。
从截图点击到读取 a11y tree,是电脑操作变得可靠的一个关键拐点。下一阶段的竞争,不只是模型能不能看懂屏幕,而是谁能把观察、动作、复核和安全边界组合成一个在真实环境里经得起长时间运行的系统。





