header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
扫码下载APP

Cua Driver给Agent补上「眼睛」:纯像素界面也能识别按钮和文字

动察 Beating AI 快讯,开源 Computer Use 工具 Cua 给 Cua Driver 加入可选的 Perception 视觉扩展。Driver 原本优先通过网页结构和系统无障碍树找按钮。遇到 Canvas、游戏、远程桌面或自绘应用时,这些结构可能为空。Perception 会直接读取截图,把画面拆成带文字、类型和位置的区域,供 Agent 继续操作。


首版用 OmniParser 识别图标和控件,用 PP-OCR 读取文字。整个解析过程在本机 CPU 完成,不需要 GPU,也不把截图发到网络。官方实测单张截图在 macOS 约需 2 至 2.5 秒,Linux 为 3.5 至 4 秒,Windows 为 8 至 9 秒。它主要在页面结构和无障碍树失效时兜底,不会默认每一步都跑视觉解析。


Cua 还限制了视觉操作对旧截图的复用。每次视觉识别都会绑定当前截图的 `capture_id`,随后点击必须来自同一张截图。截图超过 60 秒,或者已经执行过一次操作,Driver 就会拒绝继续使用,避免界面变化后还拿旧坐标误点。


Cua 过去其实已经能通过 `cua-som` 和 OmniParser 做视觉定位。现在这套能力被直接接进 Cua Driver,上层 Agent 可以通过统一接口拿到识别结果。即使模型本身不会看图,也可以根据这些文字和区域信息决定下一步操作。


Perception 不是默认组件,其中 OmniParser 检测器采用 AGPL-3.0;Cua Driver 仍保持 MIT 协议。

AI 解读
Cua 给 Driver 加可选 Perception:DOM 与无障碍树失效时,把截图拆成文字、类型、位置区域,OmniParser 识别控件、PP-OCR 读字,本机 CPU 完成,截图不出网。Computer Use 执行层竞速在加速:DeepSeek Harness 已接入 Cua Driver,Browser Use 让 Agent 操作整台 Mac,Cua 又连发 S1 决策模型与评测。

关键约束是 capture_id:点击必须来自同一张截图,超 60 秒或已操作一次即失效,旧坐标误点被堵死。Perception 非默认,OmniParser 采 AGPL-3.0,Driver 仍 MIT,视觉扩展被隔离成可选模块;Windows 单图 8-9 秒也说明本地兜底成本不低,适合关键节点,常态调用仍不现实。
展开
举报 纠错/举报
纠错/举报
提交
新增文库
仅自己可见
公开
保存
选择文库
新增文库
取消
完成