这个 Skill 能做什么,适合哪些场景?
gui-automation 是 trycua/cua 仓库(MIT 许可)中的一个 Agent Skill,通过 `cua` CLI 赋予代理对真实计算机屏幕的“眼睛和双手”:截图、点击、输入、拖拽、管理窗口。它适用于无法通过 shell 或 API 完成的可视化交互场景,如按钮测试、表单填写、界面布局验证和网页模糊测试。技能支持连接沙箱、中继远程主机、spacesd URL 或本机,并自动录制操作轨迹(trajectory)供回放查看。可选配置 ANTHROPIC_API_KEY 后,`cua do snapshot` 可返回带元素坐标的 AI 标注屏幕截图。
- 截取目标屏幕截图(
cua do screenshot),必要时先cua do zoom裁剪到单个窗口提高点击精度 - 执行鼠标键盘操作:点击、双击、输入文本、按键、快捷键、滚动、拖拽、移动光标
- 使用
cua do snapshot(需 ANTHROPIC_API_KEY)获取带元素坐标的 AI 标注屏幕,用于精确定位 - 连接多种目标:沙箱(
cua sb ls)、中继 Space、spacesd URL 或经一次性授权的本机 - 自动把每一步操作录制到 ~/.cua/trajectories/,用
cua trajectory view打开回放供用户审阅 - 列出、聚焦和管理应用窗口(
cua do window ls/focus)
- QA 工程师需要端到端测试一个没有 API 的桌面或 Web 应用时,用截图-点击-再截图的循环验证按钮和界面行为
- 测试人员在云虚拟机、Docker 容器或沙箱中自动化完整的用户流程,如登录、上传文件、提交表单
- 安全团队对 Web 表单做模糊测试,注入 XSS 或 SQL 载荷后截图检查错误、崩溃或异常行为
- 需要在表单中填入多条字段并逐项 Tab 切换的自动化录入场景
- 开发者需要在本机小而密集的 UI 元素上精确点击,先用 zoom 裁剪窗口再操作
- 只能通过 shell、API 或 headless 方式完成的任务——SKILL.md 明确说明本技能用于『无法通过 shell 或 API 实现的可视化交互』
- 不愿安装 cua CLI 及其运行时(沙箱/Spaces/驱动)的用户——技能完全依赖 `cua` 命令
- 想要 AI 自动标注屏幕元素但不愿提供 ANTHROPIC_API_KEY 的团队——无 key 时只能自己读原始截图
如何安装这个 Skill?
- 本评审为静态源码评审(置信度低),未执行任何命令;示例可用性未经实际验证。
- 安装命令 curl -fsSL https://cua.ai/install.sh | sh 属于远程脚本执行,建议先审查脚本内容;该域名在中国大陆的可达性未经验证。
- GUI 自动化是宽权限操作:技能示例包含键入密码(SecureP@ss123)等敏感输入,用户应在受控环境中使用并知晓轨迹默认记录于 ~/.cua/trajectories/。
- AI 标注快照功能依赖 ANTHROPIC_API_KEY,会向第三方 API 发送屏幕内容,注意敏感屏幕信息的泄露风险。
- 控制本机(switch host)前请确认已了解同意机制的作用范围;沙箱/中继等远程目标的安全性依赖相应基础设施。
- 发布方未经 FollowSkills 企业注册表验证,身份视为未知;技能本身无版本号和变更记录,更新需自行跟踪上游仓库。
- Shell / 命令行
- 网络访问
- 本地文件系统
cua CLI (curl -fsSL https://cua.ai/install.sh | sh)optional ANTHROPIC_API_KEY for AI-annotated snapshots
安装 skills 所在的 cua 集合(含 cua CLI 与 Spaces 应用,macOS 26+ 默认装 Spaces):
curl -fsSL https://cua.ai/install.sh | shWindows(PowerShell):
irm https://cua.ai/install.ps1 | iex安装器会运行 cua auth login,并可选将 cua skills 和 MCP 服务器装入 Claude Code、Codex、Cursor 等 AI 编码代理:
cua auth login本技能文件位于仓库 libs/cua/skills/gui-automation/SKILL.md;SKILL.md 本身未给出单独的技能复制命令。
如何使用这个 Skill?
安装后,把下面任意一句发给 Agent 即可触发:
- 打开浏览器访问 http://127.0.0.1:3000 的注册页,填入用户名和邮箱并提交,截图验证是否显示成功提示
- 在 LibreOffice 里点击菜单 File > Export,把当前文档导出为 PDF 到 /home/user/report.pdf,全程截图确认每一步
- 对这个登录表单做模糊测试:依次注入 <script>alert(1)</script> 和 SQL 注入载荷,然后截图检查有没有报错或崩溃
- 切换到我的 dev 沙箱,打开文件上传对话框,选择 /home/user/report.pdf 并上传,验证页面上显示文件名
技能在代理需要可视化操作 GUI 时触发,核心是「Look → Act → Verify」循环:截图查看、执行操作、再截图验证,反复直到完成,最后分享轨迹回放。先连接目标(沙箱、relay Space、spacesd URL 或本机):
cua do switch my-sandbox
cua do screenshot
cua do click 450 280
cua do screenshot
cua trajectory view关键选项:每次 UI 变化后必须重新截图(坐标会过期);点击小目标前用 cua do zoom "App Name" 使坐标变为窗口相对坐标,完成后 cua do unzoom 恢复;用 cua do --no-record click x y 可对单条操作禁用轨迹录制;本机需一次性 cua do-host-consent 授权。
这个 Skill 有哪些优点和局限?
- 跨环境通用:云 VM、Docker 容器、本机和沙箱都可作为操作目标
- 自动录制操作轨迹并支持回放查看,便于审计和复现
- zoom 功能提供窗口相对坐标,解决小元素点击精度问题
- 命令参考详尽,涵盖点击、输入、拖拽、窗口管理、滚动等完整 GUI 动作集
- 依赖坐标点击,屏幕变化后坐标即失效,需严格遵循每次操作后重新截图的纪律
- AI 标注屏幕功能需要额外的 ANTHROPIC_API_KEY,且产生相应的 API 成本
- SKILL.md 未提供自动化测试套件或成功率数据,实际可靠性需自行验证
- Cua Spaces 应用及 cua-spacesd 为 FSL-1.1-MIT 源码可用许可(非 MIT),商用托管需查看 COMMERCIAL.md 条款
这个 Skill 与同类方案有什么区别?
与相关 Skills 并排比较;分数均按同一 FSRS 标准得出。
| Skill | FS 评分 | Star 数 | 最近更新 | License |
|---|---|---|---|---|
| Cua GUI 自动化技能 本页 | 51 · 谨慎使用 | ★ 29k | 今天 | MIT |
| Cua Driver 技能 | 58 · 推荐 | ★ 29k | 今天 | MIT |
| cmux Computer Use 技能 | 50 · 谨慎使用 | ★ 28k | 今天 | NOASSERTION |
| Cua Driver GUI 自动化技能 | 61 · 推荐 | ★ 29k | 今天 | MIT |
| 跨平台屏幕截图助手 ✓ OpenAI · 官方 | 46 · 谨慎使用 | ★ 28k | 3 个月前 | — |
README 将本仓库定位为『Computer-Use 2.0』方案:代理在同一任务中可在代码、API 与图形界面之间切换;与仅在图形界面层操作的单一 computer-use 工具相比,Cua 还提供沙箱 SDK、Lume 本地 VM 和 Cua Bench 评测环境。SKILL.md 未列出具体竞品名称。
FollowSkills 如何评估这个 Skill?
加分项:连接本机前要求显式的一键同意(cua do-host-consent),默认目标为沙箱/中继等远程环境,所有操作自动记录轨迹且提供 --no-record 例外,截图数据流披露较清楚。扣分项:安装方式为 curl | sh 远程脚本(供应链透明度弱),GUI 自动化本质上是宽权限操作(点击、输入、shell、剪贴板),技能未对敏感输入(如示例中的密码键入)给出风险提示或最小化指引,回滚依赖轨迹记录而非真正撤销机制。给予中等偏上的 14 分。
SKILL.md 与 command-reference.md 内容自洽,命令语法表与参考文件一致,工作流(Look→Act→Verify)可复现路径清晰,坐标失效等边界有提醒。扣分项:静态评审无法执行验证,未展示错误反馈示例(命令失败时如何诊断)、无测试证据覆盖本技能关键路径,sandbox/relay 等前置依赖的可用性未在本技能内说明。封顶 9 分。
触发条件(需要视觉交互、无法通过 shell/API 完成的任务)和适用环境(云 VM、Docker、本机、沙箱)声明明确,zoom 等技巧覆盖精度边界。扣分项:未声明明确的非适用范围(如无头/无显示环境),ANTHROPIC_API_KEY 依赖的 snapshot 功能对中国大陆网络可达性未披露,中文场景支持无说明。给 8 分。
信息架构良好:SKILL.md 主体精简、细节下沉到 references/command-reference.md(渐进披露),命令参考来自 --help,许可证(MIT)与仓库维护责任(SECURITY.md、贡献指南)清楚。扣分项:技能本身无版本号或变更记录,引用文件是否随技能同步更新无版本治理,已知限制(平台差异、权限要求)披露不完整。给 10 分。
面向真实需求(GUI 测试、表单填写、端到端 QA),示例直接可用且格式统一,轨迹回放为用户提供了可核查的输出。扣分项:静态评审无法验证示例实际产出,marginal value 依赖 cua CLI 生态安装成功与否,未提供代表任务的完成证据或与其他方案(如 Playwright、原生 a11y API)的对比。给 6 分。
仓库含真实 CI 工作流和测试套件,但评审材料中未见覆盖本技能关键路径(GUI 点击/键入)的可独立复现测试证据;命令参考声称源自 --help,属作者自述。事实与推断尚可区分,但第三方佐证与执行复现不足。给 4 分。
点击维度查看打分理由
证据充分度:低 — 主要依赖静态检查、作者材料或有限演示;适合发现线索,不适合做高风险决策。
查看完整评分方法 →