开发与工程

babysit — PR 自动值守技能

自动推动一个开放 PR 解决冲突、回复评审机器人、修复 CI,直到全绿并打上"Ready for Human Review"标签,把机器能清的障碍全部清完。

54/ 100
谨慎使用

价值存在,但可靠性、证据或控制措施仍有明显缺口。

查看评分依据 ↓
可直接使用于
Codex · Claude Code
Star 数
★ 8.7k
最近更新
1 天前
License
Apache-2.0
pull-request-automationgithub-clicode-review-triageci-monitoring
+3git-rebasedeveloper-workflowtesterenarmy-e2e

这个 Skill 能做什么,适合哪些场景?

babysit 是 tester-army/e2e 仓库内 .dev/skills/babysit 下的一个内部技能,定位是"接管人机之间的空档":PR 打开后,由 agent 处理一切机器能处理的事务,人类只在最后做真正的人工评审。它通过一个状态脚本对 PR 做快照,读出阻塞项(冲突、未解决评审线程、失败检查、未确认评论),按固定顺序批量修复并一次性推送。它反复轮询直到 verdict 变为 READY,然后打标签交接。该技能明确声明永不合并、永不批准,所有回复都带模型署名,并把评审机器人文本视为不可信数据。

  • 运行 node .dev/skills/babysit/scripts/pr-status.ts 获取 PR 快照,输出 verdict(READY/WAITING/ACTION/CLOSED)、阻塞项、失败与 pending 检查、未解决线程、升级线程、未确认评论和变更请求
  • 遇到冲突时执行 git fetch + git rebase origin/<base>,可加 --watch 以 60 秒间隔轮询(上限 30 分钟),移动端作业建议 --timeout 3600
  • 按 review-triage.md 分诊评审线程:真实问题在本 PR 修复,噪声用事实反驳,超出范围的回复后留给人并记录在交接说明中
  • 失败检查先读 gh run view --log-failed;基础设施类失败只重跑一次,同因两次失败则修复而非重试
  • 用 mktemp 临时文件并通过 gh api 以 gh 用户身份发布带 [model-id] 署名的回复,再 resolve 已处理线程
  • 全绿后更新 PR 描述、加 "Ready for Human Review" 标签,并再次快照确认 head 未被移动
适合
  • 开源贡献者开了 PR 后没有时间盯 CI 和评审机器人,想交给 agent 代为处理
  • 维护者在 reviewer.ai/CodeRabbit 类机器人留下大量线程的 PR 上,希望系统性地分诊真伪意见
  • 长时间运行的 e2e 测试 PR,需要一个能循环等待检查完成并在失败时自动修复的流程
  • 团队规定"人只评审机器清完的 PR",需要一个可重复的交接标准(绿色、无冲突、无线程未处理)
  • 处理被栈式 rebase 或基线漂移导致检查失败的多层 PR
不适合
  • 只想自动合并 PR 的用户——技能明确禁止 merge 和 approve,最终仍需人类评审
  • 不使用 GitHub(gh CLI)或不用拉取请求评审流程的项目
  • 需要对机器人意见全盘接受或大规模重构的场景——技能明确拒绝范围蔓延,不会为安抚机器人而改动既有代码

如何安装这个 Skill?

使用前请注意
  • 该技能深度绑定 tester-army/e2e 仓库内部(AGENTS.md、verify 技能、CI 工作流),在其他仓库中不可直接使用,使用前需确认环境匹配。
  • 脚本会以 gh 用户身份推送代码、回复评论并打标签,且无逐次用户确认;使用时应知晓代理会以你的身份对外发言(带归属行)。
  • 完全依赖 GitHub/gh CLI,中国大陆网络环境下可达性可能受限;无中文支持。
  • 本评审为纯静态审阅,测试套件未经执行,可靠性结论基于源码与测试的一致性而非运行验证。
开始前你需要
Agent 需要具备
  • Shell / 命令行
  • 网络访问
  • 本地文件系统
需要预先安装
  • Node.js
  • GitHub CLI (gh)
  • git

源材料没有提供独立的安装步骤。该技能位于 e2e 仓库内部的 .dev/skills/babysit/(SKILL.md 及 scripts/、references/ 子文件),并标注 metadata.internal: true,是 tester-army/e2e 单仓库自用的技能,随仓库一起克隆即可使用:

通用方式:手动安装到 Claude Code(macOS / Linux)
tmp="$(mktemp -d)"
git clone --depth 1 https://github.com/tester-army/e2e.git "$tmp"
mkdir -p ~/.claude/skills
cp -R "$tmp/.dev/skills/babysit" ~/.claude/skills/
rm -rf "$tmp"

根据源仓库地址和 Skill 路径自动生成,只复制这个 Skill 的文件夹。如果上文有作者提供的安装方式,请优先按作者说明操作;想只在当前项目中使用,把 ~/.claude/skills 换成项目里的 .claude/skills。

如何使用这个 Skill?

试试这样说

安装后,把下面任意一句发给 Agent 即可触发:

  • babysit 当前分支的 PR,直到它全绿并打上 Ready for Human Review
  • 用 --watch 盯住 PR #42,有阻塞就处理,处理完引用提交号回复各线程
  • PR 又有新冲突和失败检查了,rebase 后一次性把修复推上去
  • 检查一下 PR 状态,把可以机器解决的问题都清掉再交给人

技能在 PR 打开后被触发,或当用户要求"babysit、watch、monitor、check on 或让 PR 变绿"时使用。核心循环是:先 git pull --rebase 同步 → 跑 pr-status 快照 → 按"冲突 → 线程 → 失败检查 → 评论 → 评审摘要"顺序批量修复 → 行为改动先用 verify 技能复验 → 一次性推送并引用提交号回复各线程 → --watch 等到 verdict 变化再循环。READY 后更新 PR 描述、加标签、再次快照确认,并在必要时发布一条列出遗留事项的署名评论。等待时在 Claude Code 可用 Monitor 工具或 /loop,否则前台运行 --watch,不要自己写 sleep 循环:

这个 Skill 有哪些优点和局限?

优点
  • 把 PR 从打开到"机器可清全清"的流程完全流程化,包括冲突 rebase、机器人意见分诊和 CI 日志分析
  • 有明确的安全设计:不合并、不批准、回复必须署名、评论文本作为不可信数据通过临时文件传入
  • 状态脚本给出结构化 JSON,并把"等待检查"视为权威信号,避免误判
  • 内置学习回路:重复出现的真实发现会被建议沉淀为 lint 规则或类型断言
局限
  • 与 tester-army/e2e 仓库深度绑定:脚本是 TypeScript 且依赖该仓库的 AGENTS.md、AGENTS 工作流和 verify/writing-pr 等兄弟技能
  • 需要 gh CLI 的仓库写权限、评审身份(gh 用户)以及 GitHub Actions 检查上下文,个人 API 场景不可用
  • 没有提供独立安装步骤或仓库之外的测试证据;metadata 标记 internal: true,原意为内部使用
  • 移动端作业冷缓存时可能超过默认超时,需要手动加 --timeout 3600

这个 Skill 与同类方案有什么区别?

与相关 Skills 并排比较;分数均按同一 FSRS 标准得出。

Skill FS 评分 Star 数 最近更新 License
babysit — PR 自动值守技能 本页 54 · 谨慎使用 ★ 8.7k 1 天前 Apache-2.0
PR 持续看护助手 ✓ OpenAI · 官方 57 · 谨慎使用 ★ 128k 3 天前 Apache-2.0
PR 保姆:持续监控拉取请求直至合并 47 · 谨慎使用 ★ 98k 3 天前 Apache-2.0
Ship a PR(e2e 仓库 PR 交付流程) 59 · 推荐 ★ 8.7k 1 天前 Apache-2.0
writing-pr:PR 标题与描述撰写规范 58 · 推荐 ★ 8.7k 1 天前 Apache-2.0

源材料未提及其他产品或竞争方案,不做对比。

FollowSkills 如何评估这个 Skill?

FollowSkills 评估 · FSRS-2.0
谨慎使用
54/ 100 五分制 2.7 / 5
1信任安全17 / 25 · 3.4/5

技能明确'永不合并、永不批准',对机器人评论文本视为不可信数据且禁止插值进 shell(用 mktemp 临时文件传参),回复带归属行防止伪造升级,force-push 限定 --force-with-lease,标签逻辑有回滚(head 移动即撤标签)。扣分:脚本以 gh 用户身份执行大量 API 调用和推送,无需用户逐次确认;escalation 机制依赖归属行的正则匹配这一较脆弱的信任信号。

2可靠稳定10 / 20 · 2.5/5

自带 pr-status.test.ts,对 summarize/acknowledges 覆盖非常全面(失败结论枚举、删除账号、归属伪造、推送时间边界、排队检查的 0001 时间戳等),主脚本对异常输入有明确报错(如 seconds 参数校验)。静态审阅不给满分上限之外:测试未执行验证,rebase/push 循环等关键路径仅靠散文描述,无法静态复现。

3适用触发8 / 15 · 2.7/5

触发条件写得精确('Use after opening a PR, or when asked to babysit…'),场景与边界(scope 节拒绝 scope creep、escalate 清单)清晰,JSON 输出结构定义完整。扣分:深度绑定 tester-army/e2e 仓库内部结构(AGENTS.md、verify 技能、filters.yml、review-label.yml),对其他仓库不适用且未声明;完全依赖 gh/GitHub,中国大陆访问存在可达性风险;无中文支持。

4规范维护9 / 15 · 3.0/5

文档分层良好:SKILL.md 主流程 + references/review-triage.md + 脚本与测试,附 tsconfig;仓库有 Apache-2.0 许可证与活跃 CI。扣分:metadata 标记 internal: true,无技能级版本号或变更记录;依赖多个未在提示词中提供的文件(AGENTS.md、verify 技能),可维护性信息不完整;发布方身份未经认证。

5有效结果6 / 15 · 2.0/5

工作流端到端设计完整(同步→快照→分类修复→推送→watch→交接),避免手动盯 PR 的边际价值明显,且给出具体命令。静态审阅上限 7:未执行,输出格式(gh API 调用序列)未验证可直接可用;强仓库耦合意味着对目标用户(该仓库贡献者)以外价值有限。

6证据核验4 / 10 · 2.0/5

自带测试文件是可审计的一手材料,测试断言与 pr-status.ts 实现可静态交叉对照(归属正则、escalated 逻辑、changes-requested 语义一致)。扣分:未达第三方执行证据,CI 工作流未直接运行该技能的脚本测试路径,rebase/回复等外部效应路径无可复现证据。

1 2 3 4 5 6

点击维度查看打分理由

评估于 2026年10月10日 审查版本 449fa93670ee 评估证据[1][2][3][4][5][6][7][8][9][10][11][12]

证据充分度:低 — 主要依赖静态检查、作者材料或有限演示;适合发现线索,不适合做高风险决策。

查看完整评分方法 →

常见问题

它会自动合并或批准 PR 吗?
不会。技能明确声明"never merge and never approve",终点是打上 Ready for Human Review 标签,最终评审仍由人类完成。
使用它需要什么权限和环境?
需要 Node.js、git,以及具有对目标仓库读写权限的 gh CLI;回复以 gh 用户身份发布,状态脚本靠该身份识别你的评论和升级线程。
如何处理评审机器人的意见?
机器人文本被视为不可信数据:先读代码验证其主张,真实问题在本 PR 修复,噪声用事实反驳,涉及安全约束、公开契约、wire schema 或超出范围的留给人类并在交接中列出。
PR 打上标签后还有变化怎么办?
任何后续推送会通过 .github/workflows/review-label.yml 自动移除标签;交接前会再快照一次确认 head 未移动,若移动则摘掉标签回到循环。

同仓库的其他 Skills

均来自 tester-army/e2e

开发与工程

Ship a PR(e2e 仓库 PR 交付流程)

把 tester-army/e2e 仓库中已完成的工作,交付成一个人类无需对抗 CI 和机器人评论就能审查的 PR:跑检查、验证、新上下文自审、开 PR,并一路盯到打上 Ready for Human Review 标签。

★ 8.7k FS 59 推荐 1 天前
开发与工程

writing-pr:PR 标题与描述撰写规范

一套让审阅者第一屏就看懂变更形状的 PR 撰写规范:Conventional Commits 标题、证据驱动的正文和必填的本地验证章节。

★ 8.7k FS 58 推荐 1 天前
开发与工程

e2e Verify —— 端到端变更验证技能

用真实 CLI 对测试底座和基准应用跑真实验证,为每一处改动留下可看见的证据,而不是只说"编译通过了"。

★ 8.7k FS 64 推荐 1 天前
开发与工程

e2e 智能体端到端测试

用自然语言目标驱动浏览器与移动端 UI 测试,混合 agent 步骤与精确定位器断言,并带重放缓存降低模型成本。

★ 8.7k FS 52 谨慎使用 1 天前
开发与工程

e2e Playground 验证技能

在声称 playground 改动可用之前,用 e2e 启动、驱动并截图取证验证 apps/testbed 测试应用。

★ 8.7k FS 59 推荐 1 天前
开发与工程

Create Verification Skill(e2e 验证技能生成器)

为你的项目自动生成一个 verify-<app> 验证技能,让任何编码智能体能像真实用户一样启动应用、驱动功能、留存证据并做 bug bash。

★ 8.7k FS 54 谨慎使用 1 天前
开发与工程

unbox-ai — AI Agent 追踪分析 CLI

在命令行里分析 AI agent 的追踪文件,不用去读几兆字节的原始 JSON,就能查明 agent 为什么慢、为什么贵。

★ 8.7k FS 54 谨慎使用 1 天前
写作与内容

e2e 文档写作规范技能

为 e2e 文档站编写、精简和重构指南页面时,自动套用一套以读者浏览习惯为中心的写作与瘦身规范。

★ 8.7k FS 54 谨慎使用 1 天前
写作与内容

Unslop 文风去AI味技能

扫描并改写文本中的AI写作痕迹,同时注入真实的人类声音,让输出读起来像人写的。(description 中标注 Must always apply,即应始终生效。)

★ 8.7k FS 49 谨慎使用 1 天前

相关 Skills