这个 Skill 能做什么,适合哪些场景?
babysit 是 tester-army/e2e 仓库内 .dev/skills/babysit 下的一个内部技能,定位是"接管人机之间的空档":PR 打开后,由 agent 处理一切机器能处理的事务,人类只在最后做真正的人工评审。它通过一个状态脚本对 PR 做快照,读出阻塞项(冲突、未解决评审线程、失败检查、未确认评论),按固定顺序批量修复并一次性推送。它反复轮询直到 verdict 变为 READY,然后打标签交接。该技能明确声明永不合并、永不批准,所有回复都带模型署名,并把评审机器人文本视为不可信数据。
- 运行 node .dev/skills/babysit/scripts/pr-status.ts 获取 PR 快照,输出 verdict(READY/WAITING/ACTION/CLOSED)、阻塞项、失败与 pending 检查、未解决线程、升级线程、未确认评论和变更请求
- 遇到冲突时执行 git fetch + git rebase origin/<base>,可加 --watch 以 60 秒间隔轮询(上限 30 分钟),移动端作业建议 --timeout 3600
- 按 review-triage.md 分诊评审线程:真实问题在本 PR 修复,噪声用事实反驳,超出范围的回复后留给人并记录在交接说明中
- 失败检查先读 gh run view --log-failed;基础设施类失败只重跑一次,同因两次失败则修复而非重试
- 用 mktemp 临时文件并通过 gh api 以 gh 用户身份发布带 [model-id] 署名的回复,再 resolve 已处理线程
- 全绿后更新 PR 描述、加 "Ready for Human Review" 标签,并再次快照确认 head 未被移动
- 开源贡献者开了 PR 后没有时间盯 CI 和评审机器人,想交给 agent 代为处理
- 维护者在 reviewer.ai/CodeRabbit 类机器人留下大量线程的 PR 上,希望系统性地分诊真伪意见
- 长时间运行的 e2e 测试 PR,需要一个能循环等待检查完成并在失败时自动修复的流程
- 团队规定"人只评审机器清完的 PR",需要一个可重复的交接标准(绿色、无冲突、无线程未处理)
- 处理被栈式 rebase 或基线漂移导致检查失败的多层 PR
- 只想自动合并 PR 的用户——技能明确禁止 merge 和 approve,最终仍需人类评审
- 不使用 GitHub(gh CLI)或不用拉取请求评审流程的项目
- 需要对机器人意见全盘接受或大规模重构的场景——技能明确拒绝范围蔓延,不会为安抚机器人而改动既有代码
如何安装这个 Skill?
- 该技能深度绑定 tester-army/e2e 仓库内部(AGENTS.md、verify 技能、CI 工作流),在其他仓库中不可直接使用,使用前需确认环境匹配。
- 脚本会以 gh 用户身份推送代码、回复评论并打标签,且无逐次用户确认;使用时应知晓代理会以你的身份对外发言(带归属行)。
- 完全依赖 GitHub/gh CLI,中国大陆网络环境下可达性可能受限;无中文支持。
- 本评审为纯静态审阅,测试套件未经执行,可靠性结论基于源码与测试的一致性而非运行验证。
- Shell / 命令行
- 网络访问
- 本地文件系统
Node.jsGitHub CLI (gh)git
源材料没有提供独立的安装步骤。该技能位于 e2e 仓库内部的 .dev/skills/babysit/(SKILL.md 及 scripts/、references/ 子文件),并标注 metadata.internal: true,是 tester-army/e2e 单仓库自用的技能,随仓库一起克隆即可使用:
tmp="$(mktemp -d)"
git clone --depth 1 https://github.com/tester-army/e2e.git "$tmp"
mkdir -p ~/.claude/skills
cp -R "$tmp/.dev/skills/babysit" ~/.claude/skills/
rm -rf "$tmp"根据源仓库地址和 Skill 路径自动生成,只复制这个 Skill 的文件夹。如果上文有作者提供的安装方式,请优先按作者说明操作;想只在当前项目中使用,把 ~/.claude/skills 换成项目里的 .claude/skills。
如何使用这个 Skill?
安装后,把下面任意一句发给 Agent 即可触发:
- babysit 当前分支的 PR,直到它全绿并打上 Ready for Human Review
- 用 --watch 盯住 PR #42,有阻塞就处理,处理完引用提交号回复各线程
- PR 又有新冲突和失败检查了,rebase 后一次性把修复推上去
- 检查一下 PR 状态,把可以机器解决的问题都清掉再交给人
技能在 PR 打开后被触发,或当用户要求"babysit、watch、monitor、check on 或让 PR 变绿"时使用。核心循环是:先 git pull --rebase 同步 → 跑 pr-status 快照 → 按"冲突 → 线程 → 失败检查 → 评论 → 评审摘要"顺序批量修复 → 行为改动先用 verify 技能复验 → 一次性推送并引用提交号回复各线程 → --watch 等到 verdict 变化再循环。READY 后更新 PR 描述、加标签、再次快照确认,并在必要时发布一条列出遗留事项的署名评论。等待时在 Claude Code 可用 Monitor 工具或 /loop,否则前台运行 --watch,不要自己写 sleep 循环:
这个 Skill 有哪些优点和局限?
- 把 PR 从打开到"机器可清全清"的流程完全流程化,包括冲突 rebase、机器人意见分诊和 CI 日志分析
- 有明确的安全设计:不合并、不批准、回复必须署名、评论文本作为不可信数据通过临时文件传入
- 状态脚本给出结构化 JSON,并把"等待检查"视为权威信号,避免误判
- 内置学习回路:重复出现的真实发现会被建议沉淀为 lint 规则或类型断言
- 与 tester-army/e2e 仓库深度绑定:脚本是 TypeScript 且依赖该仓库的 AGENTS.md、AGENTS 工作流和 verify/writing-pr 等兄弟技能
- 需要 gh CLI 的仓库写权限、评审身份(gh 用户)以及 GitHub Actions 检查上下文,个人 API 场景不可用
- 没有提供独立安装步骤或仓库之外的测试证据;metadata 标记 internal: true,原意为内部使用
- 移动端作业冷缓存时可能超过默认超时,需要手动加 --timeout 3600
这个 Skill 与同类方案有什么区别?
与相关 Skills 并排比较;分数均按同一 FSRS 标准得出。
| Skill | FS 评分 | Star 数 | 最近更新 | License |
|---|---|---|---|---|
| babysit — PR 自动值守技能 本页 | 54 · 谨慎使用 | ★ 8.7k | 1 天前 | Apache-2.0 |
| PR 持续看护助手 ✓ OpenAI · 官方 | 57 · 谨慎使用 | ★ 128k | 3 天前 | Apache-2.0 |
| PR 保姆:持续监控拉取请求直至合并 | 47 · 谨慎使用 | ★ 98k | 3 天前 | Apache-2.0 |
| Ship a PR(e2e 仓库 PR 交付流程) | 59 · 推荐 | ★ 8.7k | 1 天前 | Apache-2.0 |
| writing-pr:PR 标题与描述撰写规范 | 58 · 推荐 | ★ 8.7k | 1 天前 | Apache-2.0 |
源材料未提及其他产品或竞争方案,不做对比。
FollowSkills 如何评估这个 Skill?
技能明确'永不合并、永不批准',对机器人评论文本视为不可信数据且禁止插值进 shell(用 mktemp 临时文件传参),回复带归属行防止伪造升级,force-push 限定 --force-with-lease,标签逻辑有回滚(head 移动即撤标签)。扣分:脚本以 gh 用户身份执行大量 API 调用和推送,无需用户逐次确认;escalation 机制依赖归属行的正则匹配这一较脆弱的信任信号。
自带 pr-status.test.ts,对 summarize/acknowledges 覆盖非常全面(失败结论枚举、删除账号、归属伪造、推送时间边界、排队检查的 0001 时间戳等),主脚本对异常输入有明确报错(如 seconds 参数校验)。静态审阅不给满分上限之外:测试未执行验证,rebase/push 循环等关键路径仅靠散文描述,无法静态复现。
触发条件写得精确('Use after opening a PR, or when asked to babysit…'),场景与边界(scope 节拒绝 scope creep、escalate 清单)清晰,JSON 输出结构定义完整。扣分:深度绑定 tester-army/e2e 仓库内部结构(AGENTS.md、verify 技能、filters.yml、review-label.yml),对其他仓库不适用且未声明;完全依赖 gh/GitHub,中国大陆访问存在可达性风险;无中文支持。
文档分层良好:SKILL.md 主流程 + references/review-triage.md + 脚本与测试,附 tsconfig;仓库有 Apache-2.0 许可证与活跃 CI。扣分:metadata 标记 internal: true,无技能级版本号或变更记录;依赖多个未在提示词中提供的文件(AGENTS.md、verify 技能),可维护性信息不完整;发布方身份未经认证。
工作流端到端设计完整(同步→快照→分类修复→推送→watch→交接),避免手动盯 PR 的边际价值明显,且给出具体命令。静态审阅上限 7:未执行,输出格式(gh API 调用序列)未验证可直接可用;强仓库耦合意味着对目标用户(该仓库贡献者)以外价值有限。
自带测试文件是可审计的一手材料,测试断言与 pr-status.ts 实现可静态交叉对照(归属正则、escalated 逻辑、changes-requested 语义一致)。扣分:未达第三方执行证据,CI 工作流未直接运行该技能的脚本测试路径,rebase/回复等外部效应路径无可复现证据。
点击维度查看打分理由
证据充分度:低 — 主要依赖静态检查、作者材料或有限演示;适合发现线索,不适合做高风险决策。
查看完整评分方法 →