Remote GPU Trainer:深度学习实验全流程 Agent Skill
覆盖 RUN → VERIFY → DELIVER 三阶段:把训练作业安全跑完、验证数字真实、交付可复现的图表,专治租用 GPU 的计费陷阱与不可逆销毁。
证据显示安全设计成熟:销毁/关机前有 Iron Law 证据门(PULL_MANIFEST、SHA-256、逐字节校验、用户显式确认)、禁止静默删除与改路由/DNS、密钥经 stdin、严格 host-key 校验、Paramiko 回退需记录证据且失败即关闭。扣分:整体权限面广(SSH、计费动词、清理脚本),Paramiko 单套接字回退路径复杂,静态审阅无法验证其安全实现细节。
指令自洽性高:渐进式披露结构清晰、平台verb模型一致、CI 中有结构性可达性 evals 与 reconcile 单元测试。扣分:静态审查无法复现关键路径;六份以上 profile 与数十个 reference/script 的实际一致性未经执行验证;README 自述六个平台 profile 未经实测,失败反馈质量只能部分推断。
受众与场景明确(自有/租用GPU、AutoDL、SSH、调试、验证、交付),非适用范围(SkyPilot/dstack/Modal 场景)明确声明,触发词含中文且覆盖国内平台与镜像,对中国用户环境适配良好。扣分:触发条件宽泛(几乎所有训练任务都可能命中),语义触发精度缺乏实际调用证据。
分层文档结构优秀:hub + references + profiles + scripts + examples + evals;MIT 许可证明确、版本 v1.0.0、 SECURITY.md、维护路径(self-improvement、staleness 检查、verified 时间戳)齐备。扣分:无独立 CHANGELOG,部分 DELIVER 层被标记为 legacy 非规范,存在跨技能依赖的历史包袱与隐藏假设。
方法论价值高:RUN→VERIFY→DELIVER 全链路、可运行示例、单一真源交付架构,边际价值明显(覆盖平台文档不含的运维与验证知识)。扣分:静态上限 7;实际输出(图表/导出胶囊)的直接可用性未经执行验证,代表产物未核实。
仓库含真实 CI workflow(evals.yml:结构可达性 evals + reconcile 单元测试 + staleness 检查)、evals/RESULTS.md 声称的导航记录、逐条引用并盖 verified 时间戳的计费事实。扣分:静态上限附近;测试覆盖的是结构性漂移与单个脚本,不覆盖技能关键路径(训练、拉取、销毁门)的端到端复现,作者自述六个平台 profile 未实测。
- 静态审阅未执行任何代码:teardown/计费等涉及金钱的事实使用前请按 skill 自身要求对照平台当前文档复核(6个平台 profile 作者自述未实测)。
- 销毁/关机不可逆:即使遵循 Iron Law,也务必亲自核对本地 PULL_VERIFIED. 再确认计费动作。
- 该技能会深度操作远程主机与计费动作,建议先在小额/短租实例上试用;publisher 身份未经验证。
- 跨技能引用(research-artifact-hygiene、mirror-research-artifacts 等)为可选依赖,缺失时部分 DELIVER 指引标记为 legacy。
这个 Skill 能做什么,适合哪些场景?
这是一个面向深度学习实验全生命周期的 Agent Skill,核心在于远程租用 GPU(AutoDL、RunPod、vast.ai、Lambda、Paperspace 及国内平台)上的运维知识。它把'在别人的机器上做短期租客'的关键判断——断连存续、结果先于实例存活、安全停表——写成了可执行的检查点。RUN 之外还延伸到 VERIFY(判断一个数是 bug、真效应还是噪声)和 DELIVER(让每个数字成为不可变证据层的确定性函数)。六份平台 profile 各自锁定具体路径、计费动词与 spot 规则,核心逻辑则跨平台不变。对于在租用卡上跑长任务、或常被'关机仍计费''checkpoint 没写进去'这类问题坑过的用户,这个 skill 提供的是一份按操作顺序编排的护栏。
SKILL.md 是常驻路由层:先按'自有 vs 租用'分流到 run-local 或 run-remote,再进入六阶段远程生命周期(环境/磁盘审计、SSH 凭据、租卡前 CPU 冒烟、detached 启动、四层持久监控、关闭导出)。平台 profile(8 个)绑定具体命令、计费动词(如 AutoDL 关机停表留盘、RunPod terminate、vast.ai destroy)与网络/镜像设置。references/training/ 提供 8 个按症状路由的调试文件(OOM、多卡挂起、NaN、吞吐、断点续训、收敛、数据管线)。references/verifying/ 提供 14 探针方法论判断结果真伪。scripts/ 含可运行模板:监控(mem_monitor、gpu_health、reap_vram_zombies)、传输与聚合(aggregate_to_fs、build_pull_manifest、verify_local)、对账与取证(reconcile.py、wandb_forensics.py、check_staleness.py)。拆卸前执行'铁律':必须用 SHA-256 清单逐字节核对拉回结果并写入 PULL_VERIFIED.,且用户显式批准后才允许任何不可逆的销毁动作。
- 在 AutoDL 上跑数天的训练任务,担心 SSH 断连或实例回收丢结果,需要断点续训加拆卸前核验的用户
- 首次使用 RunPod / vast.ai 等平台,不确定 stop 还是 terminate 才能停止计费、避免磁盘继续扣费的用户
- 训练出现 OOM、DDP 挂起、loss 变 NaN 或'跑了但不收敛',需要按症状定位根因的研究者
- 得到一个'显著提升'的结果,想系统排查泄漏、不公平对比或方差后再写进论文的作者
- 需要跑消融扫描并在多平台之间复用同一套操作模型(up/push/run/watch/pull/down)的用户
- Windows + Clash/Mihomo 环境下 SSH 高端口 banner 超时、fake-IP 或 TUN 干扰远程连接的用户
这个 Skill 有哪些优点和局限?
- 罕见的深度:覆盖从租卡前的 CPU 冒烟到拆卸后的本地校验的完整链路,每个阶段都有可运行的门禁
- 平台计费陷阱写得具体(如 AutoDL 关机停表留盘、RunPod stop 仍按 2 倍计费),并标注 verified 日期与出处
- VERIFY 层提供 14 探针方法论,明确'审计→披露'而非硬性拦截,尊重科研判断
- 拆卸铁律用 SHA-256 逐字节核对,从机制上防止'日志说完成了就相信'
- 自带 evals 回归护栏与 worked example,且完全可独立安装,不依赖任何配套 skill
- 六个非 AutoDL 平台 profile 来自官方文档与社区报告研究,作者未逐一实测,计费/拆卸事实仍需按当前文档复核
- VERIFY 与 DELIVER 的方法论来自作者个人科研实践,无第三方基准佐证
- 部分持久监控配方假设宿主有后台任务运行器与调度器,其他 agent 需按 §7 映射
- 引用的配套 skill(nature-figure、experiment-verifier 等)需另行安装
如何安装这个 Skill?
克隆整个文件夹到 agent 的 skills 目录并重启 agent:
Claude Code:
git clone https://github.com/Hanyuyuan6/remote-gpu-trainer.git ~/.claude/skills/remote-gpu-trainer
OpenAI Codex:
git clone https://github.com/Hanyuyuan6/remote-gpu-trainer.git ~/.agents/skills/remote-gpu-trainer
其他兼容 agent(Cursor、Trae、Gemini CLI、Goose 等)放入各自的 skills 目录即可,目录名须保持 remote-gpu-trainer。可选校验:uvx --from skills-ref agentskills validate <路径>。README 未说明除克隆外的其他安装方式。
如何使用这个 Skill?
安装后自动触发,无需按名称调用。典型触发场景:'在 AutoDL 上启动并监控一个训练任务'、'这个 loss 一直是 NaN,帮我排查'、'结果拉回来之后帮我确认数字是不是真的,然后再销毁实例'。Skill 会先让你选平台 profile,然后按六阶段推进;每个阶段的产物(CPU 冒烟结果、checkpoint、拉回清单、verify 报告)都有可运行的检查。注意拆卸/计费动作永远需要你显式确认,skill 只审计与披露,不会替你按下销毁按钮。
这个 Skill 与同类方案有什么区别?
与 SkyPilot、dstack、Modal 等基础设施编排器互补而非竞争:它们负责跨云搬箱与价格寻优,本 skill 在你已有的裸租实例上工作,尤其是它们不覆盖的 AutoDL 与国内平台,并延伸到'数字是否真实'与'交付是否可复现'这两个编排器完全不进入的阶段。作者建议的用法是:让 SkyPilot/dstack 移动机器,用本 skill 保证断点续训与正确回收。