开发与工程 gpupytorchautodlrunpodvast-aidistributed-trainingexperiment-trackingreproducibilityspot-instancesmlops

Remote GPU Trainer:深度学习实验全流程 Agent Skill

覆盖 RUN → VERIFY → DELIVER 三阶段:把训练作业安全跑完、验证数字真实、交付可复现的图表,专治租用 GPU 的计费陷阱与不可逆销毁。

FollowSkills 评估 · FSRS-2.0
推荐
65/ 100 五分制 3.3 / 5
1 2 3 4 5 6
1信任安全20 / 25 · 4.0/5

证据显示安全设计成熟:销毁/关机前有 Iron Law 证据门(PULL_MANIFEST、SHA-256、逐字节校验、用户显式确认)、禁止静默删除与改路由/DNS、密钥经 stdin、严格 host-key 校验、Paramiko 回退需记录证据且失败即关闭。扣分:整体权限面广(SSH、计费动词、清理脚本),Paramiko 单套接字回退路径复杂,静态审阅无法验证其安全实现细节。

2可靠稳定9 / 20 · 2.3/5

指令自洽性高:渐进式披露结构清晰、平台verb模型一致、CI 中有结构性可达性 evals 与 reconcile 单元测试。扣分:静态审查无法复现关键路径;六份以上 profile 与数十个 reference/script 的实际一致性未经执行验证;README 自述六个平台 profile 未经实测,失败反馈质量只能部分推断。

3适用触发12 / 15 · 4.0/5

受众与场景明确(自有/租用GPU、AutoDL、SSH、调试、验证、交付),非适用范围(SkyPilot/dstack/Modal 场景)明确声明,触发词含中文且覆盖国内平台与镜像,对中国用户环境适配良好。扣分:触发条件宽泛(几乎所有训练任务都可能命中),语义触发精度缺乏实际调用证据。

4规范维护13 / 15 · 4.3/5

分层文档结构优秀:hub + references + profiles + scripts + examples + evals;MIT 许可证明确、版本 v1.0.0、 SECURITY.md、维护路径(self-improvement、staleness 检查、verified 时间戳)齐备。扣分:无独立 CHANGELOG,部分 DELIVER 层被标记为 legacy 非规范,存在跨技能依赖的历史包袱与隐藏假设。

5有效结果6 / 15 · 2.0/5

方法论价值高:RUN→VERIFY→DELIVER 全链路、可运行示例、单一真源交付架构,边际价值明显(覆盖平台文档不含的运维与验证知识)。扣分:静态上限 7;实际输出(图表/导出胶囊)的直接可用性未经执行验证,代表产物未核实。

6证据核验5 / 10 · 2.5/5

仓库含真实 CI workflow(evals.yml:结构可达性 evals + reconcile 单元测试 + staleness 检查)、evals/RESULTS.md 声称的导航记录、逐条引用并盖 verified 时间戳的计费事实。扣分:静态上限附近;测试覆盖的是结构性漂移与单个脚本,不覆盖技能关键路径(训练、拉取、销毁门)的端到端复现,作者自述六个平台 profile 未实测。

证据充分度: 评估于 2026年9月10日 审查版本 892e5674ccf3
使用前请注意
  • 静态审阅未执行任何代码:teardown/计费等涉及金钱的事实使用前请按 skill 自身要求对照平台当前文档复核(6个平台 profile 作者自述未实测)。
  • 销毁/关机不可逆:即使遵循 Iron Law,也务必亲自核对本地 PULL_VERIFIED. 再确认计费动作。
  • 该技能会深度操作远程主机与计费动作,建议先在小额/短租实例上试用;publisher 身份未经验证。
  • 跨技能引用(research-artifact-hygiene、mirror-research-artifacts 等)为可选依赖,缺失时部分 DELIVER 指引标记为 legacy。
评估证据 [1][2][3][4][5]
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

这是一个面向深度学习实验全生命周期的 Agent Skill,核心在于远程租用 GPU(AutoDL、RunPod、vast.ai、Lambda、Paperspace 及国内平台)上的运维知识。它把'在别人的机器上做短期租客'的关键判断——断连存续、结果先于实例存活、安全停表——写成了可执行的检查点。RUN 之外还延伸到 VERIFY(判断一个数是 bug、真效应还是噪声)和 DELIVER(让每个数字成为不可变证据层的确定性函数)。六份平台 profile 各自锁定具体路径、计费动词与 spot 规则,核心逻辑则跨平台不变。对于在租用卡上跑长任务、或常被'关机仍计费''checkpoint 没写进去'这类问题坑过的用户,这个 skill 提供的是一份按操作顺序编排的护栏。

SKILL.md 是常驻路由层:先按'自有 vs 租用'分流到 run-local 或 run-remote,再进入六阶段远程生命周期(环境/磁盘审计、SSH 凭据、租卡前 CPU 冒烟、detached 启动、四层持久监控、关闭导出)。平台 profile(8 个)绑定具体命令、计费动词(如 AutoDL 关机停表留盘、RunPod terminate、vast.ai destroy)与网络/镜像设置。references/training/ 提供 8 个按症状路由的调试文件(OOM、多卡挂起、NaN、吞吐、断点续训、收敛、数据管线)。references/verifying/ 提供 14 探针方法论判断结果真伪。scripts/ 含可运行模板:监控(mem_monitor、gpu_health、reap_vram_zombies)、传输与聚合(aggregate_to_fs、build_pull_manifest、verify_local)、对账与取证(reconcile.py、wandb_forensics.py、check_staleness.py)。拆卸前执行'铁律':必须用 SHA-256 清单逐字节核对拉回结果并写入 PULL_VERIFIED.,且用户显式批准后才允许任何不可逆的销毁动作。

  1. 在 AutoDL 上跑数天的训练任务,担心 SSH 断连或实例回收丢结果,需要断点续训加拆卸前核验的用户
  2. 首次使用 RunPod / vast.ai 等平台,不确定 stop 还是 terminate 才能停止计费、避免磁盘继续扣费的用户
  3. 训练出现 OOM、DDP 挂起、loss 变 NaN 或'跑了但不收敛',需要按症状定位根因的研究者
  4. 得到一个'显著提升'的结果,想系统排查泄漏、不公平对比或方差后再写进论文的作者
  5. 需要跑消融扫描并在多平台之间复用同一套操作模型(up/push/run/watch/pull/down)的用户
  6. Windows + Clash/Mihomo 环境下 SSH 高端口 banner 超时、fake-IP 或 TUN 干扰远程连接的用户

这个 Skill 有哪些优点和局限?

优点
  • 罕见的深度:覆盖从租卡前的 CPU 冒烟到拆卸后的本地校验的完整链路,每个阶段都有可运行的门禁
  • 平台计费陷阱写得具体(如 AutoDL 关机停表留盘、RunPod stop 仍按 2 倍计费),并标注 verified 日期与出处
  • VERIFY 层提供 14 探针方法论,明确'审计→披露'而非硬性拦截,尊重科研判断
  • 拆卸铁律用 SHA-256 逐字节核对,从机制上防止'日志说完成了就相信'
  • 自带 evals 回归护栏与 worked example,且完全可独立安装,不依赖任何配套 skill
局限
  • 六个非 AutoDL 平台 profile 来自官方文档与社区报告研究,作者未逐一实测,计费/拆卸事实仍需按当前文档复核
  • VERIFY 与 DELIVER 的方法论来自作者个人科研实践,无第三方基准佐证
  • 部分持久监控配方假设宿主有后台任务运行器与调度器,其他 agent 需按 §7 映射
  • 引用的配套 skill(nature-figure、experiment-verifier 等)需另行安装

如何安装这个 Skill?

克隆整个文件夹到 agent 的 skills 目录并重启 agent:

Claude Code:
git clone https://github.com/Hanyuyuan6/remote-gpu-trainer.git ~/.claude/skills/remote-gpu-trainer

OpenAI Codex:
git clone https://github.com/Hanyuyuan6/remote-gpu-trainer.git ~/.agents/skills/remote-gpu-trainer

其他兼容 agent(Cursor、Trae、Gemini CLI、Goose 等)放入各自的 skills 目录即可,目录名须保持 remote-gpu-trainer。可选校验:uvx --from skills-ref agentskills validate <路径>。README 未说明除克隆外的其他安装方式。

如何使用这个 Skill?

安装后自动触发,无需按名称调用。典型触发场景:'在 AutoDL 上启动并监控一个训练任务'、'这个 loss 一直是 NaN,帮我排查'、'结果拉回来之后帮我确认数字是不是真的,然后再销毁实例'。Skill 会先让你选平台 profile,然后按六阶段推进;每个阶段的产物(CPU 冒烟结果、checkpoint、拉回清单、verify 报告)都有可运行的检查。注意拆卸/计费动作永远需要你显式确认,skill 只审计与披露,不会替你按下销毁按钮。

这个 Skill 与同类方案有什么区别?

与 SkyPilot、dstack、Modal 等基础设施编排器互补而非竞争:它们负责跨云搬箱与价格寻优,本 skill 在你已有的裸租实例上工作,尤其是它们不覆盖的 AutoDL 与国内平台,并延伸到'数字是否真实'与'交付是否可复现'这两个编排器完全不进入的阶段。作者建议的用法是:让 SkyPilot/dstack 移动机器,用本 skill 保证断点续训与正确回收。

常见问题

用这个 skill 会被额外收费吗?
Skill 本身是开源 MIT 许可的静态知识库,不调用任何付费 API。风险在于它管理的租用 GPU 本身——skill 的设计目标恰恰是通过拆卸铁律与计费动词表避免你为遗忘的实例买单。
我的平台不在 profile 列表里怎么办?
generic-ssh profile 覆盖裸 SSH、Slurm、K8s、Colab/Kaggle 等场景,核心生命周期对平台不变。具体路径与计费动词可能需要你按平台文档补全。
skill 会不会自动销毁我的实例或删除文件?
不会。任何成本相关或不可逆动作(terminate/destroy/删除持久文件)都要求你显式批准;skill 的原则是'审计→披露而非拦截',它只确保你看到完整证据后再做决定。
README 里的'evals passing'意味着什么?
evals/ 是一个无需 API key 的检索漂移护栏:检查每个典型场景的答案是否仍在文档记录的位置,并记录新 agent 的导航运行结果。它验证的是文档结构完整性,不是平台事实的实时正确性。

相关 Skills