NeMo-RL 自动研究助手
将 NeMo-RL 研究目标转化为可复现的迭代实验。
技能明确要求用户确认 campaign 计划后再建分支或启动 GPU 任务,禁止 destructive git 操作,并要求保留用户改动;这些措施降低了越权和不可逆风险。仍扣分,因为允许执行 shell、写磁盘、创建分支和消耗 GPU,未具体说明敏感数据、凭据、训练数据外传、第三方服务权限或全面回滚流程。
工作流、分支规则、日志字段、超时和异常分类较具体,且要求在指标提取失败时检查日志。静态证据未覆盖实际关键路径复现;依赖 nemo-rl-session-memory、launch-nemo-rl、Brev etiquette 及仓库运行环境,部分依赖内容不可见,因此扣分并受静态上限约束。
描述、触发词和不适用范围清晰,覆盖基线、迭代实验、停止条件及 local/Slurm/Kubernetes 等环境。未声明更细的输入输出契约、硬件和版本边界,也没有中文交互支持或大陆网络可达性说明;核心训练可本地运行但文档和相关服务可能依赖海外资源,因此扣分。
SKILL.md 结构清楚,并提供 git、探索思路和 TSV 模板;skill-card 给出 Apache-2.0、所有者 NVIDIA、版本线索和评估摘要。扣分原因是缺少推荐的 Instructions/Examples、author/tags 元数据,维护责任、变更日志、版本兼容策略和依赖安装说明不完整。
技能对长期 NeMo-RL 研究活动提供了可直接采用的分支、实验循环、停止规则和日志规范,benchmark 文件报告了正负触发案例及一定的效果提升。静态审查无法验证训练结果、指标正确性或端到端产出,且实际执行仍需用户提供仓库、数据、模型和算力,因此未超过静态评估上限并扣分。
存在固定 revision、具体引用文件、TSV 示例、评估任务和结果摘要,提供了一定审计线索。扣分原因是 benchmark 结果在所给文件中属于报告性材料,没有可见的覆盖关键路径的提交测试套件或可独立复现的 CI 证据,外部文档也未提供可验证内容。
- 启动训练前必须再次确认分支、数据、凭据、日志位置、资源预算和停止条件;该技能会写文件、修改 git 状态并可能消耗大量 GPU。
- 不要把训练日志、模型检查点或环境变量中的凭据写入 TSV、日志或提交;技能未提供具体的敏感数据脱敏策略。
- nemo-rl-session-memory 等 companion skill、recipe、launcher 和依赖版本未在本次材料中完整提供,执行前需核对可用性和兼容性。
- benchmark 结果不能替代本地复现;应先进行低成本 dry run,并验证权威指标来源。
这个 Skill 能做什么,适合哪些场景?
该技能指导智能体围绕准确率、奖励、吞吐量、延迟或稳定性等目标开展 NeMo-RL 与 NeMo-gym 研究。它覆盖环境和配方理解、基线运行、假设迭代、结果分析及研究记录维护。每个实验使用独立 Git 分支,并通过 TSV 日志记录指标、命令、耗时和状态。技能要求在创建分支或启动训练任务前确认研究计划,并要求配合 nemo-rl-session-memory 使用。
检查 Git 状态和目标配方,读取相关代码与文档;识别数据、检查点、运行时输入和启动器;创建实验分支、TSV 记录和日志目录;运行基线及后续训练实验;从日志提取权威指标;记录分支、提交、指标、显存、耗时、命令和日志路径;按 keep、discard 或 crash 标记结果,并持续检查实验数量、时间和指标停止条件。
- NeMo-RL 研究人员希望针对奖励或准确率目标运行一轮有记录的假设测试时。
- 工程师希望比较不同训练配方、批大小、精度或调度设置时。
- 团队需要将长期 RL 研究过程保存为可追溯 Git 分支和 TSV 研究账本时。
- 用户希望在 GPU、Slurm、Kubernetes 或 Brev 环境中组织可复现实验活动时。
这个 Skill 有哪些优点和局限?
- 覆盖从基线、假设分支到指标提取和结果交接的完整实验流程。
- 强调小范围、可复现修改,并将 Git 与 TSV 作为研究账本。
- 明确处理停止条件、超时、失败实验和人类监督。
- 考虑本地 GPU、Slurm、Kubernetes 和 Brev 等运行环境。
- 会创建分支、写入文件并执行训练命令,可能消耗 GPU 资源。
- 启动任务前需要用户确认计划,不能完全无人监督地直接运行。
- 依赖目标仓库、配方、数据、检查点和合适的运行时;SKILL.md 未提供具体安装或环境配置步骤。
- 要求配合 nemo-rl-session-memory,但该伴随技能的内容不在本资料中。
如何安装这个 Skill?
使用 NVIDIA/skills 的 skills CLI 安装指定技能:
npx skills add nvidia/skills --skill nemo-rl-auto-research --yes
README 未说明单独复制文件夹的必要性;安装后,客户端在加载相关技能时使用它。
如何使用这个 Skill?
先提供研究目标、权威指标和明确停止条件,例如:“运行 NeMo-RL 实验,测试提升准确率的配方,完成 10 个尝试或达到目标指标。” 启动自动研究前,确认 campaign 计划;同时使用 nemo-rl-session-memory,并在开始、计划形成、重要修改、长任务前后及交接时保存会话记录。