开发与工程 ✓ NVIDIA · 官方 reinforcement-learningnemo-rlexperiment-trackinghypothesis-testinggpu-traininggit

NeMo-RL 自动研究助手

将 NeMo-RL 研究目标转化为可复现的迭代实验。

FollowSkills 评估 · FSRS-2.0
不推荐
51/ 100 五分制 2.6 / 5
信任安全14 / 25 · 2.8/5

技能明确要求用户确认 campaign 计划后再建分支或启动 GPU 任务,禁止 destructive git 操作,并要求保留用户改动;这些措施降低了越权和不可逆风险。仍扣分,因为允许执行 shell、写磁盘、创建分支和消耗 GPU,未具体说明敏感数据、凭据、训练数据外传、第三方服务权限或全面回滚流程。

可靠稳定8 / 20 · 2.0/5

工作流、分支规则、日志字段、超时和异常分类较具体,且要求在指标提取失败时检查日志。静态证据未覆盖实际关键路径复现;依赖 nemo-rl-session-memory、launch-nemo-rl、Brev etiquette 及仓库运行环境,部分依赖内容不可见,因此扣分并受静态上限约束。

适用触发10 / 15 · 3.3/5

描述、触发词和不适用范围清晰,覆盖基线、迭代实验、停止条件及 local/Slurm/Kubernetes 等环境。未声明更细的输入输出契约、硬件和版本边界,也没有中文交互支持或大陆网络可达性说明;核心训练可本地运行但文档和相关服务可能依赖海外资源,因此扣分。

规范维护9 / 15 · 3.0/5

SKILL.md 结构清楚,并提供 git、探索思路和 TSV 模板;skill-card 给出 Apache-2.0、所有者 NVIDIA、版本线索和评估摘要。扣分原因是缺少推荐的 Instructions/Examples、author/tags 元数据,维护责任、变更日志、版本兼容策略和依赖安装说明不完整。

有效结果6 / 15 · 2.0/5

技能对长期 NeMo-RL 研究活动提供了可直接采用的分支、实验循环、停止规则和日志规范,benchmark 文件报告了正负触发案例及一定的效果提升。静态审查无法验证训练结果、指标正确性或端到端产出,且实际执行仍需用户提供仓库、数据、模型和算力,因此未超过静态评估上限并扣分。

证据核验4 / 10 · 2.0/5

存在固定 revision、具体引用文件、TSV 示例、评估任务和结果摘要,提供了一定审计线索。扣分原因是 benchmark 结果在所给文件中属于报告性材料,没有可见的覆盖关键路径的提交测试套件或可独立复现的 CI 证据,外部文档也未提供可验证内容。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 启动训练前必须再次确认分支、数据、凭据、日志位置、资源预算和停止条件;该技能会写文件、修改 git 状态并可能消耗大量 GPU。
  • 不要把训练日志、模型检查点或环境变量中的凭据写入 TSV、日志或提交;技能未提供具体的敏感数据脱敏策略。
  • nemo-rl-session-memory 等 companion skill、recipe、launcher 和依赖版本未在本次材料中完整提供,执行前需核对可用性和兼容性。
  • benchmark 结果不能替代本地复现;应先进行低成本 dry run,并验证权威指标来源。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能指导智能体围绕准确率、奖励、吞吐量、延迟或稳定性等目标开展 NeMo-RL 与 NeMo-gym 研究。它覆盖环境和配方理解、基线运行、假设迭代、结果分析及研究记录维护。每个实验使用独立 Git 分支,并通过 TSV 日志记录指标、命令、耗时和状态。技能要求在创建分支或启动训练任务前确认研究计划,并要求配合 nemo-rl-session-memory 使用。

检查 Git 状态和目标配方,读取相关代码与文档;识别数据、检查点、运行时输入和启动器;创建实验分支、TSV 记录和日志目录;运行基线及后续训练实验;从日志提取权威指标;记录分支、提交、指标、显存、耗时、命令和日志路径;按 keep、discard 或 crash 标记结果,并持续检查实验数量、时间和指标停止条件。

  1. NeMo-RL 研究人员希望针对奖励或准确率目标运行一轮有记录的假设测试时。
  2. 工程师希望比较不同训练配方、批大小、精度或调度设置时。
  3. 团队需要将长期 RL 研究过程保存为可追溯 Git 分支和 TSV 研究账本时。
  4. 用户希望在 GPU、Slurm、Kubernetes 或 Brev 环境中组织可复现实验活动时。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖从基线、假设分支到指标提取和结果交接的完整实验流程。
  • 强调小范围、可复现修改,并将 Git 与 TSV 作为研究账本。
  • 明确处理停止条件、超时、失败实验和人类监督。
  • 考虑本地 GPU、Slurm、Kubernetes 和 Brev 等运行环境。
局限
  • 会创建分支、写入文件并执行训练命令,可能消耗 GPU 资源。
  • 启动任务前需要用户确认计划,不能完全无人监督地直接运行。
  • 依赖目标仓库、配方、数据、检查点和合适的运行时;SKILL.md 未提供具体安装或环境配置步骤。
  • 要求配合 nemo-rl-session-memory,但该伴随技能的内容不在本资料中。

如何安装这个 Skill?

使用 NVIDIA/skills 的 skills CLI 安装指定技能:

npx skills add nvidia/skills --skill nemo-rl-auto-research --yes

README 未说明单独复制文件夹的必要性;安装后,客户端在加载相关技能时使用它。

如何使用这个 Skill?

先提供研究目标、权威指标和明确停止条件,例如:“运行 NeMo-RL 实验,测试提升准确率的配方,完成 10 个尝试或达到目标指标。” 启动自动研究前,确认 campaign 计划;同时使用 nemo-rl-session-memory,并在开始、计划形成、重要修改、长任务前后及交接时保存会话记录。

常见问题

安装或使用该技能需要付费吗?
资料没有说明该技能收取费用;README 仅提供通过 npx skills CLI 安装 NVIDIA/skills 的方式。
它会自动启动训练任务吗?
它可以执行训练和其他 shell 命令,但明确要求在创建分支或启动计算密集型任务前获得用户确认。
它适合修复 bug 或重构代码吗?
不适合。SKILL.md 明确排除 bug 修复、代码审查、文档、重构、依赖更新和单文件修改。
没有明确停止条件时会怎样?
技能规定先运行基线,再运行最多三个低风险实验,然后总结最佳结果并询问是否继续。

同仓库的其他 Skills

均来自 NVIDIA/skills

自动化与运维 ✓ NVIDIA · 官方

NeMo-RL Brev 运行规范

帮助 NeMo-RL 代理在 Brev 上安全管理实验存储、缓存、日志与认证。

数据与分析 ✓ NVIDIA · 官方

Nemotron 模型定制流水线

为 Nemotron 模型规划、配置并串联数据处理、训练、对齐、转换、优化与评测步骤。

自动化与运维 ✓ NVIDIA · 官方

NeMo-RL Kubernetes 启动助手

在 Kubernetes 上启动、监控、迭代和排查 NeMo-RL 训练任务。

写作与内容 ✓ NVIDIA · 官方

NeMo-RL 文档规范

帮助 NeMo-RL 项目按统一规范编写和维护文档。

开发与工程 ✓ NVIDIA · 官方

TAO 平台执行 SDK

在多种 GPU 平台上提交、监控并管理 NVIDIA TAO 训练任务。

开发与工程 ✓ NVIDIA · 官方

I4H 机器人策略微调

在 LeRobot 数据集上微调 GR00T 或 openpi PI0 策略。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 训练助手

帮助运行 Megatron-LM 与 Megatron Bridge 训练并核对损失曲线。

开发与工程 ✓ NVIDIA · 官方

CODEOWNERS 分组拆分 PR

按 CODEOWNERS 审核组拆分大型 PR,降低审核负担并保持每个 PR 可独立合并。

开发与工程 ✓ NVIDIA · 官方

TAO Sparse4D 训练技能

帮助代理训练、评估、导出、量化和推理多摄像头时序3D检测跟踪模型。

开发与工程 ✓ NVIDIA · 官方

MoE 硬件配置参考

为不同 NVIDIA 平台提供 MoE 训练配置与吞吐规划参考。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 模型接入指南

指导开发者将新的 LLM、MoE 或 VLM 架构接入 NeMo AutoModel。

开发与工程 ✓ NVIDIA · 官方

Megatron Bridge 激活重计算

在 Megatron Bridge 中用额外计算换取更低的 GPU 激活内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 分布式训练配置

为 NeMo AutoModel 选择并配置多 GPU 与多节点训练策略。

自动化与运维 ✓ NVIDIA · 官方

Megatron-LM 集群训练启动助手

帮助你在 SLURM GPU 集群上可靠启动、监控和排查多节点 Megatron-LM 训练任务。

自动化与运维 ✓ NVIDIA · 官方

VSS 多摄像头三维检测追踪部署

部署基于 DeepStream 与 BEV Fusion 的多摄像头三维感知服务。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 配方开发

帮助构建、修改和验证 NeMo AutoModel 训练与评估配方。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CPU Offload

为 Megatron Bridge 配置、验证并排查 CPU 卸载,以缓解 GPU 显存压力。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CUDA 图优化

在 Megatron Bridge 训练中配置、验证并评估 CUDA Graph,以降低主机驱动开销。

自动化与运维 ✓ NVIDIA · 官方

NeMo AutoModel 启动配置

为 NeMo AutoModel 配置交互式、多节点与云端任务启动。

相关 Skills