自动化与运维 ✓ NVIDIA · 官方 kubernetesnemo-rlnrl-k8srayclusterrayjobtraining-monitoringhydra-overrides

NeMo-RL Kubernetes 启动助手

在 Kubernetes 上启动、监控、迭代和排查 NeMo-RL 训练任务。

FollowSkills 评估 · FSRS-2.0
不推荐
54/ 100 五分制 2.7 / 5
信任安全16 / 25 · 3.2/5

技能明确要求先核验共享集群状态,并提示删除共享基础设施前确认;Secret 使用 secretKeyRef,未见凭据硬编码。扣分在于允许 Bash、Write、Edit 等高影响工具,包含集群删除、RayJob 删除和作业停止操作,确认、权限边界、回滚方案及数据流披露仍不完整,且 wandb 外部日志暴露风险仅间接提示。

可靠稳定9 / 20 · 2.3/5

命令、生命周期模式、常见故障和完成检查较系统,失败场景有若干诊断路径。静态评审未执行 CLI,技能本身没有提交覆盖关键路径的测试或明确错误输出契约;BENCHMARK 仅提供有限评测摘要,因此不超过静态上限10,扣除可复现性和异常输入反馈不足。

适用触发10 / 15 · 3.3/5

受众、Kubernetes/NeMo-RL 场景、触发短语、ephemeral 与 long-lived 边界较清楚,也覆盖监控、调试和开发循环。扣分在于依赖特定 NVIDIA/NeMo-RL 仓库结构、nrl-k8s CLI、Kubernetes 集群和 profile 配置,非适用范围与版本兼容边界不足,未说明中文交互支持;核心功能不是完全依赖海外服务,但 wandb 等外部服务可能影响部分流程。

规范维护9 / 15 · 3.0/5

SKILL.md 结构清晰,采用渐进式章节、表格、命令示例、gotchas 和完成清单;skill-card 给出 Apache 2.0、Owner、版本1.5.4、参考资料和评测信息。扣分在于 BENCHMARK 明确指出缺少 metadata.author、metadata.tags、Instructions、Examples,且维护责任和变更路径只由仓库同步/发布上下文间接体现,限制与故障排查仍有隐藏前置条件。

有效结果6 / 15 · 2.0/5

技能直接提供运行、监控、日志、停止和 teardown 的命令级流程,正向评测任务覆盖模式选择、日志获取和前置检查,显示核心任务有实际帮助。静态评审无法验证命令与当前 CLI、集群配置或 API 的一致性;输出仍依赖用户补齐 recipe、infra、namespace、权限和环境信息,因此只给接近静态上限7但略低的分数。

证据核验4 / 10 · 2.0/5

文件包含具体命令、路径、配置字段、评测任务及一份 benchmark 结果,具备一定审计线索;skill-card 还列出文档和源码参考。扣分在于没有本技能目录内覆盖关键路径的测试、CI 结果或独立复核材料,benchmark 的执行细节和证据链有限,不能静态确认关键声明。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
使用前请注意
  • 执行前必须确认目标 namespace、recipe/infra 配对、PVC、Secret、ServiceAccount、权限和共享集群归属;cluster down、--replace、RayJob 删除等操作可能影响他人且缺少自动回滚。
  • 不要把 wandb、HF 或镜像凭据写入 YAML 或命令行;确认日志、项目名、运行名和数据路径不会泄露敏感信息,并核实外部服务可达性。
  • 该技能依赖特定仓库布局、nrl-k8s 版本、Kubernetes/KubeRay、调度器、DRA 和硬件 profile;应用前应以目标环境的实际 CLI help、相邻 infra 文件和权限策略复核命令。
  • BENCHMARK 报告的评测结果属于静态提供的发布材料,不能替代在目标集群中的独立验证;中文支持、版本兼容和维护更新责任未充分说明。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

这是一个使用 nrl-k8s CLI 在 Kubernetes 集群上运行 NeMo-RL recipe 的操作手册。它覆盖 RayJob 临时集群和可复用的长期 RayCluster 两种生命周期模式,并提供状态查看、日志获取、任务停止和集群管理流程。手册还说明如何使用 Hydra 覆盖配置、处理共享文件系统差异,以及排查训练任务卡住或失败的问题。它适合已经拥有 Kubernetes、KubeRay 和 NeMo-RL 运行环境的工程团队。

指导代理先检查 recipe、基础设施文件、git 状态和 Kubernetes 前置资源,然后调用 nrl-k8s check、run、status、cluster、job、logs 和 dev 命令。它根据需要生成或应用 RayJob、RayCluster 和 Deployment,选择 upload、image 或 lustre 代码来源,跟踪训练状态并获取驱动日志。它还使用 kubectl、kubectl port-forward 和 Ray Dashboard API 检查作业、读取日志、停止任务并确认 RayJob 完成后的集群清理。

  1. NeMo-RL 工程师需要在 Kubernetes 上提交一次性训练任务,并希望任务完成后自动删除集群。
  2. 训练开发者需要反复修改配置并复用长期运行的 RayCluster 进行迭代。
  3. 平台运维人员需要查看 RayCluster、Pod、daemon 和 Ray Job 状态,或获取终止任务的驱动日志。
  4. 研究人员发现训练任务卡住或失败,需要检查节点调度、GPU 数量、DRA、共享文件系统和日志。
  5. 团队需要在不修改共享 recipe 文件的情况下,通过 Hydra 覆盖实验参数并生成唯一运行名称。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖从校验、提交到监控、停止和清理的完整 NeMo-RL Kubernetes 流程。
  • 清楚区分临时 RayJob 与长期 RayCluster,包含迭代和重建选项。
  • 提供针对 GPU 调度、DRA、共享文件系统、OmegaConf 和日志获取的具体排障指导。
  • 支持通过 README 所述 skills CLI 单独安装,不必手动复制技能目录。
局限
  • 依赖现成的 nrl-k8s CLI、kubectl、Kubernetes 集群、KubeRay 和 Ray 环境。
  • 涉及共享集群和高成本 GPU 资源,错误的 cluster down 或重建操作可能影响他人。
  • 技能内容未提供具体硬件 profile 的完整配置;使用新 profile 前仍需阅读相邻 infra 文件。
  • 提供的是操作手册,不是独立的训练执行器;源材料没有给出该技能自身的测试结果或平台覆盖矩阵。

如何安装这个 Skill?

使用 NVIDIA/skills 仓库提供的 skills CLI 安装单个技能:npx skills add nvidia/skills --skill launch-nemo-rl --yes。README 未提供 nrl-k8s CLI 或 Kubernetes 集群的安装步骤;这些运行环境需要事先准备。

如何使用这个 Skill?

安装后,向代理提出明确任务,例如“在 Kubernetes 集群上提交这个 NeMo-RL training job”或“为什么这个 NeMo-RL run 卡住了,帮我查看日志”。实际运行时提供 recipe 和对应的 infra 文件,例如:nrl-k8s run <recipe> --infra <infra> --rayjob --dry-run;长期开发循环可使用 nrl-k8s run <recipe> --infra <infra> --run-id <id>。操作前应确认目标命名空间中的 PVC、Secret 和 service account,并在共享集群上删除资源前进行确认。

常见问题

这个技能会自动创建 Kubernetes 集群吗?
它管理 RayCluster 和 RayJob 的应用、复用、重建及清理,但源材料没有说明如何创建底层 Kubernetes 集群;目标集群需要预先存在。
临时运行和长期开发循环应如何选择?
一次性运行通常使用默认的 ephemeral 模式;如果运行后还要保留集群以便迭代,则使用 --raycluster。
任务卡住时首先检查什么?
先查看 nrl-k8s status、kubectl 中的 RayJob/RayCluster 和 Pod 状态,再检查 GPU 配额与节点选择、KAI 调度、DRA、PVC、Secret、service account 及驱动日志。
使用这个技能有明确费用吗?
源材料没有列出技能费用;但它明确提醒共享集群和 GPU 资源操作成本较高。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

TAO 平台执行 SDK

在多种 GPU 平台上提交、监控并管理 NVIDIA TAO 训练任务。

开发与工程 ✓ NVIDIA · 官方

NeMo-RL 自动研究助手

将 NeMo-RL 研究目标转化为可复现的迭代实验。

写作与内容 ✓ NVIDIA · 官方

NeMo-RL 文档规范

帮助 NeMo-RL 项目按统一规范编写和维护文档。

自动化与运维 ✓ NVIDIA · 官方

TAO Kubernetes 作业运行

通过 Kubernetes 提交和监控带 NVIDIA GPU 的 TAO 训练作业。

自动化与运维 ✓ NVIDIA · 官方

NeMo-RL Brev 运行规范

帮助 NeMo-RL 代理在 Brev 上安全管理实验存储、缓存、日志与认证。

自动化与运维 ✓ NVIDIA · 官方

DOCA 管理服务运维技能

帮助运维团队部署、配置并排查 NVIDIA DMS 管理服务。

自动化与运维 ✓ NVIDIA · 官方

TAO NVIDIA GPU 主机配置

为 TAO 的 Docker 与 Kubernetes GPU 主机检查并配置 NVIDIA 驱动、CUDA 和容器运行时。

自动化与运维 ✓ NVIDIA · 官方

Dynamo 路由启动器

快速配置 Dynamo 路由模式并验证前端端点可用性。

自动化与运维 ✓ NVIDIA · 官方

Dynamo 互联就绪检查

在信任 Dynamo 分离式服务的性能数据前,验证 RDMA、NVLink 与 NIXL 传输链路是否就绪。

自动化与运维 ✓ NVIDIA · 官方

Dynamo 部署故障排查

按证据定位不健康的 Dynamo Kubernetes 部署。

自动化与运维 ✓ NVIDIA · 官方

Dynamo 配方部署助手

在 Kubernetes 上选择、校验、修补并部署现有的 NVIDIA Dynamo 推理配方。

自动化与运维 ✓ NVIDIA · 官方

Physical AI 基础设施与弹性扩展

为合成数据生成工作流搭建、验证并恢复可扩展的 Physical AI 基础设施。

自动化与运维 ✓ NVIDIA · 官方

TAO 推理微服务部署技能

在多种计算平台上启动、调用并停止 TAO 推理微服务。

自动化与运维 ✓ NVIDIA · 官方

NVIDIA RAG Blueprint 运维技能

帮助代理部署、配置、排障和管理 NVIDIA RAG Blueprint。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 分布式训练配置

为 NeMo AutoModel 选择并配置多 GPU 与多节点训练策略。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 配方开发

帮助构建、修改和验证 NeMo AutoModel 训练与评估配方。

自动化与运维 ✓ NVIDIA · 官方

NeMo AutoModel 启动配置

为 NeMo AutoModel 配置交互式、多节点与云端任务启动。

开发与工程 ✓ NVIDIA · 官方

MoE 硬件配置参考

为不同 NVIDIA 平台提供 MoE 训练配置与吞吐规划参考。

开发与工程 ✓ NVIDIA · 官方

NeMo Relay 安装助手

为 CLI、语言包和主流框架选择并验证 NeMo Relay 安装路径。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

相关 Skills