自动化与运维 ✓ NVIDIA · 官方 kubernetesnvidia-dynamorecipe-validationmodel-deploymentkubectlgpu-inference

Dynamo 配方部署助手

在 Kubernetes 上选择、校验、修补并部署现有的 NVIDIA Dynamo 推理配方。

FollowSkills 评估 · FSRS-2.0
不推荐
50/ 100 五分制 2.5 / 5
信任安全13 / 25 · 2.6/5

证据显示技能声明了 file_read、network、kubectl_exec 权限,先执行只读预检,要求使用 Kubernetes Secret 保存 HF token,限制为现有 recipes 且强调最小补丁;但默认流程包含 kubectl apply、创建命名空间和 Secret,却没有明确的逐步用户确认、变更前备份、回滚方案或完整数据流说明,因此扣分。

可靠稳定8 / 20 · 2.0/5

证据显示提供 recipe_tool.py 的发现和轻量校验、预检命令、常见阻塞及故障转交路径;但脚本没有提交的针对关键路径测试,校验覆盖有限,部署就绪检查缺少统一超时和失败诊断,且 run_script 协议与 shell 命令并存,基准报告还记录了重复内容问题,因此扣分。

适用触发9 / 15 · 3.0/5

证据显示目标用户、模型/框架/GPU/部署模式输入、非适用范围以及 router-starter 和 troubleshoot 的负向触发边界较清楚,evals.json 也包含正负用例;但没有中文交互支持、国内网络可达性或 Hugging Face 访问替代方案说明,环境适配证据有限,因此扣分。

规范维护8 / 15 · 2.7/5

证据显示有目的、前置条件、输入、步骤、脚本、示例、输出契约、限制、故障排查、引用、Apache-2.0 许可和 1.2.0 版本信息;但没有清晰的变更日志、稳定维护责任与更新路径,skill-card.md 和签名文件被基准标为意外文件,且基准报告指出重复内容,因此扣分。

有效结果7 / 15 · 2.3/5

证据显示技能覆盖从现有 recipe 选择、校验、最小修改、部署到 OpenAI 兼容 smoke test 的完整目标,并提供输出契约;但静态材料没有成功部署或可直接使用输出的第三方执行证据,且 benchmark 总体 verdict 为 FAIL,按静态上限仅给核心任务完成度分数。

证据核验5 / 10 · 2.5/5

证据包括明确的源代码、评估用例、静态 NVSkills-Eval 报告、CI 相关说明和可审计命令;但 benchmark 缺少 Tier 3 细节与实际结果,未提供覆盖关键路径的提交测试套件或多源独立复现,因此按静态上限给分并扣分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 执行 kubectl apply、创建命名空间或 Secret 前应获得明确用户确认,并补充变更预览、回滚和作用域验证。
  • HF token 虽要求使用 Secret,但日志、环境变量和第三方镜像/模型下载的数据流仍应在部署前审查。
  • benchmark 报告为 FAIL,且缺少真实 Tier 3 结果;不要把文档中的 smoke test 当作已验证成功。
  • 技能未说明中文提示或中国大陆网络下的 Hugging Face/镜像可达性,相关环境可能需要额外配置。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向需要在 Kubernetes 上启动 NVIDIA Dynamo 模型服务的操作者。它根据模型、框架、部署模式和 GPU 配置,从现有 recipes 树中选择配方,执行预检和轻量校验,并只修改本次部署所需的最小配置。具备集群访问权限时,它可以应用模型缓存和部署清单,并通过 OpenAI 兼容接口执行基本冒烟测试。它不创建新清单,也不覆盖路由器专用工作或部署后的故障排查。

读取 recipes/ 树、配方 README、模型缓存清单、deploy.yaml 和 perf.yaml(如存在);运行 scripts/recipe_tool.py 的 list 和 validate;检查 Git 状态、Kubernetes 上下文、存储类、节点、命名空间和 Hugging Face Secret;按需修补 storageClassName、镜像、模型路径、GPU 资源、路由模式或命名空间;使用 kubectl 应用清单并等待资源;端口转发前端服务,检查 /v1/models,并执行一次基本聊天补全冒烟测试;返回所选配方、修改值、命令、端点、测试结果和未解决阻塞项。

  1. 负责模型服务上线的 Kubernetes 操作者,需要为指定模型、vLLM/sglang/TRT-LLM/TokenSpeed 框架、部署模式和 GPU 选择现有 Dynamo 配方。
  2. 集群已有存储类、模型缓存和 Hugging Face Secret,但配方中的镜像标签或 GPU 配置需要针对当前环境调整。
  3. 希望先完成配方发现与校验、但当前 kubectl 不可用或集群不可达的操作者,需要获得准确的后续命令。
  4. 需要验证 Dynamo 前端是否提供 OpenAI 兼容端点,并通过 /v1/models 和聊天请求完成最小部署验收。

这个 Skill 有哪些优点和局限?

优点
  • 围绕现有配方工作,强调最小化清单修改。
  • 覆盖从配方选择、预检、校验到部署和基本端点验证的连续流程。
  • 明确要求不把 Hugging Face Token 写入文件或日志。
  • 提供常见 PVC、Secret、镜像拉取、服务端口和 Kubernetes 连接问题的下一步。
局限
  • 要求 Python 3.10+、kubectl、可用 Kubernetes 上下文以及目标集群权限。
  • 依赖 recipes/ 树和已有配方,不负责创建新部署清单。
  • 冒烟测试深度有限;完整路由器/端点覆盖需使用 dynamo-router-starter。
  • 多节点 disagg 传输正确性不在范围内,需使用 dynamo-interconnect-check。
  • 资料未提供具体配方内容、测试结果或已验证的平台清单。

如何安装这个 Skill?

使用仓库 README 支持的 skills CLI 安装指定技能:npx skills add nvidia/skills --skill dynamo-recipe-runner --yes。CLI 的目标安装位置由其流程决定;具体文件夹位置未在提供的资料中说明。

如何使用这个 Skill?

向代理提出类似“使用 dynamo-recipe-runner 为指定模型选择并部署 Dynamo Kubernetes 配方”的请求,并提供或允许推断模型、框架、部署模式、GPU 类型/数量、Kubernetes 上下文、命名空间、Hugging Face Secret 和存储类。还需说明是执行命令,还是只生成准确命令。若集群不可达,技能应只完成选择和校验并返回命令。

这个 Skill 与同类方案有什么区别?

与 dynamo-router-starter 的边界是:本技能处理模型/后端/GPU/部署模式配方启动,而 router-starter 处理仅路由器模式;部署失败后的故障排查应转交 dynamo-troubleshoot;多节点 disagg 传输检查应使用 dynamo-interconnect-check。

常见问题

它会自动创建新的 Kubernetes 配方吗?
不会。它只操作现有 recipes/ 树;除非用户明确要求编写新配方,否则不会发明新的清单。
没有集群访问权限还能使用吗?
可以完成配方选择和校验,并返回准确命令,但不能声称部署已经执行。
它需要哪些权限?
技能元数据声明需要文件读取、网络和 kubectl 执行能力;部署还需要目标命名空间中的 Kubernetes 权限。
部署不健康时怎么办?
先根据症状检查存储类、PVC、Hugging Face Secret、镜像拉取和前端端口;持续失败时转用 dynamo-troubleshoot。

同仓库的其他 Skills

均来自 NVIDIA/skills

自动化与运维 ✓ NVIDIA · 官方

Dynamo 互联就绪检查

在信任 Dynamo 分离式服务的性能数据前,验证 RDMA、NVLink 与 NIXL 传输链路是否就绪。

自动化与运维 ✓ NVIDIA · 官方

Dynamo 部署故障排查

按证据定位不健康的 Dynamo Kubernetes 部署。

自动化与运维 ✓ NVIDIA · 官方

TAO NVIDIA GPU 主机配置

为 TAO 的 Docker 与 Kubernetes GPU 主机检查并配置 NVIDIA 驱动、CUDA 和容器运行时。

自动化与运维 ✓ NVIDIA · 官方

TAO Kubernetes 作业运行

通过 Kubernetes 提交和监控带 NVIDIA GPU 的 TAO 训练作业。

自动化与运维 ✓ NVIDIA · 官方

TAO 推理微服务部署技能

在多种计算平台上启动、调用并停止 TAO 推理微服务。

自动化与运维 ✓ NVIDIA · 官方

VSS 视频嵌入部署技能

部署并运维支持文件、文本和实时视频流的 NVIDIA 视频嵌入服务。

自动化与运维 ✓ NVIDIA · 官方

DOCA 管理服务运维技能

帮助运维团队部署、配置并排查 NVIDIA DMS 管理服务。

开发与工程 ✓ NVIDIA · 官方

TAO 平台执行 SDK

在多种 GPU 平台上提交、监控并管理 NVIDIA TAO 训练任务。

自动化与运维 ✓ NVIDIA · 官方

Dynamo 路由启动器

快速配置 Dynamo 路由模式并验证前端端点可用性。

数据与分析 ✓ NVIDIA · 官方

脑部 MRI 合成生成

通过 NVIDIA 工作流生成合成脑部 MRI 体积。

自动化与运维 ✓ NVIDIA · 官方

NeMo-RL Kubernetes 启动助手

在 Kubernetes 上启动、监控、迭代和排查 NeMo-RL 训练任务。

自动化与运维 ✓ NVIDIA · 官方

Physical AI 基础设施与弹性扩展

为合成数据生成工作流搭建、验证并恢复可扩展的 Physical AI 基础设施。

自动化与运维 ✓ NVIDIA · 官方

NVIDIA RAG Blueprint 运维技能

帮助代理部署、配置、排障和管理 NVIDIA RAG Blueprint。

自动化与运维 ✓ NVIDIA · 官方

NVIDIA AI-Q 部署助手

部署、验证和运维 NVIDIA AI-Q Blueprint 基础设施。

开发与工程 ✓ NVIDIA · 官方

TAO Sparse4D 训练技能

帮助代理训练、评估、导出、量化和推理多摄像头时序3D检测跟踪模型。

开发与工程 ✓ NVIDIA · 官方

DeepStream 管道构建器

通过交互式需求收集,为 NVIDIA DeepStream 生成并验证可运行的 GStreamer 推理管道。

数据与分析 ✓ NVIDIA · 官方

TAO DEFT AOI 检测优化循环

为 PCB 视觉检测模型自动执行评估、缺陷增强、挖掘、重训与部署门控。

数据与分析 ✓ NVIDIA · 官方

Hugging Face 本地 GPU 微调助手

在本地 NVIDIA GPU 上,以可复现流程微调 Hugging Face 模型。

自动化与运维 ✓ NVIDIA · 官方

VSS 配置文件部署助手

为 NVIDIA 视频搜索与摘要蓝图选择、部署并验证 Compose 配置文件。

数据与分析 ✓ NVIDIA · 官方

TAO DAFT 数据集验证器

用 tao-daft validate 检查 TAO DAFT 数据集的结构、架构与交叉引用错误。

相关 Skills