Dynamo 配方部署助手
在 Kubernetes 上选择、校验、修补并部署现有的 NVIDIA Dynamo 推理配方。
证据显示技能声明了 file_read、network、kubectl_exec 权限,先执行只读预检,要求使用 Kubernetes Secret 保存 HF token,限制为现有 recipes 且强调最小补丁;但默认流程包含 kubectl apply、创建命名空间和 Secret,却没有明确的逐步用户确认、变更前备份、回滚方案或完整数据流说明,因此扣分。
证据显示提供 recipe_tool.py 的发现和轻量校验、预检命令、常见阻塞及故障转交路径;但脚本没有提交的针对关键路径测试,校验覆盖有限,部署就绪检查缺少统一超时和失败诊断,且 run_script 协议与 shell 命令并存,基准报告还记录了重复内容问题,因此扣分。
证据显示目标用户、模型/框架/GPU/部署模式输入、非适用范围以及 router-starter 和 troubleshoot 的负向触发边界较清楚,evals.json 也包含正负用例;但没有中文交互支持、国内网络可达性或 Hugging Face 访问替代方案说明,环境适配证据有限,因此扣分。
证据显示有目的、前置条件、输入、步骤、脚本、示例、输出契约、限制、故障排查、引用、Apache-2.0 许可和 1.2.0 版本信息;但没有清晰的变更日志、稳定维护责任与更新路径,skill-card.md 和签名文件被基准标为意外文件,且基准报告指出重复内容,因此扣分。
证据显示技能覆盖从现有 recipe 选择、校验、最小修改、部署到 OpenAI 兼容 smoke test 的完整目标,并提供输出契约;但静态材料没有成功部署或可直接使用输出的第三方执行证据,且 benchmark 总体 verdict 为 FAIL,按静态上限仅给核心任务完成度分数。
证据包括明确的源代码、评估用例、静态 NVSkills-Eval 报告、CI 相关说明和可审计命令;但 benchmark 缺少 Tier 3 细节与实际结果,未提供覆盖关键路径的提交测试套件或多源独立复现,因此按静态上限给分并扣分。
- 执行 kubectl apply、创建命名空间或 Secret 前应获得明确用户确认,并补充变更预览、回滚和作用域验证。
- HF token 虽要求使用 Secret,但日志、环境变量和第三方镜像/模型下载的数据流仍应在部署前审查。
- benchmark 报告为 FAIL,且缺少真实 Tier 3 结果;不要把文档中的 smoke test 当作已验证成功。
- 技能未说明中文提示或中国大陆网络下的 Hugging Face/镜像可达性,相关环境可能需要额外配置。
这个 Skill 能做什么,适合哪些场景?
该技能面向需要在 Kubernetes 上启动 NVIDIA Dynamo 模型服务的操作者。它根据模型、框架、部署模式和 GPU 配置,从现有 recipes 树中选择配方,执行预检和轻量校验,并只修改本次部署所需的最小配置。具备集群访问权限时,它可以应用模型缓存和部署清单,并通过 OpenAI 兼容接口执行基本冒烟测试。它不创建新清单,也不覆盖路由器专用工作或部署后的故障排查。
读取 recipes/ 树、配方 README、模型缓存清单、deploy.yaml 和 perf.yaml(如存在);运行 scripts/recipe_tool.py 的 list 和 validate;检查 Git 状态、Kubernetes 上下文、存储类、节点、命名空间和 Hugging Face Secret;按需修补 storageClassName、镜像、模型路径、GPU 资源、路由模式或命名空间;使用 kubectl 应用清单并等待资源;端口转发前端服务,检查 /v1/models,并执行一次基本聊天补全冒烟测试;返回所选配方、修改值、命令、端点、测试结果和未解决阻塞项。
- 负责模型服务上线的 Kubernetes 操作者,需要为指定模型、vLLM/sglang/TRT-LLM/TokenSpeed 框架、部署模式和 GPU 选择现有 Dynamo 配方。
- 集群已有存储类、模型缓存和 Hugging Face Secret,但配方中的镜像标签或 GPU 配置需要针对当前环境调整。
- 希望先完成配方发现与校验、但当前 kubectl 不可用或集群不可达的操作者,需要获得准确的后续命令。
- 需要验证 Dynamo 前端是否提供 OpenAI 兼容端点,并通过 /v1/models 和聊天请求完成最小部署验收。
这个 Skill 有哪些优点和局限?
- 围绕现有配方工作,强调最小化清单修改。
- 覆盖从配方选择、预检、校验到部署和基本端点验证的连续流程。
- 明确要求不把 Hugging Face Token 写入文件或日志。
- 提供常见 PVC、Secret、镜像拉取、服务端口和 Kubernetes 连接问题的下一步。
- 要求 Python 3.10+、kubectl、可用 Kubernetes 上下文以及目标集群权限。
- 依赖 recipes/ 树和已有配方,不负责创建新部署清单。
- 冒烟测试深度有限;完整路由器/端点覆盖需使用 dynamo-router-starter。
- 多节点 disagg 传输正确性不在范围内,需使用 dynamo-interconnect-check。
- 资料未提供具体配方内容、测试结果或已验证的平台清单。
如何安装这个 Skill?
使用仓库 README 支持的 skills CLI 安装指定技能:npx skills add nvidia/skills --skill dynamo-recipe-runner --yes。CLI 的目标安装位置由其流程决定;具体文件夹位置未在提供的资料中说明。
如何使用这个 Skill?
向代理提出类似“使用 dynamo-recipe-runner 为指定模型选择并部署 Dynamo Kubernetes 配方”的请求,并提供或允许推断模型、框架、部署模式、GPU 类型/数量、Kubernetes 上下文、命名空间、Hugging Face Secret 和存储类。还需说明是执行命令,还是只生成准确命令。若集群不可达,技能应只完成选择和校验并返回命令。
这个 Skill 与同类方案有什么区别?
与 dynamo-router-starter 的边界是:本技能处理模型/后端/GPU/部署模式配方启动,而 router-starter 处理仅路由器模式;部署失败后的故障排查应转交 dynamo-troubleshoot;多节点 disagg 传输检查应使用 dynamo-interconnect-check。