Physical AI 基础设施与弹性扩展
为合成数据生成工作流搭建、验证并恢复可扩展的 Physical AI 基础设施。
技能明确要求确认目标、最小化组件读取、避免输出密钥、使用secretKeyRef并在失败时停止;但Terraform和Azure/Kubernetes操作具有重大外部影响,setup.sh可在IP漂移时自动修改tfvars并执行带-auto-approve的完整apply,缺少明确的逐次确认、通用回滚方案和完整数据流说明,因此扣分。
主流程、前置检查、分层验证门和错误输出较清晰,Azure preflight检查命令、版本、认证、提供商和配置;但本次为静态审查,未执行关键路径,且组件覆盖、异常输入处理和恢复测试证据不足,按静态上限保守给分。
目标用户、Azure/MicroK8s、OSMO、推理后端、工作负载选择及正负触发示例较明确;但描述过长,边界和环境兼容性仍不完整,没有中文交互支持说明,也未说明中国大陆网络对Azure、NVIDIA NGC/NVCF及相关上游服务的可达性,故扣分。
目录按组件和阶段组织,支持渐进读取,包含版本、Apache-2.0许可、作者、标签和维护性规则;但缺少推荐的Instructions和Examples章节,benchmark报告指出无示例、描述过长及重复内容,版本变更记录、维护责任和更新路径不够明确。
流程覆盖集群、OSMO、推理、工作负载和验证,理论上可减少盲目重试并提供直接命令;但静态材料没有可复现执行结果,benchmark总体FAIL且Tier 3不可用,输出完整性和相对手工操作的收益无法充分验证,因此仅给有限分数。
有具体脚本、配置、验证门和静态benchmark报告,部分关键主张可追溯;但没有本次独立执行、完整测试套件或第三方运行证据,benchmark也缺少Tier 3信号,无法支持更高可验证性。
- 不要在未获得用户明确确认的情况下运行Terraform apply、Azure provider注册、Helm同步或其他集群变更;特别注意setup.sh的IP漂移分支会自动执行带-auto-approve的完整Terraform apply。
- 在生产环境前验证Azure、NVIDIA NGC/NVCF、Helm仓库和上游OSMO服务的网络可达性、凭据权限、配额与费用;材料未证明中国大陆网络可用。
- 先补充并执行覆盖各选定组件关键路径的测试和回滚演练;现有benchmark总体为FAIL,且没有Tier 3执行结果。
这个 Skill 能做什么,适合哪些场景?
这是 NVIDIA Physical AI 技能集合中的一项基础设施运维技能,面向本地 MicroK8s 和 Azure AKS。它编排 Kubernetes 集群、推理端点、OSMO 和工作负载阶段,并在部署前后执行验证。技能覆盖 NIM Operator、NVCF、Azure AI Foundry 以及多种 OSMO 工作负载路径。它适合需要可重复部署、分层故障排查和基础设施恢复流程的团队,但需要目标平台、凭据和相应命令行环境。
读取选定组件的参考文件、工作流规格和环境信息;通过已签入的 Shell、Helm、Terraform、kubectl、Azure 和 OSMO 脚本执行预检、集群部署、推理部署、OSMO 部署及工作负载提交;验证集群节点、GPU 容量、推理端点、OSMO 池、存储凭据和工作流状态;在 Pending、ImagePullBackOff、PVC 未绑定或工作流失败时,按配置、脚本和指导的层级定位问题,并要求检查事件与日志后再重试。
- Physical AI 工程师需要在 Azure AKS 上为视频数据增强搭建 NIM Operator 环境,并验证 GPU、推理端点和 OSMO 工作流就绪状态。
- 平台工程师需要在本地 MicroK8s 上部署 OSMO 和 NVCF 推理路径,用于合成数据生成。
- 基础设施运维人员需要在部署前检查 Azure GPU 配额、存储、访问权限和凭据,避免在 Terraform 或集群阶段失败。
- 工作流运营人员遇到 Pending、镜像拉取失败、PVC 未绑定或终止失败状态,需要按层排查并执行恢复。
这个 Skill 有哪些优点和局限?
- 同时覆盖 MicroK8s 与 Azure AKS 两种 Kubernetes 目标。
- 为 Kubernetes、推理、OSMO 和工作负载定义了明确的阶段门和组合约束。
- 包含凭据保护、预检、失败分层排查和恢复规则。
- 支持 NIM Operator、NVCF、Azure AI Foundry 及多种 Physical AI 工作负载路径。
- 依赖 kubectl、MicroK8s 或 Azure CLI/Terraform,以及 OSMO 或推理凭据。
- SKILL.md 未提供完整的逐命令部署教程,具体操作依赖组件参考和仓库内脚本。
- Azure 路径受 GPU/CPU 配额、身份访问、存储和网络条件影响。
- 该技能明确不覆盖单纯的 OSMO 日志总结或仅工作负载操作。
如何安装这个 Skill?
使用 NVIDIA/skills 集合中的默认 skills CLI 安装:
npx skills add nvidia/skills --skill physical-ai-infrastructure-setup-and-resilient-scaling --yes
也可以指定 Codex:
npx skills add nvidia/skills --skill physical-ai-infrastructure-setup-and-resilient-scaling --agent codex --yes
源材料未说明该单项技能的独立安装包或手工复制步骤。
如何使用这个 Skill?
安装后,向代理提出明确的目标组合,例如:"Set up resilient Physical AI infrastructure for VDA on Azure AKS with NIM Operator." 代理应先选择 Kubernetes、OSMO、推理和工作负载阶段,加载所需组件参考,运行预检,并依次通过 Kubernetes、推理、OSMO 和工作负载验证门。不要把仅要求总结 OSMO 日志的任务交给此技能,除非同时涉及基础设施设置、扩展、验证或恢复。