自动化与运维 ✓ NVIDIA · 官方 physical-aikubernetesmicrok8sazure-aksosmonim-operatorresilient-scaling

Physical AI 基础设施与弹性扩展

为合成数据生成工作流搭建、验证并恢复可扩展的 Physical AI 基础设施。

FollowSkills 评估 · FSRS-2.0
不推荐
47/ 100 五分制 2.4 / 5
信任安全16 / 25 · 3.2/5

技能明确要求确认目标、最小化组件读取、避免输出密钥、使用secretKeyRef并在失败时停止;但Terraform和Azure/Kubernetes操作具有重大外部影响,setup.sh可在IP漂移时自动修改tfvars并执行带-auto-approve的完整apply,缺少明确的逐次确认、通用回滚方案和完整数据流说明,因此扣分。

可靠稳定7 / 20 · 1.8/5

主流程、前置检查、分层验证门和错误输出较清晰,Azure preflight检查命令、版本、认证、提供商和配置;但本次为静态审查,未执行关键路径,且组件覆盖、异常输入处理和恢复测试证据不足,按静态上限保守给分。

适用触发9 / 15 · 3.0/5

目标用户、Azure/MicroK8s、OSMO、推理后端、工作负载选择及正负触发示例较明确;但描述过长,边界和环境兼容性仍不完整,没有中文交互支持说明,也未说明中国大陆网络对Azure、NVIDIA NGC/NVCF及相关上游服务的可达性,故扣分。

规范维护8 / 15 · 2.7/5

目录按组件和阶段组织,支持渐进读取,包含版本、Apache-2.0许可、作者、标签和维护性规则;但缺少推荐的Instructions和Examples章节,benchmark报告指出无示例、描述过长及重复内容,版本变更记录、维护责任和更新路径不够明确。

有效结果4 / 15 · 1.3/5

流程覆盖集群、OSMO、推理、工作负载和验证,理论上可减少盲目重试并提供直接命令;但静态材料没有可复现执行结果,benchmark总体FAIL且Tier 3不可用,输出完整性和相对手工操作的收益无法充分验证,因此仅给有限分数。

证据核验3 / 10 · 1.5/5

有具体脚本、配置、验证门和静态benchmark报告,部分关键主张可追溯;但没有本次独立执行、完整测试套件或第三方运行证据,benchmark也缺少Tier 3信号,无法支持更高可验证性。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 不要在未获得用户明确确认的情况下运行Terraform apply、Azure provider注册、Helm同步或其他集群变更;特别注意setup.sh的IP漂移分支会自动执行带-auto-approve的完整Terraform apply。
  • 在生产环境前验证Azure、NVIDIA NGC/NVCF、Helm仓库和上游OSMO服务的网络可达性、凭据权限、配额与费用;材料未证明中国大陆网络可用。
  • 先补充并执行覆盖各选定组件关键路径的测试和回滚演练;现有benchmark总体为FAIL,且没有Tier 3执行结果。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

这是 NVIDIA Physical AI 技能集合中的一项基础设施运维技能,面向本地 MicroK8s 和 Azure AKS。它编排 Kubernetes 集群、推理端点、OSMO 和工作负载阶段,并在部署前后执行验证。技能覆盖 NIM Operator、NVCF、Azure AI Foundry 以及多种 OSMO 工作负载路径。它适合需要可重复部署、分层故障排查和基础设施恢复流程的团队,但需要目标平台、凭据和相应命令行环境。

读取选定组件的参考文件、工作流规格和环境信息;通过已签入的 Shell、Helm、Terraform、kubectl、Azure 和 OSMO 脚本执行预检、集群部署、推理部署、OSMO 部署及工作负载提交;验证集群节点、GPU 容量、推理端点、OSMO 池、存储凭据和工作流状态;在 Pending、ImagePullBackOff、PVC 未绑定或工作流失败时,按配置、脚本和指导的层级定位问题,并要求检查事件与日志后再重试。

  1. Physical AI 工程师需要在 Azure AKS 上为视频数据增强搭建 NIM Operator 环境,并验证 GPU、推理端点和 OSMO 工作流就绪状态。
  2. 平台工程师需要在本地 MicroK8s 上部署 OSMO 和 NVCF 推理路径,用于合成数据生成。
  3. 基础设施运维人员需要在部署前检查 Azure GPU 配额、存储、访问权限和凭据,避免在 Terraform 或集群阶段失败。
  4. 工作流运营人员遇到 Pending、镜像拉取失败、PVC 未绑定或终止失败状态,需要按层排查并执行恢复。

这个 Skill 有哪些优点和局限?

优点
  • 同时覆盖 MicroK8s 与 Azure AKS 两种 Kubernetes 目标。
  • 为 Kubernetes、推理、OSMO 和工作负载定义了明确的阶段门和组合约束。
  • 包含凭据保护、预检、失败分层排查和恢复规则。
  • 支持 NIM Operator、NVCF、Azure AI Foundry 及多种 Physical AI 工作负载路径。
局限
  • 依赖 kubectl、MicroK8s 或 Azure CLI/Terraform,以及 OSMO 或推理凭据。
  • SKILL.md 未提供完整的逐命令部署教程,具体操作依赖组件参考和仓库内脚本。
  • Azure 路径受 GPU/CPU 配额、身份访问、存储和网络条件影响。
  • 该技能明确不覆盖单纯的 OSMO 日志总结或仅工作负载操作。

如何安装这个 Skill?

使用 NVIDIA/skills 集合中的默认 skills CLI 安装:

npx skills add nvidia/skills --skill physical-ai-infrastructure-setup-and-resilient-scaling --yes

也可以指定 Codex:

npx skills add nvidia/skills --skill physical-ai-infrastructure-setup-and-resilient-scaling --agent codex --yes

源材料未说明该单项技能的独立安装包或手工复制步骤。

如何使用这个 Skill?

安装后,向代理提出明确的目标组合,例如:"Set up resilient Physical AI infrastructure for VDA on Azure AKS with NIM Operator." 代理应先选择 Kubernetes、OSMO、推理和工作负载阶段,加载所需组件参考,运行预检,并依次通过 Kubernetes、推理、OSMO 和工作负载验证门。不要把仅要求总结 OSMO 日志的任务交给此技能,除非同时涉及基础设施设置、扩展、验证或恢复。

常见问题

它是否适合只运行 OSMO 工作流的用户?
只有当任务还涉及基础设施设置、扩展、验证或恢复时才适合;单纯的日志总结或工作负载操作不应触发它。
使用它需要哪些权限和凭据?
通常需要集群或云平台操作权限、kubectl,以及 MicroK8s 或 Azure CLI/Terraform;目标路径还可能需要 OSMO、推理 API、Azure 访问和存储凭据。
工作流失败后它会自动盲目重试吗?
不会。规则要求先检查事件和日志,并定位配置、脚本或指导层的最低负责层,再决定是否重试。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

PAS 人员属性搜索工作流

在 OSMO 上扩增人员图像并自动生成属性标注。

自动化与运维 ✓ NVIDIA · 官方

OSMO 物理 AI 视频增强编排器

在 OSMO 上安全运行视频增强、自动标注与结果回收流程。

自动化与运维 ✓ NVIDIA · 官方

TAO Kubernetes 作业运行

通过 Kubernetes 提交和监控带 NVIDIA GPU 的 TAO 训练作业。

开发与工程 ✓ NVIDIA · 官方

CAD 到 SimReady 工作流

将 CAD 或其他源资产按阶段转换、赋予仿真属性并验证为可交付的 SimReady USD。

自动化与运维 ✓ NVIDIA · 官方

DOCA 管理服务运维技能

帮助运维团队部署、配置并排查 NVIDIA DMS 管理服务。

数据与分析 ✓ NVIDIA · 官方

NVIDIA 物理AI缺陷图像生成

在 OSMO 上编排 PCBA、金属表面和玻璃检测的缺陷图像生成、增强与标注流程。

开发与工程 ✓ NVIDIA · 官方

TAO 平台执行 SDK

在多种 GPU 平台上提交、监控并管理 NVIDIA TAO 训练任务。

自动化与运维 ✓ NVIDIA · 官方

TAO NVIDIA GPU 主机配置

为 TAO 的 Docker 与 Kubernetes GPU 主机检查并配置 NVIDIA 驱动、CUDA 和容器运行时。

自动化与运维 ✓ NVIDIA · 官方

NeMo-RL Kubernetes 启动助手

在 Kubernetes 上启动、监控、迭代和排查 NeMo-RL 训练任务。

自动化与运维 ✓ NVIDIA · 官方

Dynamo 路由启动器

快速配置 Dynamo 路由模式并验证前端端点可用性。

自动化与运维 ✓ NVIDIA · 官方

Dynamo 互联就绪检查

在信任 Dynamo 分离式服务的性能数据前,验证 RDMA、NVLink 与 NIXL 传输链路是否就绪。

自动化与运维 ✓ NVIDIA · 官方

Dynamo 部署故障排查

按证据定位不健康的 Dynamo Kubernetes 部署。

自动化与运维 ✓ NVIDIA · 官方

Dynamo 配方部署助手

在 Kubernetes 上选择、校验、修补并部署现有的 NVIDIA Dynamo 推理配方。

自动化与运维 ✓ NVIDIA · 官方

TAO 推理微服务部署技能

在多种计算平台上启动、调用并停止 TAO 推理微服务。

自动化与运维 ✓ NVIDIA · 官方

NVIDIA RAG Blueprint 运维技能

帮助代理部署、配置、排障和管理 NVIDIA RAG Blueprint。

写作与内容 ✓ NVIDIA · 官方

技能卡生成器

为现有智能体技能生成或更新治理技能卡。

自动化与运维 ✓ NVIDIA · 官方

NVIDIA AI-Q 部署助手

部署、验证和运维 NVIDIA AI-Q Blueprint 基础设施。

开发与工程 ✓ NVIDIA · 官方

cuPyNumeric 迁移就绪度评估

在投入大规模移植工作前,判断 NumPy 代码能否在 GPU 和多 GPU 环境中有效扩展。

数据与分析 ✓ NVIDIA · 官方

NVIDIA AI-Q 深度研究

通过本地 AI-Q Blueprint 后端执行可追踪的深度研究。

自动化与运维 ✓ NVIDIA · 官方

NemoClaw AI 代理用户指南

引导 AI 编程助手检索权威 NemoClaw 文档并完成配置、运维与故障排查。

相关 Skills