自动化与运维 ✓ NVIDIA · 官方 tao-toolkitinference-servicemicroservicecontainer-deploymenthuggingface-hubdockerkubernetes

TAO 推理微服务部署技能

在多种计算平台上启动、调用并停止 TAO 推理微服务。

FollowSkills 评估 · FSRS-2.0
不推荐
45/ 100 五分制 2.3 / 5
信任安全14 / 25 · 2.8/5

文档明确禁止在提示中索取或硬编码秘密,并限制模型路径、云 URI 和部分环境变量;但允许 Bash、Write 及 Docker、SSH、kubectl、服务停止等外部副作用,启动前没有明确的用户确认、权限边界或完整回滚方案,且 skill_info.yaml 与主文档对云存储和凭据要求相互矛盾,因此扣分。

可靠稳定6 / 20 · 1.5/5

主流程、平台分支、注册表、就绪轮询和部分错误类型有较详细说明;但静态材料未证明关键路径可运行,平台技能、依赖版本和运行时 API 未随目标技能提供,模板还包含占位符和未验证的环境变量处理,因此按静态上限保守给分。

适用触发9 / 15 · 3.0/5

适用场景、输入、平台、架构、路由规则和若干非适用范围较清楚;但中文支持未说明,跨平台依赖较重,网络可达性和 NVIDIA/HuggingFace/Brev/Kubernetes 环境限制缺乏边界说明,且云存储冲突会误导触发后的输入收集。

规范维护6 / 15 · 2.0/5

SKILL.md 结构清晰,引用了参考数据、平台技能和版本信息,并记录了维护性线索;但缺少 Examples 推荐章节,BENCHMARK.md 报告了目录层级和作者格式问题,版本变更、维护责任和更新路径不完整,skill_info.yaml 过时且与主文档矛盾,许可证元数据为 NOASSERTION。

有效结果6 / 15 · 2.0/5

如果依赖环境和相关平台技能均正确,流程覆盖启动、请求、路由、就绪检查和停止,具有直接操作价值;但没有静态可验证的真实输出,执行结果依赖外部容器、镜像、平台和未提供的配置,且冲突文档可能导致错误准备,因此仅给予核心任务的有限分数。

证据核验4 / 10 · 2.0/5

存在版本化参考文件、代码模板、评估报告和单个正向评估任务,提供了一定可审计线索;但没有覆盖关键路径的提交测试或真实 CI 证据,BENCHMARK 主要是自述性报告,无法独立复现运行结论,因此不超过静态上限。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 执行会启动或停止容器,并可能调用 SSH、kubectl、端口转发和远程平台操作;应在实际执行前明确确认目标、平台、端口、命名空间和停止对象。
  • skill_info.yaml 要求云 URI、云凭据和云输出,但 SKILL.md及 service.yaml 明确拒绝云存储;应先统一文档,否则可能产生错误或无效命令。
  • cosmos-predict2.5 模板中的 HF_TOKEN 使用占位字符串而非明确的 os.environ 读取实现;应修正秘密注入方式并验证镜像、CLI 和模型键。
  • 该评估仅基于静态文件,未执行容器、平台命令、请求或停止流程;不要将 BENCHMARK.md 的 PASS 视为独立运行验证。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向使用 TAO 模型检查点部署推理端点的用户。它根据网络架构解析容器镜像,构建作业负载和容器内命令,并通过平台技能在 local-docker、Brev、Slurm 或 Kubernetes 上运行服务。技能还维护服务注册表、检查就绪状态,并将请求路由到指定服务。模型权重支持 HuggingFace Hub 或本地容器路径,不支持云存储 URI。

收集 network_arch、model_path、platform 和 num_gpus;读取架构配置、service.yaml、request.yaml、code-templates.yaml 及对应平台技能;解析默认或环境变量覆盖的容器镜像;生成作业 JSON、环境变量和架构专用启动命令;启动并停止容器或平台作业;写入 /tmp/tao-inf-ms-state.json 服务注册表;为并发本地 Docker/Brev 服务分配不同端口;轮询服务就绪状态;读取目标服务端点并发送 OpenAI 兼容的 /v1/chat/completions 请求;处理 200、202、400、500 和 503 响应。

  1. TAO 模型用户希望通过 HuggingFace Hub 检查点启动一个推理微服务。
  2. 开发者需要在本地 Docker 上运行 cosmos-rl 或 cosmos-predict2.5 推理端点。
  3. 平台工程师需要在 Brev、Slurm 或 Kubernetes 上部署 TAO 推理容器。
  4. 用户同时运行多个推理服务,需要按 job_id 或 network_arch 精确路由请求。
  5. 运维人员需要停止指定的 TAO 推理服务并清理服务注册表。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖 local-docker、Brev、Slurm 和 Kubernetes 四类平台。
  • 支持服务注册、就绪检查、多服务路由和并发端口分配。
  • 明确规定秘密通过 HF_TOKEN 等环境变量读取,不应写入提示词或代码。
  • 针对 cosmos-rl 与 cosmos-predict2.5 提供不同的启动命令和请求约束。
局限
  • 实际执行依赖对应的平台技能,但提供材料未展示这些技能的完整内容。
  • 只支持 HuggingFace Hub 和本地容器路径,不支持云存储 URI。
  • 必须在每次请求前处理采样参数提示,多服务场景不能自动选择 latest。
  • 提供材料没有展示测试套件、性能数据或各平台的实际验证结果。

如何安装这个 Skill?

使用 NVIDIA/skills 仓库提供的 skills CLI 安装指定技能:npx skills add nvidia/skills --skill tao-run-inference-service --yes。README 没有说明该命令是否会自动安装此技能依赖的各平台技能;平台技能需按仓库说明另行确认。

如何使用这个 Skill?

向已加载该技能的代理提出类似请求:“在 local-docker 上使用 network_arch=cosmos-rl、model_path=hf_model://org/model、num_gpus=1 启动 TAO 推理服务。”使用时必须提供 network_arch、model_path 和 platform;num_gpus 默认 1。model_path 可为 hf_model://<org>/<model> 或本地容器路径,不能使用 s3://、gs:// 或 az://。发送请求或停止服务时提供 job_id;若请求未指定采样参数,代理应逐项询问 max_tokens、top_p、temperature 及适用的架构参数。

常见问题

需要哪些模型路径?
需要用户明确提供 HuggingFace Hub 路径 hf_model://<org>/<model> 或本地容器文件系统路径。云存储 URI 不受支持。
哪些凭据可以使用?
秘密应通过环境变量提供,例如受限 HuggingFace 模型使用 HF_TOKEN。技能禁止把秘密写入提示词、代码或请求体。
可以同时运行多个服务吗?
可以。local-docker 和 Brev 会从 8080 起选择未占用端口;请求必须通过 job_id、唯一的 network_arch 或用户明确选择来路由。
服务返回 202 或 503 怎么办?
202 表示服务或模型仍在初始化,应稍后重试。503 需要检查 error.type;model_not_ready 可重试,而 initialization_error 或 model_load_error 应停止重试并检查日志。

同仓库的其他 Skills

均来自 NVIDIA/skills

自动化与运维 ✓ NVIDIA · 官方

TAO NVIDIA GPU 主机配置

为 TAO 的 Docker 与 Kubernetes GPU 主机检查并配置 NVIDIA 驱动、CUDA 和容器运行时。

自动化与运维 ✓ NVIDIA · 官方

TAO Kubernetes 作业运行

通过 Kubernetes 提交和监控带 NVIDIA GPU 的 TAO 训练作业。

数据与分析 ✓ NVIDIA · 官方

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

开发与工程 ✓ NVIDIA · 官方

TAO Sparse4D 训练技能

帮助代理训练、评估、导出、量化和推理多摄像头时序3D检测跟踪模型。

数据与分析 ✓ NVIDIA · 官方

TAO FoundationStereo 立体深度

使用 FoundationStereo 从双目图像生成视差图,支持三维重建模型的训练、评估与部署。

数据与分析 ✓ NVIDIA · 官方

TAO 标准训练流程

为 TAO 模型执行标准的训练、评估与导出流程。

自动化与运维 ✓ NVIDIA · 官方

TAO Brev GPU 运行技能

在 Brev GPU 实例上运行和管理 TAO 训练、评估与推理任务。

数据与分析 ✓ NVIDIA · 官方

TAO BEVFusion 训练技能

用 TAO 训练、评估和推理融合激光雷达与摄像头数据的 BEV 三维检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO NVPanoptix3D 三维全景重建

训练和运行基于 RGB 图像的三维全景分割与占用补全模型。

自动化与运维 ✓ NVIDIA · 官方

TAO 本地 Docker 运行

帮助 AI 代理在本机或远程单节点 Docker GPU 主机上运行 TAO 作业。

数据与分析 ✓ NVIDIA · 官方

TAO Visual ChangeNet 工业视觉检测

训练和部署用于 PCB 缺陷检测的图像分类与变化分割模型。

数据与分析 ✓ NVIDIA · 官方

TAO 视频推理标注流水线

把原始视频转换为带推理链的训练数据。

自动化与运维 ✓ NVIDIA · 官方

TAO 工作流启动门禁

在执行 TAO 作业前完成平台、凭证、数据与容器预检。

自动化与运维 ✓ NVIDIA · 官方

Dynamo 配方部署助手

在 Kubernetes 上选择、校验、修补并部署现有的 NVIDIA Dynamo 推理配方。

数据与分析 ✓ NVIDIA · 官方

TAO 视频动作识别训练

用 NVIDIA TAO 训练、评估、导出并推理 RGB、光流或多流视频动作识别模型。

自动化与运维 ✓ NVIDIA · 官方

NVIDIA GPU Docker 运行规范

为 NVIDIA GPU 容器工作负载提供可复用的 Docker 运行、认证、挂载与故障排查规范。

数据与分析 ✓ NVIDIA · 官方

TAO DINO 目标检测

指导使用 NVIDIA TAO 训练、评估和部署 DINO 目标检测器。

开发与工程 ✓ NVIDIA · 官方

DOCA 环境设置技能

帮助开发者验证、配置和排查 DOCA 开发与运行环境,并选择合适的部署路径。

数据与分析 ✓ NVIDIA · 官方

TAO Grounding DINO 开放词汇检测

用文本提示训练和部署无需固定类别词表的目标检测模型。

自动化与运维 ✓ NVIDIA · 官方

TAO SLURM 集群运行

通过 SSH、SLURM 和 Pyxis/Enroot 在远程 GPU 集群上运行 TAO 作业。

相关 Skills