TAO PyT 图像分类
用 NVIDIA TAO 训练、评估并部署 PyTorch 图像分类模型。
文档明确限定为 Read/Bash,并说明数据路径、容器和输入排除规则,也提供 NVIDIA 归属与 Apache-2.0 元数据;但 Bash、Docker、GPU、模型文件和可能启用的 Weights & Biases 具有外部影响,未要求逐步确认、说明敏感数据处理、网络流向、回滚或恢复,因此扣分。
技能包含动作清单、生成 schema、模板、参数映射、确定性训练设置和常见错误模式,且基准报告声称通过;但静态材料没有覆盖关键路径的可执行测试或真实 CI 复现,部署说明依赖未提供内容的引用文件,异常处理和失败诊断仍有限,因此扣分。
触发短语、目标用户场景、训练/评估/蒸馏/量化/导出/推理范围、GPU要求和数据格式较清晰;但未明确非适用边界、中文交互支持或中国大陆网络适配,Docker、镜像和可能的外部服务可达性未说明,因此扣分。
目录文档提供 front matter、版本、作者、许可证、schema 清单、模板、参数表、错误模式和基准报告;仓库还提供发布、同步和安全报告路径。缺少推荐的 Instructions/Examples、详细 FAQ、技能级 changelog、依赖版本锁定和明确维护责任,因此扣分。
文档覆盖从数据路径构造到训练、检查点交接和部署的完整核心流程,基准报告记录单个正向任务通过;但只有一个任务、无代表性产物或静态可验证输出,直接可用性和相对替代方案收益证据不足,因此按静态上限扣分。
存在 schema、模板、skill_info、评估任务和一份外部评估报告,可审计部分声明;但没有覆盖该技能关键路径的提交测试或可独立复现的 CI 证据,且基准仅一个任务,因此只能给有限分数。
- 执行前应确认 Docker 镜像来源、GPU权限、模型和数据路径,以及 Weights & Biases 是否会产生网络传输。
- 应补充该技能关键动作的可执行 CI/测试、部署引用文件内容、失败恢复步骤和版本化依赖信息。
- 中国大陆用户可能受到容器镜像、NVIDIA 服务或外部实验跟踪服务可达性的影响,文档未给出替代方案。
这个 Skill 能做什么,适合哪些场景?
该技能面向 NVIDIA TAO Toolkit 的 PyTorch 图像分类流程,覆盖训练、评估、推理、蒸馏、量化、导出和 TensorRT 部署操作。它支持 FAN、EfficientNet、ResNet 等多类骨干网络,也支持 AutoML 训练策略。运行环境需要 Docker、nvidia-container-toolkit 和 GPU。技能会根据动作读取打包的 schema、规格模板及部署参考,并处理数据路径、检查点和输出目录。
读取 skill_info.yaml、JSON schema、YAML 规格模板及 TensorRT 部署参考;为训练、评估、推理、蒸馏、量化、导出和 TensorRT 引擎生成或调整 TAO 规格;要求配置训练、验证、测试、类别文件和量化校准数据路径;运行 TAO PyT 模型工作流;处理父作业中的检查点;生成或使用模型检查点、ONNX 文件和 TensorRT 引擎,并执行评估或推理。
- 计算机视觉工程师希望用自有分类数据训练 FAN、EfficientNet 或 ResNet 模型时。
- 团队需要在训练前后进行验证、测试集评估或模型推理时。
- 部署工程师需要将分类模型导出为 ONNX 并生成 TensorRT 引擎时。
- 模型优化人员需要进行知识蒸馏或量化,并使用训练数据完成校准时。
- 研究人员希望启用 AutoML,或为单次训练关闭 AutoML 时。
这个 Skill 有哪些优点和局限?
- 覆盖从训练到 TensorRT 部署的完整分类模型流程。
- 支持多种骨干网络、知识蒸馏、量化和 AutoML。
- 包含动作级数据要求、参数推断规则、检查点交接说明和错误排查提示。
- 明确要求使用 Docker 与 nvidia-container-toolkit,适合 NVIDIA GPU 环境。
- 至少需要 GPU、Docker 和 nvidia-container-toolkit;文档建议每块 GPU 具备 16GB 以上显存。
- 数据必须先从归档中解压,并按动作提供正确的数据目录和 classes.txt。
- 该材料没有提供独立测试套件、实际基准结果或已验证的平台清单。
- 不支持 FSDP;多节点环境还需要由编排器设置指定环境变量。
如何安装这个 Skill?
使用仓库 README 中给出的 skills CLI 安装指定技能:
npx skills add nvidia/skills --skill tao-train-image-classification --yes
README 未说明该命令的具体安装目录;CLI 会提示选择安装目标。
如何使用这个 Skill?
安装后,向智能体提出明确任务,例如:"train image classifier with TAO classification-pyt"、"evaluate this TAO classification model" 或 "export the classifier and generate a TensorRT engine"。提供训练、验证、测试数据及 classes.txt,并说明所需骨干网络、GPU、输出目录和 AutoML 策略。数据源必须指向解压后的图像目录,不能直接把 tar.gz 文件作为本地 Docker 的 images_dir。