TAO AutoML 调参技能
为 NVIDIA TAO 网络运行可审查的自动超参数优化流程。
文档要求平台、凭据、数据、镜像、资源和用户确认后才启动,并禁止询问或打印秘密;但允许 Bash/Write,涉及 pip 安装、外部服务、S3/WandB/LLM,且示例中的 curl 可能将 API 密钥放入命令行,缺少更严格的权限隔离、回滚和敏感数据流控制,因此扣分。
预检、模型支持门、基线评估、失败分类、恢复和状态查询描述较完整;但 SKILL.md 与引用文件存在接口和路径不一致(如 platform_sdk 与 sdk、构造参数及工作流路径),依赖模型技能和未提供文件,静态上无法复现关键路径,故不超过静态上限并扣分。
目标用户、TAO AutoML/HPO 场景、平台选择、算法和非适用条件基本明确;但触发边界仍依赖读取其他模型与平台技能,未提供中文交互支持,LLM 功能可能依赖海外 NVIDIA 端点,面向中国大陆的可达性未说明,因此扣分。
有 front matter、Apache-2.0、版本号、作者、标签、引用地图、分层参考文档、示例和常见故障;但作者格式被基准报告指出不符合规范,缺少明确维护责任、变更日志、更新路径,且引用内容存在过时或冲突接口,故扣分。
工作流覆盖从预检、搜索空间、基线评估、运行监控到结果交接,理论上能直接支持 AutoML 运行;基准报告显示一次任务取得较高正确性和有效性结果,但只有单任务且无本次执行,模型特定依赖和接口冲突限制了可验证的直接可用性,故按静态上限保守扣分。
存在固定修订版本、具体命令、返回结构、示例和 NVSkills-Eval 报告,提供了一定审计线索;但报告仅含单任务,未见覆盖关键路径的真实 CI 与提交测试套件,无法静态独立复现,多数结论仍依赖未提供的模型、平台和脚本文件,因此扣分。
- 启动真实训练任务前,核对 AutoMLRunner 构造参数、平台 SDK 接口和文档路径的冲突。
- 不要在 shell 命令、日志或配置中暴露 LLM、WandB、云平台或 Hugging Face 凭据;尤其避免直接复制带 API 密钥的 curl 示例。
- 确认 NVIDIA LLM 端点及 S3/WandB 等外部服务在目标网络(包括中国大陆)可达,并准备不可用时的替代方案。
- 该评估只覆盖 tao-run-automl/SKILL.md 及其随附材料;实际运行仍必须验证对应模型和平台技能、schema、镜像与依赖。
这个 Skill 能做什么,适合哪些场景?
该技能使用 AutoMLRunner 为 NVIDIA TAO 网络执行自动机器学习和超参数优化。它支持贝叶斯搜索、Hyperband、ASHA、BOHB、LLM 引导搜索、混合搜索和 autoresearch,并可在 Brev、SLURM、Kubernetes 或 Docker 平台上运行。流程会先检查模型、平台、数据、凭据、容器镜像和计算资源,再运行基线评估并请求启动确认。它还支持 WandB 跟踪、结果解释、自定义评估钩子、断点恢复和最终模型评估。
读取选定模型与平台技能及其元数据、训练 schema 和模板;执行平台、依赖、数据可见性、凭据、容器和资源预检;验证 nvidia-tao-automl 是否可导入;构建嵌套训练配置和搜索空间;在推荐任务前运行自动基线评估;调用 AutoMLRunner 生成推荐、提交训练任务、提取指标并反馈给优化器;通过平台 SDK 查询任务状态、日志和失败分析;记录推荐指标、失败原因、最佳检查点、结果路径和最终评估结果。
- 需要为受支持的 TAO 视觉网络在小到中等预算下选择训练超参数的团队,可使用默认贝叶斯搜索。
- 需要并行尝试大量配置且训练支持早期停止的用户,可使用 Hyperband 或 ASHA。
- 希望在 Brev、SLURM、Kubernetes 或本地 Docker 上执行 TAO AutoML 的用户,可按所选平台完成预检和任务提交。
- 需要用任务验证指标而非训练损失比较模型的团队,可配置评估函数和最终评估回调。
- 希望跟踪实验、恢复已有工作区或检查失败推荐的用户,可使用 WandB、监控和恢复流程。
这个 Skill 有哪些优点和局限?
- 覆盖多种超参数优化算法和 TAO SDK 平台。
- 要求在提交推荐任务前完成模型支持、数据、凭据、镜像和资源检查。
- 支持基线评估、每次推荐评估、最终评估、监控、失败分类和结果交接。
- 可使用模型技能中的训练 schema 约束搜索空间,降低无效配置风险。
- 不能脱离模型技能的支持门禁自行推断搜索空间;缺少必需 schema 或评估能力时会停止。
- 运行依赖 Docker、nvidia-container-toolkit、Python 和 nvidia-tao-automl;部分流程还可能需要对象存储或平台 CLI。
- AutoML 任务可能耗时很长,具体运行时间和成本取决于预算、数据、平台和资源;源材料没有定价信息。
- 源材料未提供该技能自身的测试套件或已验证的平台覆盖证据。
如何安装这个 Skill?
按仓库 README 使用:npx skills add nvidia/skills --skill tao-run-automl --yes。该命令安装指定技能;源材料未说明具体安装目录。运行工作流还需要 Docker、nvidia-container-toolkit、Python 以及 nvidia-tao-automl 包。
如何使用这个 Skill?
安装后,向兼容的 Agent Skills 客户端提出类似“为我的 NVIDIA TAO 网络运行 AutoML 超参数优化,使用 bayesian 算法和指定平台”的请求,并提供模型、平台、训练/评估数据、结果目录、GPU/节点数量、镜像、指标和预算。技能会在启动前展示评审信息并请求确认;源材料未提供完整的用户项目配置示例。
这个 Skill 与同类方案有什么区别?
技能将 bayesian 定位为小到中等预算的默认选择;Hyperband/ASHA 适合可早停的多配置搜索;BOHB/DEHB 面向多保真搜索;PBT 面向需要训练期间变异的长任务;llm、hybrid 和 autoresearch 需要用户明确要求并配置端点。