数据与分析 ✓ NVIDIA · 官方 huggingfacemodel-finetuningcomputer-visionlorangcnvidia-gpumodel-evaluation

Hugging Face 本地 GPU 微调助手

在本地 NVIDIA GPU 上,以可复现流程微调 Hugging Face 模型。

FollowSkills 评估 · FSRS-2.0
不推荐
48/ 100 五分制 2.4 / 5
信任安全14 / 25 · 2.8/5

技能明确限制凭据读取场景,声明仅检查令牌存在性,并要求本地只读数据挂载、烟雾测试和错误停止;但允许 Bash/Write,默认 push_to_hub=true,可能构建大型镜像、写入本地输出并向 HF Hub/W&B 产生外部影响,缺少明确的逐次发布确认、细粒度权限和回滚方案,因此扣分。

可靠稳定8 / 20 · 2.0/5

六步流程、门禁、最小变更错误恢复和提交的示例结果提升了可诊断性;但关键 references 未在给定材料中提供,依赖 live research、Docker、NGC、HF 及特定 GPU 环境,且存在默认镜像版本与平台说明不一致等稳定性不确定性。静态评估不超过10分,故扣分。

适用触发7 / 15 · 2.3/5

目标用户、模型/数据输入、支持任务和非适用条件基本清楚;但核心能力严格依赖 NVIDIA GPU、Docker、NGC、Hugging Face 网络和可选 W&B,未说明中文交互或中国大陆网络可达性,触发边界和替代后端证据也有限。

规范维护9 / 15 · 3.0/5

SKILL.md 结构清晰,包含输入、兼容性、工作流、门禁、错误手册、版本和 Apache-2.0 许可;示例和 benchmark 提供维护线索。但缺少显式 Instructions/Examples 推荐章节,作者格式被 benchmark 标为不合规,缺少明确 changelog、维护责任和更新流程,且引用的参考文件未随材料提供。

有效结果6 / 15 · 2.0/5

文档承诺从资格审查到训练、评估、推理、Hub 发布和可重跑 skill,并提供四个示例及指标,显示核心任务可能可完成;但仅有一个 benchmark 任务,示例结果不能在静态审查中独立验证,且多任务、多模型路径仍需用户承担环境和数据适配,故保守给分。

证据核验4 / 10 · 2.0/5

示例 config 含模型卡、脚本、任务文档和论文 URL,提交的 benchmark、报告和示例产物提供一定审计线索;但没有本次审查的执行复现,benchmark 仅一项且结果声明无法独立核验,故不超过静态上限5分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 默认 push_to_hub=true,运行前应明确确认 Hub 发布目标、数据范围、模型卡内容及 W&B 外部日志。
  • 核心依赖 live Hugging Face/NGC 文档与海外服务;中国大陆网络不可达或凭据缺失时,流程可能无法推进。
  • 提交材料引用了大量未提供的 references 文件,实际执行前需核对其内容、依赖版本和 Docker 安全边界。
  • 示例指标和 benchmark 结果属于提交证据,不应视为本次静态审查已执行验证。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能指导代理在 NGC PyTorch 容器中使用本地 NVIDIA GPU 微调 Hugging Face 的计算机视觉、视觉语言和语言模型。它覆盖全参数微调与 LoRA,以及图像分类、目标检测、分割、深度估计、VLM SFT/LoRA 和 LLM 的 SFT、DPO、GRPO。流程包含模型与数据检查、硬件审计、实时资料研究、项目生成、真实数据冒烟测试、训练评估、推理、Hub 发布和可复运行技能生成。它适合已有 Docker 与 NVIDIA GPU 环境、希望获得可审计训练产物的使用者。

读取 Hugging Face 模型与数据集标识、本地数据路径、训练参数和可选凭据;在 Docker 中探测模型配置、模型卡、数据格式与任务结构;根据主机驱动和 CUDA 条件选择 NGC PyTorch 镜像;实时获取模型卡、仓库示例、任务文档或论文中的训练配方;生成 config.yaml、Dockerfile、requirements.txt、数据准备、训练、评估和推理脚本;用真实数据执行 1 步冒烟测试;完成基线评估、训练、训练后评估和 5 个推理样本;可将模型、模型卡、配置、报告和样本推送到 Hugging Face Hub,并生成用于复跑的 SKILL.md。

  1. 研究人员希望在本地 NVIDIA GPU 上微调一个 Hugging Face 视觉模型,并先用真实数据验证训练管线。
  2. 机器学习工程师需要以 LoRA 方式微调视觉语言模型或语言模型,同时保留可复现的配置和容器环境。
  3. 团队需要为图像分类、目标检测、语义分割、实例分割或全景分割任务生成端到端训练项目。
  4. 模型开发者希望在扩大训练规模前,对 Hugging Face 模型和数据集进行本地兼容性与硬件适配检查。
  5. 团队希望将微调结果、模型卡、评估结果和复跑技能一并发布到 Hugging Face Hub。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖视觉、视觉语言和语言模型的多种 Hugging Face 微调任务。
  • 强制实时研究模型卡、任务文档和示例,降低因过时库知识导致的训练配置错误。
  • 要求在真实数据上执行 1 步冒烟测试,并定义损失和梯度范数的通过标准。
  • 生成容器、配置、训练、评估、推理和复跑技能等完整产物。
  • 明确规定 OOM、NaN、平坦损失和重复错误的最小变更恢复策略。
局限
  • 依赖 Docker、NVIDIA Container Toolkit、NVIDIA GPU、NGC 镜像和较大磁盘空间。
  • 硬件门槛较高;文档给出的默认参考是 3B 及以下模型需要至少 24 GB 显存。
  • 技能正文描述了完整流程,但未提供该具体模型或数据集已验证成功的结果。
  • 实时研究、镜像构建、数据处理和完整训练会产生网络、存储和计算开销。
  • README 的仓库级签名、评估和基准要求不能证明该单项技能本身已完成相同验证。

如何安装这个 Skill?

使用 NVIDIA/skills 仓库提供的 skills CLI 安装指定技能:

npx skills add nvidia/skills --skill tao-finetune-huggingface-model --yes

也可以指定目标代理,例如:

npx skills add nvidia/skills --skill tao-finetune-huggingface-model --agent codex --yes

README 未说明该单项技能的其他独立安装方式。

如何使用这个 Skill?

安装后,让代理执行类似请求:“使用 tao-finetune-huggingface-model,在本地 NVIDIA GPU 上微调 google/vit-base-patch16-224。”请求至少应提供 model_id;数据可提供 Hugging Face dataset_id、本地数据路径,或让代理推荐数据集。可进一步指定 task_type、训练方法、LoRA 参数、输出目录、是否跳过基线评估以及是否推送到 Hub。运行前需要 Docker、NVIDIA Container Toolkit、兼容的 NVIDIA GPU 主机和足够磁盘空间;技能要求先完成冒烟测试,再进行完整训练。

常见问题

必须使用 NVIDIA GPU 吗?
是。该技能面向本地 NVIDIA GPU,并要求 Docker 与 NVIDIA Container Toolkit;CPU-only Docker 仅用于前置探测,不用于实际训练。
可以不上传模型到 Hugging Face Hub 吗?
可以,将 push_to_hub 设置为 false 即可跳过发布。默认值为 true;启用发布或访问受限模型、数据集时才需要 HF_TOKEN。
训练失败时会自动更换模型或训练方法吗?
不会。技能禁止静默替换 model_id、dataset_id 或 training_method;无法加载或连续出现同一错误 3 次时应停止并请求用户处理。
它是否支持 LoRA?
支持。可用于视觉语言模型和语言模型等场景;如果全参数微调无法适配显存且用户未请求 LoRA,技能要求先征得同意再切换。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

TAO HuggingFace 模型集成助手

将 HuggingFace 计算机视觉模型接入 NVIDIA TAO 的训练、导出与 TensorRT 部署流程。

自动化与运维 ✓ NVIDIA · 官方

Holoscan NGC 容器安装助手

通过 NGC Docker 容器安装、验证并启动 NVIDIA Holoscan SDK。

数据与分析 ✓ NVIDIA · 官方

Cosmos Reason 视频问答微调

为 Cosmos3-Nano 视频问答模型提供基于 FSDP 的 SFT、LoRA、评估与 AutoML 工作流指导。

开发与工程 ✓ NVIDIA · 官方

DeepStream 视觉模型导入助手

将目标检测模型自动接入 NVIDIA DeepStream 并生成基准报告。

开发与工程 ✓ NVIDIA · 官方

TAO Sparse4D 训练技能

帮助代理训练、评估、导出、量化和推理多摄像头时序3D检测跟踪模型。

数据与分析 ✓ NVIDIA · 官方

TAO 标准训练流程

为 TAO 模型执行标准的训练、评估与导出流程。

数据与分析 ✓ NVIDIA · 官方

TAO Depth Anything v2 深度估计

使用 NVIDIA TAO 从单张 RGB 图像训练、评估、导出和推理单目深度模型。

数据与分析 ✓ NVIDIA · 官方

TAO 人员重识别训练技能

训练和部署用于跨摄像头人员匹配的 TAO ReID 模型。

数据与分析 ✓ NVIDIA · 官方

TAO MAE 视觉预训练技能

指导 NVIDIA TAO 使用掩码自编码器进行视觉预训练与微调。

自动化与运维 ✓ NVIDIA · 官方

NVIDIA GPU Docker 运行规范

为 NVIDIA GPU 容器工作负载提供可复用的 Docker 运行、认证、挂载与故障排查规范。

数据与分析 ✓ NVIDIA · 官方

TAO ChangeNet 根因分析

基于图像证据定位 NVIDIA TAO Visual ChangeNet 分类实验的模型失败原因。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

数据与分析 ✓ NVIDIA · 官方

NV-Segment-CT 微调

为 CT NIfTI 标注执行 NV-Segment-CT VISTA3D 微调。

数据与分析 ✓ NVIDIA · 官方

Nemotron 模型定制流水线

为 Nemotron 模型规划、配置并串联数据处理、训练、对齐、转换、优化与评测步骤。

自动化与运维 ✓ NVIDIA · 官方

VSS 多摄像头三维检测追踪部署

部署基于 DeepStream 与 BEV Fusion 的多摄像头三维感知服务。

自动化与运维 ✓ NVIDIA · 官方

TAO NVIDIA GPU 主机配置

为 TAO 的 Docker 与 Kubernetes GPU 主机检查并配置 NVIDIA 驱动、CUDA 和容器运行时。

自动化与运维 ✓ NVIDIA · 官方

AutoMagicCalib 校准栈启动器

通过 Docker Compose 部署 AutoMagicCalib 微服务与 Web UI,快速启动摄像头自动标定环境。

开发与工程 ✓ NVIDIA · 官方

DeepStream 管道构建器

通过交互式需求收集,为 NVIDIA DeepStream 生成并验证可运行的 GStreamer 推理管道。

数据与分析 ✓ NVIDIA · 官方

Cosmos-Embed 视频检索与微调技能

用 Cosmos-Embed1 将视频与文本嵌入用于检索和微调。

开发与工程 ✓ NVIDIA · 官方

Holoscan Conda 安装助手

在 Linux x86_64 的 CUDA 13 环境中,通过 Conda 安装并验证 Holoscan SDK。

相关 Skills