数据与分析 object-detectionimage-classificationimage-segmentationhugging-face-jobstransformerssam2trackio

Hugging Face 视觉模型训练助手

在 Hugging Face Jobs 云 GPU 上训练检测、分类与分割视觉模型,并将结果保存到 Hub。

FollowSkills 评估 · FSRS-2.0
不推荐
43/ 100 五分制 2.2 / 5
信任安全12 / 25 · 2.4/5

文档要求在 Job secrets 中传递 HF_TOKEN、训练前验证数据集,并提示 Hub 持久化和部分故障处理,说明权限与数据流有一定透明度;但默认会产生付费云 GPU、推送到 Hub 的外部影响,未明确最终提交确认、公开/私有仓库选择、回滚方案或敏感数据处理,且示例包含直接读取和传递令牌,因此扣分。

可靠稳定7 / 20 · 1.8/5

工作流、数据格式检查、超时建议和常见错误说明较完整,且强调失败前验证;但实际训练脚本未提供在本次证据中,依赖版本未稳定锁定,SAM 示例存在 original_sizes 与 original_image_size 等字段不一致风险,也没有静态可验证的关键路径测试,因此按静态上限保守扣分。

适用触发8 / 15 · 2.7/5

覆盖目标检测、分类和 SAM/SAM2,并列出模型、数据集格式、硬件和触发词,场景边界基本清楚;但非适用范围、输入异常处理、中文使用和中国大陆网络可达性没有说明,核心服务依赖 Hugging Face 海外云端,扣分。

规范维护7 / 15 · 2.3/5

目录层次、相关技能、前置条件、快速开始、参考资料和故障排查较丰富,许可证元数据明确为 Apache-2.0;但缺少技能版本、变更日志、明确维护责任与更新路径,脚本和引用材料的版本兼容性也未充分说明,因此扣分。

有效结果6 / 15 · 2.0/5

文档覆盖从数据检查、训练、评估、监控到 Hub 保存和推理,理论上可完成核心任务,且提供可直接改写的参数示例;但脚本本体未在证据中出现,示例未有可核验执行结果,部分配置一致性和模型/硬件假设仍需人工复核,静态评估不得超过7分,故扣分。

证据核验3 / 10 · 1.5/5

提供了较多代码、参数和故障现象,具备一定审计线索;但没有提交的测试套件、CI 覆盖、真实运行日志或第三方复现证据,主要结论仍来自文档声明,故仅给低分。

证据充分度: 评估于 2026年7月20日 审查版本 86cdeee824b7
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 提交训练 Job 可能产生实际 GPU 费用并向 Hub 写入模型;在执行前应明确获得用户对预算、目标仓库可见性和最终提交的确认。
  • 不要把真实令牌写入脚本、日志或普通环境变量;应确认 secrets 机制、权限范围和令牌失效/轮换流程。
  • 提供的证据未包含 scripts/ 目录及其测试,且 SAM 参考代码存在字段名不一致风险;应先在隔离环境复核依赖、参数和数据批处理。
  • 核心流程依赖 Hugging Face Hub、Jobs、模型和数据下载;应评估中国大陆网络可达性,并准备可访问的镜像或本地替代方案。
评估证据 [1][2][3][4][5][6]
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向使用 Hugging Face Transformers 训练视觉模型的用户,覆盖目标检测、图像分类以及 SAM/SAM2 分割。它提供数据集格式检查、训练脚本模板、硬件与成本选择、指标评估、Trackio 监控和 Hub 持久化流程。训练任务可通过 Hugging Face Jobs 提交到云 GPU,也支持本地运行相关脚本。使用者需要付费的 Hugging Face 计划、具备写权限的令牌,以及符合要求的 Hub 数据集。

读取并检查 Hub 数据集的图像、标签、目标框、掩码和提示字段;运行 dataset_inspector.py 验证数据格式;使用目标检测、图像分类或 SAM/SAM2 训练脚本准备训练任务;通过 hf_jobs MCP 工具或 HfApi().run_uv_job() 提交云 GPU 作业;估算成本、配置超时和硬件;计算 mAP、mAR、准确率等指标;将训练结果推送到 Hugging Face Hub,并提供作业 ID、监控地址和 Trackio 仪表板地址。

  1. 需要在没有本地 GPU 的情况下,用自定义 COCO 格式数据集微调 D-FINE、RT-DETR v2、DETR 或 YOLOS 的目标检测用户。
  2. 需要用带有 image 和 label 字段的数据集训练 MobileNetV3、MobileViT、ResNet、ViT/DINOv3 或其他 Transformers 分类器的用户。
  3. 需要用二值掩码和边界框或点提示微调 SAM 或 SAM2,进行图像分割或图像抠图的用户。
  4. 希望在提交 GPU 训练前检查数据格式、选择硬件、估算费用并将模型永久保存到 Hub 的用户。

这个 Skill 有哪些优点和局限?

优点
  • 同时覆盖目标检测、图像分类和 SAM/SAM2 分割三类视觉训练任务。
  • 提供数据集检查器和多套可直接提交的训练脚本,明确处理常见框格式、标签映射和字段问题。
  • 包含硬件、超时、成本、令牌注入、Hub 保存和常见故障处理指导。
  • 支持云 GPU 训练,并强调将结果推送到 Hub 以避免临时环境丢失。
局限
  • 训练需要 Hugging Face Pro、Team 或 Enterprise 计划,并需要具有写权限的令牌。
  • 云 GPU 按小时计费,实际费用和训练时长取决于数据规模、模型、硬件和配置。
  • 技能依赖 Hugging Face Jobs、Hub 数据集和相关 Python 训练环境;不适合完全离线的工作流。
  • 提供的材料没有展示独立测试套件或跨平台验证证据。

如何安装这个 Skill?

从 https://github.com/huggingface/skills 获取仓库,将 skills/huggingface-vision-trainer 文件夹复制或链接到 Codex 的标准 .agents/skills 位置,例如 $REPO_ROOT/.agents/skills。README 也记录了通过 Hugging Face CLI 添加技能的方式:hf skills add huggingface-vision-trainer

如何使用这个 Skill?

安装后,可以向编码代理提出:“使用 Hugging Face vision trainer,在 Hugging Face Jobs 上用我的数据集训练一个 D-FINE 目标检测模型,并将结果推送到 Hub。”典型流程是验证账户和令牌、运行 uv run scripts/dataset_inspector.py --dataset username/dataset-name --split train、选择数据规模和 GPU、准备对应训练脚本、提交作业并等待用户请求状态检查。

这个 Skill 与同类方案有什么区别?

该技能专注于视觉模型训练;README 中的 hugging-face-jobs 技能负责更通用的 Jobs 基础设施问题,例如令牌、硬件、密钥、超时和任务持久化。README 中的 hugging-face-model-trainer 面向 TRL 语言模型训练,不是本技能的替代品。

常见问题

是否必须有本地 GPU?
不必须。技能主要指导通过 Hugging Face Jobs 使用托管云 GPU,也描述了本地脚本运行方式。
训练前为什么要检查数据集?
技能将字段和格式不匹配列为训练失败的主要原因,并提供 dataset_inspector.py 在消耗 GPU 时间前验证数据集。
如何避免训练结果在云任务结束后丢失?
启用 `push_to_hub`,设置 `hub_model_id`,并把具有写权限的 HF 令牌放入作业 secrets。
它是否负责自动监控已提交的作业?
不会自动轮询;提交后应报告作业 ID、日志或监控地址,等待用户请求状态检查。

同仓库的其他 Skills

均来自 huggingface/skills

数据与分析

Hugging Face LLM 训练器

在 Hugging Face 云端 GPU 上训练、微调并保存模型。

数据与分析

Hugging Face 本地模型评测

在本地硬件上为 Hugging Face Hub 模型运行可控的 inspect-ai 或 lighteval 评测。

数据与分析

Trackio 实验追踪

记录、监控并分析机器学习训练实验,让指标和诊断告警可供自动化工作流使用。

数据与分析

Sentence Transformers 训练助手

为检索、相似度与稀疏搜索训练 Sentence Transformers 模型。

开发与工程

Hugging Face MCP 助手

通过 MCP 让智能体直接搜索、阅读并使用 Hugging Face Hub 资源。

开发与工程

Hugging Face ZeroGPU 开发指南

帮助你构建可靠的 Gradio ZeroGPU AI 演示与 GPU 工作负载。

开发与工程

LoRA Space Demo Builder

为 Hugging Face LoRA 自动设计并发布定制化 Gradio 演示 Space。

开发与工程

Hugging Face Spaces 构建器

帮助智能体创建、部署和维护 Hugging Face Spaces 应用。

数据与分析

Hugging Face 数据集探索助手

通过 Dataset Viewer API 探索、检索和提取 Hugging Face 数据集。

开发与工程

Hugging Face 论文研究助手

读取 AI 论文并提取 Hugging Face 论文页的结构化元数据。

数据与分析

Hugging Face 模型内存估算器

在不下载权重的情况下估算模型推理所需内存。

开发与工程

Hugging Face 本地模型运行器

帮助你从 Hugging Face 选择合适的 GGUF 量化模型,并用 llama.cpp 在本机运行。

开发与工程

Hugging Face Hub CLI 技能

让智能体通过 hf 命令管理 Hugging Face Hub 上的模型、数据集、空间、作业与基础设施。

数据与分析

Hugging Face 模型优选器

根据任务、基准成绩和设备内存筛选并推荐合适的 AI 模型。

开发与工程

Hugging Face API 工具构建器

把 Hugging Face API 调用组合成可复用、可管道化的命令行工具。

写作与内容

Hugging Face 论文发布器

在 Hugging Face Hub 上发布、关联和管理研究论文。

数据与分析

Transformers.js 浏览器与 Node.js 推理技能

在 JavaScript 应用中直接运行 Hugging Face 模型。

自动化与运维

AWS 云账户上下文发现

在 AWS 操作前准确识别本地配置、账户与身份。

自动化与运维

SageMaker 模型部署规划器

为不同模型和流量需求选择合适的 AWS SageMaker 部署路径。

自动化与运维

SageMaker Python 环境管家

为 SageMaker 与 AWS 任务创建隔离且版本正确的 Python 环境。

相关 Skills