Hugging Face 视觉模型训练助手
在 Hugging Face Jobs 云 GPU 上训练检测、分类与分割视觉模型,并将结果保存到 Hub。
文档要求在 Job secrets 中传递 HF_TOKEN、训练前验证数据集,并提示 Hub 持久化和部分故障处理,说明权限与数据流有一定透明度;但默认会产生付费云 GPU、推送到 Hub 的外部影响,未明确最终提交确认、公开/私有仓库选择、回滚方案或敏感数据处理,且示例包含直接读取和传递令牌,因此扣分。
工作流、数据格式检查、超时建议和常见错误说明较完整,且强调失败前验证;但实际训练脚本未提供在本次证据中,依赖版本未稳定锁定,SAM 示例存在 original_sizes 与 original_image_size 等字段不一致风险,也没有静态可验证的关键路径测试,因此按静态上限保守扣分。
覆盖目标检测、分类和 SAM/SAM2,并列出模型、数据集格式、硬件和触发词,场景边界基本清楚;但非适用范围、输入异常处理、中文使用和中国大陆网络可达性没有说明,核心服务依赖 Hugging Face 海外云端,扣分。
目录层次、相关技能、前置条件、快速开始、参考资料和故障排查较丰富,许可证元数据明确为 Apache-2.0;但缺少技能版本、变更日志、明确维护责任与更新路径,脚本和引用材料的版本兼容性也未充分说明,因此扣分。
文档覆盖从数据检查、训练、评估、监控到 Hub 保存和推理,理论上可完成核心任务,且提供可直接改写的参数示例;但脚本本体未在证据中出现,示例未有可核验执行结果,部分配置一致性和模型/硬件假设仍需人工复核,静态评估不得超过7分,故扣分。
提供了较多代码、参数和故障现象,具备一定审计线索;但没有提交的测试套件、CI 覆盖、真实运行日志或第三方复现证据,主要结论仍来自文档声明,故仅给低分。
- 提交训练 Job 可能产生实际 GPU 费用并向 Hub 写入模型;在执行前应明确获得用户对预算、目标仓库可见性和最终提交的确认。
- 不要把真实令牌写入脚本、日志或普通环境变量;应确认 secrets 机制、权限范围和令牌失效/轮换流程。
- 提供的证据未包含 scripts/ 目录及其测试,且 SAM 参考代码存在字段名不一致风险;应先在隔离环境复核依赖、参数和数据批处理。
- 核心流程依赖 Hugging Face Hub、Jobs、模型和数据下载;应评估中国大陆网络可达性,并准备可访问的镜像或本地替代方案。
这个 Skill 能做什么,适合哪些场景?
该技能面向使用 Hugging Face Transformers 训练视觉模型的用户,覆盖目标检测、图像分类以及 SAM/SAM2 分割。它提供数据集格式检查、训练脚本模板、硬件与成本选择、指标评估、Trackio 监控和 Hub 持久化流程。训练任务可通过 Hugging Face Jobs 提交到云 GPU,也支持本地运行相关脚本。使用者需要付费的 Hugging Face 计划、具备写权限的令牌,以及符合要求的 Hub 数据集。
读取并检查 Hub 数据集的图像、标签、目标框、掩码和提示字段;运行 dataset_inspector.py 验证数据格式;使用目标检测、图像分类或 SAM/SAM2 训练脚本准备训练任务;通过 hf_jobs MCP 工具或 HfApi().run_uv_job() 提交云 GPU 作业;估算成本、配置超时和硬件;计算 mAP、mAR、准确率等指标;将训练结果推送到 Hugging Face Hub,并提供作业 ID、监控地址和 Trackio 仪表板地址。
- 需要在没有本地 GPU 的情况下,用自定义 COCO 格式数据集微调 D-FINE、RT-DETR v2、DETR 或 YOLOS 的目标检测用户。
- 需要用带有 image 和 label 字段的数据集训练 MobileNetV3、MobileViT、ResNet、ViT/DINOv3 或其他 Transformers 分类器的用户。
- 需要用二值掩码和边界框或点提示微调 SAM 或 SAM2,进行图像分割或图像抠图的用户。
- 希望在提交 GPU 训练前检查数据格式、选择硬件、估算费用并将模型永久保存到 Hub 的用户。
这个 Skill 有哪些优点和局限?
- 同时覆盖目标检测、图像分类和 SAM/SAM2 分割三类视觉训练任务。
- 提供数据集检查器和多套可直接提交的训练脚本,明确处理常见框格式、标签映射和字段问题。
- 包含硬件、超时、成本、令牌注入、Hub 保存和常见故障处理指导。
- 支持云 GPU 训练,并强调将结果推送到 Hub 以避免临时环境丢失。
- 训练需要 Hugging Face Pro、Team 或 Enterprise 计划,并需要具有写权限的令牌。
- 云 GPU 按小时计费,实际费用和训练时长取决于数据规模、模型、硬件和配置。
- 技能依赖 Hugging Face Jobs、Hub 数据集和相关 Python 训练环境;不适合完全离线的工作流。
- 提供的材料没有展示独立测试套件或跨平台验证证据。
如何安装这个 Skill?
从 https://github.com/huggingface/skills 获取仓库,将 skills/huggingface-vision-trainer 文件夹复制或链接到 Codex 的标准 .agents/skills 位置,例如 $REPO_ROOT/.agents/skills。README 也记录了通过 Hugging Face CLI 添加技能的方式:hf skills add huggingface-vision-trainer。
如何使用这个 Skill?
安装后,可以向编码代理提出:“使用 Hugging Face vision trainer,在 Hugging Face Jobs 上用我的数据集训练一个 D-FINE 目标检测模型,并将结果推送到 Hub。”典型流程是验证账户和令牌、运行 uv run scripts/dataset_inspector.py --dataset username/dataset-name --split train、选择数据规模和 GPU、准备对应训练脚本、提交作业并等待用户请求状态检查。
这个 Skill 与同类方案有什么区别?
该技能专注于视觉模型训练;README 中的 hugging-face-jobs 技能负责更通用的 Jobs 基础设施问题,例如令牌、硬件、密钥、超时和任务持久化。README 中的 hugging-face-model-trainer 面向 TRL 语言模型训练,不是本技能的替代品。