Hugging Face 模型评测管理技能
把评测基准分数结构化写入 Hugging Face 模型卡:从 README 提取、从 Artificial Analysis 导入,或用 vLLM/lighteval 自行跑分。
脚本默认仅打印YAML预览,写入前有get-prs防重复PR检查,token经环境变量/secrets传递,无恶意代码或隐蔽外传;但--apply可直接推送他人仓库,用户确认与回滚机制不完整,扣分。
脚本结构一致,错误提示与troubleshooting较完善(缺依赖、token权限、OOM等有明确反馈);但无已提交测试覆盖关键路径(test_extraction.py被引用但未见内容),evaluation_manager.py证据截断,静态无法验证可运行性,扣分。
场景(为模型卡添加评测结果)、触发条件、使用边界、vLLM本地与HF Jobs远程的适用对比表清晰;但功能完全依赖Hugging Face、Artificial Analysis等海外服务,无中文支持,中国大陆可达性风险明显,扣分。
文档分层良好(SKILL.md+示例+troubleshooting),版本号1.3.0已声明,依赖以PEP 723固定;但无changelog、无明确维护责任与更新路径,发布者身份未经验证,扣分。
核心任务(README表格提取、AA导入、自定义评测)命令与代码自洽,预览-应用流程合理,相较手工操作有实际增益;但静态审查无已验证的代表性输出,实际正确性未证实,扣分。
源代码、示例表格格式、metric映射等一手材料可审计;但无第三方执行证据、无CI测试记录,关键声称(解析准确性、API兼容性)仅作者陈述,扣分。
- --apply会直接推送至目标模型仓库,使用前务必先预览YAML并确认仓库归属;对他人仓库应使用--create-pr。
- HF_TOKEN需具备写权限,请最小化授权并避免提交到.env之外的版本控制。
- 该技能核心功能完全依赖Hugging Face Hub、Artificial Analysis API及HF Jobs,中国大陆网络环境下可能无法稳定访问,且无中文文档。
- evaluation_manager.py源码在提供的证据中被截断(detect_table_format函数不完整),实际行为无法完全静态确认。
这个 Skill 能做什么,适合哪些场景?
这是一个面向 Hugging Face 生态的模型评测管理技能,核心是 scripts/evaluation_manager.py 命令行工具。它能把模型 README 中的 Markdown 评测表解析为符合 Papers with Code 规范的 model-index YAML,也能调用 Artificial Analysis API 导入基准分数,还支持在 Hugging Face Jobs 或本地 GPU 上用 lighteval、inspect-ai(vLLM/accelerate 后端)运行自定义评测。所有写入操作支持直接推送或自动开 Pull Request。版本 1.3.0,随 patchy631/ai-engineering-hub 仓库以 MIT 许可发布。
1) 用 inspect-tables 查看 README 中所有表格的结构、列名和样例行;2) 用 extract-readme 把指定表格转成 model-index YAML,可通过 --table N、--model-column-index、--task-type 控制提取;3) 用 import-aa 从 Artificial Analysis API 拉取基准分数并保留来源信息;4) 用 --apply 直接推送或 --create-pr 开 PR(推送前会强制检查已有开放 PR,避免重复);5) 通过 hf jobs uv run 在 HF 基础设施上运行 inspect-ai 或 lighteval/vLLM 评测任务;6) 用 show 和 validate 子命令查看和校验现有 model-index。
- 开源模型作者想把自己论文或 README 里的基准成绩表规范地写入 HF 模型卡,供排行榜抓取
- 社区贡献者想为别人的模型补充评测分数,希望以 PR 形式提交且不重复开 PR
- 需要快速拿到某个商业模型在 Artificial Analysis 上的最新基准数据的工程师
- 有本地 GPU 的研究者想用 Open LLM Leaderboard 任务(MMLU、GSM8K、ARC 等)评测自己微调的模型
- 团队想在 HF Jobs 上按模型规模自动选择硬件(t4/a10g/a100)批量跑评测任务
这个 Skill 有哪些优点和局限?
- 一条 CLI 覆盖提取、导入、自评、PR 管理全流程,且默认打印 YAML 供人工核对后再写入
- 强制先查开放 PR(get-prs),从机制上防止给模型仓库刷重复 PR
- 模型名匹配采用精确 token 归一化匹配,匹配不到会报错而不是猜一个相似名字
- 支持 HF Jobs 零配置运行(无需 Dockerfile),并用硬件推荐表按模型规模选机器
- 合并写入时保留已有 model-index 条目,不会覆盖
- vLLM 自定义评测要求本地有 uv 和足够显存的 GPU,纯 CPU 环境不可用
- HF Jobs 非 CPU 硬件需要在 Hugging Face 账户绑定付费方式,会产生计算费用
- Artificial Analysis 导入依赖 AA_API_KEY,没有该 API key 的用户无法使用该方法
- README 提取依赖模型 README 中确实存在含数值分数的 Markdown 表格,格式不规范时提取失败
- 源材料未提供测试套件或独立验证结果,脚本可靠性只能依据文档自述
如何安装这个 Skill?
仓库未单独说明该技能的安装步骤。可从 patchy631/ai-engineering-hub 获取技能目录(含 SKILL.md 与 scripts/),放入你的 Agent Skills 技能目录。运行依赖:首选安装 uv(脚本带 PEP 723 头,uv run 会自动装依赖),或手动 pip install huggingface-hub markdown-it-py python-dotenv pyyaml requests。需要设置 HF_TOKEN(需写权限);使用 Artificial Analysis 导入时还需 AA_API_KEY(可写入 .env,装了 python-dotenv 会自动加载)。跑自定义 vLLM 评测需 GPU 并安装 lighteval[accelerate,vllm]、vllm、torch 等。
如何使用这个 Skill?
推荐流程:先查开放 PR,再查看表格,然后提取、最后写入。示例:
1) uv run scripts/evaluation_manager.py get-prs --repo-id "username/model"
2) uv run scripts/evaluation_manager.py inspect-tables --repo-id "username/model"
3) uv run scripts/evaluation_manager.py extract-readme --repo-id "username/model" --table 1
4) 确认 YAML 后加 --apply(直接推送)或 --create-pr(开 PR)
导入 Artificial Analysis:AA_API_KEY=... python scripts/evaluation_manager.py import-aa --creator-slug "anthropic" --model-name "claude-sonnet-4" --repo-id "username/model-name" --create-pr
HF Jobs 评测:hf jobs uv run scripts/inspect_eval_uv.py --flavor a10g-small --secret HF_TOKEN=$HF_TOKEN -- --model "meta-llama/Llama-2-7b-hf" --task "mmlu"
这个 Skill 与同类方案有什么区别?
SKILL.md 将 vLLM 本地评测与推理服务商(Inference Provider)方式做了对比:vLLM 可评测任意 HF 模型、可离线、速度更快但需要 GPU 并承担 HF Jobs 计算成本;推理服务商方式走 API、无硬件要求但按用量计费且不支持离线。文档未提及其他第三方评测工具作为替代品。