开发与工程 hugging-facemodel-evaluationmodel-cardsmodel-indexlightevalvllminspect-aibenchmark-import

Hugging Face 模型评测管理技能

把评测基准分数结构化写入 Hugging Face 模型卡:从 README 提取、从 Artificial Analysis 导入,或用 vLLM/lighteval 自行跑分。

FollowSkills 评估 · FSRS-2.0
谨慎使用
54/ 100 五分制 2.7 / 5
1 2 3 4 5 6
1信任安全15 / 25 · 3.0/5

脚本默认仅打印YAML预览,写入前有get-prs防重复PR检查,token经环境变量/secrets传递,无恶意代码或隐蔽外传;但--apply可直接推送他人仓库,用户确认与回滚机制不完整,扣分。

2可靠稳定10 / 20 · 2.5/5

脚本结构一致,错误提示与troubleshooting较完善(缺依赖、token权限、OOM等有明确反馈);但无已提交测试覆盖关键路径(test_extraction.py被引用但未见内容),evaluation_manager.py证据截断,静态无法验证可运行性,扣分。

3适用触发9 / 15 · 3.0/5

场景(为模型卡添加评测结果)、触发条件、使用边界、vLLM本地与HF Jobs远程的适用对比表清晰;但功能完全依赖Hugging Face、Artificial Analysis等海外服务,无中文支持,中国大陆可达性风险明显,扣分。

4规范维护10 / 15 · 3.3/5

文档分层良好(SKILL.md+示例+troubleshooting),版本号1.3.0已声明,依赖以PEP 723固定;但无changelog、无明确维护责任与更新路径,发布者身份未经验证,扣分。

5有效结果6 / 15 · 2.0/5

核心任务(README表格提取、AA导入、自定义评测)命令与代码自洽,预览-应用流程合理,相较手工操作有实际增益;但静态审查无已验证的代表性输出,实际正确性未证实,扣分。

6证据核验4 / 10 · 2.0/5

源代码、示例表格格式、metric映射等一手材料可审计;但无第三方执行证据、无CI测试记录,关键声称(解析准确性、API兼容性)仅作者陈述,扣分。

证据充分度: 评估于 2026年9月9日 审查版本 2c9b106168d4
使用前请注意
  • --apply会直接推送至目标模型仓库,使用前务必先预览YAML并确认仓库归属;对他人仓库应使用--create-pr。
  • HF_TOKEN需具备写权限,请最小化授权并避免提交到.env之外的版本控制。
  • 该技能核心功能完全依赖Hugging Face Hub、Artificial Analysis API及HF Jobs,中国大陆网络环境下可能无法稳定访问,且无中文文档。
  • evaluation_manager.py源码在提供的证据中被截断(detect_table_format函数不完整),实际行为无法完全静态确认。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

这是一个面向 Hugging Face 生态的模型评测管理技能,核心是 scripts/evaluation_manager.py 命令行工具。它能把模型 README 中的 Markdown 评测表解析为符合 Papers with Code 规范的 model-index YAML,也能调用 Artificial Analysis API 导入基准分数,还支持在 Hugging Face Jobs 或本地 GPU 上用 lighteval、inspect-ai(vLLM/accelerate 后端)运行自定义评测。所有写入操作支持直接推送或自动开 Pull Request。版本 1.3.0,随 patchy631/ai-engineering-hub 仓库以 MIT 许可发布。

1) 用 inspect-tables 查看 README 中所有表格的结构、列名和样例行;2) 用 extract-readme 把指定表格转成 model-index YAML,可通过 --table N、--model-column-index、--task-type 控制提取;3) 用 import-aa 从 Artificial Analysis API 拉取基准分数并保留来源信息;4) 用 --apply 直接推送或 --create-pr 开 PR(推送前会强制检查已有开放 PR,避免重复);5) 通过 hf jobs uv run 在 HF 基础设施上运行 inspect-ai 或 lighteval/vLLM 评测任务;6) 用 show 和 validate 子命令查看和校验现有 model-index。

  1. 开源模型作者想把自己论文或 README 里的基准成绩表规范地写入 HF 模型卡,供排行榜抓取
  2. 社区贡献者想为别人的模型补充评测分数,希望以 PR 形式提交且不重复开 PR
  3. 需要快速拿到某个商业模型在 Artificial Analysis 上的最新基准数据的工程师
  4. 有本地 GPU 的研究者想用 Open LLM Leaderboard 任务(MMLU、GSM8K、ARC 等)评测自己微调的模型
  5. 团队想在 HF Jobs 上按模型规模自动选择硬件(t4/a10g/a100)批量跑评测任务

这个 Skill 有哪些优点和局限?

优点
  • 一条 CLI 覆盖提取、导入、自评、PR 管理全流程,且默认打印 YAML 供人工核对后再写入
  • 强制先查开放 PR(get-prs),从机制上防止给模型仓库刷重复 PR
  • 模型名匹配采用精确 token 归一化匹配,匹配不到会报错而不是猜一个相似名字
  • 支持 HF Jobs 零配置运行(无需 Dockerfile),并用硬件推荐表按模型规模选机器
  • 合并写入时保留已有 model-index 条目,不会覆盖
局限
  • vLLM 自定义评测要求本地有 uv 和足够显存的 GPU,纯 CPU 环境不可用
  • HF Jobs 非 CPU 硬件需要在 Hugging Face 账户绑定付费方式,会产生计算费用
  • Artificial Analysis 导入依赖 AA_API_KEY,没有该 API key 的用户无法使用该方法
  • README 提取依赖模型 README 中确实存在含数值分数的 Markdown 表格,格式不规范时提取失败
  • 源材料未提供测试套件或独立验证结果,脚本可靠性只能依据文档自述

如何安装这个 Skill?

仓库未单独说明该技能的安装步骤。可从 patchy631/ai-engineering-hub 获取技能目录(含 SKILL.md 与 scripts/),放入你的 Agent Skills 技能目录。运行依赖:首选安装 uv(脚本带 PEP 723 头,uv run 会自动装依赖),或手动 pip install huggingface-hub markdown-it-py python-dotenv pyyaml requests。需要设置 HF_TOKEN(需写权限);使用 Artificial Analysis 导入时还需 AA_API_KEY(可写入 .env,装了 python-dotenv 会自动加载)。跑自定义 vLLM 评测需 GPU 并安装 lighteval[accelerate,vllm]、vllm、torch 等。

如何使用这个 Skill?

推荐流程:先查开放 PR,再查看表格,然后提取、最后写入。示例:
1) uv run scripts/evaluation_manager.py get-prs --repo-id "username/model"
2) uv run scripts/evaluation_manager.py inspect-tables --repo-id "username/model"
3) uv run scripts/evaluation_manager.py extract-readme --repo-id "username/model" --table 1
4) 确认 YAML 后加 --apply(直接推送)或 --create-pr(开 PR)
导入 Artificial Analysis:AA_API_KEY=... python scripts/evaluation_manager.py import-aa --creator-slug "anthropic" --model-name "claude-sonnet-4" --repo-id "username/model-name" --create-pr
HF Jobs 评测:hf jobs uv run scripts/inspect_eval_uv.py --flavor a10g-small --secret HF_TOKEN=$HF_TOKEN -- --model "meta-llama/Llama-2-7b-hf" --task "mmlu"

这个 Skill 与同类方案有什么区别?

SKILL.md 将 vLLM 本地评测与推理服务商(Inference Provider)方式做了对比:vLLM 可评测任意 HF 模型、可离线、速度更快但需要 GPU 并承担 HF Jobs 计算成本;推理服务商方式走 API、无硬件要求但按用量计费且不支持离线。文档未提及其他第三方评测工具作为替代品。

常见问题

需要付费吗?
从 README 提取和开 PR 本身不需要费用;HF Jobs 使用非 CPU 硬件(如 a10g、a100)需要账户绑定支付方式并按计算付费;Artificial Analysis 导入需要你自己的 AA_API_KEY。
需要什么权限?
写入模型卡需要具备仓库写权限的 HF_TOKEN; Artificial Analysis 导入额外需要 AA_API_KEY;本地 vLLM 评测只需能访问 GPU 和模型下载权限。
README 里没有评测表会怎样?
inspect-tables 会报告未找到评测表。表格存在但找不到目标模型时,脚本会列出可用模型名,可用 --model-name-override 指定精确名称。
为什么我不该直接 --create-pr?
技能明确要求先用 get-prs 检查已有开放 PR;若已有开放 PR 再创建会造成重复工作,应先向用户展示已有 PR 链接并征得确认。

同仓库的其他 Skills

均来自 patchy631/ai-engineering-hub

开发与工程

Hugging Face API 工具构建器

把与 Hugging Face API 的交互打包成可复用、可管道组合的命令行脚本,免去每次重复写一次性抓取代码。

开发与工程

HF 论文发布助手

把 arXiv 论文索引到 Hugging Face Hub,并将其关联到模型、数据集卡片,一站管理作者身份与引用。

开发与工程

Hugging Face CLI 技能

让 AI 助手直接在终端执行 Hugging Face Hub 的模型下载、上传、仓库管理、缓存清理与云端 GPU 任务。

数据与分析

Trackio 实验追踪技能

在模型训练时记录指标、在训练后检索分析,并将仪表板同步到 Hugging Face Spaces,实现实时监控。

开发与工程

Hugging Face Jobs 运行技能

让 AI 助手直接把任意 Python 工作负载提交到 Hugging Face 全托管云算力,无需本地 GPU 或环境配置,并安全处理认证、超时与结果持久化。

开发与工程

HF 模型训练器(TRL on Hugging Face Jobs)

无需本地 GPU,通过 Hugging Face Jobs 云端基础设施使用 TRL 完成语言模型的微调、GGUF 转换与 Hub 持久化。

开发与工程

GRPO 微调技能(Qwen3 / Fireworks)

用一句自然语言任务描述和数据集,即可在 Fireworks 托管 GPU 上启动 GRPO 强化学习微调,全程无需手动配置训练脚本。

开发与工程

Bright Data Web MCP 网页访问技能

为 MCP 兼容智能体提供可靠的网页访问:搜索、抓取、结构化提取与浏览器自动化,自动绕过反爬和 CAPTCHA。

数据与分析

Hugging Face 数据集管理技能

在 Hugging Face Hub 上创建、配置、流式写入数据集,并用 DuckDB SQL 直接查询、转换、再发布任意公开数据集。

相关 Skills