Hugging Face 本地模型评测
在本地硬件上为 Hugging Face Hub 模型运行可控的 inspect-ai 或 lighteval 评测。
证据显示脚本默认进行本地评测,HF_TOKEN仅通过环境变量传递,远程代码执行需显式参数,且明确区分本地与Jobs边界;但未说明提示词/模型数据向Inference Providers或Hub的流向、缺少敏感数据处理和用户确认、隔离、回滚及依赖安全说明,因此扣分。
文档、参数和三个脚本基本一致,包含后端回退、smoke test和错误退出信息;但没有针对关键路径的测试或执行证据,参数/CLI兼容性未验证,异常输入校验较少,示例中的目录名与评估技能实际路径不一致,因此扣分。
目标场景、框架选择、后端选择、硬件范围和非覆盖范围较清楚;但触发条件与输入边界仍不够精确,没有中文使用指导,核心功能依赖Hugging Face Hub/Inference Providers及本地GPU,未说明中国大陆网络可达性,因此扣分。
SKILL.md采用分层说明,提供安装前提、命令示例、任务格式、故障排查和边界说明;仓库提供Apache-2.0许可和CI生成文件校验,但缺少该技能明确的版本策略、变更记录、维护责任人和更新路径,且示例路径存在不一致,因此扣分。
脚本声称可直接启动inspect-ai或lighteval本地评测,并提供vLLM、Transformers和accelerate回退,核心价值明确;但静态审查无法确认命令实际可运行,结果格式、持久化和发布前输出仍需用户自行处理,且GPU/依赖成本较高,因此扣分。
脚本和文档均可审计,仓库CI能验证生成工件,但没有覆盖评测关键路径的测试套件、真实运行日志或第三方复核;因此仅给予有限静态可验证性。
- 未执行任何命令;请在隔离环境中先运行小样本 smoke test,并确认inspect-ai/lighteval CLI版本兼容性。
- 使用HF_TOKEN、Inference Providers、模型仓库或--trust-remote-code前,应确认凭据、输入数据和远程代码的信任边界。
- 示例中的cd skills/hugging-face-evaluation与目标路径skills/huggingface-community-evals不一致,可能导致直接复制执行失败。
- 若在中国大陆使用,应预先验证Hub、Inference Providers及模型下载链路的网络可达性。
这个 Skill 能做什么,适合哪些场景?
该技能面向需要在本地硬件上评测 Hugging Face Hub 模型的用户。它支持使用 inspect-ai 或 lighteval,并帮助在 vLLM、Hugging Face Transformers 和 accelerate 之间选择推理后端。流程覆盖任务选择、GPU 可用性检查、冒烟测试和后端回退策略。它不负责 Hugging Face Jobs 远程编排、模型卡编辑、评测结果发布或 community-evals 自动化。
它读取用户指定的 Hub 模型和评测任务,调用仓库提供的 Python 脚本,通过 uv 运行 inspect-ai 或 lighteval;可使用 Hugging Face Inference Providers、本地 vLLM、Transformers 或 accelerate。它支持设置 HF_TOKEN 访问受限或私有模型,使用 --limit 或 --max-samples 执行小规模冒烟测试,并根据模型兼容性选择回退后端。
- 需要快速检查一个 Hugging Face Hub 模型在 mmlu、gsm8k 或其他 inspect-ai 任务上的表现,并希望先运行少量样本的用户。
- 拥有本地 GPU、希望用 vLLM 提高吞吐量来评测支持架构的模型的用户。
- 模型不受 vLLM 支持,需要改用 Transformers 或 accelerate 运行本地评测的用户。
- 希望使用 Open LLM Leaderboard 风格任务字符串运行 lighteval 评测的用户。
- 需要评测 gated 或 private Hub 模型,并能提供 HF_TOKEN 的用户。
这个 Skill 有哪些优点和局限?
- 同时覆盖 inspect-ai 和 lighteval 两种评测框架。
- 提供 vLLM、Transformers 和 accelerate 的明确选择与回退路径。
- 建议先用 --limit 或 --max-samples 做低成本冒烟测试。
- 包含本地 GPU、Inference Providers、受限模型访问和常见 OOM 排查指引。
- 核心范围限定为本地执行,不包含 Hugging Face Jobs 远程硬件选择、调度或监控。
- 不负责 .eval_results 生成发布、模型卡修改、PR 创建或 community-evals 自动化。
- 需要本地 shell、文件系统和相关 Python 工具;13B 以上模型可能需要高显存硬件或转交远程执行。
- SKILL.md 未提供测试套件、精确版本要求或各平台兼容性验证记录。
如何安装这个 Skill?
该仓库遵循 Agent Skills 格式。按照 README,将 skills/huggingface-community-evals 文件夹复制或软链接到 Codex 的标准 .agents/skills 位置,例如 $REPO_ROOT/.agents/skills 或 $HOME/.agents/skills。也可以先安装仓库提供的 hf-cli,再运行 hf skills add huggingface-community-evals;README 未提供该命令针对版本或具体安装路径的更多说明。
如何使用这个 Skill?
在已安装该技能的编码代理中直接提出类似“用 Hugging Face community evals 在本地评测 meta-llama/Llama-3.2-1B,任务为 mmlu,先运行 20 个样本”的请求。对应命令示例为:uv run scripts/inspect_eval_uv.py --model meta-llama/Llama-3.2-1B --task mmlu --limit 20。本地 GPU 可使用 scripts/inspect_vllm_uv.py 或 scripts/lighteval_vllm_uv.py;开始前可运行 uv --version、printenv HF_TOKEN >/dev/null 和 nvidia-smi 检查环境。
这个 Skill 与同类方案有什么区别?
该技能明确比较 inspect-ai 与 lighteval,并在本地推理中比较 vLLM、Hugging Face Transformers 和 accelerate:inspect-ai 适合显式任务控制,lighteval 适合任务字符串和 leaderboard 风格基准;vLLM 偏向支持架构上的吞吐量,Transformers 或 accelerate 用作兼容性回退。