数据与分析 hugging-facemodel-evaluationinspect-ailightevalvllmtransformersaccelerategpu-inference

Hugging Face 本地模型评测

在本地硬件上为 Hugging Face Hub 模型运行可控的 inspect-ai 或 lighteval 评测。

FollowSkills 评估 · FSRS-2.0
不推荐
47/ 100 五分制 2.4 / 5
信任安全13 / 25 · 2.6/5

证据显示脚本默认进行本地评测,HF_TOKEN仅通过环境变量传递,远程代码执行需显式参数,且明确区分本地与Jobs边界;但未说明提示词/模型数据向Inference Providers或Hub的流向、缺少敏感数据处理和用户确认、隔离、回滚及依赖安全说明,因此扣分。

可靠稳定8 / 20 · 2.0/5

文档、参数和三个脚本基本一致,包含后端回退、smoke test和错误退出信息;但没有针对关键路径的测试或执行证据,参数/CLI兼容性未验证,异常输入校验较少,示例中的目录名与评估技能实际路径不一致,因此扣分。

适用触发8 / 15 · 2.7/5

目标场景、框架选择、后端选择、硬件范围和非覆盖范围较清楚;但触发条件与输入边界仍不够精确,没有中文使用指导,核心功能依赖Hugging Face Hub/Inference Providers及本地GPU,未说明中国大陆网络可达性,因此扣分。

规范维护8 / 15 · 2.7/5

SKILL.md采用分层说明,提供安装前提、命令示例、任务格式、故障排查和边界说明;仓库提供Apache-2.0许可和CI生成文件校验,但缺少该技能明确的版本策略、变更记录、维护责任人和更新路径,且示例路径存在不一致,因此扣分。

有效结果6 / 15 · 2.0/5

脚本声称可直接启动inspect-ai或lighteval本地评测,并提供vLLM、Transformers和accelerate回退,核心价值明确;但静态审查无法确认命令实际可运行,结果格式、持久化和发布前输出仍需用户自行处理,且GPU/依赖成本较高,因此扣分。

证据核验4 / 10 · 2.0/5

脚本和文档均可审计,仓库CI能验证生成工件,但没有覆盖评测关键路径的测试套件、真实运行日志或第三方复核;因此仅给予有限静态可验证性。

证据充分度: 评估于 2026年7月20日 审查版本 86cdeee824b7
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 未执行任何命令;请在隔离环境中先运行小样本 smoke test,并确认inspect-ai/lighteval CLI版本兼容性。
  • 使用HF_TOKEN、Inference Providers、模型仓库或--trust-remote-code前,应确认凭据、输入数据和远程代码的信任边界。
  • 示例中的cd skills/hugging-face-evaluation与目标路径skills/huggingface-community-evals不一致,可能导致直接复制执行失败。
  • 若在中国大陆使用,应预先验证Hub、Inference Providers及模型下载链路的网络可达性。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向需要在本地硬件上评测 Hugging Face Hub 模型的用户。它支持使用 inspect-ai 或 lighteval,并帮助在 vLLM、Hugging Face Transformers 和 accelerate 之间选择推理后端。流程覆盖任务选择、GPU 可用性检查、冒烟测试和后端回退策略。它不负责 Hugging Face Jobs 远程编排、模型卡编辑、评测结果发布或 community-evals 自动化。

它读取用户指定的 Hub 模型和评测任务,调用仓库提供的 Python 脚本,通过 uv 运行 inspect-ai 或 lighteval;可使用 Hugging Face Inference Providers、本地 vLLM、Transformers 或 accelerate。它支持设置 HF_TOKEN 访问受限或私有模型,使用 --limit 或 --max-samples 执行小规模冒烟测试,并根据模型兼容性选择回退后端。

  1. 需要快速检查一个 Hugging Face Hub 模型在 mmlu、gsm8k 或其他 inspect-ai 任务上的表现,并希望先运行少量样本的用户。
  2. 拥有本地 GPU、希望用 vLLM 提高吞吐量来评测支持架构的模型的用户。
  3. 模型不受 vLLM 支持,需要改用 Transformers 或 accelerate 运行本地评测的用户。
  4. 希望使用 Open LLM Leaderboard 风格任务字符串运行 lighteval 评测的用户。
  5. 需要评测 gated 或 private Hub 模型,并能提供 HF_TOKEN 的用户。

这个 Skill 有哪些优点和局限?

优点
  • 同时覆盖 inspect-ai 和 lighteval 两种评测框架。
  • 提供 vLLM、Transformers 和 accelerate 的明确选择与回退路径。
  • 建议先用 --limit 或 --max-samples 做低成本冒烟测试。
  • 包含本地 GPU、Inference Providers、受限模型访问和常见 OOM 排查指引。
局限
  • 核心范围限定为本地执行,不包含 Hugging Face Jobs 远程硬件选择、调度或监控。
  • 不负责 .eval_results 生成发布、模型卡修改、PR 创建或 community-evals 自动化。
  • 需要本地 shell、文件系统和相关 Python 工具;13B 以上模型可能需要高显存硬件或转交远程执行。
  • SKILL.md 未提供测试套件、精确版本要求或各平台兼容性验证记录。

如何安装这个 Skill?

该仓库遵循 Agent Skills 格式。按照 README,将 skills/huggingface-community-evals 文件夹复制或软链接到 Codex 的标准 .agents/skills 位置,例如 $REPO_ROOT/.agents/skills 或 $HOME/.agents/skills。也可以先安装仓库提供的 hf-cli,再运行 hf skills add huggingface-community-evals;README 未提供该命令针对版本或具体安装路径的更多说明。

如何使用这个 Skill?

在已安装该技能的编码代理中直接提出类似“用 Hugging Face community evals 在本地评测 meta-llama/Llama-3.2-1B,任务为 mmlu,先运行 20 个样本”的请求。对应命令示例为:uv run scripts/inspect_eval_uv.py --model meta-llama/Llama-3.2-1B --task mmlu --limit 20。本地 GPU 可使用 scripts/inspect_vllm_uv.pyscripts/lighteval_vllm_uv.py;开始前可运行 uv --versionprintenv HF_TOKEN >/dev/nullnvidia-smi 检查环境。

这个 Skill 与同类方案有什么区别?

该技能明确比较 inspect-ai 与 lighteval,并在本地推理中比较 vLLM、Hugging Face Transformers 和 accelerate:inspect-ai 适合显式任务控制,lighteval 适合任务字符串和 leaderboard 风格基准;vLLM 偏向支持架构上的吞吐量,Transformers 或 accelerate 用作兼容性回退。

常见问题

它能在没有本地 GPU 的机器上运行吗?
可以使用 inspect_eval_uv.py 走 Hugging Face Inference Providers;如果需要本地 GPU 评测,则应先确认 nvidia-smi 可用,或转交 hugging-face-jobs 技能处理远程计算。
它会自动发布评测结果到 Hugging Face 社区评测流程吗?
不会。该技能在生成评测运行后停止;发布步骤需要交给 community-evals 工作流。
私有或 gated 模型需要什么权限?
需要设置 HF_TOKEN;源材料没有进一步说明令牌权限范围或获取方式。
vLLM 运行失败时怎么办?
可降低 batch size 或 gpu-memory-utilization、换用更小模型;如果模型不受支持,inspect-ai 可切换到 Transformers,lighteval 可切换到 accelerate。

同仓库的其他 Skills

均来自 huggingface/skills

数据与分析

Hugging Face LLM 训练器

在 Hugging Face 云端 GPU 上训练、微调并保存模型。

开发与工程

Hugging Face ZeroGPU 开发指南

帮助你构建可靠的 Gradio ZeroGPU AI 演示与 GPU 工作负载。

数据与分析

Hugging Face 视觉模型训练助手

在 Hugging Face Jobs 云 GPU 上训练检测、分类与分割视觉模型,并将结果保存到 Hub。

开发与工程

Hugging Face Hub CLI 技能

让智能体通过 hf 命令管理 Hugging Face Hub 上的模型、数据集、空间、作业与基础设施。

数据与分析

Hugging Face 模型优选器

根据任务、基准成绩和设备内存筛选并推荐合适的 AI 模型。

数据与分析

Hugging Face 数据集探索助手

通过 Dataset Viewer API 探索、检索和提取 Hugging Face 数据集。

开发与工程

Hugging Face 论文研究助手

读取 AI 论文并提取 Hugging Face 论文页的结构化元数据。

自动化与运维

SageMaker 服务镜像选择器

为 Hugging Face 模型选择兼容的 SageMaker 服务容器,并获取当前区域的镜像 URI。

自动化与运维

SageMaker 生产部署默认配置

为 SageMaker 实时或异步端点自动配置弹性伸缩、CloudWatch 告警和资源标签。

数据与分析

TRL 大模型训练助手

用 TRL 命令行完成语言模型的监督微调、偏好对齐与强化学习训练。

开发与工程

Hugging Face Spaces 构建器

帮助智能体创建、部署和维护 Hugging Face Spaces 应用。

数据与分析

Sentence Transformers 训练助手

为检索、相似度与稀疏搜索训练 Sentence Transformers 模型。

开发与工程

Hugging Face 本地模型运行器

帮助你从 Hugging Face 选择合适的 GGUF 量化模型,并用 llama.cpp 在本机运行。

开发与工程

Hugging Face MCP 助手

通过 MCP 让智能体直接搜索、阅读并使用 Hugging Face Hub 资源。

开发与工程

LoRA Space Demo Builder

为 Hugging Face LoRA 自动设计并发布定制化 Gradio 演示 Space。

开发与工程

Hugging Face API 工具构建器

把 Hugging Face API 调用组合成可复用、可管道化的命令行工具。

自动化与运维

SageMaker 模型部署规划器

为不同模型和流量需求选择合适的 AWS SageMaker 部署路径。

数据与分析

Hugging Face 模型内存估算器

在不下载权重的情况下估算模型推理所需内存。

数据与分析

Trackio 实验追踪

记录、监控并分析机器学习训练实验,让指标和诊断告警可供自动化工作流使用。

写作与内容

Hugging Face 论文发布器

在 Hugging Face Hub 上发布、关联和管理研究论文。

相关 Skills