开发与工程 llama.cppgguflocal-inferencemodel-quantizationhugging-face-hubopenai-compatible-api

Hugging Face 本地模型运行器

帮助你从 Hugging Face 选择合适的 GGUF 量化模型,并用 llama.cpp 在本机运行。

FollowSkills 评估 · FSRS-2.0
不推荐
44/ 100 五分制 2.2 / 5
信任安全11 / 25 · 2.2/5

文档主要指导本地下载、编译和运行模型,没有发现恶意代码、凭据窃取或隐蔽外传;但缺少下载模型来源校验、哈希/签名验证、敏感输入处理、安装与认证确认、服务暴露边界及回滚说明,因此未接近满分。

可靠稳定7 / 20 · 1.8/5

工作流从搜索、确认文件到启动服务较连贯,且提供自定义文件名和无GGUF时的转换路径;但未固定llama.cpp或工具版本,没有针对关键路径的提交测试,平台构建命令存在差异,异常输入、网络失败、兼容性失败和诊断反馈覆盖不足,静态评估按上限保守扣分。

适用触发8 / 15 · 2.7/5

目标用户、CPU/Metal/CUDA/ROCm场景和主要输入输出较明确,也说明了量化选择范围;但触发条件、非适用模型/硬件边界和环境前置条件不够完整,核心检索和下载依赖Hugging Face海外服务,未说明中国大陆网络可达性或替代路径。

规范维护8 / 15 · 2.7/5

SKILL.md配合三个主题化参考文档,具备渐进式说明、示例、故障排查和Apache-2.0许可证上下文;但缺少版本要求、变更记录、维护负责人、更新路径、依赖锁定、确认过时内容的方法,以及更完整的安装和FAQ说明,因此扣除维护性分数。

有效结果6 / 15 · 2.0/5

对于已安装llama.cpp且可访问Hugging Face的用户,搜索GGUF、选择量化、确认文件名和生成llama-cli/llama-server命令具有直接价值;但没有已验证的代表性输出或执行证据,硬件容量估算、模型兼容性、服务安全配置和转换结果仍需用户复核,静态校准限制有效性不超过7分。

证据核验4 / 10 · 2.0/5

文档给出具体Hugging Face页面、树API、命令和量化表,且仓库存在生成校验CI与安全策略;但选定技能没有提交测试、执行日志或第三方复现证据,量化性能数字和示例可用性无法仅凭文件独立确认,因此仅给有限可验证性分数。

证据充分度: 评估于 2026年7月20日 审查版本 86cdeee824b7
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 运行llama-server前应确认仅监听受信任的本机或网络接口,并不要把示例中的无效Bearer令牌当作真实访问控制。
  • 下载模型、转换脚本和依赖前应核对仓库、文件哈希、许可证及安全来源;文档未提供这一流程。
  • 核心Hugging Face URL工作流可能受中国大陆网络访问限制,需准备可达性验证或离线/镜像方案。
  • 示例中的模型、命令参数和量化性能数据未在所给文件中提供可复现证据,使用前应按实际版本和硬件复核。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向希望在本地运行 Hugging Face 模型的开发者。它搜索与 llama.cpp 兼容的 GGUF 仓库,协助选择量化版本,并生成使用 llama-cli 或 llama-server 的运行方式。它还支持确认精确 GGUF 文件名、必要时从 Transformers 权重转换,以及启动 OpenAI 兼容的本地服务。适用平台包括 CPU、Mac Metal、CUDA 和 ROCm,但材料未提供性能基准。

搜索 Hugging Face Hub 上标记为 llama.cpp 的模型;打开模型的本地应用页面并读取量化建议;通过模型树 API 确认精确的 .gguf 文件名;使用 llama-cli 或 llama-server 从 Hub 启动模型;在自定义文件名时使用 --hf-repo 与 --hf-file;仅在没有 GGUF 文件时下载 Transformers 权重、转换为 GGUF 并量化;通过 curl 请求本地服务器的 OpenAI 兼容聊天接口。

  1. 需要在 CPU、Mac Metal、CUDA 或 ROCm 设备上运行 Hugging Face 模型的开发者。
  2. 需要根据内存或显存预算选择 Q4、Q5、Q6、Q3 或仓库专用量化版本的用户。
  3. 需要准确定位某个 GGUF 文件并用 llama-server 提供本地 API 的开发者。
  4. 拥有 Transformers 权重但模型仓库尚未提供 GGUF 文件、需要执行转换的用户。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖从 Hub 搜索、量化选择、精确文件确认到本地服务启动的完整流程。
  • 保留仓库原生量化标签,并提供内存受限和代码工作负载的选择建议。
  • 支持 llama-cli、llama-server、GGUF 转换和 OpenAI 兼容接口。
  • 明确要求在已有 GGUF 时避免不必要的转换。
局限
  • 依赖 llama.cpp、Hugging Face CLI、Python 以及本地文件系统和网络访问。
  • 材料未提供自动化测试、性能基准或不同硬件上的验证结果。
  • 量化选择仍需结合模型页面和实际硬件;技能不会替用户保证最佳质量或速度。
  • 受限仓库需要额外完成 Hugging Face 身份验证。

如何安装这个 Skill?

将仓库中的 skills/huggingface-local-models 文件夹复制或符号链接到 Codex 等客户端的标准 .agents/skills 目录,例如 $REPO_ROOT/.agents/skills 或 $HOME/.agents/skills。安装 llama.cpp 可使用 brew install llama.cpp、winget install llama.cpp,或从 https://github.com/ggml-org/llama.cpp 克隆后执行 make。需要访问受限仓库时,执行 hf auth login。

如何使用这个 Skill?

在支持 Agent Skills 的编码代理中明确要求使用 Hugging Face Local Models 技能,例如:“使用 Hugging Face Local Models 技能,为我选择一个适合本机内存的 GGUF 模型,并启动 llama-server。”典型运行命令为 llama-server -hf unsloth/Qwen3.6-35B-A3B-GGUF:UD-Q4_K_M。若需指定文件,可使用 --hf-repo 与 --hf-file。

常见问题

这个技能是否会托管模型或调用远程推理服务?
不会。材料描述的是从 Hugging Face Hub 获取模型文件,并使用本地 llama.cpp 运行或提供本地服务。
什么时候需要转换模型?
只有当目标仓库没有现成 GGUF 文件时,才下载 Transformers 权重并转换、量化。
它支持哪些硬件后端?
SKILL.md 明确覆盖 CPU、Mac Metal、CUDA 和 ROCm。
如何选择量化版本?
优先采用模型本地应用页面标记的兼容量化;默认可考虑 Q4_K_M,内存允许时,代码或技术工作负载可考虑 Q5_K_M 或 Q6_K。

同仓库的其他 Skills

均来自 huggingface/skills

数据与分析

Hugging Face 模型内存估算器

在不下载权重的情况下估算模型推理所需内存。

数据与分析

Sentence Transformers 训练助手

为检索、相似度与稀疏搜索训练 Sentence Transformers 模型。

开发与工程

Hugging Face MCP 助手

通过 MCP 让智能体直接搜索、阅读并使用 Hugging Face Hub 资源。

写作与内容

Hugging Face 论文发布器

在 Hugging Face Hub 上发布、关联和管理研究论文。

数据与分析

Hugging Face LLM 训练器

在 Hugging Face 云端 GPU 上训练、微调并保存模型。

数据与分析

Hugging Face 本地模型评测

在本地硬件上为 Hugging Face Hub 模型运行可控的 inspect-ai 或 lighteval 评测。

开发与工程

Hugging Face Hub CLI 技能

让智能体通过 hf 命令管理 Hugging Face Hub 上的模型、数据集、空间、作业与基础设施。

开发与工程

Hugging Face API 工具构建器

把 Hugging Face API 调用组合成可复用、可管道化的命令行工具。

开发与工程

LoRA Space Demo Builder

为 Hugging Face LoRA 自动设计并发布定制化 Gradio 演示 Space。

开发与工程

Hugging Face Spaces 构建器

帮助智能体创建、部署和维护 Hugging Face Spaces 应用。

数据与分析

Hugging Face 数据集探索助手

通过 Dataset Viewer API 探索、检索和提取 Hugging Face 数据集。

开发与工程

Hugging Face 论文研究助手

读取 AI 论文并提取 Hugging Face 论文页的结构化元数据。

数据与分析

Hugging Face 模型优选器

根据任务、基准成绩和设备内存筛选并推荐合适的 AI 模型。

开发与工程

Hugging Face ZeroGPU 开发指南

帮助你构建可靠的 Gradio ZeroGPU AI 演示与 GPU 工作负载。

自动化与运维

SageMaker 模型部署规划器

为不同模型和流量需求选择合适的 AWS SageMaker 部署路径。

数据与分析

Trackio 实验追踪

记录、监控并分析机器学习训练实验,让指标和诊断告警可供自动化工作流使用。

数据与分析

Hugging Face 视觉模型训练助手

在 Hugging Face Jobs 云 GPU 上训练检测、分类与分割视觉模型,并将结果保存到 Hub。

自动化与运维

SageMaker 服务镜像选择器

为 Hugging Face 模型选择兼容的 SageMaker 服务容器,并获取当前区域的镜像 URI。

自动化与运维

SageMaker 生产部署默认配置

为 SageMaker 实时或异步端点自动配置弹性伸缩、CloudWatch 告警和资源标签。

自动化与运维

AWS 云账户上下文发现

在 AWS 操作前准确识别本地配置、账户与身份。

相关 Skills