数据与分析 hugging-face-hubsafetensorsggufvram-estimationkv-cacheuvx

Hugging Face 模型内存估算器

在不下载权重的情况下估算模型推理所需内存。

FollowSkills 评估 · FSRS-2.0
不推荐
44/ 100 五分制 2.2 / 5
信任安全13 / 25 · 2.6/5

文档明确说明通过 Hugging Face Hub 的 HTTP Range 请求读取权重元数据,并说明 HF_TOKEN 仅用于 gated/private 模型,数据流边界基本可见;但要求使用 uvx 获取并运行未固定版本的外部 CLI,未说明令牌保护、用户确认、权限隔离、失败恢复或回滚,因此扣除 12 分。未发现凭据窃取、隐蔽外泄或破坏性默认行为。

可靠稳定7 / 20 · 1.8/5

命令、Safetensors/GGUF 分支及主要参数说明相互一致,正常路径看似可运行;但未提供版本锁定、测试套件、错误输出示例、异常输入处理或诊断指引,且本次未执行验证,按静态校准限制为 7 分。

适用触发9 / 15 · 3.0/5

使用场景、模型 ID、GGUF 文件、实验模式和 JSON 输出均有明确说明,覆盖 Transformers、Diffusers、Sentence Transformers、LLM/VLM;但非适用范围、估算误差边界、触发排除条件、中文支持及中国大陆网络可达性未说明,核心功能依赖 Hugging Face Hub 和 uv 获取包,故扣分。

规范维护7 / 15 · 2.3/5

SKILL.md 结构简洁,包含触发条件、需求、运行方式、参数和示例;仓库提供 Apache-2.0 许可证及 CI 生成校验。但该技能没有版本、变更记录、明确维护责任人或更新路径,也缺少故障排查、限制说明和输出字段解释,因此为中等分数。

有效结果5 / 15 · 1.7/5

命令直接生成 JSON 内存估算,且涵盖权重与可选 KV cache,目标结果具有直接可用性;但没有提交的实际运行结果、准确性验证或与其他方法的比较,估算适用边界也不完整,按静态校准仅给 5 分。

证据核验3 / 10 · 1.5/5

源文件提供了可审计的命令、参数和示例,仓库 CI 能验证生成文件一致性;但未见覆盖 hf-mem 关键路径的测试、真实输出、第三方复核或多源交叉证据,静态证据有限,故为 3 分。

证据充分度: 评估于 2026年7月20日 审查版本 86cdeee824b7
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 运行 uvx 可能从外部源获取未固定版本的工具;应确认包来源、版本和执行环境。
  • 该技能会访问 Hugging Face Hub;私有或 gated 模型涉及 HF_TOKEN,需避免在命令、日志或输出中泄露令牌。
  • 文档未说明中国大陆网络可达性、失败处理、估算误差和结果字段语义;部署前应补充这些限制并进行实际验证。
评估证据 [1][2][3][4][5]
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

hf-mem 是 Hugging Face Skills 仓库中的独立技能,用于估算 Hugging Face Hub 上模型权重的推理内存需求。它支持 Safetensors 和 GGUF,并通过 HTTP Range 请求读取远程文件信息,无需在本地下载或加载权重。默认估算模型权重内存;使用 --experimental 时,还可为支持的 LLM、VLM 和 GGUF 模型估算 KV 缓存。它适合在部署前判断模型是否适合目标 GPU 或计算实例。

运行 hf-mem CLI,检查指定 Hugging Face Hub 仓库中的 Safetensors 或 GGUF 权重,并输出 JSON 格式的内存估算结果。对于包含多个 GGUF 精度或量化文件的仓库,可按文件估算,也可使用 --gguf-file 指定目标文件或分片路径。使用 --experimental 时,根据上下文长度、批大小和 KV 缓存精度计算额外的 KV 缓存内存。

  1. 用户想在运行某个 Hugging Face 模型前了解所需 VRAM 或内存时使用。
  2. 用户需要判断模型是否能装入指定 GPU 或云实例时使用。
  3. 用户提供 Hugging Face 模型 ID 或 URL,并询问推理资源需求时使用。
  4. 用户需要比较同一 GGUF 仓库中不同量化文件的内存估算时使用。

这个 Skill 有哪些优点和局限?

优点
  • 支持 Safetensors 和 GGUF。
  • 通过 HTTP Range 请求工作,无需下载或本地加载模型权重。
  • 可输出 JSON,便于自动化处理。
  • 实验性模式可将 KV 缓存纳入估算,并支持上下文长度、批大小和缓存精度参数。
局限
  • 依赖 uv 和网络访问 Hugging Face Hub。
  • GGUF 仓库包含多个量化文件时,可能需要手动指定目标文件。
  • KV 缓存估算标记为 experimental。
  • 源材料没有提供测试套件、性能数据或跨平台验证信息。

如何安装这个 Skill?

将仓库中的 skills/hf-mem/ 文件夹复制或符号链接到客户端支持的 Agent Skills 目录,例如 Codex 的 $REPO_ROOT/.agents/skills 或 $HOME/.agents/skills。README 还说明可通过 hf skills add <skill-name> 添加其他 Hugging Face 技能,但未提供 hf-mem 的独立安装包或版本信息。

如何使用这个 Skill?

先确保已安装 uv,然后运行:
uvx hf-mem --model-id <model-id> --json-output
对于指定 GGUF 文件,运行:
uvx hf-mem --model-id <model-id> --gguf-file <file-or-path> --json-output
要估算 KV 缓存,可加入 --experimental,并按需设置 --max-model-len、--batch-size 和 --kv-cache-dtype。访问 gated 或 private 模型时,设置 HF_TOKEN 环境变量或传入 --hf-token。

常见问题

它会下载模型权重吗?
不会。SKILL.md 明确说明它使用 HTTP Range 请求估算 Safetensors 或 GGUF 权重,不下载或本地加载权重。
访问私有或 gated 模型需要什么?
需要 HF_TOKEN 环境变量,或使用 --hf-token 参数;公开模型不需要该凭据。
它能估算 KV 缓存吗?
可以,但需要使用 --experimental。该模式适用于 LLM、VLM 和 GGUF 模型,并可设置最大上下文长度、批大小和 KV 缓存精度。
源材料是否说明使用成本?
没有。提供的资料未说明 hf-mem 的收费、Hugging Face Hub 网络访问费用或云实例费用。

同仓库的其他 Skills

均来自 huggingface/skills

开发与工程

Hugging Face 本地模型运行器

帮助你从 Hugging Face 选择合适的 GGUF 量化模型,并用 llama.cpp 在本机运行。

数据与分析

Sentence Transformers 训练助手

为检索、相似度与稀疏搜索训练 Sentence Transformers 模型。

开发与工程

Hugging Face MCP 助手

通过 MCP 让智能体直接搜索、阅读并使用 Hugging Face Hub 资源。

写作与内容

Hugging Face 论文发布器

在 Hugging Face Hub 上发布、关联和管理研究论文。

数据与分析

Hugging Face LLM 训练器

在 Hugging Face 云端 GPU 上训练、微调并保存模型。

开发与工程

Hugging Face Hub CLI 技能

让智能体通过 hf 命令管理 Hugging Face Hub 上的模型、数据集、空间、作业与基础设施。

开发与工程

Hugging Face ZeroGPU 开发指南

帮助你构建可靠的 Gradio ZeroGPU AI 演示与 GPU 工作负载。

开发与工程

LoRA Space Demo Builder

为 Hugging Face LoRA 自动设计并发布定制化 Gradio 演示 Space。

开发与工程

Hugging Face Spaces 构建器

帮助智能体创建、部署和维护 Hugging Face Spaces 应用。

数据与分析

Hugging Face 数据集探索助手

通过 Dataset Viewer API 探索、检索和提取 Hugging Face 数据集。

开发与工程

Hugging Face 论文研究助手

读取 AI 论文并提取 Hugging Face 论文页的结构化元数据。

数据与分析

Hugging Face 本地模型评测

在本地硬件上为 Hugging Face Hub 模型运行可控的 inspect-ai 或 lighteval 评测。

数据与分析

Trackio 实验追踪

记录、监控并分析机器学习训练实验,让指标和诊断告警可供自动化工作流使用。

数据与分析

Hugging Face 视觉模型训练助手

在 Hugging Face Jobs 云 GPU 上训练检测、分类与分割视觉模型,并将结果保存到 Hub。

数据与分析

Hugging Face 模型优选器

根据任务、基准成绩和设备内存筛选并推荐合适的 AI 模型。

开发与工程

Hugging Face API 工具构建器

把 Hugging Face API 调用组合成可复用、可管道化的命令行工具。

自动化与运维

AWS 云账户上下文发现

在 AWS 操作前准确识别本地配置、账户与身份。

自动化与运维

SageMaker 模型部署规划器

为不同模型和流量需求选择合适的 AWS SageMaker 部署路径。

自动化与运维

SageMaker Python 环境管家

为 SageMaker 与 AWS 任务创建隔离且版本正确的 Python 环境。

数据与分析

TRL 大模型训练助手

用 TRL 命令行完成语言模型的监督微调、偏好对齐与强化学习训练。

相关 Skills