数据与分析 hugging-facedataset-viewerdataset-apiparquetpaginationtext-searchdata-statistics

Hugging Face 数据集探索助手

通过 Dataset Viewer API 探索、检索和提取 Hugging Face 数据集。

FollowSkills 评估 · FSRS-2.0
不推荐
49/ 100 五分制 2.5 / 5
信任安全14 / 25 · 2.8/5

证据显示核心 Dataset Viewer 流程为只读,并提醒 gated/private 数据集使用 Bearer token;追踪上传默认私有也降低了暴露风险。但技能同时包含创建、上传数据集和上传 agent traces 的写操作,未要求逐次用户确认、未说明令牌最小权限或回滚,也未提供上传前的敏感信息扫描/脱敏,因此扣分。

可靠稳定8 / 20 · 2.0/5

核心端点、分页参数和示例较一致,且说明使用 total/page/partial 继续分页;但未提供端点版本兼容性、错误响应处理、重试/限流策略、参数校验或技能专属测试。静态证据不足以超过 10 分上限,因此扣分。

适用触发8 / 15 · 2.7/5

描述明确覆盖元数据、行分页、搜索、过滤、parquet、统计等 Dataset Viewer 场景;但触发条件、输入输出边界、失败或不适用场景说明不足,且没有中文支持或中国大陆网络可达性评估。上传与只读主流程也存在范围混杂,因此扣分。

规范维护8 / 15 · 2.7/5

文档有 frontmatter、分阶段工作流、默认值、端点示例和部分安全提示;仓库提供 Apache-2.0、CI 生成校验和安全报告渠道。但该技能自身没有版本、变更记录、维护责任、更新路径、FAQ 或系统化限制说明,且把 hf-cli 作为外部前置能力而未明确安装要求,因此扣分。

有效结果7 / 15 · 2.3/5

对 Dataset Viewer 的常见读取、分页、搜索和统计任务提供了可直接改写的 curl 模板,核心价值清晰;但未验证代表性结果,API 行为和字段假设仍需用户检查,上传流程还依赖其他技能/工具。按静态校准不超过 7 分,未给满分。

证据核验4 / 10 · 2.0/5

证据包括固定修订中的技能文本、仓库 CI 工作流、安全政策和许可证;CI 只验证生成文件与版本变更,并未覆盖该技能的关键 API 路径或结果。没有第三方执行记录或专属测试,因此只能给有限可审计性。

证据充分度: 评估于 2026年7月20日 审查版本 86cdeee824b7
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 技能标题和核心声明强调只读,但后半部分包含创建数据集、上传 parquet 和上传 agent traces 的写操作;执行上传前应明确征得用户同意并确认目标仓库、可见性、路径和令牌权限。
  • Agent traces 可能包含提示词、文件路径、工具输出、密钥或个人信息;“默认私有”不足以替代上传前审查、脱敏和凭据轮换。
  • Dataset Viewer API 的端点、字段、限制和可达性未在该文件中验证;应在实际环境中检查服务可用性、认证失败、限流和分页边界。
评估证据 [1][2][3][4][5]
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

这是一个面向 Hugging Face Dataset Viewer API 的 Agent Skill,适合检查数据集元数据、浏览数据行并提取数据。它支持配置与分片解析、分页、文本搜索、条件过滤、Parquet 链接发现,以及规模和统计信息读取。技能默认使用只读 API 工作流,但也提供通过网页或 CLI 创建并上传 Parquet 数据集的流程。它还说明了如何上传 Claude Code、Codex 和 Pi Agent 的原始会话追踪文件,并提醒这类数据应默认存储在私有数据集仓库中。

调用 https://datasets-server.huggingface.co 上的 /is-valid、/splits、/first-rows、/rows、/search、/filter、/parquet、/size、/statistics 和 /croissant 端点;使用 offset 和 length 分页读取数据行;根据字符串查询或 where/orderby 条件检索数据;发现 Parquet 分片链接;读取数据集规模、列统计和可用的 Croissant 元数据。它还给出使用 Hugging Face 网页、npx @huggingface/hub 或 hf CLI 创建私有数据集并上传 Parquet 文件的示例。

  1. 数据分析人员需要确认某个 Hugging Face 数据集是否可用,并解析其配置和 split。
  2. 研究人员需要按页读取数据集样本,避免一次请求过多行。
  3. 工程师需要在字符串列中搜索内容,或按谓词和排序条件筛选数据。
  4. 数据管道开发者需要发现 Parquet 分片 URL,并读取数据集总量或列统计。
  5. 使用 Claude Code、Codex 或 Pi Agent 的团队需要将会话 JSONL 追踪上传到 Hugging Face Datasets,并降低敏感信息泄露风险。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖 Dataset Viewer API 的主要探索、检索、分页和统计端点。
  • 给出可直接改写的 curl 请求和分页模式。
  • 同时说明 Parquet 上传和 Agent traces 数据集的实际工作流。
  • 明确提醒追踪文件可能包含提示词、路径、工具输出、密钥或个人信息。
局限
  • SKILL.md 没有提供测试结果、测试套件或失败响应示例。
  • 主要聚焦 Hugging Face Dataset Viewer API,不是完整的数据工程或数据处理框架。
  • 创建和上传数据集的流程依赖额外命令行工具或网页操作;具体错误处理未说明。
  • 关于费用、速率限制和 API 可用性没有说明。

如何安装这个 Skill?

该仓库是包含 26 个技能的集合。按 README,使用 Codex 时,将 skills/huggingface-datasets/ 文件夹复制或符号链接到 Codex 的标准 .agents/skills 位置,例如 $REPO_ROOT/.agents/skills 或 $HOME/.agents/skills。安装后,兼容 Agent Skills 标准的客户端会发现其中的 SKILL.md。README 未提供该单个技能的独立安装命令。

如何使用这个 Skill?

在已加载该技能的编码代理中直接提出具体请求,例如:"检查 stanfordnlp/imdb 的配置和 train split,读取前 100 行,并搜索包含指定文本的记录。" API 请求可使用类似 curl "https://datasets-server.huggingface.co/rows?dataset=stanfordnlp/imdb&config=plain_text&split=train&offset=0&length=100" 的命令。受限或私有数据集需要 Authorization: Bearer <HF_TOKEN>。分页时继续增加 offset,并根据 num_rows_total、num_rows_per_page 和 partial 判断是否完成。

这个 Skill 与同类方案有什么区别?

README 将 hf-cli 定位为 Hugging Face Hub 核心操作的推荐入口,覆盖搜索模型、管理数据集和其他 Hub 命令。本技能范围更窄,专门处理 Dataset Viewer API 的数据集探索、提取和相关 Parquet 操作。

常见问题

这个技能是否只读?
其核心 Dataset Viewer 工作流被定义为只读,但 SKILL.md 另外提供了创建数据集仓库和上传 Parquet 文件的流程,因此整体内容不只包含读取操作。
访问私有或 gated 数据集需要什么?
需要设置 HF_TOKEN,并在请求中使用 Authorization: Bearer <HF_TOKEN>。
上传 Agent traces 时应注意什么?
追踪文件可能包含提示词、文件路径、工具输出、密钥或个人信息。SKILL.md 建议默认创建私有数据集仓库,保留原始 JSONL,并按项目或工作目录嵌套存放。
它是否适合完整的数据集创建和管理?
它提供 Parquet 数据集创建和上传的基础流程,但 README 将 hf-cli 作为更广泛 Hub 操作的推荐技能;本技能本身更适合 Dataset Viewer 探索和提取。

同仓库的其他 Skills

均来自 huggingface/skills

开发与工程

Hugging Face 论文研究助手

读取 AI 论文并提取 Hugging Face 论文页的结构化元数据。

开发与工程

Hugging Face Hub CLI 技能

让智能体通过 hf 命令管理 Hugging Face Hub 上的模型、数据集、空间、作业与基础设施。

开发与工程

Hugging Face ZeroGPU 开发指南

帮助你构建可靠的 Gradio ZeroGPU AI 演示与 GPU 工作负载。

数据与分析

Hugging Face LLM 训练器

在 Hugging Face 云端 GPU 上训练、微调并保存模型。

数据与分析

Hugging Face 本地模型评测

在本地硬件上为 Hugging Face Hub 模型运行可控的 inspect-ai 或 lighteval 评测。

数据与分析

Hugging Face 模型优选器

根据任务、基准成绩和设备内存筛选并推荐合适的 AI 模型。

开发与工程

Hugging Face API 工具构建器

把 Hugging Face API 调用组合成可复用、可管道化的命令行工具。

开发与工程

Hugging Face MCP 助手

通过 MCP 让智能体直接搜索、阅读并使用 Hugging Face Hub 资源。

开发与工程

Hugging Face 本地模型运行器

帮助你从 Hugging Face 选择合适的 GGUF 量化模型,并用 llama.cpp 在本机运行。

开发与工程

LoRA Space Demo Builder

为 Hugging Face LoRA 自动设计并发布定制化 Gradio 演示 Space。

开发与工程

Hugging Face Spaces 构建器

帮助智能体创建、部署和维护 Hugging Face Spaces 应用。

数据与分析

Sentence Transformers 训练助手

为检索、相似度与稀疏搜索训练 Sentence Transformers 模型。

数据与分析

Hugging Face 模型内存估算器

在不下载权重的情况下估算模型推理所需内存。

数据与分析

Trackio 实验追踪

记录、监控并分析机器学习训练实验,让指标和诊断告警可供自动化工作流使用。

数据与分析

Hugging Face 视觉模型训练助手

在 Hugging Face Jobs 云 GPU 上训练检测、分类与分割视觉模型,并将结果保存到 Hub。

写作与内容

Hugging Face 论文发布器

在 Hugging Face Hub 上发布、关联和管理研究论文。

自动化与运维

SageMaker 服务镜像选择器

为 Hugging Face 模型选择兼容的 SageMaker 服务容器,并获取当前区域的镜像 URI。

自动化与运维

AWS 云账户上下文发现

在 AWS 操作前准确识别本地配置、账户与身份。

自动化与运维

SageMaker 模型部署规划器

为不同模型和流量需求选择合适的 AWS SageMaker 部署路径。

自动化与运维

SageMaker Python 环境管家

为 SageMaker 与 AWS 任务创建隔离且版本正确的 Python 环境。

相关 Skills