Hugging Face 数据集探索助手
通过 Dataset Viewer API 探索、检索和提取 Hugging Face 数据集。
证据显示核心 Dataset Viewer 流程为只读,并提醒 gated/private 数据集使用 Bearer token;追踪上传默认私有也降低了暴露风险。但技能同时包含创建、上传数据集和上传 agent traces 的写操作,未要求逐次用户确认、未说明令牌最小权限或回滚,也未提供上传前的敏感信息扫描/脱敏,因此扣分。
核心端点、分页参数和示例较一致,且说明使用 total/page/partial 继续分页;但未提供端点版本兼容性、错误响应处理、重试/限流策略、参数校验或技能专属测试。静态证据不足以超过 10 分上限,因此扣分。
描述明确覆盖元数据、行分页、搜索、过滤、parquet、统计等 Dataset Viewer 场景;但触发条件、输入输出边界、失败或不适用场景说明不足,且没有中文支持或中国大陆网络可达性评估。上传与只读主流程也存在范围混杂,因此扣分。
文档有 frontmatter、分阶段工作流、默认值、端点示例和部分安全提示;仓库提供 Apache-2.0、CI 生成校验和安全报告渠道。但该技能自身没有版本、变更记录、维护责任、更新路径、FAQ 或系统化限制说明,且把 hf-cli 作为外部前置能力而未明确安装要求,因此扣分。
对 Dataset Viewer 的常见读取、分页、搜索和统计任务提供了可直接改写的 curl 模板,核心价值清晰;但未验证代表性结果,API 行为和字段假设仍需用户检查,上传流程还依赖其他技能/工具。按静态校准不超过 7 分,未给满分。
证据包括固定修订中的技能文本、仓库 CI 工作流、安全政策和许可证;CI 只验证生成文件与版本变更,并未覆盖该技能的关键 API 路径或结果。没有第三方执行记录或专属测试,因此只能给有限可审计性。
- 技能标题和核心声明强调只读,但后半部分包含创建数据集、上传 parquet 和上传 agent traces 的写操作;执行上传前应明确征得用户同意并确认目标仓库、可见性、路径和令牌权限。
- Agent traces 可能包含提示词、文件路径、工具输出、密钥或个人信息;“默认私有”不足以替代上传前审查、脱敏和凭据轮换。
- Dataset Viewer API 的端点、字段、限制和可达性未在该文件中验证;应在实际环境中检查服务可用性、认证失败、限流和分页边界。
这个 Skill 能做什么,适合哪些场景?
这是一个面向 Hugging Face Dataset Viewer API 的 Agent Skill,适合检查数据集元数据、浏览数据行并提取数据。它支持配置与分片解析、分页、文本搜索、条件过滤、Parquet 链接发现,以及规模和统计信息读取。技能默认使用只读 API 工作流,但也提供通过网页或 CLI 创建并上传 Parquet 数据集的流程。它还说明了如何上传 Claude Code、Codex 和 Pi Agent 的原始会话追踪文件,并提醒这类数据应默认存储在私有数据集仓库中。
调用 https://datasets-server.huggingface.co 上的 /is-valid、/splits、/first-rows、/rows、/search、/filter、/parquet、/size、/statistics 和 /croissant 端点;使用 offset 和 length 分页读取数据行;根据字符串查询或 where/orderby 条件检索数据;发现 Parquet 分片链接;读取数据集规模、列统计和可用的 Croissant 元数据。它还给出使用 Hugging Face 网页、npx @huggingface/hub 或 hf CLI 创建私有数据集并上传 Parquet 文件的示例。
- 数据分析人员需要确认某个 Hugging Face 数据集是否可用,并解析其配置和 split。
- 研究人员需要按页读取数据集样本,避免一次请求过多行。
- 工程师需要在字符串列中搜索内容,或按谓词和排序条件筛选数据。
- 数据管道开发者需要发现 Parquet 分片 URL,并读取数据集总量或列统计。
- 使用 Claude Code、Codex 或 Pi Agent 的团队需要将会话 JSONL 追踪上传到 Hugging Face Datasets,并降低敏感信息泄露风险。
这个 Skill 有哪些优点和局限?
- 覆盖 Dataset Viewer API 的主要探索、检索、分页和统计端点。
- 给出可直接改写的 curl 请求和分页模式。
- 同时说明 Parquet 上传和 Agent traces 数据集的实际工作流。
- 明确提醒追踪文件可能包含提示词、路径、工具输出、密钥或个人信息。
- SKILL.md 没有提供测试结果、测试套件或失败响应示例。
- 主要聚焦 Hugging Face Dataset Viewer API,不是完整的数据工程或数据处理框架。
- 创建和上传数据集的流程依赖额外命令行工具或网页操作;具体错误处理未说明。
- 关于费用、速率限制和 API 可用性没有说明。
如何安装这个 Skill?
该仓库是包含 26 个技能的集合。按 README,使用 Codex 时,将 skills/huggingface-datasets/ 文件夹复制或符号链接到 Codex 的标准 .agents/skills 位置,例如 $REPO_ROOT/.agents/skills 或 $HOME/.agents/skills。安装后,兼容 Agent Skills 标准的客户端会发现其中的 SKILL.md。README 未提供该单个技能的独立安装命令。
如何使用这个 Skill?
在已加载该技能的编码代理中直接提出具体请求,例如:"检查 stanfordnlp/imdb 的配置和 train split,读取前 100 行,并搜索包含指定文本的记录。" API 请求可使用类似 curl "https://datasets-server.huggingface.co/rows?dataset=stanfordnlp/imdb&config=plain_text&split=train&offset=0&length=100" 的命令。受限或私有数据集需要 Authorization: Bearer <HF_TOKEN>。分页时继续增加 offset,并根据 num_rows_total、num_rows_per_page 和 partial 判断是否完成。
这个 Skill 与同类方案有什么区别?
README 将 hf-cli 定位为 Hugging Face Hub 核心操作的推荐入口,覆盖搜索模型、管理数据集和其他 Hub 命令。本技能范围更窄,专门处理 Dataset Viewer API 的数据集探索、提取和相关 Parquet 操作。