数据与分析 document-extractionpdf-extractionoffice-xmlarchive-extractionstructured-dataemail-parsingocr

格式特定文档提取工作流

针对多种文档格式的提取工作流,包括Office XML、PDF、压缩包、结构化文本和电子邮件的安全解析

FollowSkills 评估 · FSRS-2.0
谨慎使用
66/ 100 五分制 3.3 / 5
1 2 3 4 5 6
1信任安全21 / 25 · 4.2/5

该技能与Xberg文档提取框架紧密集成,明确承认对可能不可信的用户文档进行处理。仓库包含详细的安全策略、专门的输入验证器(ZipBombValidator、DepthValidator、StringGrowthValidator等)以及谨慎的默认安全限制,这些都对处理不可信输入进行了强有力的保障。但是,在技能层面缺少用户确认或数据流透明的显式机制;技能文档未涵盖权限、回滚或用户确认。该技能本身的功能范围是提取,不涉及外部网络调用,但OCR等某些功能可能依赖外部服务。因此,扣分是因为技能层面权限和确认指导不完整。

2可靠稳定9 / 20 · 2.3/5

技能文档中的说明一致,格式特定的提取工作流清晰。仓库展示了广泛的测试和CI基础设施(例如,Docker CI、基准测试工作流、e2e测试)。但是,对于所选的技能路径,没有可用的测试或可复制的执行证据;技能文档仅引用源代码文件,没有提供测试或验证结果。指令自洽且结构合理,但缺乏测试方面覆盖和异常处理的证据。鉴于静态审查,最高分数被限制,这一项得分为9分,因为快乐路径看似可行,但错误处理和失败反馈的细节尚不清楚。

3适用触发12 / 15 · 4.0/5

该技能针对明确的场景:从各种特定格式(Office、PDF、归档、结构化文本、电子邮件)中提取内容,这与真实需求高度契合。但是,非适配范围未明确定义;技能的名称和描述暗示一种通用提取技能,但仅涵盖格式特定的方面,未明确说明何时不应使用。此外,文档中提到复杂内容(如宏或受密码保护的文件)可能不支持,但未作为技能边界描述。就环境适宜性而言,没有提及中国相关服务或从中国网络的可达性;某些功能(如基于提供商的OCR或LLM)可能依赖中国可能无法访问的服务,但技能核心功能是本地处理。由于边界和触发条件证据不足,扣分。

4规范维护12 / 15 · 4.0/5

技能文档组织良好,包含清晰的层级标题、图表和源代码引用,并遵循渐进式披露模式。许可证明确(MIT)。提供安装和依赖注意事项(表明Cargo功能标志)。维护责任(常规CI和版本控制)存在,但技能本身没有版本化或变更日志,也不清楚技能是否会定期更新。已知限制未明确记录在技能级别。由于缺乏版本控制和明确的维护责任,以及隐藏假设(例如,需要先构建项目),扣分。

5有效结果7 / 15 · 2.3/5

公开的证据表明该技能能够完成核心任务,即提取指定格式的内容。仓库包含广泛的基准测试工作和针对各种格式的测试,表明其实际有效。然而,对于所选技能路径,缺乏直接可用的输出示例或验证结果。技能文档引用了实现细节,但没有展示关键路径的输出或提供代表性结果。收益与手动操作相比尚不明确。由于缺乏来自静态审查的直接可验证证据,最高分数限制为7分,且没有具体的可复制结果证明其有效性。

6证据核验5 / 10 · 2.5/5

仓库包含大量可审计的主要材料:详细的CI工作流、基准测试配置、测试套件以及可复现的构建配置。这些材料为技能所基于的框架能力提供了支持性证据。然而,该技能的具体路径并未有单独的测试或验证,框架的覆盖范围分散。没有独立的验证或跨来源的证实。由于这是一次静态审查,且没有针对技能路径的专门测试,最高分数限制为5分,以获得部分证据。

证据充分度: 评估于 2026年8月7日 审查版本 fbdb9f18ca7c
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 技能文档未包含明确的安全/权限指导,也未提及用户确认或数据流透明度。
  • 某些功能(如基于提供商的OCR或LLM)可能依赖在中国可能无法访问的外部服务,应从中国网络环境评估可达性。
  • 技能文档未定义明确的非适用范围或触发边界,可能导致误用。
  • 技能本身没有版本控制或变更日志,维护责任不明确,更新路径未知。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能为数据提取场景提供了格式特定的文档提取工作流。它涵盖Office XML(DOCX/PPTX/ODT)、PDF(带OCR备用)、压缩包(ZIP/TAR/7z/GZIP)、结构化文本(JSON/YAML/TOML/XML)以及电子邮件(EML/MSG)。每个工作流包含安全校验(如ZipBombValidator)、流式XML解析以及用于文本、表格和元数据提取的专用提取器。该技能是Xberg monorepo的一部分,包含5个技能,此技能仅关注格式特定提取工作流。

该技能定义了从不同格式提取文档内容的步骤。对于Office XML,它验证ZIP归档并解析XML以提取文本、表格和元数据。对于PDF,它使用pdf_oxide提取逐页文本,支持OCR回退。对于压缩包,它在提取前验证ZIP炸弹,提取元数据并仅提取纯文本文件。对于结构化文本,它检测MIME格式并进行解析/美化。对于电子邮件,它解析头部并处理正文和附件。它还提供了添加新格式的步骤,包括MIME映射、提取器实现和注册。

  1. 从DOCX、PPTX或ODT文件中提取文本和表格,以便进行文档分析。
  2. 从PDF中提取逐页文本,当扫描件无搜索文本时自动使用OCR。
  3. 安全地解析ZIP、TAR、7z或GZIP归档文件,避免zip炸弹攻击,获取元数据和纯文本内容。
  4. 将JSON、YAML、TOML和XML格式化并转换为文本,用于数据管道。
  5. 从EML或MSG文件中解析电子邮件正文和附件,用于信息整理。
  6. 在Xberg框架内实现对新文档格式的支持,遵循提取器指南。

这个 Skill 有哪些优点和局限?

优点
  • 安全为先,内置ZipBomb验证和深度/长度验证器
  • 支持多种格式,包括Office、PDF、归档、结构化数据和电子邮件
  • 提供清晰的添加新格式的指南,包含MIME注册和提取器实现
  • PDF OCR回退可处理扫描文档
局限
  • 需要Rust环境和Xberg核心库,这可能带来额外依赖
  • 技能没有提供完整的端到端CLI/GUI,仅定义工作流
  • 未提及测试套件或特定平台的验证(如Windows/macOS)
  • OCR默认依赖,可能需额外配置

如何安装这个 Skill?

该技能是Xberg monorepo的一部分,需先安装并构建Xberg Rust核心。安装Xberg库(例如通过cargo add xberg),技能文件位于仓库的.ai-rulez/skills/format-specific-extraction/SKILL.md路径下。

如何使用这个 Skill?

将技能文件复制到您的Agent技能目录中。然后在文档处理任务中使用该技能,按照SKILL.md中的工作流进行提取。例如,请求“从example.docx中提取文本”,Agent将遵循DOCX提取工作流。

常见问题

该技能是否需要外部OCR工具?
它支持PDF的OCR回退,但未指定OCR引擎。该技能使用Xberg的OCR功能,实际可能依赖支持的后端(如Tesseract)。
是否支持所有归档格式的提取?
它涵盖ZIP、TAR、7z和GZIP。但仅从纯文本文件提取文本,不处理归档中的二进制文件。
该技能是否适用于非Rust项目?
该技能定义了使用Rust API的工作流。它需要Xberg Rust库,但Xberg提供了多语言绑定,前提是底层引擎可用。
添加新格式的步骤是否详细?
是的,步骤包括MIME映射、提取器实现、注册和功能门控,需要Rust编程能力。

同仓库的其他 Skills

均来自 xberg-io/xberg

相关 Skills