PDF 文档处理技能
读取、生成并通过渲染检查 PDF 文档。
文档限定了 PDF 处理范围并说明临时目录、输出目录和依赖,但未要求执行安装或外部写入前确认,也未说明 PDF 敏感数据处理、数据流、回滚或依赖完整性验证,因此扣分。
工作流步骤基本一致,覆盖渲染、提取和最终检查;但没有提交测试、关键路径复现证据,依赖缺失时主要让用户自行安装,异常输入和失败诊断说明较少,因此扣分。
明确覆盖 PDF 阅读、创建和审阅,并说明布局相关场景;但未明确非适用范围、语义触发边界或中文输出支持,且依赖本地工具安装,环境适配证据有限,因此扣分。
结构清晰,包含触发条件、流程、依赖、环境、命令和质量标准;但单项许可证未知,缺少版本、变更记录、维护责任、更新路径、示例和 FAQ,且仓库 README 声称仓库已弃用,因此扣分。
文档提供了可直接执行的 PDF 生成、提取和渲染流程,理论上可完成核心任务;但没有代表性产物或静态可验证的结果证据,输出完整性和相对手工处理的收益仍有限,因此扣分。
源文件本身可审计,包含具体工具、命令和检查要求;但没有测试套件、CI 覆盖或第三方执行证据,结论主要来自文档声明,因此扣分。
- 安装依赖可能执行系统级包安装或网络下载;应在获得用户确认并评估环境权限后进行。
- 未说明 PDF 内容是否会离开本地环境,也未提供敏感文档处理、清理和恢复指引。
- 仓库 README 标记为弃用,当前维护状态、许可证和后续更新来源需要另行确认。
它能做什么 & 适用场景
该技能面向需要处理 PDF 内容、版式和视觉呈现的任务。它指导代理优先将页面渲染为 PNG 进行检查,并使用 reportlab 生成 PDF。pdfplumber 或 pypdf 可用于文本提取和快速检查,但不应被视为版式保真工具。该技能属于已弃用的 openai/skills 仓库中的 PDF 技能,仓库 README 建议新项目参考 OpenAI Plugins 仓库。
读取和审阅 PDF 内容;使用 pdftoppm 将页面渲染为 PNG 并检查视觉效果;使用 reportlab 以可靠格式生成 PDF;使用 pdfplumber 或 pypdf 提取文本并进行快速检查;在更新后重新渲染页面,检查对齐、间距、可读性、表格、图像、页眉页脚和页码。
- 需要检查 PDF 版式和视觉内容的文档审阅者,可先渲染页面再复核。
- 需要以程序方式生成格式稳定 PDF 的开发者,可使用 reportlab。
- 需要从 PDF 提取文本并做快速校验的用户,可使用 pdfplumber 或 pypdf。
- 需要在交付前确认页面没有文字裁切、元素重叠或不可读字形的用户,可执行最终渲染检查。
优缺点一览
- 明确要求优先进行视觉渲染检查。
- 同时覆盖 PDF 生成、文本提取和交付前验证。
- 指定了 reportlab、pdfplumber、pypdf 和 pdftoppm 等具体工具。
- 提供临时文件和最终输出目录约定。
- 仓库已弃用,长期采用时应评估 OpenAI Plugins 仓库中的替代方案。
- pdfplumber 和 pypdf 不保证版式保真。
- 依赖 Poppler 和多个 Python 包,源材料未提供版本信息。
- 源材料未提供测试套件、平台验证结果或错误恢复细节。
如何安装
该技能位于 skills/.curated/pdf/SKILL.md。README 提供的安装方式是使用 Codex 内的技能安装器:$skill-installer pdf。安装后重启 Codex 以加载新技能。仓库已弃用,README 建议当前的 Codex 技能和插件示例改用 OpenAI Plugins 仓库。
如何使用
在支持技能的 Codex 环境中提出明确的 PDF 任务,例如:"请使用 PDF 技能审阅这个 PDF,先渲染页面并检查版式,再提取文本。" 若创建 PDF,可要求使用 reportlab 生成,并在每次重要更新后重新渲染检查。具体触发机制未在源材料中说明。
对比同类
与仅依赖 pdfplumber 或 pypdf 的文本提取流程相比,该技能额外强调使用 Poppler 渲染页面来验证布局;与仅生成 PDF 的流程相比,它要求在交付前进行视觉复核。