图片转可编辑 PPT
把幻灯片截图、PDF 和图片版 PPT 重建为对象级可编辑的 PowerPoint 文件,而不是把整页截图贴进 PPT。
SKILL.md 明确声明数据流(PaddleOCR、Codex OAuth、OpenAI 兼容 API 仅上传任务本地的页面图片/prompt/参考图),禁止发送凭据和无关文件,并要求受限环境下先请求批准;但 README 建议以'完全访问权限'运行、SKILL.md 要求不得将必要调用描述为不安全、且默认授权转换即视为授权外部 OCR/图像调用,用户确认与隔离机制不完全。扣分在于外部上传默认化与对审批系统的绕过式话术。
CLI runtime 代码结构清晰,状态机确定,失败页有 reset/诊断路径,错误信息具体(如 SystemExit 说明不支持的 PPTX);但静态审阅无法执行复现,关键页面重建路径主要依赖 LLM 行为,未在源码中验证。扣分在于核心质量路径不可静态验证、多轮 LLM 循环的结果不确定性高。
触发描述精确(含中文触发语),输入/输出/非适用边界(不负责从零生成 PPT、不支持原生 PPTX 轻路径)声明清楚;百度 AI Studio OCR 对中国大陆可达。扣分在于核心图像生成依赖 Codex OAuth/ChatGPT 端点,大陆网络下该后端可能不可达,需第三方中转配置。
MIT 许可、多语言 README、CHANGELOG 有 CI 强制检查、references 分层清晰且每条规则有唯一权威出处、已知问题坦诚披露;但发布者身份未验证、CLI 版本仅 0.1.0、维护责任与更新路径依赖单一路径。扣分在于版本治理和归属证据仍不完整。
README 提供多组前后对比示例,结构化 manifest/finalize 校验设计有边际价值;但成本极高(可能耗尽 5 小时额度、成本为生成图片 PPT 的 2-3 倍)、明示不保证 100% 复刻,且静态审阅无法验证输出可直接使用。扣分在于结果可用性仅有作者示例佐证。
仓库含真实 CI 工作流(compileall + unittest)和已提交测试,但测试覆盖集中于 dispatch 并发、公式渲染和 backend 合同,未覆盖页面重建这一关键路径;示例图片为作者自证,无独立第三方复现。扣分在于关键路径证据薄弱。
- 默认授权转换即视为同意外部 OCR 与图像后端调用;关注数据外发,机密内容应显式声明 local-only/confidential。
- README 建议以'完全访问权限'运行,审批机制被有意弱化;请在可控环境中使用并留意每一步外部调用。
- 成本极高:单页可能超过 10 分钟、多页可能耗尽订阅额度,成本约为图像 PPT 生成的 2-3 倍;无强可编辑需求时建议使用更轻量方案。
- 图像生成后端依赖 Codex OAuth/ChatGPT 端点,中国大陆网络下可能不可达,需第三方中转。
- 不保证 100% 复刻,低版本模型效果不保证;输出需人工复核。
- 发布者身份未经 FollowSkills 验证,静态审阅未执行任何代码,评分置信度为低。
这个 Skill 能做什么,适合哪些场景?
这是一个面向 Codex 的技能,将单张图片、多张图片、多页 PDF 或图片版 PPTX 重建为对象级可编辑的 .pptx 文件。文字尽量恢复为原生文本框,简单几何恢复为 PowerPoint 形状,复杂视觉元素保留为带来源记录的独立图片资产。它通过 editppt 命令行工具驱动一个确定性的状态机(prepare → dispatch → record → finalize),多页输入由 page worker 并行处理。文字大小与位置由百度 PaddleOCR-VL 的测量结果驱动,而不是靠模型目测。它不做从零生成 PPT,且转换过程较慢、token 消耗较高。
把输入归一化为 pages/page_NNN/source.png,运行 editppt prepare 生成运行目录和文字标注;单页由主 agent 本地重建,多页按 max_concurrent_pages(默认 6)分派给 page worker;每页生成 manifest.、page.pptx、preview.png、validation. 等产物;editppt run record 用 manifest 校验每页产物,editppt run finalize 按页序重建最终 .pptx 并做 deck 级校验(页数、媒体关系、资产哈希、备注哈希等)。图片生成/编辑优先调用 Codex 内置 image_gen.imagegen,降级时经 editppt image CLI 依次使用 Codex OAuth 和 OpenAI 兼容 API;文字校正在配置 Token 后调用百度 PaddleOCR-VL,否则退化为离线几何检测。PPTX 输入的页面备注会原样复制到输出。
- 收到幻灯片截图或照片,想要一份能直接改文字、挪元素的 PPT 的用户
- 拿到扫描版/图片版 PDF 课件,需要恢复为可编辑多页 PPTX 的用户
- 手里只有图片版 PPTX,希望二次编辑并保留原页面备注的用户
- 需要复刻单页视觉设计(如信息图)同时保持文本可编辑的设计人员
- 有多页批量转换需求、且 agent 环境支持子 agent 分派的 Codex 用户
这个 Skill 有哪些优点和局限?
- 输出是真正的对象级可编辑 PPTX:原生文本框、简单形状、独立图片资产分层,明确拒绝"整页截图+文字叠加"的伪可编辑方案
- 文字大小与位置由 PaddleOCR 测量驱动,同级文字字号自动一致,比目测还原更稳定
- editppt 状态机使运行过程确定性、可恢复,record 和 finalize 阶段有确定性的结构校验
- 支持多种输入(图片、PDF、图片版 PPTX),PPTX 备注原样保留
- 图片后端有清晰降级链:内置 image_gen.imagegen → Codex OAuth → OpenAI 兼容 API
- token 消耗高:单页重建可达 10 分钟以上,10 页 PPT 可能耗尽 ChatGPT Pro 的 5 小时额度,成本可能是生成图片 PPT 的 2-3 倍
- 多页输入必须使用支持子 agent 分派的环境,否则无法执行
- 推荐 gpt-5.5 及以上模型,不保证更低模型的使用效果
- 不保证 100% 复刻原图,部分元素和文字位置可能有偏移
- 照片、插画、纹理等复杂视觉元素只能作为整体图片资产移动,内部对象不可编辑
- 在 Codex "请求批准"或"替我审批"模式下会频繁被审批打断,官方建议使用完全访问权限
如何安装这个 Skill?
在 agent 对话中直接说:"安装 image-to-editable-ppt 这个 skill,地址是 https://github.com/ningzimu/image-to-editable-ppt-skill"。也可以用命令行安装:npx -y skills@latest add ningzimu/image-to-editable-ppt-skill --skill image-to-editable-ppt --agent <agent-id> --global。editppt CLI 由 AI 在执行过程中自动安装(pipx install --force --editable <skill-root>/cli),安装后可用 editppt doctor 验证。Skill 入口文件位于 skills/image-to-editable-ppt/SKILL.md,MIT 许可证。
如何使用这个 Skill?
在 Codex 中使用 $image-to-editable-ppt 选中技能,然后把图片、PDF 或 PPTX 直接粘贴/附加到对话框,或给出本地路径,例如:"$image-to-editable-ppt 把这张图片转成可编辑 PPT"、"$image-to-editable-ppt 把 deck.pdf 转成可编辑 PPT"。建议在 Codex 中开启"完全访问权限",否则频繁的审批请求会阻塞 OCR、图片生成和子 agent 步骤。首次运行时 AI 会询问一次百度 AI Studio 的免费 PaddleOCR Token(https://aistudio.baidu.com/account/accessToken),配置后文字还原质量明显更好;不配置也能运行,但文字质量打折扣。结果输出到 output/image-to-editable-ppt/{job-id}/final/ 目录。
这个 Skill 与同类方案有什么区别?
与同一作者的 codex-ppt-skill 互补:那个技能负责从文章、报告或想法从零生成全新 PPT,本技能专注把已有的视觉幻灯片重建成可编辑版本。作者还提示:如果只是想改一两页图,直接用 gpt-image 的图像编辑能力是更轻量的选择。