GordenImage2PPTX 图片PPT还原术
把幻灯片截图或任意图片页逆向还原成完全可编辑的 .pptx,文字是真文本框,框架与图标是可移动图片。
技能明确要求任务隔离目录(RUN_ROOT)、不扫描/复用历史文件、生成证据 manifest 硬门禁,数据流和外部效果基本透明;脚本仅读写本机文件,无网络上传或凭据处理。扣分项:无回滚/清理说明,依赖 Codex 内置 imagegen 等外部后端但无安全边界说明,许可与发布者归属信息未知。
SKILL.md 与 references 层层递进、脚本自包含(chroma_key.py 参数与文档一致,compose_pptx.py 实现完整),失败反馈明确(如 layout_guard 拦截、edge_touch 不交付),文档还总结了常见失败模式与补救。扣分项:静态评审未执行,无测试套件或 CI 覆盖关键路径;imagegen 生成质量与坐标换算等核心环节实际成功率无证据,边缘情况(如自动切片粘连)依赖人工重试。
触发条件在 frontmatter 中描述清晰(图片转可编辑 PPTX、抠图标等),输入输出边界明确,中文支持好,目标环境(Codex/Cursor/Claude)有适配说明。扣分项:核心出图完全依赖 imagegen 类后端,在无该后端的运行时按文档应停下询问,可用性受限;未明确声明对复杂手绘/照片型页面的不适配边界。
文档结构分层良好(SKILL.md 概览 + references 细节 + schema),示例与 QA 检查单齐全,命名稳定。扣分项:许可元数据未知,无版本号/变更记录,维护责任与更新路径不明;references/image-to-pptx.md 结尾 schema 说明被截断,存在文档完整性瑕疵。
设计上确实能把图片 PPT 还原为文字可编辑、图形为图片层的 PPTX,比手工重排有真实边际价值,并内置多重 QA 反馈环。扣分项:静态无法验证产物可直接使用;流程要求多轮人工视觉回校(图标回校、frame 锚点回校、文字回校),实际成本高且最终保真度依赖 imagegen 复刻质量,产出可能仍需明显返工。
文档包含大量具体公式、命令与可复查的 QA 产物清单,具备一定可审计性。扣分项:全部为作者自述与提示词设计,无第三方执行证据、无 CI 测试或提交的测试套件,'豪华效果/最强'类描述无独立佐证,效果结论只能停留在低置信推断。
- 许可与发布者信息未知,商用或企业内部引入前需先确认授权与归属。
- 核心出图依赖 Codex 内置 imagegen 等后端,无该后端的运行时无法完成关键步骤;中国大陆网络环境下对海外图像后端的可达性未评估。
- 文档要求的坐标换算、图标回校、frame 锚点回校等多轮人工校准成本高,实际产出可能仍需明显返工,请勿预期一键高质量还原。
- 本次为纯静态评审,未执行任何脚本或流程;无测试与 CI 佐证,可靠性结论为低置信。
- references/image-to-pptx.md 的 schema 说明在文末截断,layout 字段契约以 SKILL.md 为准并建议向维护方反馈。
这个 Skill 能做什么,适合哪些场景?
这是 GordenSun/GordenSuperPPTSkills 技能包三个技能中的还原环节。它把图片格式的 PPT、幻灯片截图或任意图片页强制拆成四层——背景、整体框架图、元素图标/装饰、文字——再按坐标合成可编辑的 .pptx。图片层由 imagegen 类生成式后端提取生成,文字用 GPT 视觉能力读取并写成真实文本框,不依赖传统 OCR。README 明确说明该技能仅限 Codex 使用,且官方声明未对 Claude 等其它运行时做专门适配。
读取用户提供的单张或多张幻灯片图片,为每次任务创建隔离的 RUN_ROOT 目录;先用 probe_palette.py 探色选定抠图底色,再用 Codex 内置 image_gen 以当前源图为编辑目标依次生成背景复刻图、框架图和图标表(纯色抠图底);用自带 chroma_key.py 去底、slice_grid.py 切分图标表;GPT 视觉逐段读取普通文字的位置、字号、颜色、粗细并写入 layout.;layout_guard.py、placement_qa.py、visual_compare_qa.py 依次做坐标契约校验、源图框视觉复核和并排/叠图/差异热图 QA;最后 compose_pptx.py 合成可编辑 .pptx 并输出预览图,每页必须生成 imagegen-assets-manifest. 记录生成证据,缺证据即判失败。
- 拿到别人发来的 PPT 截图或图片版 PPT,想要一份真正可编辑的 PPTX 继续修改的用户。
- 把 GordenImagePPTGen 生成的图片型 PPT 一键还原成可编辑文件,形成图片版到可编辑版的完整流程。
- 需要抠出幻灯片里的图标、装饰或艺术字素材的设计人员。
- 想复刻某张幻灯片背景和整体排版(含图表图形)但只有图片没有源文件的用户。
- 有多页图片 PPT、需要逐页批量还原并保持坐标与源图对位的用户。
这个 Skill 有哪些优点和局限?
- 输出不是截图,而是文字为真文本框、框架和图标可移动/替换/缩放的真正可编辑 PPTX。
- 强制四层分解加 manifest 生成证据、layout_guard、placement_qa、visual_compare_qa 等多层硬门禁,失败会强制重做而非带缺陷交付。
- 每个技能目录自包含(自带 scripts/ 与 references/),复制即用。
- 支持整框架默认不切分,也可按用户要求把框架切成独立部件。
- README 明确仅适用于 Codex,依赖 Codex 内置 image_gen 与 GPT 视觉能力,未对其它运行时做适配。
- 费用高:转换一张图片约耗 Plus 订阅 5 小时额度的 10%。
- 仓库未标注 License(仅版权声明要求商用须标注出处或作者 @Gorden Sun)。
- 无自动化测试套件;质量依赖 GPT 视觉与 imagegen 的效果,README 未提供成功率或基准数据。
- 图片层是 imagegen 生成图,默认整体框架为一张图而非原生 PPT 形状,后续编辑框架需替换整图。
如何安装这个 Skill?
在 Codex 中:把 GitHub 仓库地址 https://github.com/GordenSun/GordenSuperPPTSkills 发给 Codex 让它安装;或手动复制——cp -R GordenImage2PPTX "${CODEX_HOME:-$HOME/.codex}/skills/GordenImage2PPTX"。依赖安装:pip3 install python-pptx pillow numpy。README 未说明在其它平台(如 Claude Code)的安装方式。
如何使用这个 Skill?
仅限 Codex(README 推荐 GPT 5.5、推理强度"中")。把要转换的图片放进当前文件夹,使用提示词:"把当前文件夹里的XXX.png,使用GordenImage2PPTX,还原成可编辑的PPT,必须严格遵循技能步骤"。技能会逐页走 B0–B9 流程;若希望框架拆成独立可移动部件,在提示词中明确说明。README 提示费用较高:转换 1 张图片约消耗 Plus 订阅 5 小时额度的 10%。
这个 Skill 与同类方案有什么区别?
同仓库的 GordenSuperPPTSkill 是本技能与 GordenImagePPTGen 的串联编排(一键"先出图再转可编辑");GordenImagePPTGen 只负责生成图片版 PPT。只把已有图片转可编辑时用本技能即可。