效率与协作 pptx-generationgpt-image-2slide-generationtemplate-cloningimage-to-pptpython-pptxeditable-pptx

GPT-Image2 PPT 生成技能

用 OpenAI gpt-image-2 把 Markdown 大纲直接生成精美 16:9 PPT,还能仿制任意 .pptx 模板的版式并替换成你的内容。

FollowSkills 评估 · FSRS-1.0
推荐
66/ 100 五分制 3.3 / 5
本条评估按 FSRS 1.0 标准完成,维度分不做换算,已进入按 FSRS 2.0 重新评估的复核队列。
1 2 3 4 5 6
1价值适配15 / 20 · 3.8/5
2可靠性12 / 20 · 3.0/5
3安全性19 / 25 · 3.8/5

调用 OpenAI 官方 gpt-image-2 图片生成 API,需要用户自己的 API Key,本地生成图片再打包 PPTX,无破坏性操作,会产生 API 调用费用。

4证据6 / 15 · 2.0/5
5易用性8 / 10 · 4.0/5
6维护性6 / 10 · 3.0/5
证据充分度: 评估于 2026年7月17日
使用前请注意
  • 依赖 OpenAI gpt-image-2 付费 API,多页 PPT 会产生对应数量的图片生成调用费用
评估证据 [1]
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

这是一个面向 Claude Code、Codex、OpenClaw 等 Agent 的 PPT 生成技能。它把一份 Markdown 大纲或 slides_plan. 连同一种视觉风格交给 OpenAI gpt-image-2 官方 Images API,逐页生成高清 16:9 图片并打包为 .pptx。它不走传统的模板填字路线,而是让模型把每页当作完整视觉稿来画,以保证整体审美一致。内置 265 套风格模板(初始 10 套、精选 22 套、设计师夏目玲子提供 233 套),也支持上传任意 .pptx 模板进行版式克隆。默认输出整页图片型 PPT,用户明确要求时才启用可编辑模式,把文字、图形和素材重建为 PowerPoint 原生对象。

读取 Markdown 大纲(slides_plan.md)并转换为 slides_plan.;按选定的风格 MD + layouts. sidecar(或用户上传的 .pptx 模板分析结果)编译每页 prompt;调用 gpt-image-2 Images API 逐页出图(支持 reference image 和真实素材槽位后贴);用 python-pptx 打包成 16:9 PPTX;产物包括每页 PNG、prompts.、metadata. 和 PPTX 文件。模板克隆模式会用 render_template.py 把模板渲染成 PNG,再由多模态 Agent 或外挂 vision 端点生成 template_profile.。还支持 --edit 精确修改某页某元素、--rollback 版本回滚、--editable 生成原生对象可编辑 PPTX。

  1. 需要快速产出融资路演、产品发布 PPT 的创业者和产品经理,从一句话需求直接得到可展示的成品
  2. 手里有公司模板但不会做设计的企业用户,上传 .pptx 后让 AI 仿版式换新内容
  3. 要交毕业答辩或论文结题展示的学生,套用学术类风格或答辩模板
  4. 用 Claude Code 的开发者想在终端里一句话生成课程课件、周报、读书分享等日常 PPT
  5. 要求文字可在 PowerPoint 里直接修改的用户,明确启用可编辑模式获得原生文本框和可移动素材
  6. 需要把产品截图、logo、论文图表等真实素材精确嵌入 PPT 的用户

这个 Skill 有哪些优点和局限?

优点
  • 整页视觉稿生成方式保证了单页审美,从封面到内页风格统一,可 10 路并发、约 30 秒出 10 页
  • 265 套风格库覆盖科技、商务、学术、教育、时尚等场景,且有在线画廊可预览和复制 Prompt
  • 模板克隆支持 1 page : 1 layout 的复用检测,避免观众看到重复版式
  • 真实素材默认保真后贴为独立 PPT 图片对象,不靠 AI 重绘,医疗影像、财务表格等高精度素材不变形
  • 可追踪可回滚:metadata. 记录 slide_spec 版本,支持精确到元素的编辑
  • 依赖注入安全设计明确:不向上递归读取调用者项目的 .env
局限
  • 默认产物是整页图片型 PPT,文字和数字无法在 PowerPoint 里直接编辑,除非走可编辑模式
  • 可编辑模式和模板克隆都强依赖本机 PowerPoint COM / Keynote / LibreOffice,容器、鸿蒙、Termux 等环境可能无法使用
  • API 直连按图计费,gpt-image-2 费用不在 ChatGPT 订阅内,整套 PPT 成本需要自行评估
  • 密集表格、财报小字等场景官方自己标注'不建议直接承诺',需要严格人工核对
  • 纯文本 Agent 使用模板克隆时需额外配置外挂 vision 端点,增加配置复杂度
  • --backend codex 备用后端每页需 30-60 秒,且靠自然语言转发参数偶发失败

如何安装这个 Skill?

克隆仓库后运行一键安装脚本:git clone [email protected]:JuneYaooo/gpt-image2-ppt-skills.git && cd gpt-image2-ppt-skills && bash install_as_skill.sh --target claude(Claude Code 装到 ~/.claude/skills/)或 --target codex(装到 ~/.codex/skills/)。也可以直接把仓库地址发给 Claude Code 等 Agent,让它自行安装。API 直连需配置 OPENAI_BASE_URL、OPENAI_API_KEY、GPT_IMAGE_MODEL_NAME=gpt-image-2 等环境变量;模板克隆和可编辑模式需本机有 PowerPoint COM、Keynote 或 LibreOffice 渲染后端。

如何使用这个 Skill?

安装后在 Agent 里直接用自然语言触发,例如:'帮我做一份关于 AI 如何改变内容创作的 6 页 PPT,先生成一页封面给我确认' 或 '我上传了 company-template.pptx,参考它的版式做一份 8 页产品战略 PPT'。Agent 会先写 slides_plan.md 供确认,转 后先 --slides 1 出封面冒烟,确认后再跑全量并输出到 outputs/<timestamp>/ 目录。修改时说'改第 3 页的副标题',脚本用 --edit 只重生成目标页。

这个 Skill 与同类方案有什么区别?

README 明确说明项目上游参考 op7418/NanoBanana-PPT-Skills:最初是把图片后端从 Nano Banana Pro 换成 OpenAI gpt-image-2,重写并新增风格,再扩展出模板克隆、PPTX 打包和结构化风格库。如果你更偏好 Nano Banana 出图路径,可看上游原项目;本项目的差异化在于 gpt-image-2 出图、模板克隆和可编辑 PPTX 重建。

常见问题

生成一套 PPT 要花多少钱?
gpt-image-2 按图计费(GPT_IMAGE_QUALITY 默认 high),不在 ChatGPT 订阅内;源材料未给出具体单价,需按 OpenAI 定价自行估算。走 Codex 原生 image_generation tool 不需要 API Key,但计费逻辑相同。
我的环境没有 PowerPoint,能用模板克隆吗?
模板克隆和可编辑模式需要可执行的渲染后端(Windows PowerPoint COM / macOS Keynote / LibreOffice),脚本会用 render_template.py --check 做真实转换验证。没有后端时,可以手动把模板每页导出为 page-01.png 后用 --template-images 传入;可编辑模式则无法使用。
生成的 PPT 文字可以直接改吗?
默认模式不行——文字是整页图片的一部分,但可以通过 --edit 用图生图只重生成目标页。若需要 PowerPoint 原生文本框和 shape,必须明确要求启用可编辑模式(默认关闭),并具备 PPTX 回渲染后端。
我没想好风格和页数,直接说需求可以吗?
可以。examples/ 内置产品发布、融资路演、周报、课程课件、论文答辩、读书分享六类 recipe;Agent 会按规范先问你内容、页数、观众和风格偏好,再写 slides_plan.md 给你确认文案后才开始生成。

相关 Skills