GPT Image 2 图像创作工作流
为 GPT Image 2 提供从结构化提示词到图像生成与编辑的完整工作流。
文档区分本地、宿主委托和顾问模式,要求显式启用 ENABLE_GARDEN_IMAGEGEN,并说明会读取 OPENAI_API_KEY、环境文件和可配置的第三方 OPENAI_BASE_URL;但未要求调用前确认、未说明敏感数据处理、网络传输边界、回滚或输出清理,因此扣分。
工作流、模式分支、错误处理方向和命令示例较清晰;但脚本内容未提供,无法静态确认依赖、参数校验、关键路径复现或异常反馈质量,且“80+”与 README 的“79”存在不一致,因此不超过静态上限并扣分。
明确面向图像生成、编辑和提示词顾问,并定义 A/B/C 模式、输入缺失时的提问规则及不适用模板;但宿主工具识别依赖模糊的名称信号,未充分定义失败边界,也未说明中国大陆网络可达性,故扣分。
SKILL.md、README、中英文文档、references 分层和 manifest 版本信息较完整,提供命名、环境变量、示例及 MIT 许可证;但缺少变更日志、明确维护责任人、更新路径、依赖安装说明和系统化故障排查,因此扣分。
文档展示了大量模板、模式降级和 prompt 归档约定,理论上可覆盖多类图像任务并提供可复用输出;但本次仅静态阅读,未验证图片生成、编辑或输出文件是否实际可用,按静态校准不超过7分。
源文件包含较详细的流程、参数和模板,具备一定审计性;但没有提供脚本实现、测试套件、CI 覆盖或独立复现结果,README 的案例画廊也只是声明性外部材料,因此证据覆盖有限。
- 不要在未确认的情况下把用户图片或提示词发送到 OpenAI 或第三方兼容网关;OPENAI_BASE_URL 可指向任意网关,数据处理方式未定义。
- 本次未提供 scripts/、package.json 实体内容,不能确认依赖、API 请求、路径写入和异常处理实际可运行。
- 技术图模板输出 PNG 而非可编辑 SVG;图像生成结果中的文字、数据和学术内容仍需人工核验。
- 未说明中国大陆网络访问兼容性,核心 Mode A 可能依赖外部 API 可达性。
这个 Skill 能做什么,适合哪些场景?
这是 Garden Skills 集合中的专用图像生成与编辑技能,面向 GPT Image 2 和 OpenAI 兼容图像接口。它支持 Garden 本地生图、委托宿主图像工具,以及仅生成提示词的顾问模式。技能覆盖海报、UI 样机、产品视觉、信息图、学术图、技术架构图、漫画、头像、分镜和品牌视觉等场景。它通过分类模板组织提示词,并分别提供生成图片和编辑图片的脚本流程。
先运行 check-mode.js 判断当前运行模式;根据任务选择生成或编辑流程,并从 references/ 中读取对应模板。Mode A 使用 scripts/generate.js 调用 OpenAI 兼容的图像生成接口,或使用 scripts/edit.js 进行图片及遮罩编辑;Mode B 将渲染后的提示词交给宿主图像工具;Mode C 输出并保存可复用的提示词。默认情况下,提示词保存到 garden-gpt-image-2/prompt/,Mode A 生成的图片保存到 garden-gpt-image-2/image/。
- 设计师需要为品牌活动制作海报、横幅、杂志封面或包装视觉时,使用对应的结构化模板生成提示词。
- 产品团队需要展示聊天界面、直播电商界面或落地页 hero 图时,使用 UI mockup 模板。
- 研究人员需要制作神经网络架构图、方法流程图、图形摘要或论文数据图时,使用 academic-figures 模板。
- 工程师需要生成系统架构图、流程图、时序图、状态机或 ER 图的 PNG 示意图时,使用 technical-diagrams 模板。
- 用户已有商品、人像或场景图片,需要替换背景、移除对象或进行局部精修时,使用 editing workflows。
- 没有可用图像工具的 Agent 用户,需要一份可交给其他图像模型执行的高质量提示词时,使用 Advisor 模式。
这个 Skill 有哪些优点和局限?
- 同时覆盖图片生成、图片编辑和纯提示词顾问三种运行方式。
- 提供按场景组织的结构化模板,覆盖 UI、产品、学术图、技术图、漫画和品牌视觉等任务。
- 支持 OpenAI 兼容接口,并允许通过 OPENAI_BASE_URL 使用兼容网关。
- 具备明确的提示词和图片保存、命名及版本复用规则。
- Mode A 需要 Node.js、网络访问和 OPENAI_API_KEY;接口失败、网络问题或配额不足会中断生成。
- Mode B 依赖宿主 Agent 自带图像工具,Mode C 无法实际生成图片。
- 技术图模板输出 PNG 位图,不是可编辑 SVG。
- README 列出 79 个模板,而 SKILL.md 描述为 80+ 个,模板数量存在文档口径差异。
如何安装这个 Skill?
使用 skills CLI 安装单个技能:npx skills add ConardLi/garden-skills -s gpt-image-2 --global。也可以克隆仓库后,将 skills/gpt-image-2 文件夹复制到目标 Agent 扫描的技能目录,例如 .claude/skills/、.agents/skills/ 或 .codex/skills/。整个集合采用 MIT 许可证。
如何使用这个 Skill?
先让 Agent 执行 node skills/gpt-image-2/scripts/check-mode.js。Mode A 可使用 node skills/gpt-image-2/scripts/generate.js --prompt "A cute baby sea otter" --size 1024x1024 --quality high,或使用 node skills/gpt-image-2/scripts/edit.js --image assets/source.png --prompt "Replace the background with a clean studio scene"。使用前需要根据环境配置 ENABLE_GARDEN_IMAGEGEN;Mode A 还需要 OPENAI_API_KEY。没有 Garden 生图配置时,Agent 会根据宿主是否具备图像工具选择 Mode B 或 Mode C。
这个 Skill 与同类方案有什么区别?
与宿主原生图像工具相比,本技能增加了模式检测、场景模板、提示词保存和图片编辑脚本;但在 Mode B 下仍需依赖宿主工具实际出图。与纯提示词顾问相比,它在 Mode A 还可以直接调用 OpenAI 兼容接口并落盘图片。