PPT Agent
像软件工程一样生成专业演示文稿:多子代理流水线 + 像素级视觉审计,把一句话需求变成可交付的 PPTX。
SKILL.md 显示较多安全设计:subagent 上下文隔离、输出目录限定相对路径、WAIT_USER 强制确认点、人工审计放行节点、禁止主 agent 越权改动产物。扣分项:依赖联网检索与 Puppeteer 等外部组件但安全性与依赖来源未披露;prompt 模板与脚本本体未在证据中,数据流透明度只能部分确认;无明确整体回滚/清理机制。
文档层面的自洽性较高:Gate 校验、重试/回退、断点恢复规则完备且内部一致。扣分项:关键路径全部依赖 scripts/*.py 与 references/ 文件,均未提供,无法静态复现任何命令;禁止读脚本、只按 cheatsheet 执行的设计意味着接口不匹配时排错成本转嫁用户;无测试或 CI 证据,静态上限 10。
目标场景清晰(中文 PPT 全流程生成),环境感知与降级策略有明确约定,中文支持好。扣分项:frontmatter 触发描述过度宽泛('美化'、'数据可视化'、隐式意图均触发),存在误触发风险;非适配边界声明薄弱;强依赖特定 CLI 的 subagent 创建能力,环境不满足时可用性大幅下降。
版本号(v4.1 / 2026.04.09)、更新日志、LICENSE(MIT)、目录结构与真源索引清晰,命名一致。扣分项:仓库许可证元数据为 NOASSERTION 与 LICENSE 不一致;发布者身份未验证,维护责任与更新路径无承诺;'2026-04-09' 日期异常;cheatsheet、模板等关键文件未提供,可维护性无法完整确认。
声称从一句话需求产出可直接使用的 PPTX,若成立边际价值显著。扣分项:无任何可静态验证的产出证据(截图资产未随证据提供);流程极重——多 subagent、多轮等待、高 token 消耗,成本收益比存疑;核心价值主张只能采信作者陈述,静态上限 7 未达。
有版本化更新日志、产物链与 Gate 设计等可审计的内部一致材料。扣分项:无 CI 工作流、无提交的测试套件、无第三方执行证据;README 宣传性表述('0 丢字体'、'像素级')不可复核;效果示例图未在证据中,事实与营销话术未分离。
- 核心脚本与模板文件未在本次审查证据中,所有 Gate 校验与命令均未经执行验证,实际可用性未知。
- 触发条件声明过宽,可能在用户仅想美化或可视化数据时被误触发,启动极重的多代理流水线。
- 依赖联网检索与 Puppeteer 渲染,安全性与网络可达性(尤其大陆网络环境)未验证。
- 许可证元数据为 NOASSERTION,与 LICENSE 文件的 MIT 声明不一致,安装渠道应核实。
- 流程 token 与时间成本高,产出质量主张仅为作者陈述,建议先小规模试用验证。
这个 Skill 能做什么,适合哪些场景?
PPT Agent(v4.1)是一个代码驱动的演示文稿全自动生成框架,以严格状态机调度多子代理协作。它把 PPT 制作拆成采访、分支确认、检索/资料压缩、大纲、风格锁定、逐页并行生产(Planning → HTML → Visual QA)和双格式导出七个阶段,每个阶段产物落盘后必须通过校验 Gate 才放行。页面先产出经校验的 JSON 合同再渲染 HTML,截图后由大模型做视觉审计并驱动结构级修复,从根源上缓解传统 LLM 生成幻灯片的幻觉、重叠与布局混乱问题。最终交付网页预览和 PNG/SVG 双管线导出的 PPTX 文件。
读取用户采访答案与本地资料(或联网检索),通过 prompt_harness.py 从模板生成子代理 prompt,依次调度 ResearchSynth / SourceSynth / Outline / Style / PageAgent 等子代理产出 search-brief.txt、outline.txt、style.、planningN.、slide-N.html 等产物;用 contract_validator、planning_validator、visual_qa.py 做双层校验;每页 HTML 渲染后截图并由子代理按 DOM+CSS 重写消除布局溢出;最后用 Puppeteer 光栅化引擎导出 preview.html、presentation-png.pptx、presentation-svg.pptx 和 delivery-manifest.,全部产物落在 ppt-output/runs/<RUN_ID>/ 下。
- 需要给老板或客户做结构化汇报的职场人,只说一句'帮我做个关于 X 的介绍'即可触发全流程
- 创业者/融资团队要制作路演 pitch deck,需要暗色科技风、15 页量级的专业级输出
- 已有 doc/excel/pdf/pptx 资料,想把现有文档转成演示文稿或仅美化排版/重构大纲的团队
- 培训师需要生成多页课件,且希望在关键节点亲自图审把关(人工审计模式)
- 断点续作场景:任务中断后提供 RUN_ID,框架扫描磁盘产物自动推断恢复点继续跑
这个 Skill 有哪些优点和局限?
- 子代理阶段隔离,上下文不互染,且强制显式指定模型,防止静默降格
- 数据层与渲染层分离:planning JSON 先过校验再驱动 HTML,结构可被物理探测器拦截
- 像素级 Visual QA 闭环:截图审计后按 DOM+CSS 重写,而非微调间距糊弄
- 无状态断点恢复:只信磁盘产物与 Gate 校验,跨对话可续跑
- 双管线 PPTX 导出:PNG 保证视觉还原,SVG 保留字体可编辑
- GitHub 许可证字段为 NOASSERTION(README 标注 MIT,两者不一致需自行确认)
- 对运行环境要求高:需要 Python、截图引擎、子代理创建能力,裸 API 场景无法直接用
- 流程重(7 阶段、强制采访、多重 Gate),小任务上开销明显;子代理死亡需整页重跑
- BLOCKED 页需用户人工裁决,框架禁止静默跳过,长任务需要人盯
- 源材料未提供测试套件或跨平台兼容性证据,效果依赖所选大模型质量
如何安装这个 Skill?
运行 npx skills add sunbigfly/ppt-agent-skills,将技能装进支持 Agent Skill 的代理环境。仓库包含 SKILL.md(主控制台)、scripts/(校验器/harness/导出脚本)、references/(playbook、风格、版式、图表、组件库)与 assets/。需确保环境有 Python 3 和可用的截图/Puppeteer 引擎,研究分支还需要 web 搜索工具。
如何使用这个 Skill?
在支持 Skill 的代理环境直接用自然语言触发,例如:"帮我生成一份关于 2026 年具身智能发展趋势的 15 页路演 Deck,暗色科技风格。"流程从强制采访(Step 0)开始,需确认场景、受众、页数密度、配图策略、子代理模型与思考深度、是否人工审计等;随后按 P0→P5 主链执行,产物输出至 ppt-output/runs/<RUN_ID>/。具体 CLI 参数以仓库内 cli-cheatsheet.md 为准(源材料未逐条列出)。