效率与协作 pptx-generationhtml-to-pptxmulti-agentvisual-qapitch-deckslide-generatorpythonpuppeteer

PPT Agent

像软件工程一样生成专业演示文稿:多子代理流水线 + 像素级视觉审计,把一句话需求变成可交付的 PPTX。

FollowSkills 评估 · FSRS-2.0
谨慎使用
53/ 100 五分制 2.7 / 5
1 2 3 4 5 6
1信任安全15 / 25 · 3.0/5

SKILL.md 显示较多安全设计:subagent 上下文隔离、输出目录限定相对路径、WAIT_USER 强制确认点、人工审计放行节点、禁止主 agent 越权改动产物。扣分项:依赖联网检索与 Puppeteer 等外部组件但安全性与依赖来源未披露;prompt 模板与脚本本体未在证据中,数据流透明度只能部分确认;无明确整体回滚/清理机制。

2可靠稳定10 / 20 · 2.5/5

文档层面的自洽性较高:Gate 校验、重试/回退、断点恢复规则完备且内部一致。扣分项:关键路径全部依赖 scripts/*.py 与 references/ 文件,均未提供,无法静态复现任何命令;禁止读脚本、只按 cheatsheet 执行的设计意味着接口不匹配时排错成本转嫁用户;无测试或 CI 证据,静态上限 10。

3适用触发9 / 15 · 3.0/5

目标场景清晰(中文 PPT 全流程生成),环境感知与降级策略有明确约定,中文支持好。扣分项:frontmatter 触发描述过度宽泛('美化'、'数据可视化'、隐式意图均触发),存在误触发风险;非适配边界声明薄弱;强依赖特定 CLI 的 subagent 创建能力,环境不满足时可用性大幅下降。

4规范维护10 / 15 · 3.3/5

版本号(v4.1 / 2026.04.09)、更新日志、LICENSE(MIT)、目录结构与真源索引清晰,命名一致。扣分项:仓库许可证元数据为 NOASSERTION 与 LICENSE 不一致;发布者身份未验证,维护责任与更新路径无承诺;'2026-04-09' 日期异常;cheatsheet、模板等关键文件未提供,可维护性无法完整确认。

5有效结果6 / 15 · 2.0/5

声称从一句话需求产出可直接使用的 PPTX,若成立边际价值显著。扣分项:无任何可静态验证的产出证据(截图资产未随证据提供);流程极重——多 subagent、多轮等待、高 token 消耗,成本收益比存疑;核心价值主张只能采信作者陈述,静态上限 7 未达。

6证据核验3 / 10 · 1.5/5

有版本化更新日志、产物链与 Gate 设计等可审计的内部一致材料。扣分项:无 CI 工作流、无提交的测试套件、无第三方执行证据;README 宣传性表述('0 丢字体'、'像素级')不可复核;效果示例图未在证据中,事实与营销话术未分离。

证据充分度: 评估于 2026年9月10日 审查版本 13e353776d0b
使用前请注意
  • 核心脚本与模板文件未在本次审查证据中,所有 Gate 校验与命令均未经执行验证,实际可用性未知。
  • 触发条件声明过宽,可能在用户仅想美化或可视化数据时被误触发,启动极重的多代理流水线。
  • 依赖联网检索与 Puppeteer 渲染,安全性与网络可达性(尤其大陆网络环境)未验证。
  • 许可证元数据为 NOASSERTION,与 LICENSE 文件的 MIT 声明不一致,安装渠道应核实。
  • 流程 token 与时间成本高,产出质量主张仅为作者陈述,建议先小规模试用验证。
评估证据 [1][2][3][4]
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

PPT Agent(v4.1)是一个代码驱动的演示文稿全自动生成框架,以严格状态机调度多子代理协作。它把 PPT 制作拆成采访、分支确认、检索/资料压缩、大纲、风格锁定、逐页并行生产(Planning → HTML → Visual QA)和双格式导出七个阶段,每个阶段产物落盘后必须通过校验 Gate 才放行。页面先产出经校验的 JSON 合同再渲染 HTML,截图后由大模型做视觉审计并驱动结构级修复,从根源上缓解传统 LLM 生成幻灯片的幻觉、重叠与布局混乱问题。最终交付网页预览和 PNG/SVG 双管线导出的 PPTX 文件。

读取用户采访答案与本地资料(或联网检索),通过 prompt_harness.py 从模板生成子代理 prompt,依次调度 ResearchSynth / SourceSynth / Outline / Style / PageAgent 等子代理产出 search-brief.txt、outline.txt、style.、planningN.、slide-N.html 等产物;用 contract_validator、planning_validator、visual_qa.py 做双层校验;每页 HTML 渲染后截图并由子代理按 DOM+CSS 重写消除布局溢出;最后用 Puppeteer 光栅化引擎导出 preview.html、presentation-png.pptx、presentation-svg.pptx 和 delivery-manifest.,全部产物落在 ppt-output/runs/<RUN_ID>/ 下。

  1. 需要给老板或客户做结构化汇报的职场人,只说一句'帮我做个关于 X 的介绍'即可触发全流程
  2. 创业者/融资团队要制作路演 pitch deck,需要暗色科技风、15 页量级的专业级输出
  3. 已有 doc/excel/pdf/pptx 资料,想把现有文档转成演示文稿或仅美化排版/重构大纲的团队
  4. 培训师需要生成多页课件,且希望在关键节点亲自图审把关(人工审计模式)
  5. 断点续作场景:任务中断后提供 RUN_ID,框架扫描磁盘产物自动推断恢复点继续跑

这个 Skill 有哪些优点和局限?

优点
  • 子代理阶段隔离,上下文不互染,且强制显式指定模型,防止静默降格
  • 数据层与渲染层分离:planning JSON 先过校验再驱动 HTML,结构可被物理探测器拦截
  • 像素级 Visual QA 闭环:截图审计后按 DOM+CSS 重写,而非微调间距糊弄
  • 无状态断点恢复:只信磁盘产物与 Gate 校验,跨对话可续跑
  • 双管线 PPTX 导出:PNG 保证视觉还原,SVG 保留字体可编辑
局限
  • GitHub 许可证字段为 NOASSERTION(README 标注 MIT,两者不一致需自行确认)
  • 对运行环境要求高:需要 Python、截图引擎、子代理创建能力,裸 API 场景无法直接用
  • 流程重(7 阶段、强制采访、多重 Gate),小任务上开销明显;子代理死亡需整页重跑
  • BLOCKED 页需用户人工裁决,框架禁止静默跳过,长任务需要人盯
  • 源材料未提供测试套件或跨平台兼容性证据,效果依赖所选大模型质量

如何安装这个 Skill?

运行 npx skills add sunbigfly/ppt-agent-skills,将技能装进支持 Agent Skill 的代理环境。仓库包含 SKILL.md(主控制台)、scripts/(校验器/harness/导出脚本)、references/(playbook、风格、版式、图表、组件库)与 assets/。需确保环境有 Python 3 和可用的截图/Puppeteer 引擎,研究分支还需要 web 搜索工具。

如何使用这个 Skill?

在支持 Skill 的代理环境直接用自然语言触发,例如:"帮我生成一份关于 2026 年具身智能发展趋势的 15 页路演 Deck,暗色科技风格。"流程从强制采访(Step 0)开始,需确认场景、受众、页数密度、配图策略、子代理模型与思考深度、是否人工审计等;随后按 P0→P5 主链执行,产物输出至 ppt-output/runs/<RUN_ID>/。具体 CLI 参数以仓库内 cli-cheatsheet.md 为准(源材料未逐条列出)。

常见问题

必须联网吗?
不必须。Research 分支(P2A)依赖 web 检索;若不需要扩写,可走非 Research 分支(P2B),仅用本地资料,但整个流程仍需能执行脚本和生成截图的本地环境。
我可以介入修改某一页吗?
可以。开启人工审计模式后,在 review 阶段有强制放行点:主代理会展示 slide-N.png 并等待你明确'通过'或'不通过';不通过时由 PagePatchAgent 从 review 阶段返工,主代理不会直接手改产物。
任务中断了怎么办?
框架是无状态设计:说'继续/恢复'并提供 RUN_ID(或用最新目录),它会按 delivery-manifest → planning → style → outline → brief → requirements 的顺序扫描磁盘产物推断最高通过点,从下一步继续。
某一页反复失败会怎样?
同类问题连续 2 轮不收敛会强制回退 planning 重定预算;单页连续 3 次失败标记为 BLOCKED,先跳过推进其余页,最后向你汇报并由你决定手动修复、简化重试或跳过该页,不会静默吞掉。

相关 Skills