anything2explainer 万物皆可讲解视频
给一个主题,产出一条黑底动效风格、有配音字幕和章节进度条的科普讲解视频,中文或英文均可,每一帧都用代码绘制。
证据显示流程设有四个强制用户确认点(时长语言/文案定稿/配音/前30秒样片),数据流披露清晰(edge-tts 为微软云端调用、kokoro 本地推理),B-roll 要求免版权来源并登记 MANIFEST,画面全部本地代码绘制,调研文档中的指令性文字被明确隔离不执行,无对外写操作或隐蔽行为。扣分:并行构建占用约 2–3GB 磁盘且未提供回滚/清理机制说明;edge-tts 依赖微软端点稳定性;许可证元数据为 NOASSERTION,归属校验不完整。未达满分。
SKILL.md 内部高度自洽:阶段、脚本(tts_build/motion_check/selfcheck/frame_metrics/preview)与确认点互相引用一致,README 交叉印证并披露已知坑(edge-tts 需锁 7.2.8、ARM 安装问题、pane 上限)。扣分:静态审查未见测试套件或 CI 执行证据,脚本内容未在证据中,异常输入的失败反馈质量只能凭文字判断,按锚点不超过 10,取 9。
触发语义清晰(用户要求讲解/科普视频),明确声明不适用范围(复刻视频、真人口播、实拍为主),中英文双支持、明确各档时长与资源门槛,Linux/macOS 环境适配披露充分。扣分:环境要求较重(Node、ffmpeg、Python venv、多 agent 并行、≥5GB 磁盘),中文云 TTS 依赖微软端点在大陆网络的可达性未披露,kokoro 英文模型下载亦依赖境外源。
文档分层出色(SKILL.md 主流程 + reference 规范 + lessons + FAQ + 已知限制),README 致谢与原创性声明诚实,PolyForm Noncommercial 许可全文与字体 OFL 许可齐备。扣分:仓库 metadata 为 NOASSERTION 与 LICENSE 不一致;无版本号/changelog,更新路径与维护责任仅隐含于个人仓库;工具链仅声明在 Claude Code/Codex 上验证过。
宣称价值高(主题进、成片出,含配音字幕进度条),样片《RAG 与知识库》全套过程文件与对比帧作为可审计标尺,四确认点控制成本。静态审查下不可执行验证:渲染结果、QC 通过率与效率宣称(8 组 40 分钟)均无法独立确认,超过静态上限 7 不可给;且产出耗时 1–3 小时、2GB 磁盘的成本效益未经证实,取 6。
证据类型较丰富:完整样片过程链(调研/分镜/QC 报告/成片帧)、6 组正反例对照、两语种成片、踩坑记录,且区分事实与设计意图。扣分:全部为作者自述材料,无第三方执行或 CI+测试覆盖,关键可复现性主张(帧级确定性渲染)无法静态核实,取 4。
- 本次为纯静态源码审查,未执行任何流程;渲染质量与效率宣称未经独立验证。
- 默认中文配音 edge-tts 调用微软云端接口,大陆网络可达性未披露;英文 kokoro 模型需从境外源下载,请自行确认网络环境。
- 每片需约 2–3GB 磁盘且并行构建对机器要求较高(≥5GB 空闲、tmux pane 上限),无自动回滚/清理说明。
- 许可为 PolyForm Noncommercial:非商业免费,商用需作者事先授权;仓库 metadata 中 NOASSERTION 与 LICENSE 文本不一致。
- 解说词配音定稿后不可改词(帧号硬编码),请在确认点 2 一次定稿。
- 仅在 macOS(及树莓派 ARM)上验证,Windows 未测试;仅 Claude Code/Codex 实测过。
这个 Skill 能做什么,适合哪些场景?
anything2explainer 是一个 Claude Code / Codex 技能,把任意技术或知识主题变成一条 2–8 分钟的动效科普讲解视频:配音、字幕、章节进度条一应俱全,全片用 Remotion(React + TypeScript)以代码逐帧绘制,不用生成式视频模型、不偷用任何现有视频素材。它交付的不只是一个模板,而是一整套方法:可编译的 Remotion 工程模板、图元与光效库、配音/分镜/渲染/量化质检工具、书面风格与动效规范、多 agent 分工协议,以及一条完整样片(《RAG 与知识库》)作为质量标尺。整片流程约 1–3 小时,大部分时间由多个并行 agent 分头构建镜头,用户只需在四个确认点介入。支持自带 TTS 或成品配音,渲染结果可复现(纯函数 + 固定随机种子)。
用户给出主题、时长和语言后,主会话按 9 个阶段编排:从模板脚手架一个 Remotion 4 项目;派 1 个研究员 agent 产出带来源 URL 的调研文档(含数字与比喻清单);按口播写作原则写解说词,调用 tts_build.py 生成配音(中文默认 edge-tts 云希、英文默认 kokoro-82m Liam)并生成帧级时间轴与字幕表;逐镜头分镜;补齐片头/章节卡/HUD/图元;先构建第一组镜头并渲 30 秒样片给用户定风格;再派 4–14 个并行构建 agent 各写 5–7 个镜头的纯函数 Remotion 组件(带 motion_check.py 动效密度自检);渲染 1280×720 H.264 成片并跑 frame_metrics.py 量化构图;每章 1 个 QC agent 按书面判据审帧、按组派修复、复验后出交付说明。画面上的每个数字和术语必须能在调研文档里找到来源 URL,未经核实的事实不上画面也不进配音。
- 知识科普创作者想批量产出风格统一的讲解视频(如“讲一下向量数据库”),但不想学动画或剪辑软件
- 技术作者手头有一篇文章或文档,想把它转成一条有配音和字幕的视频发到视频平台
- 需要英文版本的科普视频:技能有独立的英文语速模型、字幕预算和默认音色(kokoro Liam)
- 教育内容团队想用 AI agent 流水线稳定复现某种视觉风格,并要求画面上的每个事实都有出处可查
- 内容营销或开发者布道者想用一条确定性的代码渲染视频(每个数字、每帧都可追溯、可修复),而不是生成式视频模型的随机产出
这个 Skill 有哪些优点和局限?
- 产出完全由代码绘制、可复现:每帧是帧号的纯函数,任何一帧有错改一个镜头文件即可修复
- 事实纪律严格:画面上每个数字、年份、术语都要求溯源到调研文档里的 URL,未核实不上画面
- 方法论完整:不只给模板,还带风格规范、动效词汇表、六种 agent prompt 模板、踩坑记录和一条完整样片作质量标尺
- 四个确认点设计合理,把最贵的返工(改文案、改风格)放在成本最低的时点
- 无需 GPU:Remotion 走无头 Chromium CPU 渲染,中文音色 edge-tts 是云端调用,英文 kokoro-82M 本地 CPU 即可跑
- 版权为 PolyForm Noncommercial 1.0.0:非商业免费,商业用途需作者事先授权(做出来的视频归你)
- 只支持横屏 1280×720,没有竖屏 9:16;视觉风格只有一种(可选星点/点阵波两种幕底),改其他风格要手编 style-guide 和 ui.tsx
- 配音一旦生成,文案就冻结——镜头代码硬编码帧号,改词等于全片重排
- 并行构建资源占用重:多个 agent 同时 bundle Remotion,需预留 ≥5GB 磁盘;tmux pane 数量有限,约 12 个以上 agent 需分波派发
- 只验证过 Claude Code 和 Codex 两个平台;Windows 未测试;repo 声明 NOASSERTION(实际为 PolyForm Noncommercial)
- 一条 3–5 分钟视频全流程约 2 小时、约 2GB 磁盘,且依赖能稳定跑多 agent 并行的宿主环境
如何安装这个 Skill?
git clone https://github.com/Vincentwei1021/anything2explainer.git,然后为对应客户端创建软链接:ln -s "$PWD/anything2explainer" ~/.claude/skills/anything2explainer(Claude Code)或 ln -s "$PWD/anything2explainer" ~/.codex/skills/anything2explainer(Codex)。依赖:Node ≥18、ffmpeg(brew install ffmpeg);Python 虚拟环境里 pip install 'edge-tts==7.2.8' numpy pillow scipy(7.2.8 是锁定版本,跨升级易断);英文配音需额外 pip install kokoro soundfile 并安装 espeak-ng。脚本是 zsh + Python 3,在 macOS 上开发验证,Linux 应可用,Windows 未测试。
如何使用这个 Skill?
在 Claude Code 或 Codex 里直接说需求即可触发技能,例如:“Make me an explainer video about vector databases.” 或 “讲一下向量数据库,做成一条讲解视频”。流程会在四个确认点停下来等你:①时长与语言(决定句数、镜头数与并行 agent 数);②解说词定稿(定稿后帧号硬编码,改一个字全片重排);③配音引擎偏好(可用默认 edge-tts / kokoro,或自备成品 wav 放到 public/assets/<slug>/audio.wav);④前 30 秒样片(此时改风格只需改一组,整片渲完再改就是全部组的成本)。也可以手动驱动模板:template/scripts/new_project.sh ~/work/my-video myslug 建项目,然后依次写 research/调研.md、script/narration.txt(跑 tts_build.py)、script/storyboard_src.md(跑 render_storyboard.py)、改 src/config.ts、写镜头代码,用 preview.sh 30 看样片,VER=v1 scripts/render.sh 出片。
这个 Skill 与同类方案有什么区别?
README 自带的对比:与 Sora / Veo / Runway 等生成式视频模型不同,它输出确定性代码动画,画面上每个数字可溯源、任何帧可单点修复;与 HeyGen / Synthesia 等数字人口播工具不同,它没有主持人,用动效图解说机制;与裸用 Remotion 或 Motion Canvas 不同,它在画布之上补齐了调研→解说词→分镜→并行构建→质检的完整方法;与 Manim 不同,它是 React/TypeScript 而非 Python,且带 TTS 对齐字幕、章节和量化 QC 的 agent 端到端流水线。