设计与前端 text-to-videopaper-collagemotion-graphicsexplainer-videottsvoice-cloningffmpegvideo-generation

Vox Director:一键生成 Vox 风格拼贴视频

输入一个主题,自动完成脚本、拼贴海报、动画、配音、配乐和字幕,输出成品 Vox 风格解说/广告视频。

FollowSkills 评估 · FSRS-2.0
谨慎使用
56/ 100 五分制 2.8 / 5
1 2 3 4 5 6
1信任安全16 / 25 · 3.2/5

SKILL.md 明确在缺少 ATLASCLOUD_API_KEY 时停止、设了两个人工确认关口(分镜表、画幅近似),依赖只有 ffmpeg/Pillow,无凭据外传迹象;但会把用户的照片、口播视频、克隆语音样本上传至 Atlas Cloud 第三方 API,且默认水印是『Made with Atlas Cloud』(推广倾向),数据流披露不完整,扣分。

2可靠稳定10 / 20 · 2.5/5

文档内大量已记录的失败模式(gotchas)、自动重提、fallback 模型、可断点续跑(跳过已有 keyframe_url)说明工程认真;但静态审阅未见测试套件或 CI,关键路径无法复核,错误处理只停留在文档描述,按静态上限给 10。

3适用触发10 / 15 · 3.3/5

触发词、三种输入形态(B/A/C-roll)、边界(真人用 Kling、内容审核绕行)写得非常清楚,且中英双语;但核心功能完全依赖 Atlas Cloud 单一海外 API(配额、付费、可达性),对中国大陆网络可达性未声明,扣分。

4规范维护10 / 15 · 3.3/5

结构清晰(SKILL.md + references 分层渐进披露)、MIT 许可、package. 有版本号、双语文档;但无 changelog、维护责任仅个人、versioning/update 路径未说明,隐藏假设(Atlas 账号、模型 ID 漂移)依赖外部文档,扣分。

5有效结果6 / 15 · 2.0/5

若按文档执行,能端到端产出成片,边际价值明确(手工做拼贴视频成本极高);但静态审阅无独立复现,成本(多模型多镜生成)与成品质量证据仅来自作者展示片,按静态上限给 6。

6证据核验4 / 10 · 2.0/5

有示例 beats.、README 展示视频与具体踩坑记录(如 'PARFUM'→'PAREUM'),超过纯营销;但全部为作者自述与自查,无第三方测试、无 CI、模型验证表不可独立复核,按静态上限给 4。

证据充分度: 评估于 2026年9月18日 审查版本 668ec3946fe0
使用前请注意
  • 核心功能完全依赖 Atlas Cloud 付费 API,中国大陆网络可达性与账号可用性未声明,使用前需自行验证。
  • 用户照片、口播视频与语音克隆样本会上传至第三方云端处理,涉及生物特征/声音数据,敏感用户应先评估隐私风险。
  • 默认成片带 'Made with Atlas Cloud' 水印,属推广倾向,商用前需确认是否移除。
  • 模型 ID 会漂移,文档承认默认值仅『今天可用』,运行时可能需人工干预重选模型。
  • 语音克隆与『零内容审核动真人』的本地引擎路径存在被滥用于换脸/仿冒的风险,使用者须自行合规。
评估证据 [1][2][3][4][5][6][7]
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

Vox Director 是一个代理技能(agent skill),能将一句话主题端到端地变成一条 Vox 风格撕纸拼贴解说或广告视频。整条流水线跑在 Atlas Cloud API 加本地 ffmpeg 上,由每项目一份 beats. 驱动:选叙事弧线、风格比稿、生成拼贴海报、动画化、配音配乐、ffmpeg 合成。除 B-roll(主题生视频)外,还支持 A-roll(将真人出镜口播视频重绘成拼贴风)和 C-roll(把一张人物或产品照片以照片贴纸形式嵌入拼贴世界)。流程设两个人工决策关卡:批准节拍表、肉眼选定视觉风格。

按阶段各由一个脚本执行:1) 依据 beat-layer.md 的叙事弧线(timeline、pas、how_it_works 等)写出 beats. 节拍表供用户批准;2) style_bakeoff.py 用 3–4 个主题预设渲染同一节拍做风格比稿;3) keyframes.py 调 google/nano-banana-2/text-to-image 为每镜头生成带标题的拼贴海报(约 $0.08/张,便宜可重摇);4) clips.py 调 gemini-omni-flash 图生视频为每张海报加镜头运动与元素动效(真人/品牌自动换 kling-video-o3-pro);5) audio.py 用 xai/tts-v1 生成旁白(可选 seed-audio 声音克隆)、minimax/music-2.6 生成纯音乐 BGM;6) assemble.py 用 ffmpeg 合并、音乐闪避、烧录字幕和水印,产出 final.mp4。所有调用经 scripts/provider.py,作业失败会自动重提交。

  1. 内容创作者想把自己出镜的口播视频改成 Vox 拼贴风,同时保留真实人脸与口型(A-roll)
  2. 自媒体或品牌方想把一张产品照片做成拼贴风广告短片,产品标签像素级保真(C-roll)
  3. 知识科普号需要按 9:16 竖屏节奏、每 4–6 秒一切的高密度解说短视频
  4. 非 Atlas 用户想要手动提示词包:节拍表 + 每节拍图像提示词 + 动效提示词 + 旁白脚本,自行贴到任意生成器
  5. 历史/科技/美食等主题需要多语言旁白(xai/tts 支持 5 个多语言 + 约 66 个原生音色)
  6. 需要极端'零件飞入组装'效果或零内容过滤动画真人素材时,用本地 keyframe 引擎逐元素驱动

这个 Skill 有哪些优点和局限?

优点
  • 端到端全自动化,一条主题输入产出成品 mp4,同时保留两处人工把关(节拍表、风格)
  • 每阶段一个脚本、单份 beats. 驱动,节拍表已批准后重跑只生成新增部分(keyframes.py 跳过已有 keyframe_url 的镜头)
  • 文档极其详尽:提示词结构、14 条叙事弧线、音色名册、API/ffmpeg 踩坑清单均有参考文件
  • 媒体后端可插拔(provider.py),换后端无需改阶段脚本;作业卡住/失败自动重提交
  • 成本意识设计:关键帧阶段重摇便宜($0.08),弱图不必花钱去动画化
局限
  • 强依赖 Atlas Cloud——目前是唯一后端,无该平台 API key 则只能走手动提示词包模式
  • SKILL.md 未给出整片成本估算、也未提及任何自动化测试套件
  • 存在内容限制:Omni 与 Seedance 拒绝真人与品牌 logo,须切 Kling;A-roll 模式绝不能要求模型重绘人脸
  • 模型 ID 会漂移,需每次运行前拉取在线模型列表核实
  • 部分行为(如 seed-audio 克隆需 pinned-speaker 模板)有踩坑记录,需读 gotchas 文档才能避开

如何安装这个 Skill?

前置:任一可运行工作流的编码代理(Claude Code、Codex 等)、Atlas Cloud API key、ffmpeg + ffprobe、Python 3 + Pillow。安装方式 A:git clone https://github.com/Alisa0808/vox-director.git ~/.claude/skills/vox-director;方式 B:下载 vox-director.skill 通过 Claude 技能界面安装。然后导出密钥:export ATLASCLOUD_API_KEY="sk-..."(密钥在 atlascloud.ai/console/api-keys 获取)。非 Claude 代理读 AGENTS.md → SKILL.md。

如何使用这个 Skill?

装好后直接对编码代理说,例如:"帮我做一条 Vox 风格拼贴视频介绍墨西哥街头小吃——英文、16:9、15 秒。"代理会先给你节拍表审批(关卡 1),再跑风格比稿让你肉眼挑选(关卡 2),随后自动执行关键帧 → 动效 → 配音 → 配乐,输出 out/<项目>/final.mp4。验证成品需用 ffmpeg 抽帧为 jpg 查看——mp4 无法直接读取。

这个 Skill 与同类方案有什么区别?

README 明确将其风格与工作流对标 Vox 的解说视觉语言及 Stav Zilber / rom1trs / Higgsfield 的拼贴广告工作流——本技能即是对这类工作流的自动化复现,而非与它们竞争的替代品。来源未列出其他可对比的同类工具。

常见问题

没有 Atlas Cloud 账号能用吗?
不能全自动运行,但技能提供'手动提示词包'模式:输出节拍表、每节拍图像/动效提示词和旁白脚本,供你贴进任意生成器。
生成真人口播或品牌视频有什么限制?
Omni 和 Seedance 会拒绝真人与品牌内容,beats. 里把 video_model 设为 kwaivgi/kling-video-o3-pro/image-to-video 即可;A-roll 不能要求模型重绘或半调纹理化人脸,否则一律被拒。
画面比例和模型支持的比例不一致怎么办?
clips.py 的比例路由会选最接近的比例,但不会静默改画幅——会停下来请你确认(确认后设 aspect_approx_confirmed: true),同一次运行的所有镜头共享同一解析比例。
运行失败如何排查?
先读 references/models-and-gotchas.md,绝大多数 API 与 ffmpeg 失败已在该文档中记录;provider 层也会对卡住或失败的作业自动重新提交。

相关 Skills