开发与工程 ffmpegwhisper-transcriptionaudio-extractionvideo-conversionmp4webmsubtitle-generationcli

Video Processor 视频处理技能

一条命令完成视频转格式、提取音轨和 Whisper 语音转写,省去手工拼 ffmpeg 命令的麻烦。

FollowSkills 评估 · FSRS-1.0
推荐
63/ 100 五分制 3.2 / 5
本条评估按 FSRS 1.0 标准完成,维度分不做换算,已进入按 FSRS 2.0 重新评估的复核队列。
1 2 3 4 5 6
1价值适配13 / 20 · 3.3/5

用 FFmpeg + Whisper 做本地音视频处理/转录,依赖需自行安装,本地文件操作。

2可靠性12 / 20 · 3.0/5
3安全性21 / 25 · 4.2/5
4证据5 / 15 · 1.7/5
5易用性7 / 10 · 3.5/5
6维护性5 / 10 · 2.5/5
证据充分度: 评估于 2026年7月17日
评估证据 [1]
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

Video Processor 是 disler/claude-code-hooks-multi-agent-observability 仓库 .claude/skills/ 目录下的一个 Agent Skill,以单个 Python 脚本(video_processor.py)为核心,封装了 FFmpeg 与 OpenAI Whisper 的常用操作。它提供四个子命令:提取音轨、转 MP4、转 WebM、以及调用 Whisper 做语音转写(支持 txt/srt/vtt/ 输出和语言指定)。脚本通过 PEP 723 声明依赖,用 uv run 运行,并带有输入校验、依赖检查和临时文件清理。注意:该仓库本身是一个多智能体可观测性系统,此技能只是随仓库一起打包的独立工具之一。

读取用户指定的视频或音频文件,通过 FFmpeg 执行三类操作:(1) extract-audio:提取音轨为 wav/mp3/aac/flac;(2) to-mp4 / to-webm:用可选编码器(libx264/libx265、libvpx-vp9)和预设做格式转换;(3) transcribe:视频输入会先自动抽出临时 WAV(按 Whisper 优化的 16kHz 采样率),再调用 OpenAI Whisper 生成文本,输出 txt、srt(带时间戳字幕)、vtt 或含词级时间戳的 ,最后自动清理临时文件。所有操作通过 CLI 参数控制模型规模(tiny~large)、语言代码和输出格式。

  1. 内容创作者把旧相机导出的 AVI 文件批量转成通用 MP4,无需记住 ffmpeg 编码参数
  2. 讲师或学生录制了课程视频,需要生成讲稿或 SRT 字幕供发布和复习
  3. 把演示视频转成 WebM 并生成 WebVTT/SRT 字幕,直接嵌入网站播放
  4. 处理多语种素材(如西班牙语采访),指定语言并用 medium 模型获得更准确的发布级转写
  5. 批量处理训练视频文件夹:逐个转 WebM 并转写为文本档案

这个 Skill 有哪些优点和局限?

优点
  • 单个文档完善的脚本覆盖转格式、提音轨、转写三类高频任务,默认值合理
  • 转写输出格式齐全:txt、带时间戳的 srt/vtt,以及含词级时间戳的
  • PEP 723 + uv 运行方式免去手工装 Python 依赖;有输入校验、依赖检查和临时文件自动清理
  • 模型规模与语言可选,官方给出各档内存占用和速度/精度权衡建议
局限
  • 强依赖本机已安装 FFmpeg 和 Whisper,脚本只做检查不代装,缺依赖时直接报错
  • 大模型转写消耗显著内存(medium 约 5GB,large 约 10GB),长视频转写慢;WebM/VP9 编码也偏慢
  • 仓库未标注许可证(README 未声明),商用前需自行确认授权
  • 批量处理、进度显示、按段时间分段转写只是文字建议,脚本本身不提供这些功能;也没有附带的测试套件
  • 转写质量依赖 OpenAI Whisper 本地模型,源文档未说明任何云端 API 或费用选项

如何安装这个 Skill?

技能位于仓库的 .claude/skills/video-processor/ 目录;按照该仓库 README 的做法,把整个 .claude 目录复制到你的项目根目录:cp -R .claude /path/to/your/project/。运行前需在本机安装两个外部工具:FFmpeg(macOS: brew install ffmpeg;Ubuntu: apt-get install ffmpeg)和 OpenAI Whisper(pip install -U openai-whisper)。click 和 ffmpeg-python 两个 Python 包由脚本内的 PEP 723 元数据声明,通过 uv 自动处理。注意:仓库整体安装(Bun 服务器、Vue 客户端、hook 配置)是为可观测性系统准备的,与使用本技能无关。

如何使用这个 Skill?

对支持 Agent Skills 的客户端,当用户提到视频转换、音频提取、转写、mp4、webm、ffmpeg 或 whisper 时会触发该技能。实际操作都通过脚本命令完成,例如:uv run .claude/skills/video-processor/scripts/video_processor.py to-mp4 old_video.avi output.mp4;提取音频:... extract-audio lecture.mp4 lecture.wav --format wav;转写并生成字幕:... transcribe lecture.mp4 lecture.srt --format srt --model small --language es。SKILL.md 未说明自动触发之外的任何交互界面;批量处理需自行循环调用命令。

这个 Skill 与同类方案有什么区别?

技能文档把 FFmpeg 和 Whisper 定位为分工互补的两个底层工具:FFmpeg 只负责准备音频不做转写,Whisper 只做语音转文字,本技能把它们串成一条流水线。源材料未提及其他同类封装产品,故不另作对比。

常见问题

需要付费吗?
技能本身免费且调用的是本地 Whisper 模型和本机 FFmpeg,不产生 API 费用;但大模型(medium/large)需要 5–10GB 内存和更长的处理时间。注意源文档未说明仓库许可证,商用需自行确认。
视频直接转写和先提音频再转写有什么区别?
结果相同:transcribe 命令遇到视频输入时会自动抽取 16kHz 的临时 WAV 再交给 Whisper,之后清理临时文件。对很长的视频,文档建议手动先提音轨、分段转写以提速。
依赖缺失会怎样?
脚本会校验输入文件是否存在、FFmpeg 和 Whisper 是否已安装,并给出清晰的缺失依赖错误提示;FFmpeg 用 ffmpeg -version、Whisper 用 whisper --help 可自行验证安装。
这个技能和该仓库的可观测性系统是什么关系?
仓库主体是 Claude Code 多智能体可观测性平台(Bun 服务器 + Vue 客户端 + 12 类 hook),video-processor 只是随 .claude 目录打包的独立技能之一。使用本技能不需要部署那个服务器,也不应把仓库整体的监控能力归到本技能头上。

同仓库的其他 Skills

均来自 disler/claude-code-hooks-multi-agent-observability

相关 Skills