Video Processor 视频处理技能
一条命令完成视频转格式、提取音轨和 Whisper 语音转写,省去手工拼 ffmpeg 命令的麻烦。
用 FFmpeg + Whisper 做本地音视频处理/转录,依赖需自行安装,本地文件操作。
这个 Skill 能做什么,适合哪些场景?
Video Processor 是 disler/claude-code-hooks-multi-agent-observability 仓库 .claude/skills/ 目录下的一个 Agent Skill,以单个 Python 脚本(video_processor.py)为核心,封装了 FFmpeg 与 OpenAI Whisper 的常用操作。它提供四个子命令:提取音轨、转 MP4、转 WebM、以及调用 Whisper 做语音转写(支持 txt/srt/vtt/ 输出和语言指定)。脚本通过 PEP 723 声明依赖,用 uv run 运行,并带有输入校验、依赖检查和临时文件清理。注意:该仓库本身是一个多智能体可观测性系统,此技能只是随仓库一起打包的独立工具之一。
读取用户指定的视频或音频文件,通过 FFmpeg 执行三类操作:(1) extract-audio:提取音轨为 wav/mp3/aac/flac;(2) to-mp4 / to-webm:用可选编码器(libx264/libx265、libvpx-vp9)和预设做格式转换;(3) transcribe:视频输入会先自动抽出临时 WAV(按 Whisper 优化的 16kHz 采样率),再调用 OpenAI Whisper 生成文本,输出 txt、srt(带时间戳字幕)、vtt 或含词级时间戳的 ,最后自动清理临时文件。所有操作通过 CLI 参数控制模型规模(tiny~large)、语言代码和输出格式。
- 内容创作者把旧相机导出的 AVI 文件批量转成通用 MP4,无需记住 ffmpeg 编码参数
- 讲师或学生录制了课程视频,需要生成讲稿或 SRT 字幕供发布和复习
- 把演示视频转成 WebM 并生成 WebVTT/SRT 字幕,直接嵌入网站播放
- 处理多语种素材(如西班牙语采访),指定语言并用 medium 模型获得更准确的发布级转写
- 批量处理训练视频文件夹:逐个转 WebM 并转写为文本档案
这个 Skill 有哪些优点和局限?
- 单个文档完善的脚本覆盖转格式、提音轨、转写三类高频任务,默认值合理
- 转写输出格式齐全:txt、带时间戳的 srt/vtt,以及含词级时间戳的
- PEP 723 + uv 运行方式免去手工装 Python 依赖;有输入校验、依赖检查和临时文件自动清理
- 模型规模与语言可选,官方给出各档内存占用和速度/精度权衡建议
- 强依赖本机已安装 FFmpeg 和 Whisper,脚本只做检查不代装,缺依赖时直接报错
- 大模型转写消耗显著内存(medium 约 5GB,large 约 10GB),长视频转写慢;WebM/VP9 编码也偏慢
- 仓库未标注许可证(README 未声明),商用前需自行确认授权
- 批量处理、进度显示、按段时间分段转写只是文字建议,脚本本身不提供这些功能;也没有附带的测试套件
- 转写质量依赖 OpenAI Whisper 本地模型,源文档未说明任何云端 API 或费用选项
如何安装这个 Skill?
技能位于仓库的 .claude/skills/video-processor/ 目录;按照该仓库 README 的做法,把整个 .claude 目录复制到你的项目根目录:cp -R .claude /path/to/your/project/。运行前需在本机安装两个外部工具:FFmpeg(macOS: brew install ffmpeg;Ubuntu: apt-get install ffmpeg)和 OpenAI Whisper(pip install -U openai-whisper)。click 和 ffmpeg-python 两个 Python 包由脚本内的 PEP 723 元数据声明,通过 uv 自动处理。注意:仓库整体安装(Bun 服务器、Vue 客户端、hook 配置)是为可观测性系统准备的,与使用本技能无关。
如何使用这个 Skill?
对支持 Agent Skills 的客户端,当用户提到视频转换、音频提取、转写、mp4、webm、ffmpeg 或 whisper 时会触发该技能。实际操作都通过脚本命令完成,例如:uv run .claude/skills/video-processor/scripts/video_processor.py to-mp4 old_video.avi output.mp4;提取音频:... extract-audio lecture.mp4 lecture.wav --format wav;转写并生成字幕:... transcribe lecture.mp4 lecture.srt --format srt --model small --language es。SKILL.md 未说明自动触发之外的任何交互界面;批量处理需自行循环调用命令。
这个 Skill 与同类方案有什么区别?
技能文档把 FFmpeg 和 Whisper 定位为分工互补的两个底层工具:FFmpeg 只负责准备音频不做转写,Whisper 只做语音转文字,本技能把它们串成一条流水线。源材料未提及其他同类封装产品,故不另作对比。