Speech 语音生成
用 OpenAI Audio API 将文本生成可复用的语音音频。
证据显示使用本地环境变量而非要求粘贴密钥,限制为内置声音,并要求披露 AI 生成语音;但文本将用户内容发送至外部 Audio API,未说明内容保留、隐私处理或逐次确认,网络配置示例还会降低审批与沙箱防护,因此扣分。
工作流、输入长度、速率限制和缺失密钥处理较清楚,且提供 dry-run 说明;但脚本、测试和多数被引用参考文件未在证据中提供,无法复现关键路径或验证异常处理,静态上限内保守给分。
适用场景、单条/批量决策、输出格式和自定义声音边界较明确;但未说明不适用场景,中文发音质量未覆盖,且核心功能依赖 OpenAI 网络服务,对中国大陆网络可达性没有保障。
信息架构、参考映射、参数说明和示例较完整;但许可证状态未知,缺少版本、变更记录和明确维护责任,引用的 voiceover.md、sample-prompts.md 等材料未提供,故扣分。
目标是生成 narration、IVR、无障碍朗读等可直接使用的音频,流程也规定了输出路径和复核;但没有提交的脚本实现、真实输出或测试证据,结果质量和相对手工方案的收益仍需人工验证。
SKILL.md 及其参考材料提供了可审计的规则、参数和命令示例,但没有测试套件、CI 覆盖、实际运行记录或第三方 corroboration;因此只能获得有限静态可验证性。
- 用户文本会发送到外部 OpenAI Audio API;使用前应确认敏感内容、数据保留和隐私要求。
- 核心服务需要外网与 OPENAI_API_KEY,未证明中国大陆网络可达性或提供离线替代方案。
- 提交证据未包含 CLI 脚本、测试及部分引用文件,安装后应先核验实际文件、参数和错误处理。
- 不要默认采用降低网络审批或沙箱防护的配置。
它能做什么 & 适用场景
Speech 是一个用于文本转语音和批量语音生成的 Agent Skill,适合旁白、产品演示配音、IVR 提示和无障碍朗读。它默认使用 gpt-4o-mini-tts-2025-12-15 与内置声音,并优先运行随附的 Python CLI。技能会区分单条与批量任务,收集文本、声音、表达方式、格式和约束后生成音频。实时调用需要 OPENAI_API_KEY;自定义声音不在范围内。
读取用户提供的逐字文本及语音、表达方式、格式和约束;判断任务是单条还是批量;批量任务使用 tmp/speech/ 下的临时 JSONL;通过 scripts/text_to_speech.py 和 OpenAI Python SDK 调用 Audio API;将最终文件写入 output/speech/ 或用户指定的 --out/--out-dir 路径;对重要音频检查清晰度、节奏、发音和约束遵循情况。
- 需要为产品演示生成一段旁白的产品团队或开发者。
- 需要一次生成多条电话菜单提示的 IVR 开发者。
- 需要为应用或文档制作无障碍朗读音频的团队。
- 需要批量生成多行语音提示或多个音频文件的开发者。
优缺点一览
- 支持单条和批量语音生成。
- 提供可复现的随附 CLI,并使用 OpenAI Python SDK。
- 覆盖旁白、产品配音、IVR 和无障碍朗读场景。
- 包含长度、速率、格式、声音和指令方面的明确规则。
- 每次请求的输入长度不得超过 4096 个字符。
- 速率上限为每分钟 50 次请求。
- 实时调用依赖 OPENAI_API_KEY、Python、openai 包、网络、Shell 和文件系统。
- 仅支持内置声音,自定义声音不在范围内。
- 源材料未提供测试套件、平台验证结果或具体 CLI 参数文档;仓库 README 还声明该仓库已弃用。
- 所给源材料未确认该 Skill 的具体许可证。
如何安装
在 Codex 中运行:$skill-installer speech。安装后重启 Codex 以加载该 Skill。仓库 README 未提供其他平台的安装步骤。
如何使用
向 Codex 提出明确请求,例如:"Generate a spoken clip for this product demo: Welcome to the demo." 同时提供准确文本、所需声音、表达方式、输出格式和限制条件。实时生成前,在本地设置 OPENAI_API_KEY;不要把完整密钥粘贴到聊天中。