开发与工程 ✓ OpenAI · 官方 text-to-speechaudio-generationopenai-audio-apivoiceoveraccessibility-readsivr-promptspython-cli

Speech 语音生成

用 OpenAI Audio API 将文本生成可复用的语音音频。

FollowSkills 评估 · FSRS-2.0
不推荐
48/ 100 五分制 2.4 / 5
信任安全17 / 25 · 3.4/5

证据显示使用本地环境变量而非要求粘贴密钥,限制为内置声音,并要求披露 AI 生成语音;但文本将用户内容发送至外部 Audio API,未说明内容保留、隐私处理或逐次确认,网络配置示例还会降低审批与沙箱防护,因此扣分。

可靠稳定7 / 20 · 1.8/5

工作流、输入长度、速率限制和缺失密钥处理较清楚,且提供 dry-run 说明;但脚本、测试和多数被引用参考文件未在证据中提供,无法复现关键路径或验证异常处理,静态上限内保守给分。

适用触发8 / 15 · 2.7/5

适用场景、单条/批量决策、输出格式和自定义声音边界较明确;但未说明不适用场景,中文发音质量未覆盖,且核心功能依赖 OpenAI 网络服务,对中国大陆网络可达性没有保障。

规范维护7 / 15 · 2.3/5

信息架构、参考映射、参数说明和示例较完整;但许可证状态未知,缺少版本、变更记录和明确维护责任,引用的 voiceover.md、sample-prompts.md 等材料未提供,故扣分。

有效结果6 / 15 · 2.0/5

目标是生成 narration、IVR、无障碍朗读等可直接使用的音频,流程也规定了输出路径和复核;但没有提交的脚本实现、真实输出或测试证据,结果质量和相对手工方案的收益仍需人工验证。

证据核验3 / 10 · 1.5/5

SKILL.md 及其参考材料提供了可审计的规则、参数和命令示例,但没有测试套件、CI 覆盖、实际运行记录或第三方 corroboration;因此只能获得有限静态可验证性。

证据充分度: 评估于 2026年7月20日 审查版本 49f948faa925
使用前请注意
  • 用户文本会发送到外部 OpenAI Audio API;使用前应确认敏感内容、数据保留和隐私要求。
  • 核心服务需要外网与 OPENAI_API_KEY,未证明中国大陆网络可达性或提供离线替代方案。
  • 提交证据未包含 CLI 脚本、测试及部分引用文件,安装后应先核验实际文件、参数和错误处理。
  • 不要默认采用降低网络审批或沙箱防护的配置。
查看完整评分方法 →

它能做什么 & 适用场景

Speech 是一个用于文本转语音和批量语音生成的 Agent Skill,适合旁白、产品演示配音、IVR 提示和无障碍朗读。它默认使用 gpt-4o-mini-tts-2025-12-15 与内置声音,并优先运行随附的 Python CLI。技能会区分单条与批量任务,收集文本、声音、表达方式、格式和约束后生成音频。实时调用需要 OPENAI_API_KEY;自定义声音不在范围内。

读取用户提供的逐字文本及语音、表达方式、格式和约束;判断任务是单条还是批量;批量任务使用 tmp/speech/ 下的临时 JSONL;通过 scripts/text_to_speech.py 和 OpenAI Python SDK 调用 Audio API;将最终文件写入 output/speech/ 或用户指定的 --out/--out-dir 路径;对重要音频检查清晰度、节奏、发音和约束遵循情况。

  1. 需要为产品演示生成一段旁白的产品团队或开发者。
  2. 需要一次生成多条电话菜单提示的 IVR 开发者。
  3. 需要为应用或文档制作无障碍朗读音频的团队。
  4. 需要批量生成多行语音提示或多个音频文件的开发者。

优缺点一览

优点
  • 支持单条和批量语音生成。
  • 提供可复现的随附 CLI,并使用 OpenAI Python SDK。
  • 覆盖旁白、产品配音、IVR 和无障碍朗读场景。
  • 包含长度、速率、格式、声音和指令方面的明确规则。
局限
  • 每次请求的输入长度不得超过 4096 个字符。
  • 速率上限为每分钟 50 次请求。
  • 实时调用依赖 OPENAI_API_KEY、Python、openai 包、网络、Shell 和文件系统。
  • 仅支持内置声音,自定义声音不在范围内。
  • 源材料未提供测试套件、平台验证结果或具体 CLI 参数文档;仓库 README 还声明该仓库已弃用。
  • 所给源材料未确认该 Skill 的具体许可证。

如何安装

在 Codex 中运行:$skill-installer speech。安装后重启 Codex 以加载该 Skill。仓库 README 未提供其他平台的安装步骤。

如何使用

向 Codex 提出明确请求,例如:"Generate a spoken clip for this product demo: Welcome to the demo." 同时提供准确文本、所需声音、表达方式、输出格式和限制条件。实时生成前,在本地设置 OPENAI_API_KEY;不要把完整密钥粘贴到聊天中。

常见问题

使用 Speech 是否需要 OpenAI API 密钥?
需要。实时 API 调用前必须在本地设置 OPENAI_API_KEY;源材料未说明具体费用。
没有设置 OPENAI_API_KEY 会怎样?
无法进行实时 API 调用。用户应在 OpenAI 平台创建密钥并设置环境变量,而不是在聊天中粘贴完整密钥。
它能生成自定义声音吗?
不能。该 Skill 规定仅使用内置声音,自定义声音不在范围内。
批量任务如何处理?
多个提示或多个输出会被视为批量任务,使用临时 JSONL 文件一次运行 CLI,完成后删除该临时文件。

同仓库的其他 Skills

均来自 openai/skills

效率与协作 ✓ OpenAI · 官方

目标定义助手

把模糊意图转化为可验证、可量化且范围明确的工作目标。

开发与工程 ✓ OpenAI · 官方

Codex CLI 构建器

把 API、脚本或现有工具变成可复用的命令行接口。

设计与前端 ✓ OpenAI · 官方

Codex 图像生成与编辑

为项目生成和编辑可直接使用的栅格图像资产。

开发与工程 ✓ OpenAI · 官方

OpenAI 开发文档助手

为 OpenAI 产品、API 与 Codex 提供基于官方资料的当前指导。

开发与工程 ✓ OpenAI · 官方

Skill Creator 技能创建指南

指导你设计、编写、验证和迭代可复用的 Codex 技能。

开发与工程 ✓ OpenAI · 官方

ASP.NET Core 开发指南

帮助构建、审查和升级 ASP.NET Core 应用。

开发与工程 ✓ OpenAI · 官方

ChatGPT Apps 构建助手

帮助开发者按文档构建带 MCP 服务端和组件界面的 ChatGPT 应用。

设计与前端 ✓ OpenAI · 官方

Figma 代码组件连接器

将 Figma 组件映射到代码实现,保持设计与代码关联。

设计与前端 ✓ OpenAI · 官方

Figma 新建文件助手

在 Figma 草稿中快速创建空白设计或 FigJam 文件。

设计与前端 ✓ OpenAI · 官方

Figma 设计实现助手

将 Figma 设计转化为可集成、可验证的高保真前端代码。

开发与工程 ✓ OpenAI · 官方

Playwright 浏览器自动化技能

通过终端驱动真实浏览器,完成网页操作、提取与界面调试。

自动化与运维 ✓ OpenAI · 官方

安全最佳实践审查

为 Python、JavaScript/TypeScript 和 Go 项目提供安全编码审查与改进建议。

设计与前端 ✓ OpenAI · 官方

Hatch Pet 动画宠物工坊

把角色或品牌视觉转成可验证、可打包的 Codex 动画宠物。

效率与协作 ✓ OpenAI · 官方

Linear 项目协作助手

在 Codex 中统一管理 Linear 工单、项目与团队协作流程。

自动化与运维 ✓ OpenAI · 官方

代码库威胁建模

基于代码库证据生成可执行的应用安全威胁模型。

自动化与运维 ✓ OpenAI · 官方

Sentry 生产错误观察助手

通过 Sentry CLI 检查问题、事件和生产环境健康数据。

设计与前端 ✓ OpenAI · 官方

Figma 设计系统规则生成器

为 Figma-to-code 项目生成符合代码库约定的设计系统规则。

写作与内容 ✓ OpenAI · 官方

音频转写助手

将音频或视频中的语音转成文本,并可标注说话人。

设计与前端 ✓ OpenAI · 官方

Figma 设计系统构建器

从代码库构建并校验专业级 Figma 设计系统。

设计与前端 ✓ OpenAI · 官方

Figma 设计转代码助手

从 Figma 获取设计上下文并将节点实现为生产代码。

相关 Skills