开发与工程 ✓ OpenAI · 官方 text-to-speechaudio-generationopenai-audio-apivoiceoveraccessibility-readsivr-promptspython-cli

Speech 语音生成

用 OpenAI Audio API 将文本生成可复用的语音音频。

FollowSkills 评估 · FSRS-2.0
谨慎使用
48/ 100 五分制 2.4 / 5
1 2 3 4 5 6
1信任安全17 / 25 · 3.4/5

证据显示使用本地环境变量而非要求粘贴密钥,限制为内置声音,并要求披露 AI 生成语音;但文本将用户内容发送至外部 Audio API,未说明内容保留、隐私处理或逐次确认,网络配置示例还会降低审批与沙箱防护,因此扣分。

2可靠稳定7 / 20 · 1.8/5

工作流、输入长度、速率限制和缺失密钥处理较清楚,且提供 dry-run 说明;但脚本、测试和多数被引用参考文件未在证据中提供,无法复现关键路径或验证异常处理,静态上限内保守给分。

3适用触发8 / 15 · 2.7/5

适用场景、单条/批量决策、输出格式和自定义声音边界较明确;但未说明不适用场景,中文发音质量未覆盖,且核心功能依赖 OpenAI 网络服务,对中国大陆网络可达性没有保障。

4规范维护7 / 15 · 2.3/5

信息架构、参考映射、参数说明和示例较完整;但许可证状态未知,缺少版本、变更记录和明确维护责任,引用的 voiceover.md、sample-prompts.md 等材料未提供,故扣分。

5有效结果6 / 15 · 2.0/5

目标是生成 narration、IVR、无障碍朗读等可直接使用的音频,流程也规定了输出路径和复核;但没有提交的脚本实现、真实输出或测试证据,结果质量和相对手工方案的收益仍需人工验证。

6证据核验3 / 10 · 1.5/5

SKILL.md 及其参考材料提供了可审计的规则、参数和命令示例,但没有测试套件、CI 覆盖、实际运行记录或第三方 corroboration;因此只能获得有限静态可验证性。

证据充分度: 评估于 2026年7月20日 审查版本 49f948faa925
使用前请注意
  • 用户文本会发送到外部 OpenAI Audio API;使用前应确认敏感内容、数据保留和隐私要求。
  • 核心服务需要外网与 OPENAI_API_KEY,未证明中国大陆网络可达性或提供离线替代方案。
  • 提交证据未包含 CLI 脚本、测试及部分引用文件,安装后应先核验实际文件、参数和错误处理。
  • 不要默认采用降低网络审批或沙箱防护的配置。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

Speech 是一个用于文本转语音和批量语音生成的 Agent Skill,适合旁白、产品演示配音、IVR 提示和无障碍朗读。它默认使用 gpt-4o-mini-tts-2025-12-15 与内置声音,并优先运行随附的 Python CLI。技能会区分单条与批量任务,收集文本、声音、表达方式、格式和约束后生成音频。实时调用需要 OPENAI_API_KEY;自定义声音不在范围内。

读取用户提供的逐字文本及语音、表达方式、格式和约束;判断任务是单条还是批量;批量任务使用 tmp/speech/ 下的临时 JSONL;通过 scripts/text_to_speech.py 和 OpenAI Python SDK 调用 Audio API;将最终文件写入 output/speech/ 或用户指定的 --out/--out-dir 路径;对重要音频检查清晰度、节奏、发音和约束遵循情况。

  1. 需要为产品演示生成一段旁白的产品团队或开发者。
  2. 需要一次生成多条电话菜单提示的 IVR 开发者。
  3. 需要为应用或文档制作无障碍朗读音频的团队。
  4. 需要批量生成多行语音提示或多个音频文件的开发者。

这个 Skill 有哪些优点和局限?

优点
  • 支持单条和批量语音生成。
  • 提供可复现的随附 CLI,并使用 OpenAI Python SDK。
  • 覆盖旁白、产品配音、IVR 和无障碍朗读场景。
  • 包含长度、速率、格式、声音和指令方面的明确规则。
局限
  • 每次请求的输入长度不得超过 4096 个字符。
  • 速率上限为每分钟 50 次请求。
  • 实时调用依赖 OPENAI_API_KEY、Python、openai 包、网络、Shell 和文件系统。
  • 仅支持内置声音,自定义声音不在范围内。
  • 源材料未提供测试套件、平台验证结果或具体 CLI 参数文档;仓库 README 还声明该仓库已弃用。
  • 所给源材料未确认该 Skill 的具体许可证。

如何安装这个 Skill?

在 Codex 中运行:$skill-installer speech。安装后重启 Codex 以加载该 Skill。仓库 README 未提供其他平台的安装步骤。

如何使用这个 Skill?

向 Codex 提出明确请求,例如:"Generate a spoken clip for this product demo: Welcome to the demo." 同时提供准确文本、所需声音、表达方式、输出格式和限制条件。实时生成前,在本地设置 OPENAI_API_KEY;不要把完整密钥粘贴到聊天中。

常见问题

使用 Speech 是否需要 OpenAI API 密钥?
需要。实时 API 调用前必须在本地设置 OPENAI_API_KEY;源材料未说明具体费用。
没有设置 OPENAI_API_KEY 会怎样?
无法进行实时 API 调用。用户应在 OpenAI 平台创建密钥并设置环境变量,而不是在聊天中粘贴完整密钥。
它能生成自定义声音吗?
不能。该 Skill 规定仅使用内置声音,自定义声音不在范围内。
批量任务如何处理?
多个提示或多个输出会被视为批量任务,使用临时 JSONL 文件一次运行 CLI,完成后删除该临时文件。

同仓库的其他 Skills

均来自 openai/skills

写作与内容 ✓ OpenAI · 官方

音频转写助手

将音频或视频中的语音转成文本,并可标注说话人。

开发与工程 ✓ OpenAI · 官方

Codex 插件创建器

为 Codex 快速生成规范的插件目录、清单与 marketplace 配置。

开发与工程 ✓ OpenAI · 官方

Codex CLI 构建器

把 API、脚本或现有工具变成可复用的命令行接口。

开发与工程 ✓ OpenAI · 官方

OpenAI 开发文档助手

为 OpenAI 产品、API 与 Codex 提供基于官方资料的当前指导。

设计与前端 ✓ OpenAI · 官方

Codex 图像生成与编辑

为项目生成和编辑可直接使用的栅格图像资产。

开发与工程 ✓ OpenAI · 官方

ASP.NET Core 开发指南

帮助构建、审查和升级 ASP.NET Core 应用。

设计与前端 ✓ OpenAI · 官方

Figma 设计实现助手

将 Figma 设计转化为可集成、可验证的高保真前端代码。

自动化与运维 ✓ OpenAI · 官方

安全最佳实践审查

为 Python、JavaScript/TypeScript 和 Go 项目提供安全编码审查与改进建议。

设计与前端 ✓ OpenAI · 官方

Hatch Pet 动画宠物工坊

把角色或品牌视觉转成可验证、可打包的 Codex 动画宠物。

自动化与运维 ✓ OpenAI · 官方

Sentry 生产错误观察助手

通过 Sentry CLI 检查问题、事件和生产环境健康数据。

设计与前端 ✓ OpenAI · 官方

Figma 设计转代码助手

从 Figma 获取设计上下文并将节点实现为生产代码。

数据与分析 ✓ OpenAI · 官方

Jupyter 笔记本工作流助手

用模板和脚本创建、重构并验证可复现的 Jupyter 笔记本。

开发与工程 ✓ OpenAI · 官方

OpenAI Skills 安装器

从精选目录或 GitHub 仓库安装 Codex 技能。

自动化与运维 ✓ OpenAI · 官方

Netlify 部署助手

通过 Netlify CLI 将网站项目连接、预览或发布到 Netlify。

设计与前端 ✓ OpenAI · 官方

Figma 插件 API 操作助手

让智能代理按规则安全地读写 Figma 文件。

自动化与运维 ✓ OpenAI · 官方

GitHub PR 检查修复助手

定位 GitHub Actions PR 检查失败并制定获批后修复方案。

开发与工程 ✓ OpenAI · 官方

GitHub PR 评论处理器

用 GitHub CLI 梳理并处理当前分支的 PR 评论。

开发与工程 ✓ OpenAI · 官方

Yeet 一键 GitHub PR 流程

将分支、提交、推送和 GitHub 拉取请求创建整合为一次受控流程。

自动化与运维 ✓ OpenAI · 官方

Vercel 预览部署助手

将应用或网站部署到 Vercel 并返回预览链接。

效率与协作 ✓ OpenAI · 官方

目标定义助手

把模糊意图转化为可验证、可量化且范围明确的工作目标。

相关 Skills