Nemotron Speech 语音 NIM 技能
指导部署和运行 NVIDIA Riva 的语音识别、语音合成与翻译 NIM。
技能明确要求不暴露 NVIDIA_API_KEY 和 NGC_API_KEY,提示使用最小化密钥检查,并披露 Docker 环境变量可在 inspect 或进程列表中可见;同时提供官方文档路由和部分权限风险说明。扣分原因是流程仍广泛依赖 sudo、Docker、外部网络和远程 API,缺少统一的用户确认、回滚方案、网络数据流边界和完整依赖安全说明;仓库许可证元数据为 NOASSERTION,与文件内 Apache-2.0 声明存在治理不确定性。
文档具有清晰的路由、部署阶段、健康检查、音频格式校验和多种失败提示,并明确要求对易变参数查阅当前 NVIDIA 文档。扣分原因是本次仅静态阅读,未能复现关键路径;云端函数、容器标签、客户端脚本和参考文件的可用性依赖外部状态,且部分命令、版本兼容性和跨参考文件假设未通过执行验证。因此不超过静态上限 10 分。
目标用户、ASR/TTS/NMT 场景、云端与自托管路径、触发词、非适用范围和 x86_64/WSL2 限制均有说明,评测文件也明确了若干负面触发案例。扣分原因是触发词包含通用的 Whisper 等术语,仍可能误触发;中文用户支持和中国大陆网络可达性未被实质验证,云端核心路径依赖 build.nvidia.com、NVCF 和 GitHub 等境外服务。
技能采用顶层路由加 references 渐进披露,包含版本号、作者团队、标签、示例、故障排查、限制和更新时查阅官方文档的路径。扣分原因是缺少明确的维护责任人、变更日志、稳定的依赖版本和完整安装说明;评测报告指出脚本表格、run_script 说明和参考文件组织存在质量问题,且仓库许可证元数据不明确。
文档覆盖从模型选择、环境检查、部署、健康验证到推理和自定义模型转换的完整任务链,示例命令通常可直接改写使用,并能降低手工查找成本。扣分原因是具体模型、函数 ID、容器标签、VRAM 和功能支持都被要求重新查询,且本次没有执行或独立验证代表性输出;用户仍需处理外部服务、凭据、GPU 和版本差异,故仅给予接近静态上限的分数。
技能列出了大量官方 NVIDIA 文档、API、NGC 和 GitHub 参考入口,并附有评测数据、测试任务和预期行为,具备一定审计线索。扣分原因是评测报告和百分比属于文件内声明,未提供本次可独立复核的 CI、提交测试结果或第三方证据;本次未执行任何命令,也未进行跨来源事实核验。因此不超过静态上限 5 分。
- 云端推理依赖 NVIDIA NVCF/build.nvidia.com、外部网络和有效密钥;中国大陆网络可达性与延迟未验证。
- 不要把文档中的模型名、函数 ID、容器标签、VRAM 或功能支持视为当前事实,必须按发布版本重新核对。
- Docker 通过环境变量传递密钥可能泄露到 inspect 或进程信息;应改用 Docker secrets 或专用密钥管理器。
- 本次没有执行命令或验证输出,评测报告中的 PASS 和百分比不能替代独立复现。
这个 Skill 能做什么,适合哪些场景?
该技能是 NVIDIA Nemotron Speech(即 Riva / Riva NIM)任务的统一入口,覆盖 ASR、TTS 和 NMT。它支持通过 build.nvidia.com 云端推理,也支持在自有 GPU 上使用 Docker 自托管。技能会按任务加载对应参考文件,涵盖环境准备、模型选择、部署、测试、协议选择和 ASR 管线调优。自托管需要 NVIDIA AI Enterprise;云端需要 NVIDIA_API_KEY 和互联网连接。
根据用户任务路由到 setup、部署就绪检查、模型选择、ASR、定制 ASR、管线、TTS 或 NMT 参考文件;指导安装 NVIDIA 驱动、Docker、Container Toolkit 和 Riva Python 客户端;指导在 build.nvidia.com 或自托管 Docker 环境中部署和调用 NIM;覆盖 ASR 的 gRPC、HTTP、WebSocket 协议,以及 VAD、说话人分离、语言模型和 chunk size 配置;指导将 NeMo .nemo 模型转换为 RMIR 并通过 riva-build 部署;提醒保护 API 密钥并处理缓存目录权限。
- 需要在 NVIDIA GPU 上部署 Parakeet、Canary、Whisper 或 Nemotron ASR Streaming 的工程师。
- 需要通过 build.nvidia.com 调用 Magpie TTS 的开发者。
- 需要部署 Riva Translate 并处理语言对或 DNT 标签的团队。
- 需要将微调后的 NeMo `.nemo` ASR 模型转换为 RMIR 和 NIM 的开发者。
- 需要检查 GPU、容器健康状态和部署条件的运维人员。
这个 Skill 有哪些优点和局限?
- 覆盖 ASR、TTS、NMT 以及定制 ASR 部署。
- 同时支持 build.nvidia.com 云端推理和 GPU 自托管 Docker 部署。
- 涵盖 gRPC、HTTP、WebSocket 等 ASR 客户端协议。
- 提供 GPU 兼容性、容器健康检查和缓存权限方面的操作指导。
- 自托管需要 NVIDIA AI Enterprise 授权。
- 云端推理需要有效的 NVIDIA_API_KEY 和互联网连接。
- 仅支持 x86_64;Windows WSL2 需要 Podman,且只支持部分 NIM。
- SKILL.md 是路由层,具体模型目录、容器 ID、显存要求和功能支持必须查阅 NVIDIA 当前文档;提示中的参考文件正文未提供。
如何安装这个 Skill?
使用 NVIDIA 技能 CLI 安装指定技能:npx skills add nvidia/skills --skill nemotron-speech --yes。README 说明该 CLI 会将技能安装到所选的代理目标;也可使用 --agent codex、--agent claude-code 等参数指定代理。
如何使用这个 Skill?
安装后,用自然语言提出相关任务,例如“Deploy a Parakeet ASR NIM”或“Synthesize speech with Magpie”。技能会识别任务类型并加载一个对应参考文件。云端推理需要安装 nvidia-riva-client 并设置有效的 NVIDIA_API_KEY;自托管流程需要先完成驱动、Docker、Container Toolkit、NGC API key 和 Riva 客户端配置。
这个 Skill 与同类方案有什么区别?
云端模式适合通过 build.nvidia.com 快速调用并避免本地部署;自托管模式适合在自有 NVIDIA GPU 上运行,但需要 NVIDIA AI Enterprise、驱动、Docker、Container Toolkit 和 NGC 配置。