自动化与运维 ✓ NVIDIA · 官方 nvidia-rivanemotron-speechasrttsnmtdockergrpcspeech-to-text

Nemotron Speech 语音 NIM 技能

指导部署和运行 NVIDIA Riva 的语音识别、语音合成与翻译 NIM。

FollowSkills 评估 · FSRS-2.0
不推荐
54/ 100 五分制 2.7 / 5
信任安全17 / 25 · 3.4/5

技能明确要求不暴露 NVIDIA_API_KEY 和 NGC_API_KEY,提示使用最小化密钥检查,并披露 Docker 环境变量可在 inspect 或进程列表中可见;同时提供官方文档路由和部分权限风险说明。扣分原因是流程仍广泛依赖 sudo、Docker、外部网络和远程 API,缺少统一的用户确认、回滚方案、网络数据流边界和完整依赖安全说明;仓库许可证元数据为 NOASSERTION,与文件内 Apache-2.0 声明存在治理不确定性。

可靠稳定8 / 20 · 2.0/5

文档具有清晰的路由、部署阶段、健康检查、音频格式校验和多种失败提示,并明确要求对易变参数查阅当前 NVIDIA 文档。扣分原因是本次仅静态阅读,未能复现关键路径;云端函数、容器标签、客户端脚本和参考文件的可用性依赖外部状态,且部分命令、版本兼容性和跨参考文件假设未通过执行验证。因此不超过静态上限 10 分。

适用触发10 / 15 · 3.3/5

目标用户、ASR/TTS/NMT 场景、云端与自托管路径、触发词、非适用范围和 x86_64/WSL2 限制均有说明,评测文件也明确了若干负面触发案例。扣分原因是触发词包含通用的 Whisper 等术语,仍可能误触发;中文用户支持和中国大陆网络可达性未被实质验证,云端核心路径依赖 build.nvidia.com、NVCF 和 GitHub 等境外服务。

规范维护9 / 15 · 3.0/5

技能采用顶层路由加 references 渐进披露,包含版本号、作者团队、标签、示例、故障排查、限制和更新时查阅官方文档的路径。扣分原因是缺少明确的维护责任人、变更日志、稳定的依赖版本和完整安装说明;评测报告指出脚本表格、run_script 说明和参考文件组织存在质量问题,且仓库许可证元数据不明确。

有效结果6 / 15 · 2.0/5

文档覆盖从模型选择、环境检查、部署、健康验证到推理和自定义模型转换的完整任务链,示例命令通常可直接改写使用,并能降低手工查找成本。扣分原因是具体模型、函数 ID、容器标签、VRAM 和功能支持都被要求重新查询,且本次没有执行或独立验证代表性输出;用户仍需处理外部服务、凭据、GPU 和版本差异,故仅给予接近静态上限的分数。

证据核验4 / 10 · 2.0/5

技能列出了大量官方 NVIDIA 文档、API、NGC 和 GitHub 参考入口,并附有评测数据、测试任务和预期行为,具备一定审计线索。扣分原因是评测报告和百分比属于文件内声明,未提供本次可独立复核的 CI、提交测试结果或第三方证据;本次未执行任何命令,也未进行跨来源事实核验。因此不超过静态上限 5 分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 云端推理依赖 NVIDIA NVCF/build.nvidia.com、外部网络和有效密钥;中国大陆网络可达性与延迟未验证。
  • 不要把文档中的模型名、函数 ID、容器标签、VRAM 或功能支持视为当前事实,必须按发布版本重新核对。
  • Docker 通过环境变量传递密钥可能泄露到 inspect 或进程信息;应改用 Docker secrets 或专用密钥管理器。
  • 本次没有执行命令或验证输出,评测报告中的 PASS 和百分比不能替代独立复现。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能是 NVIDIA Nemotron Speech(即 Riva / Riva NIM)任务的统一入口,覆盖 ASR、TTS 和 NMT。它支持通过 build.nvidia.com 云端推理,也支持在自有 GPU 上使用 Docker 自托管。技能会按任务加载对应参考文件,涵盖环境准备、模型选择、部署、测试、协议选择和 ASR 管线调优。自托管需要 NVIDIA AI Enterprise;云端需要 NVIDIA_API_KEY 和互联网连接。

根据用户任务路由到 setup、部署就绪检查、模型选择、ASR、定制 ASR、管线、TTS 或 NMT 参考文件;指导安装 NVIDIA 驱动、Docker、Container Toolkit 和 Riva Python 客户端;指导在 build.nvidia.com 或自托管 Docker 环境中部署和调用 NIM;覆盖 ASR 的 gRPC、HTTP、WebSocket 协议,以及 VAD、说话人分离、语言模型和 chunk size 配置;指导将 NeMo .nemo 模型转换为 RMIR 并通过 riva-build 部署;提醒保护 API 密钥并处理缓存目录权限。

  1. 需要在 NVIDIA GPU 上部署 Parakeet、Canary、Whisper 或 Nemotron ASR Streaming 的工程师。
  2. 需要通过 build.nvidia.com 调用 Magpie TTS 的开发者。
  3. 需要部署 Riva Translate 并处理语言对或 DNT 标签的团队。
  4. 需要将微调后的 NeMo `.nemo` ASR 模型转换为 RMIR 和 NIM 的开发者。
  5. 需要检查 GPU、容器健康状态和部署条件的运维人员。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖 ASR、TTS、NMT 以及定制 ASR 部署。
  • 同时支持 build.nvidia.com 云端推理和 GPU 自托管 Docker 部署。
  • 涵盖 gRPC、HTTP、WebSocket 等 ASR 客户端协议。
  • 提供 GPU 兼容性、容器健康检查和缓存权限方面的操作指导。
局限
  • 自托管需要 NVIDIA AI Enterprise 授权。
  • 云端推理需要有效的 NVIDIA_API_KEY 和互联网连接。
  • 仅支持 x86_64;Windows WSL2 需要 Podman,且只支持部分 NIM。
  • SKILL.md 是路由层,具体模型目录、容器 ID、显存要求和功能支持必须查阅 NVIDIA 当前文档;提示中的参考文件正文未提供。

如何安装这个 Skill?

使用 NVIDIA 技能 CLI 安装指定技能:npx skills add nvidia/skills --skill nemotron-speech --yes。README 说明该 CLI 会将技能安装到所选的代理目标;也可使用 --agent codex--agent claude-code 等参数指定代理。

如何使用这个 Skill?

安装后,用自然语言提出相关任务,例如“Deploy a Parakeet ASR NIM”或“Synthesize speech with Magpie”。技能会识别任务类型并加载一个对应参考文件。云端推理需要安装 nvidia-riva-client 并设置有效的 NVIDIA_API_KEY;自托管流程需要先完成驱动、Docker、Container Toolkit、NGC API key 和 Riva 客户端配置。

这个 Skill 与同类方案有什么区别?

云端模式适合通过 build.nvidia.com 快速调用并避免本地部署;自托管模式适合在自有 NVIDIA GPU 上运行,但需要 NVIDIA AI Enterprise、驱动、Docker、Container Toolkit 和 NGC 配置。

常见问题

这个技能支持哪些语音任务?
支持 ASR 语音转文字、TTS 文字转语音和 NMT 翻译,并覆盖 Parakeet、Canary、Whisper、Nemotron ASR Streaming 和 Magpie 等名称。
使用云端模式需要什么?
需要安装 `nvidia-riva-client`、有效的 `NVIDIA_API_KEY` 和互联网连接。
自托管是否免费或无需授权?
不能这样假设;来源明确要求自托管具备 NVIDIA AI Enterprise entitlement。
部署失败时先检查什么?
先查看部署就绪检查流程,重点检查 GPU/VRAM、容器健康状态、`nvcr.io` 登录,以及 NIM 缓存目录对容器用户 `nvs:1000` 的写权限。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

Nemotron Speech ASR 定制编排

为特定领域或语言的语音识别改进选择并编排成本最低的适配路径。

数据与分析 ✓ NVIDIA · 官方

临床语音识别微调

用 NeMo 对 Parakeet TDT v2 进行临床词汇微调,并以离线 KER 评估闭环效果。

数据与分析 ✓ NVIDIA · 官方

TAO Grounding DINO 开放词汇检测

用文本提示训练和部署无需固定类别词表的目标检测模型。

自动化与运维 ✓ NVIDIA · 官方

DOCA 管理服务运维技能

帮助运维团队部署、配置并排查 NVIDIA DMS 管理服务。

开发与工程 ✓ NVIDIA · 官方

Holoscan SDK 安装向导

根据主机环境选择并引导完成 Holoscan SDK 的合适安装方式。

自动化与运维 ✓ NVIDIA · 官方

TAO NVIDIA GPU 主机配置

为 TAO 的 Docker 与 Kubernetes GPU 主机检查并配置 NVIDIA 驱动、CUDA 和容器运行时。

开发与工程 ✓ NVIDIA · 官方

TAO Sparse4D 训练技能

帮助代理训练、评估、导出、量化和推理多摄像头时序3D检测跟踪模型。

自动化与运维 ✓ NVIDIA · 官方

Holoscan NGC 容器安装助手

通过 NGC Docker 容器安装、验证并启动 NVIDIA Holoscan SDK。

数据与分析 ✓ NVIDIA · 官方

TAO SegFormer 语义分割技能

为 TAO SegFormer 提供语义分割训练、评估与部署指导。

数据与分析 ✓ NVIDIA · 官方

TAO Depth Anything v2 深度估计

使用 NVIDIA TAO 从单张 RGB 图像训练、评估、导出和推理单目深度模型。

开发与工程 ✓ NVIDIA · 官方

Holoscan SDK 源码构建

在 Docker 容器中从源码构建 Holoscan SDK,并生成可供 CMake 使用的本地安装目录。

自动化与运维 ✓ NVIDIA · 官方

TAO 本地 Docker 运行

帮助 AI 代理在本机或远程单节点 Docker GPU 主机上运行 TAO 作业。

数据与分析 ✓ NVIDIA · 官方

TAO PyT 图像分类

用 NVIDIA TAO 训练、评估并部署 PyTorch 图像分类模型。

数据与分析 ✓ NVIDIA · 官方

TAO Deformable DETR 目标检测

帮助 AI 代理训练、评估、导出、量化并部署轻量级 Deformable DETR 目标检测模型。

自动化与运维 ✓ NVIDIA · 官方

NVIDIA GPU Docker 运行规范

为 NVIDIA GPU 容器工作负载提供可复用的 Docker 运行、认证、挂载与故障排查规范。

数据与分析 ✓ NVIDIA · 官方

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

自动化与运维 ✓ NVIDIA · 官方

Jetson LLM 服务部署技能

为 NVIDIA Jetson 配置并启动 vLLM 或 SGLang 的 LLM/VLM 服务。

自动化与运维 ✓ NVIDIA · 官方

RTVI-CV 二维检测跟踪运维技能

部署并运维 RTVI-CV 二维视频检测与跟踪微服务。

自动化与运维 ✓ NVIDIA · 官方

VSS 视频分析报告

为单个视频片段或事件时间范围生成结构化的视频分析报告。

数据与分析 ✓ NVIDIA · 官方

VSS 视频分析查询

通过 VA-MCP 读取视频分析事件、指标、告警与传感器数据。

相关 Skills