数据与分析 ✓ NVIDIA · 官方 speech-to-textasr-fine-tuningdomain-adaptationword-boostinglanguage-modelwer-evaluationnvidia-rivanvidia-nemo

Nemotron Speech ASR 定制编排

为特定领域或语言的语音识别改进选择并编排成本最低的适配路径。

FollowSkills 评估 · FSRS-2.0
不推荐
56/ 100 五分制 2.8 / 5
信任安全17 / 25 · 3.4/5

技能明确要求先澄清范围、测量基线、选择最低成本路径,并在额外调优周期前征求用户意见;同时区分离线评估与部署服务,降低误操作风险。扣分原因是未说明敏感语音/客户数据的处理、权限最小化、依赖安全、回滚方案或部署前明确确认机制。

可靠稳定8 / 20 · 2.0/5

工作流、路径选择、子技能职责和失败时的占位符处理基本一致,也要求解释缺失子技能并继续提供临时指导。扣分原因是本次仅静态审阅,未执行关键路径;对具体版本兼容、命令失败和异常输入的诊断反馈仍主要依赖外部子技能。

适用触发11 / 15 · 3.7/5

触发短语、目标用户场景、输入范围、路径分支和非适用边界较清楚,并明确纯部署、OpenAI Whisper及文本LLM任务不应触发。扣分原因是没有明确中文语言支持,也没有评估中国大陆网络可达性;能力依赖多个外部NVIDIA/Riva/NeMo组件。

规范维护10 / 15 · 3.3/5

文档采用渐进式结构,包含工作流、路径选择、子技能注册表、规划问答、限制、版本1.0.0、Apache-2.0许可证和仓库更新说明。扣分原因是缺少推荐的Instructions和Examples章节,作者格式不符合检查器要求,且技能级变更日志、维护责任人和故障排查仍不完整。

有效结果6 / 15 · 2.0/5

技能能够完成高层ASR适配规划、成本路径选择、子技能路由和评估契约;提交的基准报告显示有正向评测结果,但其仍是静态文件中的报告。扣分原因是技能本身不执行训练、评估或部署,最终输出依赖其他技能,且本审查没有独立验证可直接使用的结果。

证据核验4 / 10 · 2.0/5

存在固定修订版本、引用的源文档、评估指南、evals.json和NVSkills-Eval报告,提供了一定可审计线索。扣分原因是缺少本审查可独立复现的执行日志、原始评测产物或多来源交叉验证,因此不能支持更高静态证据分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 不要将该编排技能视为训练或部署执行器;应先确认所需子技能、版本和外部服务可用性。
  • 处理客户语音、转录文本和合成数据前,应补充隐私、访问控制、保留期限和数据出境要求。
  • 部署或昂贵训练前应由用户确认预算、硬件、模型版本、回滚方案,并验证当前Riva/NeMo支持矩阵。
  • 中国大陆用户应单独验证NVIDIA文档、镜像、模型和服务端点的网络可达性。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向 NVIDIA Nemotron Speech(Riva)/NeMo ASR 的领域和语言适配需求。它先明确音频数据、评测集、目标指标及硬件预算,再在词语提升、n-gram 语言模型和微调之间选择足够有效的方案。它负责计划、路由和成本、时间、数据问题的回答,具体训练、评估和部署交由相应子技能执行。它适合需要降低 WER、处理术语错误、噪声或新增语言的团队,但本身不是逐步训练手册。

收集领域或语言、错误类型、评测指标、真实音频量、部署目标及延迟和硬件预算;根据问题选择词语提升、自定义词汇/发音、n-gram LM、微调或跨语言迁移;将数据生成、训练、评估和部署阶段路由到指定子技能;规划真实与合成数据的组合;要求使用领域集上的标准化 WER 和通用集上的遗忘检查;根据结果循环改进或进入 Riva/NIM 部署,并回答数据量、GPU、时间和成本问题。

  1. 呼叫中心团队发现噪声通话中的行业术语经常识别错误,需要先判断词语提升、语言模型还是微调更合适。
  2. 语音产品团队要将 Riva ASR 适配到新语言,需要评估现有检查点、数据量和跨语言迁移方案。
  3. 企业拥有领域文本但缺少标注音频,希望先用 n-gram LM 验证领域短语是否能改善识别。
  4. ASR 工程团队已有真实转写音频,需要规划 NeMo 微调、WER 评估、遗忘检查和部署流程。

这个 Skill 有哪些优点和局限?

优点
  • 以词语提升、n-gram LM 到微调的成本梯度进行方案选择。
  • 覆盖数据规划、训练、评估、遗忘检查和部署路由。
  • 明确要求用领域 WER 和通用集 A/B 检查,而不是只看训练日志。
  • 能处理真实数据不足、合成数据、噪声和 GPU/成本问题。
局限
  • 只负责编排,不执行完整训练或部署流程。
  • 部分子技能可能尚不存在,届时只能提供临时指导。
  • 训练路径需要 GPU;文档、配置、命令和模型支持可能随 NeMo/Riva 版本变化。
  • 源材料没有提供该单个技能的测试结果、具体成本或保证的 WER 提升。

如何安装这个 Skill?

使用 NVIDIA 技能集合的 CLI 安装指定技能:

npx skills add nvidia/skills --skill nemotron-asr-finetune --yes

README 未说明目标客户端的专属安装目录;CLI 会提示选择安装位置。

如何使用这个 Skill?

安装后,在代理中提出明确的 ASR 定制目标,例如:"Fine-tune ASR for my noisy call-center domain and reduce WER." 代理应先询问真实音频量、目标评测集、延迟/硬件预算和部署目标,再选择成本最低的可行路径。具体训练、评估和部署由可用的对应子技能执行;缺失的子技能会被标记为占位符。

这个 Skill 与同类方案有什么区别?

技能明确在词语提升、自定义词汇/发音、n-gram LM、微调以及最后的从头训练或跨语言迁移之间进行分层选择;其中前几种是逐步升级的 ASR 定制路径,而不是同类产品对比。

常见问题

它会直接完成 ASR 微调吗?
不会。它负责范围界定、路径选择和阶段编排,训练执行交给 nemo-speech-asr-finetune 等子技能。
没有很多标注音频时应该怎么办?
技能会优先评估词语提升或 n-gram LM,并可规划合成数据来填补测量出的缺口;它强调真实目标域音频通常仍是瓶颈。
需要多少数据才能微调?
技能会根据目标和现有数据回答数据量问题;其路径摘要引用 NIM 指南的 100 小时以上建议,并指出约 10 小时只有在混合数据以避免灾难性遗忘时才可作为下限参考。
它是否适合只想部署现成 Riva 模型的用户?
有限适合。部署阶段由 nemotron-speech 子技能负责;本技能的重点是定制方案的规划与编排。

同仓库的其他 Skills

均来自 NVIDIA/skills

自动化与运维 ✓ NVIDIA · 官方

Nemotron Speech 语音 NIM 技能

指导部署和运行 NVIDIA Riva 的语音识别、语音合成与翻译 NIM。

数据与分析 ✓ NVIDIA · 官方

临床语音识别微调

用 NeMo 对 Parakeet TDT v2 进行临床词汇微调,并以离线 KER 评估闭环效果。

数据与分析 ✓ NVIDIA · 官方

临床 ASR 评测与 KER 排行榜

评测临床语音识别清单并定位术语识别问题。

数据与分析 ✓ NVIDIA · 官方

Nemotron 模型定制流水线

为 Nemotron 模型规划、配置并串联数据处理、训练、对齐、转换、优化与评测步骤。

开发与工程 ✓ NVIDIA · 官方

临床语音识别飞轮:环境初始化

验证临床 ASR 评测环境能否通过 NVIDIA 托管语音服务完成 TTS 到 ASR 的闭环。

数据与分析 ✓ NVIDIA · 官方

Nemotron 检索配方助手

帮助规划、调试、微调、评估和部署 Nemotron 嵌入与重排检索流程。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 模型接入指南

指导开发者将新的 LLM、MoE 或 VLM 架构接入 NeMo AutoModel。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 配方推荐器

根据模型、GPU规模和训练目标推荐可调整的Megatron Bridge配方。

数据与分析 ✓ NVIDIA · 官方

Cosmos-Embed 视频检索与微调技能

用 Cosmos-Embed1 将视频与文本嵌入用于检索和微调。

数据与分析 ✓ NVIDIA · 官方

临床 ASR 基准构建器

围绕临床术语生成带发音质量控制的 NeMo ASR 评测基准。

数据与分析 ✓ NVIDIA · 官方

NV 脑部 MRI 扩散模型微调

从 NIfTI 脑部 MRI 数据微调 NV-Generate-CTMR 的扩散 UNet。

数据与分析 ✓ NVIDIA · 官方

Hugging Face 本地 GPU 微调助手

在本地 NVIDIA GPU 上,以可复现流程微调 Hugging Face 模型。

自动化与运维 ✓ NVIDIA · 官方

Isaac for Healthcare 全流程工作流

把 Isaac for Healthcare 从录制一路跑到验证

数据与分析 ✓ NVIDIA · 官方

TAO ChangeNet 根因分析

基于图像证据定位 NVIDIA TAO Visual ChangeNet 分类实验的模型失败原因。

开发与工程 ✓ NVIDIA · 官方

NeMo Evaluator 评估插件技能

帮助代理通过 NeMo CLI 与 Python SDK 执行并管理模型评估。

开发与工程 ✓ NVIDIA · 官方

NeMo Relay 自适应调优

基于运行时信号,以可测量方式调优 NeMo Relay 插件行为。

自动化与运维 ✓ NVIDIA · 官方

RAG 性能基准测试

用单一 YAML 配置分析已部署 NVIDIA RAG Blueprint 服务的性能瓶颈。

数据与分析 ✓ NVIDIA · 官方

TAO CLIP 微调与部署

为图文检索、零样本分类和嵌入提取训练并部署 NVIDIA TAO CLIP 模型。

数据与分析 ✓ NVIDIA · 官方

TAO AutoML 调参技能

为 NVIDIA TAO 网络运行可审查的自动超参数优化流程。

开发与工程 ✓ NVIDIA · 官方

TAO Sparse4D 训练技能

帮助代理训练、评估、导出、量化和推理多摄像头时序3D检测跟踪模型。

相关 Skills