Nemotron Speech ASR 定制编排
为特定领域或语言的语音识别改进选择并编排成本最低的适配路径。
技能明确要求先澄清范围、测量基线、选择最低成本路径,并在额外调优周期前征求用户意见;同时区分离线评估与部署服务,降低误操作风险。扣分原因是未说明敏感语音/客户数据的处理、权限最小化、依赖安全、回滚方案或部署前明确确认机制。
工作流、路径选择、子技能职责和失败时的占位符处理基本一致,也要求解释缺失子技能并继续提供临时指导。扣分原因是本次仅静态审阅,未执行关键路径;对具体版本兼容、命令失败和异常输入的诊断反馈仍主要依赖外部子技能。
触发短语、目标用户场景、输入范围、路径分支和非适用边界较清楚,并明确纯部署、OpenAI Whisper及文本LLM任务不应触发。扣分原因是没有明确中文语言支持,也没有评估中国大陆网络可达性;能力依赖多个外部NVIDIA/Riva/NeMo组件。
文档采用渐进式结构,包含工作流、路径选择、子技能注册表、规划问答、限制、版本1.0.0、Apache-2.0许可证和仓库更新说明。扣分原因是缺少推荐的Instructions和Examples章节,作者格式不符合检查器要求,且技能级变更日志、维护责任人和故障排查仍不完整。
技能能够完成高层ASR适配规划、成本路径选择、子技能路由和评估契约;提交的基准报告显示有正向评测结果,但其仍是静态文件中的报告。扣分原因是技能本身不执行训练、评估或部署,最终输出依赖其他技能,且本审查没有独立验证可直接使用的结果。
存在固定修订版本、引用的源文档、评估指南、evals.json和NVSkills-Eval报告,提供了一定可审计线索。扣分原因是缺少本审查可独立复现的执行日志、原始评测产物或多来源交叉验证,因此不能支持更高静态证据分。
- 不要将该编排技能视为训练或部署执行器;应先确认所需子技能、版本和外部服务可用性。
- 处理客户语音、转录文本和合成数据前,应补充隐私、访问控制、保留期限和数据出境要求。
- 部署或昂贵训练前应由用户确认预算、硬件、模型版本、回滚方案,并验证当前Riva/NeMo支持矩阵。
- 中国大陆用户应单独验证NVIDIA文档、镜像、模型和服务端点的网络可达性。
这个 Skill 能做什么,适合哪些场景?
该技能面向 NVIDIA Nemotron Speech(Riva)/NeMo ASR 的领域和语言适配需求。它先明确音频数据、评测集、目标指标及硬件预算,再在词语提升、n-gram 语言模型和微调之间选择足够有效的方案。它负责计划、路由和成本、时间、数据问题的回答,具体训练、评估和部署交由相应子技能执行。它适合需要降低 WER、处理术语错误、噪声或新增语言的团队,但本身不是逐步训练手册。
收集领域或语言、错误类型、评测指标、真实音频量、部署目标及延迟和硬件预算;根据问题选择词语提升、自定义词汇/发音、n-gram LM、微调或跨语言迁移;将数据生成、训练、评估和部署阶段路由到指定子技能;规划真实与合成数据的组合;要求使用领域集上的标准化 WER 和通用集上的遗忘检查;根据结果循环改进或进入 Riva/NIM 部署,并回答数据量、GPU、时间和成本问题。
- 呼叫中心团队发现噪声通话中的行业术语经常识别错误,需要先判断词语提升、语言模型还是微调更合适。
- 语音产品团队要将 Riva ASR 适配到新语言,需要评估现有检查点、数据量和跨语言迁移方案。
- 企业拥有领域文本但缺少标注音频,希望先用 n-gram LM 验证领域短语是否能改善识别。
- ASR 工程团队已有真实转写音频,需要规划 NeMo 微调、WER 评估、遗忘检查和部署流程。
这个 Skill 有哪些优点和局限?
- 以词语提升、n-gram LM 到微调的成本梯度进行方案选择。
- 覆盖数据规划、训练、评估、遗忘检查和部署路由。
- 明确要求用领域 WER 和通用集 A/B 检查,而不是只看训练日志。
- 能处理真实数据不足、合成数据、噪声和 GPU/成本问题。
- 只负责编排,不执行完整训练或部署流程。
- 部分子技能可能尚不存在,届时只能提供临时指导。
- 训练路径需要 GPU;文档、配置、命令和模型支持可能随 NeMo/Riva 版本变化。
- 源材料没有提供该单个技能的测试结果、具体成本或保证的 WER 提升。
如何安装这个 Skill?
使用 NVIDIA 技能集合的 CLI 安装指定技能:
npx skills add nvidia/skills --skill nemotron-asr-finetune --yes
README 未说明目标客户端的专属安装目录;CLI 会提示选择安装位置。
如何使用这个 Skill?
安装后,在代理中提出明确的 ASR 定制目标,例如:"Fine-tune ASR for my noisy call-center domain and reduce WER." 代理应先询问真实音频量、目标评测集、延迟/硬件预算和部署目标,再选择成本最低的可行路径。具体训练、评估和部署由可用的对应子技能执行;缺失的子技能会被标记为占位符。
这个 Skill 与同类方案有什么区别?
技能明确在词语提升、自定义词汇/发音、n-gram LM、微调以及最后的从头训练或跨语言迁移之间进行分层选择;其中前几种是逐步升级的 ASR 定制路径,而不是同类产品对比。