临床语音识别微调
用 NeMo 对 Parakeet TDT v2 进行临床词汇微调,并以离线 KER 评估闭环效果。
明确限制 Stage 4 触发条件,并要求 Brev 创建前输入 YES,披露 GPU 费用、停止/删除选项和 NVIDIA_API_KEY 依赖;但处理临床音频和凭据时没有脱敏、最小权限、密钥管理或数据保留说明,Docker/模型依赖也未给出完整完整性校验,因此扣分。
流程、门槛、路径改写、缺失音频、OOM、精度错误和过拟合处理较具体;但没有提交覆盖关键路径的测试或可执行驱动,部分关键命令依赖未提供的参考文件,且训练加载器可能静默丢行,因此静态证据不足,限于10分以内。
目标用户、触发语句、非适用场景、KER和manifest门槛及后续路由均清楚;但默认仅支持英语/美国英语,未说明中文临床语音适配,且 Brev、NVIDIA 容器和 API 的中国大陆可达性未评估,因此扣分。
文档分层、版本1.0.0、作者、标签、许可证、产物、限制、故障排查和引用文件较完整;但维护责任、变更日志、更新承诺和依赖版本治理不充分,且给定许可证元数据为 NOASSERTION,故未满分。
提供了从分层切分、NeMo SFT 到 cycle N+1 离线评估的完整目标、决策表和预期产物,基准文件报告了内部评估通过;但本次只能静态审阅,实证结果无法独立确认,用户仍需自行编写驱动、管理数据和复核模型,故按静态上限保守扣分。
文件包含参考manifest上的KER数字、逐类别结果、基准报告和评估任务,具备一定可审计线索;但没有外部独立来源、提交的测试套件或可复现执行记录,且经验性声明主要是作者材料,因此低分。
- 临床音频可能包含敏感健康信息;使用前应确认脱敏、访问控制、加密、保留期限和第三方云处理合规性。
- 不要仅依据文档中的KER改进数字判断效果;应在独立、代表性且无数据泄漏的验证集上复核,并检查WER/CER/SER及类别级回归。
- Brev实例、容器镜像、模型下载和NVIDIA API依赖可能产生费用或网络可达性问题;在中国大陆环境应预先验证访问路径,并确认停止实例。
- 训练和部署命令涉及 Bash、Docker、GPU 云资源及模型文件写入,执行前应审查权限、依赖版本和恢复方案。
这个 Skill 能做什么,适合哪些场景?
这是 NVIDIA 临床 ASR Flywheel 的第 4 阶段技能,面向已有基线 KER 和语音清单的用户。它在 NeMo 容器中运行标准监督微调,推荐使用 nvidia/parakeet-tdt-0.6b-v2。只有当优先类别 KER 大于 0.3、清单至少有 100 行且每个优先类别至少有 5 行时,才建议进入该阶段。微调后,它会重新进行离线评估,并依据 cycle-N 与 cycle-N+1 的 KER 变化决定保留模型、扩充清单或停止微调。
读取 cycle-N manifest 和评估结果,按 entity_category 生成行不重叠的 train.jsonl 与 validation.jsonl;在 nvcr.io/nvidia/nemo:25.11.01 中调用 /opt/NeMo/examples/asr/speech_to_text_finetune.py,使用 Parakeet TDT v2 和指定超参数进行标准 SFT;生成 adapted_model.nemo 与 training_run_info.json;使用 NeMo 离线 transcribe() 重新转录音频,计算 WER、CER、KER 和 SER,并生成 leaderboard_cycle<N+1>.md;可将模型交给 riva-asr-custom 进行部署。
- 临床语音团队已有药品、疾病或操作类别的 KER 基线,并希望用至少 100 行数据进行针对性 SFT。
- ASR 工程师希望改善 Parakeet TDT v2 对临床药品名称的识别。
- 研究人员需要比较两个评估周期的 KER,判断微调是否真正改善模型。
- 部署团队已有微调后的 .nemo 文件,并需要明确其 TDT 架构后交由 Riva NIM 服务。
- 用户考虑微调 Nemotron Speech Streaming 模型,需要了解其 SFT 路径会在验证阶段发生 UNK collapse。
这个 Skill 有哪些优点和局限?
- 提供明确的 KER 门槛、数据规模门槛、模型选择和决策表。
- 推荐的 Parakeet TDT v2 配方有参考结果:KER 从 0.513 降至 0.128,相对下降 75%。
- 使用标准 NeMo SFT,避免已知的 TDT/RNNT adapter NaN 问题。
- 微调、离线复评和可选 Riva 部署之间的流程衔接清晰。
- 需要 CUDA 主机、Docker、NeMo 容器及较大的 GPU 显存;24 GB VRAM 更舒适,16 GB 仅在较小批量下可用。
- Brev 会产生按秒计费和闲置磁盘成本,且来源要求用户自行管理停止或删除实例。
- 不适用于通用 word boosting、尚未完成基线评估或没有 manifest 的场景。
- 默认面向 en-US;其他语言环境需要不同基础模型和重新验证的配方。
- 没有开箱即用的驱动程序;输出目录、运行命名和排行榜重绘由用户自行组织。
如何安装这个 Skill?
使用 skills CLI 安装指定技能:npx skills add nvidia/skills --skill digital-health-clinical-asr-finetune --yes。也可以运行 npx skills add nvidia/skills,让 CLI 交互式选择技能和安装目标。该技能还要求同时安装 finetune-asr 与 riva-asr-custom;来源未提供它们的独立安装命令。
如何使用这个 Skill?
先准备来自 digital-health-clinical-asr-eval 的 manifest、基线 KER、分层训练/验证数据和 CUDA 主机。可向代理发出“Drug KER 0.42, 130 rows. SFT?”或“Fine-tune ASR on my clinical vocabulary”。代理应使用 stock NeMo SFT、Parakeet TDT v2 和 cycle N+1 离线评估;不要使用 TDT/RNNT 的 adapter-mixin 路径,也不要微调 nemotron-speech-streaming-en-0.6b。若没有本地 GPU,可考虑 Brev,但在创建实例前必须明确确认费用;来源未提供完整的自动化训练驱动。
这个 Skill 与同类方案有什么区别?
与 /finetune-asr 相比,本技能用于临床 ASR 的监督微调,而不是通用词增强或语言模型融合。与 /riva-asr-custom 相比,本技能负责生成和离线验证 .nemo,生产部署则交由后者。若没有基线评估或 manifest,应分别返回 /digital-health-clinical-asr-eval 或 /digital-health-clinical-asr-build。