数据与分析 ✓ NVIDIA · 官方 clinical-asrspeech-to-textfine-tuningnemoparakeetkeyword-error-rate

临床语音识别微调

用 NeMo 对 Parakeet TDT v2 进行临床词汇微调,并以离线 KER 评估闭环效果。

FollowSkills 评估 · FSRS-2.0
不推荐
50/ 100 五分制 2.5 / 5
信任安全15 / 25 · 3.0/5

明确限制 Stage 4 触发条件,并要求 Brev 创建前输入 YES,披露 GPU 费用、停止/删除选项和 NVIDIA_API_KEY 依赖;但处理临床音频和凭据时没有脱敏、最小权限、密钥管理或数据保留说明,Docker/模型依赖也未给出完整完整性校验,因此扣分。

可靠稳定8 / 20 · 2.0/5

流程、门槛、路径改写、缺失音频、OOM、精度错误和过拟合处理较具体;但没有提交覆盖关键路径的测试或可执行驱动,部分关键命令依赖未提供的参考文件,且训练加载器可能静默丢行,因此静态证据不足,限于10分以内。

适用触发8 / 15 · 2.7/5

目标用户、触发语句、非适用场景、KER和manifest门槛及后续路由均清楚;但默认仅支持英语/美国英语,未说明中文临床语音适配,且 Brev、NVIDIA 容器和 API 的中国大陆可达性未评估,因此扣分。

规范维护9 / 15 · 3.0/5

文档分层、版本1.0.0、作者、标签、许可证、产物、限制、故障排查和引用文件较完整;但维护责任、变更日志、更新承诺和依赖版本治理不充分,且给定许可证元数据为 NOASSERTION,故未满分。

有效结果6 / 15 · 2.0/5

提供了从分层切分、NeMo SFT 到 cycle N+1 离线评估的完整目标、决策表和预期产物,基准文件报告了内部评估通过;但本次只能静态审阅,实证结果无法独立确认,用户仍需自行编写驱动、管理数据和复核模型,故按静态上限保守扣分。

证据核验4 / 10 · 2.0/5

文件包含参考manifest上的KER数字、逐类别结果、基准报告和评估任务,具备一定可审计线索;但没有外部独立来源、提交的测试套件或可复现执行记录,且经验性声明主要是作者材料,因此低分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 临床音频可能包含敏感健康信息;使用前应确认脱敏、访问控制、加密、保留期限和第三方云处理合规性。
  • 不要仅依据文档中的KER改进数字判断效果;应在独立、代表性且无数据泄漏的验证集上复核,并检查WER/CER/SER及类别级回归。
  • Brev实例、容器镜像、模型下载和NVIDIA API依赖可能产生费用或网络可达性问题;在中国大陆环境应预先验证访问路径,并确认停止实例。
  • 训练和部署命令涉及 Bash、Docker、GPU 云资源及模型文件写入,执行前应审查权限、依赖版本和恢复方案。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

这是 NVIDIA 临床 ASR Flywheel 的第 4 阶段技能,面向已有基线 KER 和语音清单的用户。它在 NeMo 容器中运行标准监督微调,推荐使用 nvidia/parakeet-tdt-0.6b-v2。只有当优先类别 KER 大于 0.3、清单至少有 100 行且每个优先类别至少有 5 行时,才建议进入该阶段。微调后,它会重新进行离线评估,并依据 cycle-N 与 cycle-N+1 的 KER 变化决定保留模型、扩充清单或停止微调。

读取 cycle-N manifest 和评估结果,按 entity_category 生成行不重叠的 train.jsonl 与 validation.jsonl;在 nvcr.io/nvidia/nemo:25.11.01 中调用 /opt/NeMo/examples/asr/speech_to_text_finetune.py,使用 Parakeet TDT v2 和指定超参数进行标准 SFT;生成 adapted_model.nemo 与 training_run_info.json;使用 NeMo 离线 transcribe() 重新转录音频,计算 WER、CER、KER 和 SER,并生成 leaderboard_cycle<N+1>.md;可将模型交给 riva-asr-custom 进行部署。

  1. 临床语音团队已有药品、疾病或操作类别的 KER 基线,并希望用至少 100 行数据进行针对性 SFT。
  2. ASR 工程师希望改善 Parakeet TDT v2 对临床药品名称的识别。
  3. 研究人员需要比较两个评估周期的 KER,判断微调是否真正改善模型。
  4. 部署团队已有微调后的 .nemo 文件,并需要明确其 TDT 架构后交由 Riva NIM 服务。
  5. 用户考虑微调 Nemotron Speech Streaming 模型,需要了解其 SFT 路径会在验证阶段发生 UNK collapse。

这个 Skill 有哪些优点和局限?

优点
  • 提供明确的 KER 门槛、数据规模门槛、模型选择和决策表。
  • 推荐的 Parakeet TDT v2 配方有参考结果:KER 从 0.513 降至 0.128,相对下降 75%。
  • 使用标准 NeMo SFT,避免已知的 TDT/RNNT adapter NaN 问题。
  • 微调、离线复评和可选 Riva 部署之间的流程衔接清晰。
局限
  • 需要 CUDA 主机、Docker、NeMo 容器及较大的 GPU 显存;24 GB VRAM 更舒适,16 GB 仅在较小批量下可用。
  • Brev 会产生按秒计费和闲置磁盘成本,且来源要求用户自行管理停止或删除实例。
  • 不适用于通用 word boosting、尚未完成基线评估或没有 manifest 的场景。
  • 默认面向 en-US;其他语言环境需要不同基础模型和重新验证的配方。
  • 没有开箱即用的驱动程序;输出目录、运行命名和排行榜重绘由用户自行组织。

如何安装这个 Skill?

使用 skills CLI 安装指定技能:npx skills add nvidia/skills --skill digital-health-clinical-asr-finetune --yes。也可以运行 npx skills add nvidia/skills,让 CLI 交互式选择技能和安装目标。该技能还要求同时安装 finetune-asr 与 riva-asr-custom;来源未提供它们的独立安装命令。

如何使用这个 Skill?

先准备来自 digital-health-clinical-asr-eval 的 manifest、基线 KER、分层训练/验证数据和 CUDA 主机。可向代理发出“Drug KER 0.42, 130 rows. SFT?”或“Fine-tune ASR on my clinical vocabulary”。代理应使用 stock NeMo SFT、Parakeet TDT v2 和 cycle N+1 离线评估;不要使用 TDT/RNNT 的 adapter-mixin 路径,也不要微调 nemotron-speech-streaming-en-0.6b。若没有本地 GPU,可考虑 Brev,但在创建实例前必须明确确认费用;来源未提供完整的自动化训练驱动。

这个 Skill 与同类方案有什么区别?

与 /finetune-asr 相比,本技能用于临床 ASR 的监督微调,而不是通用词增强或语言模型融合。与 /riva-asr-custom 相比,本技能负责生成和离线验证 .nemo,生产部署则交由后者。若没有基线评估或 manifest,应分别返回 /digital-health-clinical-asr-eval 或 /digital-health-clinical-asr-build。

常见问题

需要什么硬件?
需要至少 16 GB VRAM 的 CUDA 主机;24 GB 更舒适。无本地 GPU 时可使用 Brev 的 L40S 48 GB,但会产生运行和闲置成本。
应该微调 Nemotron Speech Streaming 基础模型吗?
不应该。该模型的 SFT 路径会在第一步后出现验证集 UNK collapse,技能推荐改用 Parakeet TDT v2。
KER 没有明显变化怎么办?
先检查各类别结果;如果清单信号密度不足,应返回 digital-health-clinical-asr-build 扩充数据,而不是继续进行学习率扫描。
微调后能直接用于生产吗?
技能只负责准备 .nemo 并进行离线质量评估。生产服务应交给 riva-asr-custom,并显式指定 TDT 架构。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

临床语音识别飞轮:环境初始化

验证临床 ASR 评测环境能否通过 NVIDIA 托管语音服务完成 TTS 到 ASR 的闭环。

数据与分析 ✓ NVIDIA · 官方

临床 ASR 评测与 KER 排行榜

评测临床语音识别清单并定位术语识别问题。

数据与分析 ✓ NVIDIA · 官方

Nemotron Speech ASR 定制编排

为特定领域或语言的语音识别改进选择并编排成本最低的适配路径。

自动化与运维 ✓ NVIDIA · 官方

Nemotron Speech 语音 NIM 技能

指导部署和运行 NVIDIA Riva 的语音识别、语音合成与翻译 NIM。

数据与分析 ✓ NVIDIA · 官方

临床 ASR 基准构建器

围绕临床术语生成带发音质量控制的 NeMo ASR 评测基准。

自动化与运维 ✓ NVIDIA · 官方

Isaac for Healthcare 全流程工作流

把 Isaac for Healthcare 从录制一路跑到验证

数据与分析 ✓ NVIDIA · 官方

Nemotron 检索配方助手

帮助规划、调试、微调、评估和部署 Nemotron 嵌入与重排检索流程。

数据与分析 ✓ NVIDIA · 官方

Nemotron 模型定制流水线

为 Nemotron 模型规划、配置并串联数据处理、训练、对齐、转换、优化与评测步骤。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 配方推荐器

根据模型、GPU规模和训练目标推荐可调整的Megatron Bridge配方。

数据与分析 ✓ NVIDIA · 官方

Cosmos-Embed 视频检索与微调技能

用 Cosmos-Embed1 将视频与文本嵌入用于检索和微调。

数据与分析 ✓ NVIDIA · 官方

NV 脑部 MRI 扩散模型微调

从 NIfTI 脑部 MRI 数据微调 NV-Generate-CTMR 的扩散 UNet。

数据与分析 ✓ NVIDIA · 官方

PAIDF AnomalyGen 异常图像生成

微调模型并生成、评估和筛选合成异常图像。

开发与工程 ✓ NVIDIA · 官方

NeMo Relay 自适应调优

基于运行时信号,以可测量方式调优 NeMo Relay 插件行为。

数据与分析 ✓ NVIDIA · 官方

Cosmos Reason 视频问答微调

为 Cosmos3-Nano 视频问答模型提供基于 FSDP 的 SFT、LoRA、评估与 AutoML 工作流指导。

开发与工程 ✓ NVIDIA · 官方

NeMo Relay 安装助手

为 CLI、语言包和主流框架选择并验证 NeMo Relay 安装路径。

开发与工程 ✓ NVIDIA · 官方

NeMo Relay 快速上手

帮助首次使用 NeMo Relay 的用户通过最小试验验证可观测执行价值。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 模型接入指南

指导开发者将新的 LLM、MoE 或 VLM 架构接入 NeMo AutoModel。

开发与工程 ✓ NVIDIA · 官方

NeMo Relay 插件构建指南

帮助将可复用的 NeMo Relay 运行时行为封装为可配置插件。

自动化与运维 ✓ NVIDIA · 官方

NeMo Relay 可观测性插件

为 NeMo Relay 选择并配置事件与追踪导出。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 分布式训练配置

为 NeMo AutoModel 选择并配置多 GPU 与多节点训练策略。

相关 Skills