数据与分析 ✓ NVIDIA · 官方 clinical-asrspeech-evaluationkeyword-error-rateleaderboardnemo-manifestnvcfwer-cer-ser

临床 ASR 评测与 KER 排行榜

评测临床语音识别清单并定位术语识别问题。

FollowSkills 评估 · FSRS-2.0
不推荐
55/ 100 五分制 2.8 / 5
信任安全16 / 25 · 3.2/5

技能明确披露每条音频及参考文本会发送到外部 NVIDIA NVCF,并禁止真实患者音频或 PHI;要求回显模型和 function-id,且本地评分、环境变量和自托管路径有所说明。扣分原因是工具声明包含 Bash/Write,未明确要求在首次外传前取得用户确认,缺少删除或回滚机制,且 API 密钥传递与外部数据流的隔离控制仍较有限。

可靠稳定8 / 20 · 2.0/5

主流程、输入字段、指标定义、输出文件和若干异常诊断均有说明,静态阅读可支持合理 happy path。扣分原因是依赖 nvidia-riva-client、soundfile、Riva/NVCF 环境;RESOURCE_EXHAUSTED 时实际代码在当前行抛错,所谓重试或断点续跑没有实现;缺少提交的关键路径测试,且部分细节依赖未提供的 sibling/reference 内容。按静态校准不超过10分。

适用触发9 / 15 · 3.0/5

目标用户、触发短语、非适用范围、路由规则、输入 manifest 字段和输出报告较清楚。扣分原因是默认英文和 en-US 词法,中文及非拉丁语支持不足;核心托管路径依赖 grpc.nvcf.nvidia.com,未提供中国大陆网络可达性证据;自托管虽提及但需要额外技能和部署条件。

规范维护10 / 15 · 3.3/5

frontmatter、版本1.1.0、作者、标签、阶段、前后续技能、许可证、参考文件、示例、限制和故障排查结构完整,官方 NVIDIA 来源及维护归属可识别。扣分原因是没有变更日志、明确维护承诺或更新流程;skill-card 的输出描述与主技能的实际 Markdown/JSONL 文件产物并不完全一致,且关键 recipe 仍主要由外部参考文件承载。

有效结果7 / 15 · 2.3/5

技能对临床 ASR manifest 评分、四项指标、五段 leaderboard 和后评估路由给出了直接可用的流程与纯 Python 评分配方,核心任务定义明确。扣分原因是静态审查无法验证 ASR 调用、数值正确性或报告实际可用性;执行后仍需处理云服务、依赖、失败行重跑和人工审阅。静态校准上限为7分。

证据核验5 / 10 · 2.5/5

提供了固定 function-id、明确算法、输入输出 schema、示例 split、evals/evals.json 和一份 benchmark 报告,具备一定审计线索。扣分原因是 benchmark 是仓库内自述,未给出可独立核验的真实 CI、提交测试套件或第三方复现证据;不能据此证明运行结果。静态校准上限为5分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 不要将真实患者录音、真实临床 encounter 或 PHI 传入该技能;即使声明禁止,也应在执行前由用户确认数据是合成或已去标识。
  • 默认流程依赖外部 NVIDIA NVCF,需先验证中国大陆网络、组织合规和费用限制;RESOURCE_EXHAUSTED 或中途失败时没有可靠的内建断点续跑。
  • 结果主要面向英文临床 ASR,中文和其他语言的规范化、分词与 KER 语义未得到支持证据。
  • 仓库内 benchmark 不能替代独立执行复现,发布前应补充覆盖关键 ASR、评分和失败路径的测试。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

这是 NVIDIA 临床 ASR Flywheel 的第 3 阶段技能,接收包含临床扩展字段的 NeMo 格式 manifest.jsonl。它通过 NVIDIA NVCF 上的 ASR NIM 转录每条音频,并在本地计算 WER、CER、KER 和 SER。技能会生成五部分 KER 排行榜,并依据优先类别 KER 和 ipa_source 分组结果建议继续微调、回到数据构建,或强化评测。它面向合成临床语音,不应处理真实患者录音或 PHI。

读取 manifest.jsonl 及其 audio_filepath、text、term、entity_category、ipa_source、voice_id、noise_level 和 context_type 字段;默认调用 NVIDIA NVCF 上的 nvidia/parakeet-tdt-0.6b-v2 离线 gRPC ASR NIM,也支持通过环境变量更换模型或端点;为每行写出包含 ref、hyp 和临床元数据的 per_sample.json;按统一规范计算 WER、CER、严格连续匹配的 KER 和 SER;生成按总体指标、entity_category、ipa_source、noise_level 及最差术语排序的五部分排行榜。

  1. 临床 ASR 研究者已有 100 条以上带术语标签的 NeMo manifest,需要评估 Parakeet 基线。
  2. 医疗语音团队想比较 merriam-webster 与 magpie_g2p 发音来源对术语识别的影响。
  3. 评测工程师需要按药物、手术、解剖等实体类别查看 KER,而不是只看总体 WER。
  4. 模型团队需要根据临床术语 KER 判断应扩充术语和发音数据,还是进入微调阶段。

这个 Skill 有哪些优点和局限?

优点
  • 同时报告 WER、CER、KER 和 SER,突出临床术语识别这一核心信号。
  • 强制提供按 ipa_source 的 KER 分组,可帮助识别发音提示覆盖问题。
  • 包含从评测结果到构建、微调或强化评测的明确决策树。
  • 评分逻辑可使用内置纯 Python 配方,不依赖 jiwer。
局限
  • 默认仅面向英语和 en-US 拉丁文字规范化。
  • 严格连续 KER 会将 cefa zolin 这类近似匹配判为失败。
  • 每次评测只运行一个模型;模型比较需要分别运行并对比结果。
  • ASR 阶段会把每条音频及参考文本发送到 NVIDIA NVCF,不能用于真实患者音频或 PHI。
  • 依赖 NVIDIA_API_KEY、nvidia-riva-client、soundfile、可用音频文件和外部网络连接。

如何安装这个 Skill?

使用 NVIDIA skills CLI 安装指定技能:

npx skills add nvidia/skills --skill digital-health-clinical-asr-eval --yes

README 未说明其他客户端的该技能专属安装路径;安装后,在 agent 下次加载技能并遇到相关任务时使用。

如何使用这个 Skill?

准备包含临床扩展字段且音频文件存在的 NeMo manifest.jsonl,并设置 NVIDIA_API_KEY。可向 agent 提示:"Score my ASR manifest at manifest.jsonl and generate the five-section KER leaderboard." 运行前应确认所选 NIM 和 resolved function-id;音频及参考文本会发送到 NVIDIA 外部服务,建议仅使用 Stage 2 生成的合成音频。没有 manifest 时,应先使用 digital-health-clinical-asr-build;ASR 认证、协议或模型目录问题不属于本技能范围。

这个 Skill 与同类方案有什么区别?

与 digital-health-clinical-asr-build 相比,本技能负责已有 manifest 的转录、评分和路由,而不是生成音频或构建基准数据。与 digital-health-clinical-asr-finetune 相比,本技能先评估 KER 并判断是否应微调。ASR 模型目录、认证、gRPC 协议和自托管 NIM 配置应转至 riva-asr 或相关技能。

常见问题

它是否适合真实患者录音?
不适合。来源明确要求使用合成音频,不要通过该技能传递真实 ASR 录音、患者就诊录音或 PHI。
运行评测会产生外部服务费用吗?
可能消耗 NVIDIA API credits,因为每条 manifest 音频会发送到 NVIDIA NVCF;来源没有提供具体价格。
KER 高但 WER 低时应如何处理?
优先查看按 ipa_source 的拆分。如果 merriam-webster 较好而 magpie_g2p 较差,应回到 digital-health-clinical-asr-build 的 Step 2d,而不是先微调。
没有 manifest 可以直接使用吗?
不可以。应先通过 digital-health-clinical-asr-build 生成或准备带临床扩展字段的 NeMo manifest。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

临床语音识别飞轮:环境初始化

验证临床 ASR 评测环境能否通过 NVIDIA 托管语音服务完成 TTS 到 ASR 的闭环。

数据与分析 ✓ NVIDIA · 官方

临床语音识别微调

用 NeMo 对 Parakeet TDT v2 进行临床词汇微调,并以离线 KER 评估闭环效果。

数据与分析 ✓ NVIDIA · 官方

临床 ASR 基准构建器

围绕临床术语生成带发音质量控制的 NeMo ASR 评测基准。

数据与分析 ✓ NVIDIA · 官方

Nemotron Speech ASR 定制编排

为特定领域或语言的语音识别改进选择并编排成本最低的适配路径。

开发与工程 ✓ NVIDIA · 官方

NeMo Evaluator 评估插件技能

帮助代理通过 NeMo CLI 与 Python SDK 执行并管理模型评估。

自动化与运维 ✓ NVIDIA · 官方

Nemotron Speech 语音 NIM 技能

指导部署和运行 NVIDIA Riva 的语音识别、语音合成与翻译 NIM。

数据与分析 ✓ NVIDIA · 官方

NeMo 数据设计器合成数据技能

用 NeMo Data Designer 构建符合描述的合成数据集与数据生成流水线。

开发与工程 ✓ NVIDIA · 官方

NeMo Relay 安装助手

为 CLI、语言包和主流框架选择并验证 NeMo Relay 安装路径。

数据与分析 ✓ NVIDIA · 官方

Nemotron 检索配方助手

帮助规划、调试、微调、评估和部署 Nemotron 嵌入与重排检索流程。

开发与工程 ✓ NVIDIA · 官方

NeMo Relay 快速上手

帮助首次使用 NeMo Relay 的用户通过最小试验验证可观测执行价值。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 模型接入指南

指导开发者将新的 LLM、MoE 或 VLM 架构接入 NeMo AutoModel。

开发与工程 ✓ NVIDIA · 官方

NeMo Relay 插件构建指南

帮助将可复用的 NeMo Relay 运行时行为封装为可配置插件。

自动化与运维 ✓ NVIDIA · 官方

NeMo Relay 可观测性插件

为 NeMo Relay 选择并配置事件与追踪导出。

开发与工程 ✓ NVIDIA · 官方

Jetson BSP 源码构建

根据 Jetson BSP 源码变更重建设备树、内核和模块,并生成可部署清单。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 分布式训练配置

为 NeMo AutoModel 选择并配置多 GPU 与多节点训练策略。

写作与内容 ✓ NVIDIA · 官方

NeMo-RL 文档规范

帮助 NeMo-RL 项目按统一规范编写和维护文档。

开发与工程 ✓ NVIDIA · 官方

NeMo Relay 迁移助手

将 NeMo Flow 项目安全地迁移为 NeMo Relay。

开发与工程 ✓ NVIDIA · 官方

NeMo Relay 自适应调优

基于运行时信号,以可测量方式调优 NeMo Relay 插件行为。

数据与分析 ✓ NVIDIA · 官方

Nemotron 模型定制流水线

为 Nemotron 模型规划、配置并串联数据处理、训练、对齐、转换、优化与评测步骤。

开发与工程 ✓ NVIDIA · 官方

NeMo Relay 运行时集成调试

定位 NeMo Relay 已安装但运行时行为异常的应用集成问题。

相关 Skills