临床 ASR 评测与 KER 排行榜
评测临床语音识别清单并定位术语识别问题。
技能明确披露每条音频及参考文本会发送到外部 NVIDIA NVCF,并禁止真实患者音频或 PHI;要求回显模型和 function-id,且本地评分、环境变量和自托管路径有所说明。扣分原因是工具声明包含 Bash/Write,未明确要求在首次外传前取得用户确认,缺少删除或回滚机制,且 API 密钥传递与外部数据流的隔离控制仍较有限。
主流程、输入字段、指标定义、输出文件和若干异常诊断均有说明,静态阅读可支持合理 happy path。扣分原因是依赖 nvidia-riva-client、soundfile、Riva/NVCF 环境;RESOURCE_EXHAUSTED 时实际代码在当前行抛错,所谓重试或断点续跑没有实现;缺少提交的关键路径测试,且部分细节依赖未提供的 sibling/reference 内容。按静态校准不超过10分。
目标用户、触发短语、非适用范围、路由规则、输入 manifest 字段和输出报告较清楚。扣分原因是默认英文和 en-US 词法,中文及非拉丁语支持不足;核心托管路径依赖 grpc.nvcf.nvidia.com,未提供中国大陆网络可达性证据;自托管虽提及但需要额外技能和部署条件。
frontmatter、版本1.1.0、作者、标签、阶段、前后续技能、许可证、参考文件、示例、限制和故障排查结构完整,官方 NVIDIA 来源及维护归属可识别。扣分原因是没有变更日志、明确维护承诺或更新流程;skill-card 的输出描述与主技能的实际 Markdown/JSONL 文件产物并不完全一致,且关键 recipe 仍主要由外部参考文件承载。
技能对临床 ASR manifest 评分、四项指标、五段 leaderboard 和后评估路由给出了直接可用的流程与纯 Python 评分配方,核心任务定义明确。扣分原因是静态审查无法验证 ASR 调用、数值正确性或报告实际可用性;执行后仍需处理云服务、依赖、失败行重跑和人工审阅。静态校准上限为7分。
提供了固定 function-id、明确算法、输入输出 schema、示例 split、evals/evals.json 和一份 benchmark 报告,具备一定审计线索。扣分原因是 benchmark 是仓库内自述,未给出可独立核验的真实 CI、提交测试套件或第三方复现证据;不能据此证明运行结果。静态校准上限为5分。
- 不要将真实患者录音、真实临床 encounter 或 PHI 传入该技能;即使声明禁止,也应在执行前由用户确认数据是合成或已去标识。
- 默认流程依赖外部 NVIDIA NVCF,需先验证中国大陆网络、组织合规和费用限制;RESOURCE_EXHAUSTED 或中途失败时没有可靠的内建断点续跑。
- 结果主要面向英文临床 ASR,中文和其他语言的规范化、分词与 KER 语义未得到支持证据。
- 仓库内 benchmark 不能替代独立执行复现,发布前应补充覆盖关键 ASR、评分和失败路径的测试。
这个 Skill 能做什么,适合哪些场景?
这是 NVIDIA 临床 ASR Flywheel 的第 3 阶段技能,接收包含临床扩展字段的 NeMo 格式 manifest.jsonl。它通过 NVIDIA NVCF 上的 ASR NIM 转录每条音频,并在本地计算 WER、CER、KER 和 SER。技能会生成五部分 KER 排行榜,并依据优先类别 KER 和 ipa_source 分组结果建议继续微调、回到数据构建,或强化评测。它面向合成临床语音,不应处理真实患者录音或 PHI。
读取 manifest.jsonl 及其 audio_filepath、text、term、entity_category、ipa_source、voice_id、noise_level 和 context_type 字段;默认调用 NVIDIA NVCF 上的 nvidia/parakeet-tdt-0.6b-v2 离线 gRPC ASR NIM,也支持通过环境变量更换模型或端点;为每行写出包含 ref、hyp 和临床元数据的 per_sample.json;按统一规范计算 WER、CER、严格连续匹配的 KER 和 SER;生成按总体指标、entity_category、ipa_source、noise_level 及最差术语排序的五部分排行榜。
- 临床 ASR 研究者已有 100 条以上带术语标签的 NeMo manifest,需要评估 Parakeet 基线。
- 医疗语音团队想比较 merriam-webster 与 magpie_g2p 发音来源对术语识别的影响。
- 评测工程师需要按药物、手术、解剖等实体类别查看 KER,而不是只看总体 WER。
- 模型团队需要根据临床术语 KER 判断应扩充术语和发音数据,还是进入微调阶段。
这个 Skill 有哪些优点和局限?
- 同时报告 WER、CER、KER 和 SER,突出临床术语识别这一核心信号。
- 强制提供按 ipa_source 的 KER 分组,可帮助识别发音提示覆盖问题。
- 包含从评测结果到构建、微调或强化评测的明确决策树。
- 评分逻辑可使用内置纯 Python 配方,不依赖 jiwer。
- 默认仅面向英语和 en-US 拉丁文字规范化。
- 严格连续 KER 会将 cefa zolin 这类近似匹配判为失败。
- 每次评测只运行一个模型;模型比较需要分别运行并对比结果。
- ASR 阶段会把每条音频及参考文本发送到 NVIDIA NVCF,不能用于真实患者音频或 PHI。
- 依赖 NVIDIA_API_KEY、nvidia-riva-client、soundfile、可用音频文件和外部网络连接。
如何安装这个 Skill?
使用 NVIDIA skills CLI 安装指定技能:
npx skills add nvidia/skills --skill digital-health-clinical-asr-eval --yes
README 未说明其他客户端的该技能专属安装路径;安装后,在 agent 下次加载技能并遇到相关任务时使用。
如何使用这个 Skill?
准备包含临床扩展字段且音频文件存在的 NeMo manifest.jsonl,并设置 NVIDIA_API_KEY。可向 agent 提示:"Score my ASR manifest at manifest.jsonl and generate the five-section KER leaderboard." 运行前应确认所选 NIM 和 resolved function-id;音频及参考文本会发送到 NVIDIA 外部服务,建议仅使用 Stage 2 生成的合成音频。没有 manifest 时,应先使用 digital-health-clinical-asr-build;ASR 认证、协议或模型目录问题不属于本技能范围。
这个 Skill 与同类方案有什么区别?
与 digital-health-clinical-asr-build 相比,本技能负责已有 manifest 的转录、评分和路由,而不是生成音频或构建基准数据。与 digital-health-clinical-asr-finetune 相比,本技能先评估 KER 并判断是否应微调。ASR 模型目录、认证、gRPC 协议和自托管 NIM 配置应转至 riva-asr 或相关技能。