临床 ASR 基准构建器
围绕临床术语生成带发音质量控制的 NeMo ASR 评测基准。
文档明确禁止传输PHI,披露术语和句子会发送至Merriam-Webster与NVCF,并要求用户确认敏感术语、避免硬编码密钥、使用TLS和用户自有目录;因此主要数据流风险可见。扣分原因是Read/Write/Bash权限较宽,缺少明确的回滚机制,MW密钥通过URL查询参数传输,且外部调用的逐次确认和失败后的数据清理不够具体。
关键流程、输入输出、预检和部分失败路径有说明,且包含固定类别、IPA来源和音频存在性检查。扣分原因是文档存在“two-tier”与实际三层流程、无需兄弟技能与又要求其可达之间的不一致;合成配方没有实现其宣称的重试/退避,部分引用文件和依赖可用性也未由测试验证。静态证据不足以支持超过10分。
触发短语、非适用场景、阶段边界、固定类别和英文限制写得较清楚,适合临床ASR基准构建。扣分原因是仅支持en-US,未提供中文或多语言路径;核心Magpie服务依赖NVCF,Merriam-Webster路径依赖外网,未证明在中国大陆网络环境中的可达性。
SKILL.md采用阶段化结构,包含先决条件、示例、产物、限制、故障排查、版本、作者、团队、许可证和前后续技能;引用文件提供了进一步细节。扣分原因是缺少明确的变更日志和长期维护/更新流程,license metadata为NOASSERTION而技能和仓库又声明Apache-2.0,且部分依赖说明和“内联配方”表述不完全一致。
目标产物、字段结构、QA闸门、Cartesian生成方式和Stage 3交接均明确,理论上能完成临床术语到NeMo manifest与音频的核心任务;静态可给到7分以内。扣分原因是输出依赖未在本文件中完整实现的外部服务和脚本,模板回退、重试、音频与manifest一致性的关键路径仍需人工或后续技能处理,直接可用性缺少静态之外的验证。
存在固定修订中的参考文件、manifest预检命令以及带日期的内部NVSkills-Eval报告,能支持有限审计。扣分原因是报告仅为内部摘要,没有提交测试套件、CI覆盖或可独立复现的第三方执行证据;若干关键性能和服务行为仍是文档声明。
- 不得将真实患者记录、真实ASR转录或任何PHI发送至外部API。
- 在执行Magpie或Merriam-Webster调用前确认组织数据治理、密钥管理和网络合规要求。
- 必须先完成QA音频人工试听并获得明确结论,或以明确文字记录跳过及其KER风险;不能用Stage 3结果事后抽查替代。
- 在中国大陆部署前验证grpc.nvcf.nvidia.com和Merriam-Webster端点的实际可达性,并准备本地或自托管替代方案。
- 应补充自动化测试、重试/退避实现、变更日志和明确的维护责任。
这个 Skill 能做什么,适合哪些场景?
这是 NVIDIA 临床 ASR Flywheel 的第 2 阶段技能,用于整理临床术语、生成上下文句子、标注 IPA 发音并合成评测音频。它会生成 NeMo 格式的 manifest.jsonl 及其引用的 WAV 文件,同时保留术语类别、IPA 来源、声音和噪声等临床扩展字段。流程覆盖术语访谈、句子生成、三级发音管线、人工试听和完整基准合成。它适合需要构建临床语音识别评测集、但尚未准备好音频与 manifest 的团队。
读取用户整理的临床术语,要求将其归入 drug、procedure、anatomy、condition、lab 或 role 六类;通过 Data Designer 或模板生成 dictation、handoff、chart_note、history 等上下文句子;按 override → Merriam-Webster → Magpie G2P 的顺序处理 IPA;通过 NVIDIA NVCF Magpie TTS 生成 QA 音频和完整笛卡尔积音频;写入 term_seed.csv、pronunciation_overrides.csv、manifest.jsonl 及 audio/*.wav。
- 临床听写团队希望评测肿瘤药物名称的识别错误时,使用它整理药物术语并生成合成语音基准。
- 医院语音项目需要覆盖 ICU 交接、病历记录或术后流程时,使用它为术语生成多种临床上下文。
- ASR 团队需要验证长尾医学词汇发音时,使用它比较人工 IPA 覆盖、Merriam-Webster 和 Magpie G2P。
- 已有周期基准需要追加新手术或解剖术语时,使用它仅合成新增术语的行并追加 manifest。
这个 Skill 有哪些优点和局限?
- 覆盖从术语整理到 NeMo manifest 和音频生成的完整构建流程。
- 通过固定六类实体和 ipa_source 字段支持后续 KER 分析。
- 包含人工试听闸门和可追加的 pronunciation_overrides.csv,便于控制发音质量。
- 支持 Merriam-Webster 与 Magpie G2P 的分层回退。
- 默认仅面向英语和 Magpie en-US 音素集。
- 依赖 NVIDIA NVCF Magpie TTS;Merriam-Webster 查询会将术语发送到外部服务。
- NVCF 在超过 100 行的任务中可能出现约 5–10% 的 RESOURCE_EXHAUSTED 丢行,需要重跑。
- 技能要求先完成 Stage 1,且提供的材料没有说明该单项技能的独立测试套件。
如何安装这个 Skill?
使用仓库 README 提供的 CLI 安装命令:npx skills add nvidia/skills --skill digital-health-clinical-asr-build --yes。也可以指定目标代理,例如:npx skills add nvidia/skills --skill digital-health-clinical-asr-build --agent codex --yes。仓库由上游产品仓库每日同步维护。
如何使用这个 Skill?
先完成 /digital-health-clinical-asr-setup,并准备 NVIDIA_API_KEY、工作目录及可用的 Magpie TTS;然后向代理提出例如“Build a clinical ASR benchmark for oncology drug names”或“Create a NeMo manifest from clinical terms”。技能会先询问专业方向和 ASR 失败模式,随后要求用户确认术语,进行句子生成、IPA 处理和 QA 合成。必须由用户明确试听 QA 音频并反馈,或明确记录跳过试听的风险,之后才进行完整合成。具体输出目录由用户选择,推荐使用 $EVAL_DIR/cycle<N>/。
这个 Skill 与同类方案有什么区别?
它是临床 ASR Flywheel 的构建阶段,不负责已有 manifest 的评分;评分应使用 /digital-health-clinical-asr-eval,环境准备使用 /digital-health-clinical-asr-setup,微调使用 /digital-health-clinical-asr-finetune。通用句子生成和 TTS 专项问题分别应转到 /data-designer 与 /read-aloud 或 /riva-tts。