数据与分析 ✓ NVIDIA · 官方 clinical-asrnemo-manifestipasynthetic-speechmagpie-ttspronunciation-qa

临床 ASR 基准构建器

围绕临床术语生成带发音质量控制的 NeMo ASR 评测基准。

FollowSkills 评估 · FSRS-2.0
不推荐
52/ 100 五分制 2.6 / 5
信任安全18 / 25 · 3.6/5

文档明确禁止传输PHI,披露术语和句子会发送至Merriam-Webster与NVCF,并要求用户确认敏感术语、避免硬编码密钥、使用TLS和用户自有目录;因此主要数据流风险可见。扣分原因是Read/Write/Bash权限较宽,缺少明确的回滚机制,MW密钥通过URL查询参数传输,且外部调用的逐次确认和失败后的数据清理不够具体。

可靠稳定7 / 20 · 1.8/5

关键流程、输入输出、预检和部分失败路径有说明,且包含固定类别、IPA来源和音频存在性检查。扣分原因是文档存在“two-tier”与实际三层流程、无需兄弟技能与又要求其可达之间的不一致;合成配方没有实现其宣称的重试/退避,部分引用文件和依赖可用性也未由测试验证。静态证据不足以支持超过10分。

适用触发8 / 15 · 2.7/5

触发短语、非适用场景、阶段边界、固定类别和英文限制写得较清楚,适合临床ASR基准构建。扣分原因是仅支持en-US,未提供中文或多语言路径;核心Magpie服务依赖NVCF,Merriam-Webster路径依赖外网,未证明在中国大陆网络环境中的可达性。

规范维护9 / 15 · 3.0/5

SKILL.md采用阶段化结构,包含先决条件、示例、产物、限制、故障排查、版本、作者、团队、许可证和前后续技能;引用文件提供了进一步细节。扣分原因是缺少明确的变更日志和长期维护/更新流程,license metadata为NOASSERTION而技能和仓库又声明Apache-2.0,且部分依赖说明和“内联配方”表述不完全一致。

有效结果6 / 15 · 2.0/5

目标产物、字段结构、QA闸门、Cartesian生成方式和Stage 3交接均明确,理论上能完成临床术语到NeMo manifest与音频的核心任务;静态可给到7分以内。扣分原因是输出依赖未在本文件中完整实现的外部服务和脚本,模板回退、重试、音频与manifest一致性的关键路径仍需人工或后续技能处理,直接可用性缺少静态之外的验证。

证据核验4 / 10 · 2.0/5

存在固定修订中的参考文件、manifest预检命令以及带日期的内部NVSkills-Eval报告,能支持有限审计。扣分原因是报告仅为内部摘要,没有提交测试套件、CI覆盖或可独立复现的第三方执行证据;若干关键性能和服务行为仍是文档声明。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 不得将真实患者记录、真实ASR转录或任何PHI发送至外部API。
  • 在执行Magpie或Merriam-Webster调用前确认组织数据治理、密钥管理和网络合规要求。
  • 必须先完成QA音频人工试听并获得明确结论,或以明确文字记录跳过及其KER风险;不能用Stage 3结果事后抽查替代。
  • 在中国大陆部署前验证grpc.nvcf.nvidia.com和Merriam-Webster端点的实际可达性,并准备本地或自托管替代方案。
  • 应补充自动化测试、重试/退避实现、变更日志和明确的维护责任。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

这是 NVIDIA 临床 ASR Flywheel 的第 2 阶段技能,用于整理临床术语、生成上下文句子、标注 IPA 发音并合成评测音频。它会生成 NeMo 格式的 manifest.jsonl 及其引用的 WAV 文件,同时保留术语类别、IPA 来源、声音和噪声等临床扩展字段。流程覆盖术语访谈、句子生成、三级发音管线、人工试听和完整基准合成。它适合需要构建临床语音识别评测集、但尚未准备好音频与 manifest 的团队。

读取用户整理的临床术语,要求将其归入 drug、procedure、anatomy、condition、lab 或 role 六类;通过 Data Designer 或模板生成 dictation、handoff、chart_note、history 等上下文句子;按 override → Merriam-Webster → Magpie G2P 的顺序处理 IPA;通过 NVIDIA NVCF Magpie TTS 生成 QA 音频和完整笛卡尔积音频;写入 term_seed.csv、pronunciation_overrides.csv、manifest.jsonl 及 audio/*.wav。

  1. 临床听写团队希望评测肿瘤药物名称的识别错误时,使用它整理药物术语并生成合成语音基准。
  2. 医院语音项目需要覆盖 ICU 交接、病历记录或术后流程时,使用它为术语生成多种临床上下文。
  3. ASR 团队需要验证长尾医学词汇发音时,使用它比较人工 IPA 覆盖、Merriam-Webster 和 Magpie G2P。
  4. 已有周期基准需要追加新手术或解剖术语时,使用它仅合成新增术语的行并追加 manifest。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖从术语整理到 NeMo manifest 和音频生成的完整构建流程。
  • 通过固定六类实体和 ipa_source 字段支持后续 KER 分析。
  • 包含人工试听闸门和可追加的 pronunciation_overrides.csv,便于控制发音质量。
  • 支持 Merriam-Webster 与 Magpie G2P 的分层回退。
局限
  • 默认仅面向英语和 Magpie en-US 音素集。
  • 依赖 NVIDIA NVCF Magpie TTS;Merriam-Webster 查询会将术语发送到外部服务。
  • NVCF 在超过 100 行的任务中可能出现约 5–10% 的 RESOURCE_EXHAUSTED 丢行,需要重跑。
  • 技能要求先完成 Stage 1,且提供的材料没有说明该单项技能的独立测试套件。

如何安装这个 Skill?

使用仓库 README 提供的 CLI 安装命令:npx skills add nvidia/skills --skill digital-health-clinical-asr-build --yes。也可以指定目标代理,例如:npx skills add nvidia/skills --skill digital-health-clinical-asr-build --agent codex --yes。仓库由上游产品仓库每日同步维护。

如何使用这个 Skill?

先完成 /digital-health-clinical-asr-setup,并准备 NVIDIA_API_KEY、工作目录及可用的 Magpie TTS;然后向代理提出例如“Build a clinical ASR benchmark for oncology drug names”或“Create a NeMo manifest from clinical terms”。技能会先询问专业方向和 ASR 失败模式,随后要求用户确认术语,进行句子生成、IPA 处理和 QA 合成。必须由用户明确试听 QA 音频并反馈,或明确记录跳过试听的风险,之后才进行完整合成。具体输出目录由用户选择,推荐使用 $EVAL_DIR/cycle<N>/。

这个 Skill 与同类方案有什么区别?

它是临床 ASR Flywheel 的构建阶段,不负责已有 manifest 的评分;评分应使用 /digital-health-clinical-asr-eval,环境准备使用 /digital-health-clinical-asr-setup,微调使用 /digital-health-clinical-asr-finetune。通用句子生成和 TTS 专项问题分别应转到 /data-designer 与 /read-aloud 或 /riva-tts。

常见问题

是否会把数据发送到外部服务?
会。术语可发送到 Merriam-Webster,生成的临床句子会发送到 NVIDIA NVCF Magpie TTS。只能使用非 PHI 合成内容,并应先确认组织的数据治理政策。
必须使用 Merriam-Webster API 吗?
不必须。可以使用 dictionaryapi.com API、Merriam-Webster 公共网站,或跳过查询并让 Magpie G2P 回退处理;后者对长尾术语的覆盖较弱。
可以跳过人工试听吗?
可以,但必须在对话中明确选择跳过并记录周期级风险说明;否则不能进入完整笛卡尔积合成。
输出是什么?
主要输出是 term_seed.csv、pronunciation_overrides.csv、NeMo 格式的 manifest.jsonl,以及 manifest 引用的 audio/*.wav 文件。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

临床 ASR 评测与 KER 排行榜

评测临床语音识别清单并定位术语识别问题。

开发与工程 ✓ NVIDIA · 官方

临床语音识别飞轮:环境初始化

验证临床 ASR 评测环境能否通过 NVIDIA 托管语音服务完成 TTS 到 ASR 的闭环。

数据与分析 ✓ NVIDIA · 官方

临床语音识别微调

用 NeMo 对 Parakeet TDT v2 进行临床词汇微调,并以离线 KER 评估闭环效果。

数据与分析 ✓ NVIDIA · 官方

Nemotron Speech ASR 定制编排

为特定领域或语言的语音识别改进选择并编排成本最低的适配路径。

自动化与运维 ✓ NVIDIA · 官方

Nemotron Speech 语音 NIM 技能

指导部署和运行 NVIDIA Riva 的语音识别、语音合成与翻译 NIM。

数据与分析 ✓ NVIDIA · 官方

NeMo 数据设计器合成数据技能

用 NeMo Data Designer 构建符合描述的合成数据集与数据生成流水线。

数据与分析 ✓ NVIDIA · 官方

Data Designer 合成数据技能

用 Data Designer 构建符合描述的合成数据集与生成流水线。

开发与工程 ✓ NVIDIA · 官方

NeMo Relay 安装助手

为 CLI、语言包和主流框架选择并验证 NeMo Relay 安装路径。

开发与工程 ✓ NVIDIA · 官方

NeMo Relay 快速上手

帮助首次使用 NeMo Relay 的用户通过最小试验验证可观测执行价值。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 模型接入指南

指导开发者将新的 LLM、MoE 或 VLM 架构接入 NeMo AutoModel。

开发与工程 ✓ NVIDIA · 官方

NeMo Relay 插件构建指南

帮助将可复用的 NeMo Relay 运行时行为封装为可配置插件。

自动化与运维 ✓ NVIDIA · 官方

NeMo Relay 可观测性插件

为 NeMo Relay 选择并配置事件与追踪导出。

开发与工程 ✓ NVIDIA · 官方

Jetson BSP 源码构建

根据 Jetson BSP 源码变更重建设备树、内核和模块,并生成可部署清单。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 分布式训练配置

为 NeMo AutoModel 选择并配置多 GPU 与多节点训练策略。

开发与工程 ✓ NVIDIA · 官方

NeMo Evaluator 评估插件技能

帮助代理通过 NeMo CLI 与 Python SDK 执行并管理模型评估。

写作与内容 ✓ NVIDIA · 官方

NeMo-RL 文档规范

帮助 NeMo-RL 项目按统一规范编写和维护文档。

开发与工程 ✓ NVIDIA · 官方

NeMo Relay 迁移助手

将 NeMo Flow 项目安全地迁移为 NeMo Relay。

开发与工程 ✓ NVIDIA · 官方

NeMo Relay 自适应调优

基于运行时信号,以可测量方式调优 NeMo Relay 插件行为。

数据与分析 ✓ NVIDIA · 官方

NV-Generate-MR

通过 NVIDIA 的 rflow-mr 流程生成合成体部 MRI 影像体积。

开发与工程 ✓ NVIDIA · 官方

NeMo Relay 运行时集成调试

定位 NeMo Relay 已安装但运行时行为异常的应用集成问题。

相关 Skills