NeMo Evaluator 评估插件技能
帮助代理通过 NeMo CLI 与 Python SDK 执行并管理模型评估。
文档声明不要将秘密打印到 stdout,并区分本地环境变量与远程平台秘密;但示例包含提交持久化作业、创建平台秘密和调用远程模型的外部副作用,未要求明确用户确认、最小权限说明、数据流与回滚方案,因此扣分。
CLI、SDK、spec 示例和故意失败数据覆盖了主要路径,且提供超时、重试和失败反馈参数;但前置环境、仓库目录、依赖版本和当前 schema 依赖未完整固定,静态审查无法复现,按上限保守扣分。
名称、目标用户场景、CLI/SDK、指标、数据集和在线/离线模式较清楚;但触发边界、非适用场景和输入错误处理不足,且 LLM judge 依赖 NVIDIA 海外端点,未说明中国大陆网络可达性,因此扣分。
SKILL.md 有较好的分层、交叉引用、资产示例、安全提示、owner、maturity 和 Apache-2.0 元数据;但缺少 author/tags、版本与 changelog、维护更新路径、系统化 FAQ,引用层级偏深,基准还记录了脚本表格和 run_script 文档缺口。
内容直接提供 evaluator CLI、SDK、spec 文件和作业结果下载命令,能覆盖评估核心任务;但示例依赖现有 NeMo Platform 环境,部分结果依赖远程服务,缺乏静态可验证的端到端输出和替代方案比较,按静态上限计分。
存在提交的 SDK smoke example、spec、故意失败样例、evals.json 以及 BENCHMARK.md 中的外部评估摘要;但本审查未执行,关键路径测试覆盖有限,基准为单任务且缺少可独立核验的测试套件细节,因此不超过静态上限。
- 执行前确认当前工作目录、虚拟环境、NeMo Platform 服务和 CLI schema 版本;文档没有提供完整依赖锁定。
- 远程 submit 会创建持久化作业,LLM judge 会向 NVIDIA 端点发送评估数据;使用前应确认用户授权、数据敏感性、网络可达性和秘密映射。
- 不要把本地环境变量名直接用于远程作业;应先验证平台秘密,并为失败作业准备人工清理或停止流程。
这个 Skill 能做什么,适合哪些场景?
该技能面向 NeMo Platform 的 Evaluator 插件,指导代理使用 `nemo evaluator` CLI 和 NeMoPlatform Python SDK 执行评估任务。它覆盖指标类型查询、评估规格配置、即时评估运行以及持久化评估作业。评估规格可以包含指标、内联数据集或平台 FilesetRef、可选执行参数和模型或代理目标。使用前需要在 Nvidia-NeMo/nemo-platform 仓库根目录激活 Python 虚拟环境,并连接正在运行的 NeMo Platform 服务器。
指导代理检查插件状态,列出或查看指标模式,解释当前插件输入模式,读取或生成评估规格示例,并通过 nemo evaluator evaluate run 执行评估。它还指导使用 evaluate submit 创建持久化作业,通过 nemo jobs 查询状态、获取作业信息、列出结果并下载聚合分数和逐行分数。Python SDK 部分展示如何通过 NeMoPlatform 实例的 evaluator 客户端检查插件状态。技能同时要求不要将密钥打印到标准输出。
- NeMo Platform 开发者需要确认 Evaluator 插件是否正常运行时,使用 CLI 检查插件状态。
- 评估工程师需要发现可用指标或查看某个指标的 schema 时,查询 metric types。
- 模型开发者已有数据和指标规格,需要运行 exact-match 或 LLM-Judge 评估时,使用规格文件启动评估。
- 需要异步或可持久化执行评估的团队,提交作业并下载聚合分数与逐行分数。
- Python 集成开发者需要从 NeMoPlatform 客户端检查 Evaluator 插件状态时,参考 SDK 用法。
这个 Skill 有哪些优点和局限?
- 覆盖 CLI 指标查询、评估运行、持久化作业和结果下载的完整操作链。
- 同时提供 NeMo Platform Python SDK 的插件状态检查示例。
- 明确以 `nemo evaluator` 为新指导目标,并提供 exact-match、benchmark 和 LLM-Judge 规格示例。
- 包含避免将密钥输出到日志的安全提示。
- 依赖正在运行的 NeMo Platform 服务器,技能本身不提供服务器部署步骤。
- 命令假设当前工作目录是 Nvidia-NeMo/nemo-platform 仓库根目录,并且已有 `.venv`。
- 源材料没有提供独立测试结果、支持的平台矩阵或失败恢复保证。
- 指标 bundle 含序列化 payload,因此内联 shell JSON 不适合作为首选输入。
如何安装这个 Skill?
使用仓库 README 中的 skills CLI 安装单个技能:npx skills add nvidia/skills --skill nemo-evaluator-plugin --yes。也可以指定 Codex 安装:npx skills add nvidia/skills --skill nemo-evaluator-plugin --agent codex --yes。源材料未说明该技能的独立软件包安装方式;安装后,代理在加载技能并遇到相关任务时使用它。
如何使用这个 Skill?
在 Nvidia-NeMo/nemo-platform 仓库根目录执行 source .venv/bin/activate。检查插件:nemo evaluator info;查看指标:nemo evaluator metric-types;查看特定指标 schema:nemo evaluator metric-types <metric-name>;运行规格文件:nemo evaluator evaluate run --spec-file skills/nemo-evaluator-plugin/assets/specs/exact_match_metric.json。需要持久化作业时使用 nemo evaluator evaluate submit --spec-file skills/nemo-evaluator-plugin/assets/specs/exact_match_metric.json,然后用 nemo jobs get-status <job-name> 和 nemo jobs results download aggregate-scores --job <job-name> --output-file aggregate-scores.json 获取结果。Python 示例使用 NeMoPlatform(base_url="http://localhost:8080"),再调用 platform_client.evaluator.plugin_status()。
这个 Skill 与同类方案有什么区别?
与旧的生成式 nemo evaluation API 命令组相比,该技能明确将插件 CLI nemo evaluator 作为新指导的目标界面;旧命令组不是新指导的目标。