数据与分析 ✓ NVIDIA · 官方 rag-evaluationragasretrieval-augmented-generationpythonfastapibenchmarkingcorpus-datasets

RAGAS 检索增强生成评测

用本地语料和训练数据评估 RAG 检索与生成质量。

FollowSkills 评估 · FSRS-2.0
不推荐
45/ 100 五分制 2.3 / 5
信任安全12 / 25 · 2.4/5

文档明确要求使用安全渠道保存 NVIDIA_API_KEY、避免提交密钥,并披露会访问 RAG、ingestor、向量数据库和评审模型端点;但允许 Bash、Write、Edit,且 force_ingestion/delete_collection 可删除集合,未要求执行前确认、权限隔离或明确回滚流程,因此扣分。

可靠稳定8 / 20 · 2.0/5

主流程、前置条件、CLI 参数和常见错误信号记录较完整,具备可诊断性;但本次静态材料没有关键路径执行证据或覆盖性测试,BENCHMARK 报告总体 FAIL,并指出重复内容和结构问题,因此不能超过静态上限且继续扣分。

适用触发9 / 15 · 3.0/5

用途、输入布局、输出文件和不适用场景定义清楚,触发词也较具体;但没有中文使用指导,且核心评估依赖可达的 RAG/ingestor 服务和 NVIDIA 评审 API,未说明中国大陆网络可达性或替代方案,因此扣分。

规范维护9 / 15 · 3.0/5

具备版本号、Apache-2.0 许可、作者、引用、分层 references、示例、限制和故障排查;但维护责任与更新路径主要依赖外部产品仓库,BENCHMARK 记录 unexpected files、深层引用和重复内容,且发布建议为先修复后重新评估,因此扣分。

有效结果4 / 15 · 1.3/5

技能明确覆盖数据准备、执行、质量调参、结果分析和错误分诊,理论上可完成核心任务;但材料未提供已验证的代表性可用输出,且 BENCHMARK 总体 FAIL、Tier 3 不可用,静态证据不足以证明实际收益,因此按保守静态标准低分。

证据核验3 / 10 · 1.5/5

提供源代码路径、OpenAPI schema 引用、CLI 文档和静态评估报告,具备有限审计线索;但没有关键路径测试结果、第三方执行证据或多源交叉验证,报告还显示 Tier 3 结果缺失,因此扣分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
使用前请注意
  • 执行前应对 Write/Edit、网络访问和删除集合操作进行最小权限配置,并在 force_ingestion 或 delete_collection 前取得用户确认。
  • NVIDIA_API_KEY 会用于外部评审服务;应通过密钥管理器或未提交的环境文件注入,避免日志、历史记录和输出泄露。
  • BENCHMARK 报告为 FAIL,并列出重复内容、深层引用及异常文件;发布前应修复并重新运行完整评估。
  • 核心功能依赖 RAG、ingestor 和 NVIDIA API 端点;应先验证中国大陆网络可达性,并提供不可达时的离线或替代评审路径。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

rag-eval 面向 NVIDIA RAG Blueprint 的文件系统评测流程。它要求数据集目录包含 corpus/ 和 train.json,并运行 evaluate_rag.py 生成 RAGAS 评测结果。用户可以调整检索数量、重排、查询改写和生成参数,比较不同配置的质量。该技能不适用于生产监控、延迟或吞吐量测试,也不适用于脱离规定目录结构的评测。

指导代理准备 corpus/ 和 train.json,使用 uv 同步 scripts/eval 的依赖,并运行 scripts/eval/evaluate_rag.py。评测器连接 RAG 服务和 ingestor,读取数据集,生成 evaluation_data.json 及 rag_*_evaluation_summary.json 等 JSON 结果。它还指导代理检查 RAGAS 指标、调整 top_k、vdb_top_k、重排、查询改写和生成参数,并排查 API 密钥、网络、集合、上下文为空及 ingestor URL 错误。

  1. RAG 工程师需要用本地 PDF 或其他文档语料建立可重复的质量基准时。
  2. 评测人员需要比较不同 top_k、重排或查询改写配置的 RAGAS 分数时。
  3. 开发者需要检查 train.json 格式、数据摄取结果和生成上下文是否正常时。
  4. 运维或集成工程师需要定位 RAG、ingestor 或向量集合不匹配导致的评测失败时。

这个 Skill 有哪些优点和局限?

优点
  • 针对 corpus/ + train.json 文件系统契约,流程和错误信号说明具体。
  • 支持通过检索、重排、查询改写和生成参数进行质量比较。
  • 提供 RAGAS JSON 结果分析及常见网络、摄取和集合问题的排查路径。
  • 明确区分质量评测与延迟、吞吐量和生产监控。
局限
  • 依赖已部署且可访问的 RAG 服务和 ingestor。
  • 需要 NVIDIA_API_KEY,分数还受评测裁判模型可用性影响。
  • 向量数据库和嵌入配置不能仅通过此 CLI 覆盖。
  • 源材料未提供该技能独立测试套件或平台覆盖证据。

如何安装这个 Skill?

使用仓库 README 提供的安装方式:npx skills add nvidia/skills。CLI 会提示选择技能和安装位置;选择 rag-eval。也可以先用 npx skills add nvidia/skills --list 查看目录。源材料未提供仅安装 rag-eval 的无提示命令。

如何使用这个 Skill?

从 RAG Blueprint 仓库根目录运行:uv sync --project scripts/eval;然后执行 uv run --project scripts/eval python scripts/eval/evaluate_rag.py --dataset-paths /path/to/my_dataset --host localhost --port 8081。数据集目录必须包含 corpus/ 和 train.json;运行前准备 NVIDIA_API_KEY,并确保 RAG 服务和 ingestor 可访问。结果可用 python3 -m json.tool results/my_dataset/rag_my_dataset_evaluation_summary.json 查看。

这个 Skill 与同类方案有什么区别?

与 rag-perf 相比,rag-eval 用于 RAGAS 质量比较,而 rag-perf 用于延迟、吞吐量和负载测试;与 rag-blueprint 相比,rag-eval 不负责部署或修复服务。

常见问题

它能评估任意 RAG API 吗?
不能。它固定使用 corpus/、train.json 和 evaluate_rag.py 的文件系统契约;源材料明确排除不符合该布局的 API 评测。
运行时需要哪些外部条件?
需要 Python 3.11+、uv、可访问的 RAG 服务和 ingestor,以及用于 RAGAS 的 NVIDIA_API_KEY。
为什么评测结果中的上下文为空?
应检查集合、摄取状态、top_k/vdb_top_k,以及不带 /v1 后缀的 ingestor_server_url;旧集合还可能因未使用 force_ingestion 而保留。
它适合生产监控或性能压测吗?
不适合。该技能明确不用于生产监控、延迟、吞吐量或负载测试。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

NeMo 数据设计器合成数据技能

用 NeMo Data Designer 构建符合描述的合成数据集与数据生成流水线。

数据与分析 ✓ NVIDIA · 官方

Data Designer 合成数据技能

用 Data Designer 构建符合描述的合成数据集与生成流水线。

自动化与运维 ✓ NVIDIA · 官方

NVIDIA RAG Blueprint 运维技能

帮助代理部署、配置、排障和管理 NVIDIA RAG Blueprint。

开发与工程 ✓ NVIDIA · 官方

NeMo Relay 安装助手

为 CLI、语言包和主流框架选择并验证 NeMo Relay 安装路径。

开发与工程 ✓ NVIDIA · 官方

NeMo Relay 快速上手

帮助首次使用 NeMo Relay 的用户通过最小试验验证可观测执行价值。

数据与分析 ✓ NVIDIA · 官方

DICOM 序列预检

在转换或推理前快速验证单个 DICOM 序列目录。

开发与工程 ✓ NVIDIA · 官方

DALI 动态模式开发助手

帮助 AI 代理编写、审查和迁移 NVIDIA DALI 命令式动态模式代码。

开发与工程 ✓ NVIDIA · 官方

NeMo Relay 迁移助手

将 NeMo Flow 项目安全地迁移为 NeMo Relay。

开发与工程 ✓ NVIDIA · 官方

Earth2Studio 诊断模型构建器

为 Earth2Studio 创建单步数据转换诊断模型包装器。

数据与分析 ✓ NVIDIA · 官方

Earth2Studio 气象数据获取

按变量和时间从 Earth2Studio 数据源获取气象与气候数据。

数据与分析 ✓ NVIDIA · 官方

NVIDIA AI-Q 深度研究

通过本地 AI-Q Blueprint 后端执行可追踪的深度研究。

开发与工程 ✓ NVIDIA · 官方

AMC 样例数据集校准

用 NVIDIA AutoMagicCalib 的内置样例数据端到端验证正在运行的校准服务。

开发与工程 ✓ NVIDIA · 官方

Holoscan SDK 安装向导

根据主机环境选择并引导完成 Holoscan SDK 的合适安装方式。

开发与工程 ✓ NVIDIA · 官方

NeMo Relay 类型包装器与编解码器

为 NeMo Relay 集成提供类型安全边界,同时保持 JSON 中间件语义和调用方行为稳定。

开发与工程 ✓ NVIDIA · 官方

Omniverse 实时查看器

为 USD 查看器应用选择实现路径,并指导渲染、交互、界面与验证流程。

开发与工程 ✓ NVIDIA · 官方

CUDA-Q 量子入门指南

帮助开发者安装 CUDA-Q、编写量子内核,并使用 GPU 模拟器或真实 QPU。

开发与工程 ✓ NVIDIA · 官方

临床语音识别飞轮:环境初始化

验证临床 ASR 评测环境能否通过 NVIDIA 托管语音服务完成 TTS 到 ASR 的闭环。

数据与分析 ✓ NVIDIA · 官方

TAO DAFT 数据集格式转换

帮助 AI 代理使用 tao-daft 在受支持的 DAFT 格式之间转换数据集。

开发与工程 ✓ NVIDIA · 官方

AutoMagicCalib 视频标定

通过 REST API 将本地多摄像头 MP4 视频转换为 AutoMagicCalib 标定结果。

数据与分析 ✓ NVIDIA · 官方

DICOM CT 到 NIfTI 体数据转换

将单个 CT DICOM 序列转换为带仿射证据的 HU NIfTI 体数据。

相关 Skills