RAGAS 检索增强生成评测
用本地语料和训练数据评估 RAG 检索与生成质量。
文档明确要求使用安全渠道保存 NVIDIA_API_KEY、避免提交密钥,并披露会访问 RAG、ingestor、向量数据库和评审模型端点;但允许 Bash、Write、Edit,且 force_ingestion/delete_collection 可删除集合,未要求执行前确认、权限隔离或明确回滚流程,因此扣分。
主流程、前置条件、CLI 参数和常见错误信号记录较完整,具备可诊断性;但本次静态材料没有关键路径执行证据或覆盖性测试,BENCHMARK 报告总体 FAIL,并指出重复内容和结构问题,因此不能超过静态上限且继续扣分。
用途、输入布局、输出文件和不适用场景定义清楚,触发词也较具体;但没有中文使用指导,且核心评估依赖可达的 RAG/ingestor 服务和 NVIDIA 评审 API,未说明中国大陆网络可达性或替代方案,因此扣分。
具备版本号、Apache-2.0 许可、作者、引用、分层 references、示例、限制和故障排查;但维护责任与更新路径主要依赖外部产品仓库,BENCHMARK 记录 unexpected files、深层引用和重复内容,且发布建议为先修复后重新评估,因此扣分。
技能明确覆盖数据准备、执行、质量调参、结果分析和错误分诊,理论上可完成核心任务;但材料未提供已验证的代表性可用输出,且 BENCHMARK 总体 FAIL、Tier 3 不可用,静态证据不足以证明实际收益,因此按保守静态标准低分。
提供源代码路径、OpenAPI schema 引用、CLI 文档和静态评估报告,具备有限审计线索;但没有关键路径测试结果、第三方执行证据或多源交叉验证,报告还显示 Tier 3 结果缺失,因此扣分。
- 执行前应对 Write/Edit、网络访问和删除集合操作进行最小权限配置,并在 force_ingestion 或 delete_collection 前取得用户确认。
- NVIDIA_API_KEY 会用于外部评审服务;应通过密钥管理器或未提交的环境文件注入,避免日志、历史记录和输出泄露。
- BENCHMARK 报告为 FAIL,并列出重复内容、深层引用及异常文件;发布前应修复并重新运行完整评估。
- 核心功能依赖 RAG、ingestor 和 NVIDIA API 端点;应先验证中国大陆网络可达性,并提供不可达时的离线或替代评审路径。
这个 Skill 能做什么,适合哪些场景?
rag-eval 面向 NVIDIA RAG Blueprint 的文件系统评测流程。它要求数据集目录包含 corpus/ 和 train.json,并运行 evaluate_rag.py 生成 RAGAS 评测结果。用户可以调整检索数量、重排、查询改写和生成参数,比较不同配置的质量。该技能不适用于生产监控、延迟或吞吐量测试,也不适用于脱离规定目录结构的评测。
指导代理准备 corpus/ 和 train.json,使用 uv 同步 scripts/eval 的依赖,并运行 scripts/eval/evaluate_rag.py。评测器连接 RAG 服务和 ingestor,读取数据集,生成 evaluation_data.json 及 rag_*_evaluation_summary.json 等 JSON 结果。它还指导代理检查 RAGAS 指标、调整 top_k、vdb_top_k、重排、查询改写和生成参数,并排查 API 密钥、网络、集合、上下文为空及 ingestor URL 错误。
- RAG 工程师需要用本地 PDF 或其他文档语料建立可重复的质量基准时。
- 评测人员需要比较不同 top_k、重排或查询改写配置的 RAGAS 分数时。
- 开发者需要检查 train.json 格式、数据摄取结果和生成上下文是否正常时。
- 运维或集成工程师需要定位 RAG、ingestor 或向量集合不匹配导致的评测失败时。
这个 Skill 有哪些优点和局限?
- 针对 corpus/ + train.json 文件系统契约,流程和错误信号说明具体。
- 支持通过检索、重排、查询改写和生成参数进行质量比较。
- 提供 RAGAS JSON 结果分析及常见网络、摄取和集合问题的排查路径。
- 明确区分质量评测与延迟、吞吐量和生产监控。
- 依赖已部署且可访问的 RAG 服务和 ingestor。
- 需要 NVIDIA_API_KEY,分数还受评测裁判模型可用性影响。
- 向量数据库和嵌入配置不能仅通过此 CLI 覆盖。
- 源材料未提供该技能独立测试套件或平台覆盖证据。
如何安装这个 Skill?
使用仓库 README 提供的安装方式:npx skills add nvidia/skills。CLI 会提示选择技能和安装位置;选择 rag-eval。也可以先用 npx skills add nvidia/skills --list 查看目录。源材料未提供仅安装 rag-eval 的无提示命令。
如何使用这个 Skill?
从 RAG Blueprint 仓库根目录运行:uv sync --project scripts/eval;然后执行 uv run --project scripts/eval python scripts/eval/evaluate_rag.py --dataset-paths /path/to/my_dataset --host localhost --port 8081。数据集目录必须包含 corpus/ 和 train.json;运行前准备 NVIDIA_API_KEY,并确保 RAG 服务和 ingestor 可访问。结果可用 python3 -m json.tool results/my_dataset/rag_my_dataset_evaluation_summary.json 查看。
这个 Skill 与同类方案有什么区别?
与 rag-perf 相比,rag-eval 用于 RAGAS 质量比较,而 rag-perf 用于延迟、吞吐量和负载测试;与 rag-blueprint 相比,rag-eval 不负责部署或修复服务。