GPUNetIO RDMA 写延迟基准技能
指导测量 CUDA 内核发起的 GPUNetIO RDMA WRITE 延迟与尾延迟。
技能明确限制范围,披露GPU/NIC、CUDA、DOCA及TCP/RDMA数据流,并要求可信OOB网络、句柄生命周期和硬件变更走安全策略;但缺少明确的用户确认点、权限最小化、回滚方案和敏感输出处理细则,且许可证信息与仓库元数据存在不一致,因此扣分。
文档提供了安装前置条件、构建/运行顺序、分层错误分类和失败后的路由,正常路径较清晰;但依赖未提供的伴随文件、真实DOCA硬件和安装环境,部分输出/迭代描述缺乏可复现细节,静态审查不能验证关键路径,因此受静态上限约束并扣分。
触发条件、受众、非适用范围以及GPUNetIO/GPI/CPU路径区分写得较清楚;但中文支持未体现,且部分建议依赖外部DOCA文档和特定硬件,尚无充分证据证明在中国大陆网络环境下文档可达,因此扣分。
信息架构、加载顺序、任务路由、限制和维护入口较完整;但缺少作者、稳定版本、变更日志和明确更新责任,SKILLCARD仍含TBD字段,BENCHMARK路径/仓库路径/许可证声明也有不一致,故扣分。
能够覆盖GPU发起RDMA WRITE延迟测量、统计口径、拓扑约束和调试决策,核心任务具有直接帮助;但它是薄加载器,不提供脚本、解析器或预期样例输出,且需要用户自行构建并在专用硬件上验证,结果仍需较多人工整理,因此扣分。
文件引用了common.h、meson.build、源代码布局和评测报告,提供了一定追溯线索;但关键伴随源文件不在本次证据中,评测数据集不可用,报告也不是独立可复现的CI/测试证据,因此只能给低分。
- 未执行任何命令;关键构建、运行、统计和错误路径均未得到独立复现。
- SKILL.md声明Apache-2.0,但SKILLCARD声明Apache 2.0 AND CC-BY-4.0,且输入许可证元数据为NOASSERTION,应在发布前统一。
- 评测报告缺少原始数据集和逐任务记录,不能把PASS或高百分比视为独立验证。
- 文档要求记录完整未脱敏stdout,但未明确处理可能包含主机、网络或环境敏感信息的规则。
- 需要确认外部DOCA文档在目标用户网络环境中的可达性,并补充中文触发和说明内容。
这个 Skill 能做什么,适合哪些场景?
该技能面向需要评估 GPU 内核发起 RDMA WRITE 延迟的开发者和性能工程师。它围绕 DOCA 的 `gpunetio_ib_write_lat` 客户端与服务端,指导构建、运行和解读 ping-pong 延迟测试。技能覆盖 GPU-NIC 配对、DOCA 与 CUDA 环境、half-iter/full-iter/CUDA-side usec 列,以及 median、p99 和 jitter。它适合建立特定 GPU、NIC 和软件环境下的可复现实测基线,但不替代完整应用的实时性分析。
指导代理检查 DOCA SDK、CUDA Toolkit、nvidia_peermem、GPU-NIC 拓扑和 pkg-config 依赖;使用 Meson 从 /opt/mellanox/doca/tools/gpunetio_ib_write_lat 构建 C/CUDA 客户端和服务端;运行两端的 RDMA WRITE ping-pong 测试;读取 half-iter、full-iter 和 CUDA-side usec 输出,并整理 median、p99 与 jitter;帮助比较 GPUNetIO、GPI 和 CPU 发起的 perftest。
- 实时控制回路开发者在两台配备 GPU 和 ConnectX 网卡的主机之间验证 GPU 发起 WRITE 的尾延迟是否满足截止时间。
- 平台运维人员调整 NUMA 绑定、GPU PCIe 位置、IB 设备、GID 或 NIC 固件后,重新建立延迟基线。
- 性能工程师需要记录某一 GPU-NIC 配对下的 median、p99、jitter、DOCA 版本和运行环境。
- 团队在 GPUNetIO、GPI 编程表面和 CPU 发起的 `perftest` 之间选择适合的运行时路径。
- CUDA 内核需要批量提交多个 WR,工程师评估批处理对 GPU 侧开销和延迟的影响。
这个 Skill 有哪些优点和局限?
- 范围明确,专门针对 CUDA 内核通过 doca-gpunetio 发起 RDMA WRITE 的延迟测量。
- 覆盖构建、单次 smoke 测试、批量评估、输出列语义和尾延迟分析。
- 强调记录 GPU、NIC、DOCA、CUDA 和部署环境,便于回归比较。
- 明确区分 GPUNetIO、GPI 和 CPU 发起的 `perftest`。
- 要求两端具备 GPU-NIC 配对、DOCA SDK、CUDA Toolkit 和 `nvidia_peermem`,环境门槛较高。
- 技能本身是指导材料,不附带脚本、解析器、绑定或独立 samples。
- 未提供固定参数字符串或预期延迟数值,必须依赖已安装二进制的 `--help` 和源码。
- 该基准只测 GPUNetIO WR 延迟,不能代表用户完整应用流水线的实时截止时间。
- 源材料未提供具体平台测试结果、测试套件或性能数字。
如何安装这个 Skill?
使用 NVIDIA/skills 集合中的 skills CLI 安装:npx skills add nvidia/skills --skill doca-gpunetio-ib-write-lat --yes。安装前需准备 SKILL.md 要求的 Linux、DOCA SDK、CUDA Toolkit、GPU、InfiniBand-capable ConnectX 或 BlueField RNIC,以及已加载的 nvidia_peermem。源材料未提供该技能的独立安装脚本或完整 DOCA 安装命令。
如何使用这个 Skill?
安装后,向代理提出例如“测量两台 H100 + ConnectX 主机之间的 GPUNetIO GPU-init RDMA WRITE 延迟,并分别报告 median、p99 和 jitter”。代理应先确认 GPU-NIC 配对和 DOCA/CUDA 环境,再按技能引用的 TASKS.md 执行 configure、build、run 和 test 流程。具体命令行参数应以目标安装版本二进制的 --help 和 main.c 注册内容为准。
这个 Skill 与同类方案有什么区别?
GPUNetIO 是本技能实际覆盖的基准运行时表面;GPI 是同一物理操作的另一种编程表面,但 doca/tools/ 不提供 GPI 版 ib_write_lat 基准二进制;经典 perftest ib_write_lat 测量的是 CPU 发起的 WRITE 延迟。另有 doca-gpunetio-ib-write-bw 技能用于带宽而非延迟。