开发与工程 ✓ NVIDIA · 官方 rdmagpunetiocudainfiniBandlatency-benchmarkperformance-engineering

GPUNetIO RDMA 写延迟基准技能

指导测量 CUDA 内核发起的 GPUNetIO RDMA WRITE 延迟与尾延迟。

FollowSkills 评估 · FSRS-2.0
不推荐
52/ 100 五分制 2.6 / 5
信任安全16 / 25 · 3.2/5

技能明确限制范围,披露GPU/NIC、CUDA、DOCA及TCP/RDMA数据流,并要求可信OOB网络、句柄生命周期和硬件变更走安全策略;但缺少明确的用户确认点、权限最小化、回滚方案和敏感输出处理细则,且许可证信息与仓库元数据存在不一致,因此扣分。

可靠稳定8 / 20 · 2.0/5

文档提供了安装前置条件、构建/运行顺序、分层错误分类和失败后的路由,正常路径较清晰;但依赖未提供的伴随文件、真实DOCA硬件和安装环境,部分输出/迭代描述缺乏可复现细节,静态审查不能验证关键路径,因此受静态上限约束并扣分。

适用触发11 / 15 · 3.7/5

触发条件、受众、非适用范围以及GPUNetIO/GPI/CPU路径区分写得较清楚;但中文支持未体现,且部分建议依赖外部DOCA文档和特定硬件,尚无充分证据证明在中国大陆网络环境下文档可达,因此扣分。

规范维护8 / 15 · 2.7/5

信息架构、加载顺序、任务路由、限制和维护入口较完整;但缺少作者、稳定版本、变更日志和明确更新责任,SKILLCARD仍含TBD字段,BENCHMARK路径/仓库路径/许可证声明也有不一致,故扣分。

有效结果6 / 15 · 2.0/5

能够覆盖GPU发起RDMA WRITE延迟测量、统计口径、拓扑约束和调试决策,核心任务具有直接帮助;但它是薄加载器,不提供脚本、解析器或预期样例输出,且需要用户自行构建并在专用硬件上验证,结果仍需较多人工整理,因此扣分。

证据核验3 / 10 · 1.5/5

文件引用了common.h、meson.build、源代码布局和评测报告,提供了一定追溯线索;但关键伴随源文件不在本次证据中,评测数据集不可用,报告也不是独立可复现的CI/测试证据,因此只能给低分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 未执行任何命令;关键构建、运行、统计和错误路径均未得到独立复现。
  • SKILL.md声明Apache-2.0,但SKILLCARD声明Apache 2.0 AND CC-BY-4.0,且输入许可证元数据为NOASSERTION,应在发布前统一。
  • 评测报告缺少原始数据集和逐任务记录,不能把PASS或高百分比视为独立验证。
  • 文档要求记录完整未脱敏stdout,但未明确处理可能包含主机、网络或环境敏感信息的规则。
  • 需要确认外部DOCA文档在目标用户网络环境中的可达性,并补充中文触发和说明内容。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向需要评估 GPU 内核发起 RDMA WRITE 延迟的开发者和性能工程师。它围绕 DOCA 的 `gpunetio_ib_write_lat` 客户端与服务端,指导构建、运行和解读 ping-pong 延迟测试。技能覆盖 GPU-NIC 配对、DOCA 与 CUDA 环境、half-iter/full-iter/CUDA-side usec 列,以及 median、p99 和 jitter。它适合建立特定 GPU、NIC 和软件环境下的可复现实测基线,但不替代完整应用的实时性分析。

指导代理检查 DOCA SDK、CUDA Toolkit、nvidia_peermem、GPU-NIC 拓扑和 pkg-config 依赖;使用 Meson 从 /opt/mellanox/doca/tools/gpunetio_ib_write_lat 构建 C/CUDA 客户端和服务端;运行两端的 RDMA WRITE ping-pong 测试;读取 half-iter、full-iter 和 CUDA-side usec 输出,并整理 median、p99 与 jitter;帮助比较 GPUNetIO、GPI 和 CPU 发起的 perftest

  1. 实时控制回路开发者在两台配备 GPU 和 ConnectX 网卡的主机之间验证 GPU 发起 WRITE 的尾延迟是否满足截止时间。
  2. 平台运维人员调整 NUMA 绑定、GPU PCIe 位置、IB 设备、GID 或 NIC 固件后,重新建立延迟基线。
  3. 性能工程师需要记录某一 GPU-NIC 配对下的 median、p99、jitter、DOCA 版本和运行环境。
  4. 团队在 GPUNetIO、GPI 编程表面和 CPU 发起的 `perftest` 之间选择适合的运行时路径。
  5. CUDA 内核需要批量提交多个 WR,工程师评估批处理对 GPU 侧开销和延迟的影响。

这个 Skill 有哪些优点和局限?

优点
  • 范围明确,专门针对 CUDA 内核通过 doca-gpunetio 发起 RDMA WRITE 的延迟测量。
  • 覆盖构建、单次 smoke 测试、批量评估、输出列语义和尾延迟分析。
  • 强调记录 GPU、NIC、DOCA、CUDA 和部署环境,便于回归比较。
  • 明确区分 GPUNetIO、GPI 和 CPU 发起的 `perftest`。
局限
  • 要求两端具备 GPU-NIC 配对、DOCA SDK、CUDA Toolkit 和 `nvidia_peermem`,环境门槛较高。
  • 技能本身是指导材料,不附带脚本、解析器、绑定或独立 samples。
  • 未提供固定参数字符串或预期延迟数值,必须依赖已安装二进制的 `--help` 和源码。
  • 该基准只测 GPUNetIO WR 延迟,不能代表用户完整应用流水线的实时截止时间。
  • 源材料未提供具体平台测试结果、测试套件或性能数字。

如何安装这个 Skill?

使用 NVIDIA/skills 集合中的 skills CLI 安装:npx skills add nvidia/skills --skill doca-gpunetio-ib-write-lat --yes。安装前需准备 SKILL.md 要求的 Linux、DOCA SDK、CUDA Toolkit、GPU、InfiniBand-capable ConnectX 或 BlueField RNIC,以及已加载的 nvidia_peermem。源材料未提供该技能的独立安装脚本或完整 DOCA 安装命令。

如何使用这个 Skill?

安装后,向代理提出例如“测量两台 H100 + ConnectX 主机之间的 GPUNetIO GPU-init RDMA WRITE 延迟,并分别报告 median、p99 和 jitter”。代理应先确认 GPU-NIC 配对和 DOCA/CUDA 环境,再按技能引用的 TASKS.md 执行 configure、build、run 和 test 流程。具体命令行参数应以目标安装版本二进制的 --helpmain.c 注册内容为准。

这个 Skill 与同类方案有什么区别?

GPUNetIO 是本技能实际覆盖的基准运行时表面;GPI 是同一物理操作的另一种编程表面,但 doca/tools/ 不提供 GPI 版 ib_write_lat 基准二进制;经典 perftest ib_write_lat 测量的是 CPU 发起的 WRITE 延迟。另有 doca-gpunetio-ib-write-bw 技能用于带宽而非延迟。

常见问题

这个技能是否包含 DOCA 的安装?
不包含。它假设 DOCA 已安装在 `/opt/mellanox/doca`,并建议安装问题转交 DOCA setup 类技能。
运行时需要哪些权限和网络条件?
需要客户端与服务端主机、GPU-NIC 配对和 OOB TCP socket;技能还假设操作者拥有绑定 `doca_dev`、`doca_gpu` 和 OOB TCP socket 所需的权限。
应该引用 median 还是 p99?
实时控制回路应结合截止时间查看 p99 和 jitter;median 反映典型延迟,不能单独代表尾延迟风险。
使用这个技能是否有费用?
源材料没有提供定价或许可费用信息;技能文件标注 Apache-2.0,仓库 README 说明集合采用 Apache 2.0 与 CC BY 4.0 双许可证。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

DOCA GPUNetIO WRITE 带宽基准技能

帮助开发者构建、运行并解读由 CUDA 内核发起的 GPUNetIO RDMA WRITE 持续带宽基准。

开发与工程 ✓ NVIDIA · 官方

DOCA GPI GPU 直驱 RDMA 技能

指导 CUDA 内核绕过主机 CPU,直接从 GPU 内存驱动 RDMA 队列。

开发与工程 ✓ NVIDIA · 官方

DOCA Bench 扩展开发技能

帮助工程师为 doca-bench 构建、加载并调试自定义基准测试插件。

开发与工程 ✓ NVIDIA · 官方

DOCA GPUNetIO 开发技能

指导开发者将 NVIDIA GPU 上的 CUDA 内核连接到 DOCA 网络队列,实现 GPU 侧收发包与调试。

自动化与运维 ✓ NVIDIA · 官方

DOCA Bench 性能基准技能

在真实 NVIDIA 网络设备上,以可复现方式测量 DOCA 库的吞吐、延迟和带宽。

开发与工程 ✓ NVIDIA · 官方

CuTile 自动调优指南

为 CuTile GPU 内核设计、实现并验证低开销的自动调优流程。

开发与工程 ✓ NVIDIA · 官方

TileGym cuTile 内核性能优化

通过剖析、瓶颈诊断和逐项调优,系统降低 TileGym cuTile GPU 内核延迟。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

数据与分析 ✓ NVIDIA · 官方

NV-Segment-CT 医学影像分割技能

在 CT NIfTI 体数据上运行 VISTA3D 分割,并生成可核验的标签图证据。

数据与分析 ✓ NVIDIA · 官方

NV-Segment-CT 微调

为 CT NIfTI 标注执行 NV-Segment-CT VISTA3D 微调。

开发与工程 ✓ NVIDIA · 官方

cuPyNumeric 迁移就绪度评估

在投入大规模移植工作前,判断 NumPy 代码能否在 GPU 和多 GPU 环境中有效扩展。

开发与工程 ✓ NVIDIA · 官方

DOCA RDMA Initiator

指导在DPA上开发由加速器发起的单边RDMA应用。

数据与分析 ✓ NVIDIA · 官方

NV-Generate-MR

通过 NVIDIA 的 rflow-mr 流程生成合成体部 MRI 影像体积。

开发与工程 ✓ NVIDIA · 官方

DOCA Verbs 原始 RDMA 控制技能

为确需底层 verbs 控制的 DOCA 开发者提供路由、移植与调试指导。

自动化与运维 ✓ NVIDIA · 官方

Jetson 软件包与环境助手

为 Jetson 选择匹配架构的容器与 GPU 软件包。

数据与分析 ✓ NVIDIA · 官方

NV-Generate-CT 合成 CT 生成

通过 NVIDIA 的 rflow-ct 流程生成带配对掩码的合成 CT 体数据。

开发与工程 ✓ NVIDIA · 官方

DOCA STA 存储目标加速

帮助开发者在 BlueField 上构建并调试 RDMA NVMe-oF 存储目标。

开发与工程 ✓ NVIDIA · 官方

Holoscan SDK 安装向导

根据主机环境选择并引导完成 Holoscan SDK 的合适安装方式。

自动化与运维 ✓ NVIDIA · 官方

TAO NVIDIA GPU 主机配置

为 TAO 的 Docker 与 Kubernetes GPU 主机检查并配置 NVIDIA 驱动、CUDA 和容器运行时。

开发与工程 ✓ NVIDIA · 官方

NVIDIA 技能发现器

帮助代理在 NVIDIA 产品与工作流中发现并选择合适的技能。

相关 Skills