开发与工程 ✓ NVIDIA · 官方 cudardmainfinibandgpunetiobandwidth-benchmarkdocameson

DOCA GPUNetIO WRITE 带宽基准技能

帮助开发者构建、运行并解读由 CUDA 内核发起的 GPUNetIO RDMA WRITE 持续带宽基准。

FollowSkills 评估 · FSRS-2.0
不推荐
50/ 100 五分制 2.5 / 5
信任安全15 / 25 · 3.0/5

文档明确限制适用范围,要求可信网络、烟雾测试、维护窗口,并将固件/IOMMU/大页等硬件变更转交安全策略;但 OOB 使用明文 TCP,且 GPU 句柄和 mmap 描述符被视为凭据,缺少加密、认证和回滚流程,因此扣分。

可靠稳定6 / 20 · 1.5/5

TASKS.md 提供了较完整的安装、构建、运行和分层调试流程,但关键文件存在自洽性问题:SKILL.md 称服务器上的 CUDA kernel,CAPABILITIES.md 又称客户端 kernel;TASKS.md 还要求服务器回显 GPU 地址,而文档称服务器不使用 GPU。静态证据也不足以确认关键路径可运行,因此扣分。

适用触发11 / 15 · 3.7/5

触发语句、目标用户、输入前提和非适用范围写得清楚,并区分 GPUNetIO、GPI 和 CPU perftest;但没有中文操作支持,且依赖 DOCA/CUDA/NVIDIA 文档与实际硬件环境,对中国大陆网络可达性和替代来源未作说明,因此扣分。

规范维护9 / 15 · 3.0/5

文档分层、交叉引用、任务路由、限制和维护联系信息较完整;但 SKILL.md 的许可证为 Apache-2.0,而 SKILLCARD.yaml 和 skill-card.md 声称 Apache-2.0 AND CC-BY-4.0,版本、签名和扫描时间仍为 TBD,且 BENCHMARK.md 存在路径和统计口径不一致,故扣分。

有效结果6 / 15 · 2.0/5

技能明确提供 GPU-NIC 配对、meson 构建、烟雾测试、吞吐分解和结果记录流程,静态上可覆盖核心任务;但不提供脚本、固定输出解析器或可直接复用的 benchmark 产物,且实际工具结果仍需用户环境验证,因此按静态上限保守给分并扣除不确定性。

证据核验3 / 10 · 1.5/5

提供了提交内的能力说明、任务流程、评估记录和 evals.json,具备一定审计线索;但评估数据集不可用,没有提交的关键路径测试套件或第三方复现实据,且静态审查不能验证命令和性能结论,因此扣分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 运行前必须解决客户端/服务器 CUDA kernel 与 GPU 回显描述的矛盾,并以实际源码和二进制 --help 为准。
  • OOB TCP 明文传输句柄和内存描述符;仅在受信网络和明确维护窗口运行,避免共享生产 fabric。
  • 核对许可证、SKILL.md 路径、版本签名和 benchmark 记录的一致性。
  • 不要将静态文档或评估报告中的吞吐与安全结论视为已执行验证。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向 NVIDIA DOCA GPUNetIO 的 gpunetio_ib_write_bw 客户端与服务器基准工具。它指导用户在真实 GPU、InfiniBand 设备和 DOCA 环境上,从 CUDA 内核提交 RDMA WRITE 工作请求并测量持续带宽。内容涵盖安装前提、Meson 构建、客户端与服务器启动、结果解读、瓶颈分析和误差排查。它不负责通用 DOCA 安装、GPUNetIO 库开发、CPU 发起的 perftest,或应用端到端吞吐量。

指导用户检查 DOCA SDK、CUDA Toolkit、GPU、InfiniBand RNIC、nvidia_peermem 和 GPU-NIC 配对条件;在 doca/tools/gpunetio_ib_write_bw/ 下使用 Meson,结合 doca-gpunetio、doca-rdma 和 doca-common 的 pkg-config 模块构建客户端与服务器;通过 TCP 套接字完成带外描述符交换;运行客户端和服务器基准;读取每轮带宽报告,并根据 GPU 占用率、NIC 发包速率和链路饱和度分析结果。

  1. 性能工程师需要测量两台主机之间由 GPU 内核发起的 RDMA WRITE 持续带宽。
  2. 平台运维人员调整 NUMA 绑定、GPU PCIe 位置、IB 设备、GID 索引或 NIC 固件后,需要重新建立性能基线。
  3. 开发者希望将 GPUNetIO 路径与 GPI 编程面或 CPU 发起的 perftest 路径进行比较。
  4. SRE 需要记录某个 GPU-NIC 对在指定 DOCA、CUDA 和部署环境下的可复现实测结果。
  5. 用户遇到 Meson 编译失败、GPU 缓冲区未被 nvidia_peermem 接管或多次运行带宽波动,需要按错误分类逐层排查。

这个 Skill 有哪些优点和局限?

优点
  • 聚焦 CUDA 内核通过 GPUNetIO 提交 RDMA WRITE 的持续带宽测量。
  • 覆盖 GPU-NIC 配对、构建、运行、观测、版本匹配和错误分类。
  • 明确区分 GPUNetIO、GPI 和 CPU 发起的 perftest 测量路径。
  • 强调记录 GPU、NIC、DOCA 版本、构建方式和运行环境,便于回归比较。
局限
  • 依赖真实的 Linux、DOCA、CUDA、NVIDIA GPU 和 InfiniBand 硬件环境。
  • 要求匹配的 GPU-NIC 拓扑、nvidia_peermem 和带外 TCP 连接。
  • 这是指导型加载器,不提供包装脚本、解析器或预写的 CUDA/DOCA 内核代码。
  • 技能本身不提供固定吞吐量数字,也未在给定材料中列出独立测试平台或测试套件。

如何安装这个 Skill?

安装整个 NVIDIA skills 集合:npx skills add nvidia/skills。只安装此技能:npx skills add nvidia/skills --skill doca-gpunetio-ib-write-bw --yes。技能目录位于 skills/doca-gpunetio-ib-write-bw/。此外,运行基准本身需要已安装的 Linux DOCA SDK、匹配的 CUDA Toolkit 和 nvcc、NVIDIA GPU、BlueField DPU 或 ConnectX NIC、InfiniBand RNIC、已加载的 nvidia_peermem,以及已安装的 gpunetio_ib_write_bw 源码;具体 DOCA 安装步骤未在该 SKILL.md 中展开。

如何使用这个 Skill?

让代理处理类似“测量 GPU 发起的 GPUNetIO RDMA WRITE 带宽”或“分析 gpunetio_ib_write_bw 的带宽波动”的任务。先阅读 SKILL.md,再按 TASKS.md 的 configure、build、run、test 和 debug 流程操作;从 doca/tools/gpunetio_ib_write_bw/ 构建客户端和服务器,先执行小规模 smoke 测试,再进行稳定态测量。引用参数时应先读取已安装二进制的 --help,因为该技能不固定具体 flag 字符串或预期吞吐量。

这个 Skill 与同类方案有什么区别?

与 CPU 发起的 upstream perftest ib_write_bw 相比,该技能测量的是 CUDA 内核通过 doca-gpunetio 发起工作请求的路径;两者结果不应默认相同。它也将 GPUNetIO 与 GPI 编程面作为运行时表面的选择对象,并与同类的 GPUNetIO WRITE latency 工具区分带宽和延迟指标。

常见问题

它是否适合测量应用的端到端吞吐量?
不适合。该基准聚焦 GPUNetIO 的 GPU 侧工作请求提交路径,不代表用户完整应用流水线的端到端吞吐量。
运行它需要哪些权限和环境?
需要已安装并匹配的 DOCA SDK 与 CUDA Toolkit、GPU 和 InfiniBand 设备配对、已加载 nvidia_peermem,以及绑定 doca_dev、doca_gpu 和 TCP 带外套接字所需的权限。
为什么同一组参数的带宽会波动?
技能建议检查稳定态运行、NUMA 放置、NIC 饱和度、GPU 内核驱动能力、GPU-NIC 配对、版本和其他测量可靠性因素,而不是直接引用单次结果。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

GPUNetIO RDMA 写延迟基准技能

指导测量 CUDA 内核发起的 GPUNetIO RDMA WRITE 延迟与尾延迟。

开发与工程 ✓ NVIDIA · 官方

DOCA Bench 扩展开发技能

帮助工程师为 doca-bench 构建、加载并调试自定义基准测试插件。

开发与工程 ✓ NVIDIA · 官方

DOCA GPI GPU 直驱 RDMA 技能

指导 CUDA 内核绕过主机 CPU,直接从 GPU 内存驱动 RDMA 队列。

开发与工程 ✓ NVIDIA · 官方

DOCA 编程指南

帮助开发者从示例开始构建、测试和调试库无关的 DOCA 应用。

开发与工程 ✓ NVIDIA · 官方

DOCA GPUNetIO 开发技能

指导开发者将 NVIDIA GPU 上的 CUDA 内核连接到 DOCA 网络队列,实现 GPU 侧收发包与调试。

开发与工程 ✓ NVIDIA · 官方

DOCA RDMA Initiator

指导在DPA上开发由加速器发起的单边RDMA应用。

开发与工程 ✓ NVIDIA · 官方

DOCA Verbs 原始 RDMA 控制技能

为确需底层 verbs 控制的 DOCA 开发者提供路由、移植与调试指导。

开发与工程 ✓ NVIDIA · 官方

DOCA STA 存储目标加速

帮助开发者在 BlueField 上构建并调试 RDMA NVMe-oF 存储目标。

自动化与运维 ✓ NVIDIA · 官方

DOCA Bench 性能基准技能

在真实 NVIDIA 网络设备上,以可复现方式测量 DOCA 库的吞吐、延迟和带宽。

开发与工程 ✓ NVIDIA · 官方

DOCA UROM 主机侧卸载开发

指导 HPC、UCX 和 MPI 应用将远程内存操作卸载到 BlueField DPU。

开发与工程 ✓ NVIDIA · 官方

DOCA DPA 高级追踪器

捕获并解码 BlueField DPA 编程事件,定位内核行为、通信延迟与追踪异常。

开发与工程 ✓ NVIDIA · 官方

DOCA PCC ZTR RTTCC 拥塞控制技能

帮助在 BlueField-3 上部署、调优和验证 NVIDIA 的 RoCE RTT 拥塞控制参考算法。

自动化与运维 ✓ NVIDIA · 官方

DOCA UROM 服务运维技能

在 BlueField Arm 上部署并排查 DOCA UROM 服务容器。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

数据与分析 ✓ NVIDIA · 官方

NV-Segment-CT 医学影像分割技能

在 CT NIfTI 体数据上运行 VISTA3D 分割,并生成可核验的标签图证据。

数据与分析 ✓ NVIDIA · 官方

NV-Segment-CT 微调

为 CT NIfTI 标注执行 NV-Segment-CT VISTA3D 微调。

开发与工程 ✓ NVIDIA · 官方

cuPyNumeric 迁移就绪度评估

在投入大规模移植工作前,判断 NumPy 代码能否在 GPU 和多 GPU 环境中有效扩展。

开发与工程 ✓ NVIDIA · 官方

DOCA AES-GCM 加速开发技能

帮助开发者在 BlueField 或 ConnectX 上配置、验证和调试 DOCA AES-GCM 加解密。

开发与工程 ✓ NVIDIA · 官方

DOCA 环境设置技能

帮助开发者验证、配置和排查 DOCA 开发与运行环境,并选择合适的部署路径。

数据与分析 ✓ NVIDIA · 官方

NV-Generate-MR

通过 NVIDIA 的 rflow-mr 流程生成合成体部 MRI 影像体积。

相关 Skills