开发与工程 ✓ NVIDIA · 官方 doca-benchshared-librarymesoncudagpunetiolinuxbenchmarking

DOCA Bench 扩展开发技能

帮助工程师为 doca-bench 构建、加载并调试自定义基准测试插件。

FollowSkills 评估 · FSRS-2.0
不推荐
47/ 100 五分制 2.4 / 5
信任安全13 / 25 · 2.6/5

文档明确要求先确认前置条件、先冒烟后扩展、捕获日志后重试,并披露自定义代码在父进程和设备地址空间中的崩溃、挂起及数据面风险;但未提供隔离执行、明确用户授权边界、完整回滚/恢复流程,且可能依赖 OOB GPU 或设备重置,因此从中等水平扣分。

可靠稳定9 / 20 · 2.3/5

SKILL.md、CAPABILITIES.md 和 TASKS.md 具有较完整的配置、构建、运行、测试和分层调试流程,并说明异常反馈应引用原始错误;但关键运行时发现机制依赖外部文档和本机安装内容,未执行复现,且静态证据不足以超过 10 分。

适用触发9 / 15 · 3.0/5

目标用户、触发语句、非适用范围、协同技能和 Linux/DOCA/硬件依赖描述清楚;但仅面向熟悉 Meson、共享库和 CUDA/GPUNetIO 的高级用户,中文内容缺失,并依赖可能难以从中国大陆访问的 docs.nvidia.com,故扣分。

规范维护7 / 15 · 2.3/5

文档按能力、任务、错误分类和安全策略分层,包含示例、依赖和版本重建规则;但版本、作者、维护责任和变更路径不完整,BENCHMARK.md 还记录了缺少 Instructions/Examples、作者元数据等结构问题,且许可证信息与题设 NOASSERTION 及 SKILLCARD 内容存在不一致。

有效结果6 / 15 · 2.0/5

该技能能直接提供扩展决策、参考实现适配、SONAME 检查、冒烟测试和调试顺序,核心指导具有实际价值;但没有完整可执行的运行时发现配方,要求用户补充本机安装和外部文档信息,结果仍需较多环境验证,因此按静态上限保守扣分。

证据核验3 / 10 · 1.5/5

源文件提供了可审计的流程、符号形状、路径和自称的评测报告;但没有随技能提供覆盖关键路径的测试套件或可独立复现的第三方执行材料,评测结果主要是文件内声明,因此证据可验证性有限。

证据充分度: 评估于 2026年7月29日 审查版本 ce70ca7f1966
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 自定义扩展在 doca-bench 地址空间内运行,GPU 内核可能挂起并需要 OOB 重置;执行前应确认隔离、共租户影响、恢复权限和用户授权。
  • 运行时发现机制、精确 API 和部分版本行为依赖本机 DOCA 安装及外部 NVIDIA 文档,不能仅凭该技能静态内容确认。
  • 许可证和来源元数据存在不一致:题设为 NOASSERTION,而不同文件分别声明 Apache-2.0 或 Apache-2.0 AND CC-BY-4.0。
  • 技能主体为英文,且核心外部文档依赖可能影响中国大陆用户的可达性。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向内置 doca-bench 模式无法覆盖的工作负载,指导操作者使用扩展框架和共享库插件。它以 doca_bench_cuda 作为 GPU 侧参考示例,涵盖配置、构建、运行、测试和分层故障排查。扩展由父工具 doca-bench 加载和调用,并使用带 DOCA_EXPERIMENTAL 标记的 C 入口点。使用前需要已安装 DOCA SDK,并确认内置模式确实无法满足需求。

指导用户先判断是否需要扩展,再定位 /opt/mellanox/doca/tools/bench_extension/doca_bench_cuda/ 参考实现;说明如何使用 Meson 构建匹配 DOCA 版本的 Linux 共享库,组织入口点和工作负载设置结构;指导 doca-bench 的加载、调用和最小冒烟测试;区分构建失败、加载失败、注册不匹配和运行时调用失败。

  1. 平台或性能工程师需要测量 doca-bench 内置模式未覆盖的工作负载。
  2. 工程师希望基于 doca_bench_cuda 参考实现开发 CUDA 或 GPUNetIO RX/TX 扩展。
  3. 自定义 .so 已构建,但 doca-bench 无法找到、加载或调用它。
  4. DOCA 升级后,工程师需要处理 soversion、实验性 API 和重新构建问题。
  5. 用户希望在运行真实工作负载前验证扩展是否被加载并返回父工具期望的数据。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖自定义 doca-bench 插件从决策到调试的完整工作流。
  • 提供 doca_bench_cuda 作为实际 API 和构建布局参考。
  • 明确区分扩展框架与内置模式、GPUNetIO 语义及 CUDA 安装等边界。
  • 强调 DOCA 版本、soversion 和实验性 API 的兼容性风险。
局限
  • 不能替代 doca-bench 内置模式清单,也不适合内置模式已经覆盖的工作负载。
  • 依赖 DOCA SDK、Linux 设备和原生构建环境;GPU 示例还依赖 CUDA。
  • SKILL.md 未给出完整的运行时发现机制、所有入口点签名或完整命令附录。
  • 扩展使用 DOCA_EXPERIMENTAL API,DOCA 升级后通常需要重新构建。

如何安装这个 Skill?

使用 NVIDIA/skills 集合中的 skills CLI 安装指定技能:npx skills add nvidia/skills --skill doca-bench-extension --yes。README 说明该命令通过 npx 运行,并在下一次智能体加载相关技能时生效。运行扩展还需要 Linux 上 /opt/mellanox/doca 的 DOCA SDK、BlueField DPU 或 ConnectX NIC,以及 pkg-config doca-common;GPU 参考实现还需要匹配的 CUDA 工具包和 NVIDIA GPU。

如何使用这个 Skill?

在支持 Agent Skills 的客户端中提出相关任务,例如:“我的工作负载没有匹配的 doca-bench 内置模式,如何构建并加载自定义扩展?”技能要求先确认 DOCA 和 doca-bench 可用,再确认没有内置模式覆盖,随后按 configure → build → run → test → debug 的顺序操作。具体运行时发现机制应以已安装的 doca-bench、随附扩展的 meson.build 和 NVIDIA 公共文档为准;SKILL.md 不提供一套自创的发现机制。

这个 Skill 与同类方案有什么区别?

与 doca-bench 内置模式相比,该技能处理的是内置能力无法覆盖时的外部插件扩展;内置模式应优先由 doca-bench 技能处理。

常见问题

它能独立运行基准测试吗?
不能。它指导构建和接入由 doca-bench 调用的插件,扩展本身没有独立 CLI。
是否必须使用 CUDA?
不一定。CUDA 是 doca_bench_cuda GPU 参考扩展的要求;一般扩展的源代码语言取决于工作负载。
DOCA 升级后为什么可能需要重建?
扩展使用 DOCA_EXPERIMENTAL 入口点,并且共享库 soversion 需要匹配 DOCA 版本;技能明确将跨升级重建视为常规要求。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

DOCA GPUNetIO WRITE 带宽基准技能

帮助开发者构建、运行并解读由 CUDA 内核发起的 GPUNetIO RDMA WRITE 持续带宽基准。

开发与工程 ✓ NVIDIA · 官方

GPUNetIO RDMA 写延迟基准技能

指导测量 CUDA 内核发起的 GPUNetIO RDMA WRITE 延迟与尾延迟。

开发与工程 ✓ NVIDIA · 官方

DOCA GPUNetIO 开发技能

指导开发者将 NVIDIA GPU 上的 CUDA 内核连接到 DOCA 网络队列,实现 GPU 侧收发包与调试。

自动化与运维 ✓ NVIDIA · 官方

TAO NVIDIA GPU 主机配置

为 TAO 的 Docker 与 Kubernetes GPU 主机检查并配置 NVIDIA 驱动、CUDA 和容器运行时。

自动化与运维 ✓ NVIDIA · 官方

DOCA Bench 性能基准技能

在真实 NVIDIA 网络设备上,以可复现方式测量 DOCA 库的吞吐、延迟和带宽。

开发与工程 ✓ NVIDIA · 官方

DOCA 编程指南

帮助开发者从示例开始构建、测试和调试库无关的 DOCA 应用。

开发与工程 ✓ NVIDIA · 官方

DOCA GPI GPU 直驱 RDMA 技能

指导 CUDA 内核绕过主机 CPU,直接从 GPU 内存驱动 RDMA 队列。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

数据与分析 ✓ NVIDIA · 官方

NV-Segment-CT 医学影像分割技能

在 CT NIfTI 体数据上运行 VISTA3D 分割,并生成可核验的标签图证据。

数据与分析 ✓ NVIDIA · 官方

NV-Segment-CT 微调

为 CT NIfTI 标注执行 NV-Segment-CT VISTA3D 微调。

开发与工程 ✓ NVIDIA · 官方

cuPyNumeric 迁移就绪度评估

在投入大规模移植工作前,判断 NumPy 代码能否在 GPU 和多 GPU 环境中有效扩展。

数据与分析 ✓ NVIDIA · 官方

NV-Generate-MR

通过 NVIDIA 的 rflow-mr 流程生成合成体部 MRI 影像体积。

自动化与运维 ✓ NVIDIA · 官方

Jetson 软件包与环境助手

为 Jetson 选择匹配架构的容器与 GPU 软件包。

数据与分析 ✓ NVIDIA · 官方

NV-Generate-CT 合成 CT 生成

通过 NVIDIA 的 rflow-ct 流程生成带配对掩码的合成 CT 体数据。

开发与工程 ✓ NVIDIA · 官方

Holoscan SDK 安装向导

根据主机环境选择并引导完成 Holoscan SDK 的合适安装方式。

开发与工程 ✓ NVIDIA · 官方

Jetson 风扇曲线定制

在 Jetson BSP 中安全维护 nvfancontrol 风扇配置与启动默认值。

开发与工程 ✓ NVIDIA · 官方

NVIDIA 技能发现器

帮助代理在 NVIDIA 产品与工作流中发现并选择合适的技能。

开发与工程 ✓ NVIDIA · 官方

Earth2Studio 确定性预报

为 Earth2Studio 构建单成员天气预报推理脚本。

数据与分析 ✓ NVIDIA · 官方

NV-Segment-CTMR 医学影像分割

在 CT 或 MRI NIfTI 体数据上运行分割并生成可核查证据。

开发与工程 ✓ NVIDIA · 官方

TileGym cuTile 内核开发指南

指导开发者在 TileGym 中注册、实现、测试并基准评测新的 cuTile GPU 内核。

相关 Skills