DOCA Bench 性能基准技能
在真实 NVIDIA 网络设备上,以可复现方式测量 DOCA 库的吞吐、延迟和带宽。
文档明确要求非生产环境、远程伴随应用需注意敏感信息、先进行短时 smoke run,并禁止臆造参数;因此具备基本安全边界。扣分原因是未明确最小权限、用户确认、回滚方案或数据脱敏流程,且要求保存“full unredacted summary + CSV”,可能扩大敏感环境信息暴露。
配置、运行、测试和分层诊断流程较完整,包含版本、设备、granular-build、预热、稳态和异常分流。扣分原因是静态审查未执行关键路径,错误反馈主要依赖外部文档和现场 --help;此外 TASKS.md 将模式称为“三种”,与其他文件声明四种模式不一致。
触发条件、目标用户、适用任务和明确排除项较清楚,覆盖主机与 BlueField Arm,并强调按安装实际能力探测。扣分原因是未提供中文交互支持或中国大陆网络可达性说明,核心资料依赖 docs.nvidia.com;对设备、平台和库版本边界仍需外部矩阵确认。
采用 SKILL.md、CAPABILITIES.md、TASKS.md 分层组织,包含加载顺序、关联技能、限制、许可证和路由说明。扣分原因是作者、正式版本、签名、变更历史和维护责任在 SKILLCARD 中仍为 TBD 或仅间接可见;技能卡许可证与前置元数据不一致,且存在静态校验发现的结构和推荐章节问题。
能够指导选择库、工作负载和测量模式,要求记录命令、版本、设备、环境,并提供 smoke-before-bulk 和诊断循环,核心任务价值明确。扣分原因是未提供可直接复制的完整命令或已验证输出,执行仍需查阅现场二进制和外部指南;静态材料不能证明实际结果可用。
文档提供了大量内部交叉引用、源代码符号和一份评估报告,具备一定审计线索。扣分原因是评估数据集不可用,报告无法独立复核;未提供覆盖关键路径的可验证 CI/测试证据,公开来源仅作为指针而非本次可核验材料。
- 执行前必须确认目标设备不是生产业务设备,并对伴随应用的网络通道、CSV、日志和环境信息进行脱敏与访问控制。
- 不要直接使用文档中的假定参数;必须以目标安装上的 doca_bench --help、内置查询结果和匹配版本文档为准。
- 注意四模式与“三种模式”的文档矛盾,以及 SKILLCARD.yaml 中许可证、版本和签名字段未完全对齐。
- 中国大陆用户可能需要预先确认 docs.nvidia.com、NGC及相关外部资料的网络可达性。
这个 Skill 能做什么,适合哪些场景?
该技能指导 AI 代理调用 doca_bench,对 RDMA、Compress、AES-GCM、SHA、DMA、EC、Ethernet、Comch 和 GPUNetIO 进行微基准测试。它覆盖库枚举、三轴配置、预热与稳定性判断、基线采集以及分层故障诊断。运行环境需要已安装 DOCA SDK 2.7.0 或更高版本,并连接 BlueField DPU 或 ConnectX NIC。它不用于应用端到端计时、DOCA 安装、定制基准代码或修改二进制文件。
读取已安装 DOCA 环境和 doca_bench 的可用能力,按目标库、工作负载形状和测量轴配置测试;运行吞吐、批量延迟、精确延迟或最大带宽基准;执行先冒烟后批量的流程;记录命令、版本、设备、部署环境和 CSV/屏幕输出;根据配置、设备绑定、库前置条件、工作负载、测量稳定性和版本等层次诊断零结果、挂起或异常结果。
- 平台运维人员在固件升级、驱动升级或 NUMA 调优前后,对 BlueField 或 ConnectX 设备重跑性能基线。
- 性能工程师需要比较 DOCA Compress、RDMA、DMA 或 SHA 等库在实际设备上的吞吐或延迟。
- 开发者在应用设计前确认候选 DOCA 库在当前安装和设备上的可用能力。
- SRE 需要生成包含命令、版本、设备、环境和测量值的可引用性能记录。
- AI 代理需要解释 doca_bench 的零输出、启动挂起或不稳定结果。
这个 Skill 有哪些优点和局限?
- 面向实际设备和安装环境,而不是凭数据表推测性能。
- 覆盖多种 DOCA 库和四种测量轴。
- 要求记录命令、版本、设备和环境,适合回归分析。
- 提供从能力探测到测量稳定性和故障分层的工作流。
- 必须已有 DOCA SDK >= 2.7.0、正确的 Linux 环境和 NVIDIA 设备;技能不负责安装 DOCA。
- 没有预置脚本、解析器、样例输出或预期吞吐数字。
- 具体 flag 和场景参数随安装版本变化,不能仅凭技能内容推断。
- source prompt 未提供该技能独立测试套件或平台覆盖证据。
如何安装这个 Skill?
按仓库 README 的 skills CLI 流程安装单个技能:
npx skills add nvidia/skills --skill doca-bench --yes
也可以先运行 npx skills add nvidia/skills,再在提示中选择技能和安装位置。仓库是每日从产品源仓库同步的目录,安装后技能会在代理下次加载相关技能时可用。
如何使用这个 Skill?
在已满足环境要求的 Linux 主机或等效 DOCA 容器中,让代理执行与 doca_bench 相关的任务,例如:“测量我的 BlueField-3 上 DOCA Compress 的吞吐,并保存可回归测试的基线。”代理应先确认 DOCA 版本和二进制,枚举已启用库,选择吞吐、批量延迟、精确延迟或最大带宽轴,先执行冒烟测试,再进行稳定性评估。远程内存、RDMA 或 Eth 场景还需要远端运行 companion app。具体参数应以已安装版本的文档和 doca_bench --help 为准。
这个 Skill 与同类方案有什么区别?
与 doca-caps 相比,本技能进行细粒度的实际性能测量,而 doca-caps 提供较粗粒度的设备/库能力快照。与应用端到端基准相比,它只测量 DOCA 库表面,不测量用户应用整体耗时;与 doca-setup 相比,它要求安装已完成。