DOCA Flow 调优技能
帮助工程师快照、分析并优化运行中的 DOCA Flow 管道。
文档明确要求默认只读、变更前确认、快照与前后对比,并描述 Unix socket、配置、日志和现场状态数据流;未充分定义最小权限、回滚/恢复机制、敏感日志脱敏,且状态变更仍依赖外围 Flow 应用,故扣分。
任务流程、前置条件和分层错误分类较完整,能提供诊断路径;但本次仅静态阅读,未验证命令、依赖、关键路径或异常反馈,且具体 CLI/schema 被刻意外置,故按静态上限保守评分。
受众、触发语句、适用范围和排除范围清晰,覆盖 live/captured、offline/online 场景;但要求特定 DOCA、BlueField/ConnectX 环境,精确参数需查安装版本和外部文档,未证明中文交互或中国大陆网络可达性,故扣分。
信息架构、加载顺序、任务路由、限制和相关技能说明较好,SKILL.md声明 Apache-2.0;但版本、维护责任和变更记录不完整,SKILLCARD 存在 TBD、路径/许可证不一致,且报告指出缺少推荐 Instructions/Examples,故扣分。
能覆盖配置、快照、分析、可视化、调试及建议回写的核心流程,并强调前后对比;但没有随技能提供可执行脚本、固定示例输出或完整命令,实际结果依赖本地 DOCA 安装和外围应用,静态证据不足,按上限保守评分。
存在任务文档、错误分类、评测报告和内部交叉引用;但评测数据集不可用,报告为自述材料,未提供可由本次文件独立复现的 CI/测试覆盖,且关键契约依赖安装环境和外部指南,故仅给有限分数。
- 执行前必须核对本地 DOCA 版本、安装模板、--help、Flow 应用、Unix socket、设备范围和完整配置;文档不提供固定命令契约。
- 任何回写 Flow 程序或在线状态变更都可能影响数据面;应先取得明确确认,并保留可恢复的部署/回滚方案。
- 不要将未经脱敏的 dumper、analyze、visualize 或日志直接外传;文档要求记录完整未脱敏输出,但未定义敏感数据处理。
- 核心依赖 NVIDIA DOCA 安装、BlueField/ConnectX 硬件及相关外部文档,未证明在中国大陆网络环境中均可达。
- BENCHMARK.md 的评测数据集不可用,SKILLCARD 含 TBD 字段且与当前路径/许可证元数据存在不一致。
这个 Skill 能做什么,适合哪些场景?
该技能指导 AI 代理使用 NVIDIA 的 doca_flow_tune 调优 DOCA Flow 管道。它覆盖实时或捕获状态的快照、规则放置、资源提示与表大小、硬件卸载模式等调优轴,以及规则安装速率、查找延迟和硬件计数器增量等测量方式。工具支持在线和离线流程,并可读取 CSV、JSON 和 Mermaid 可视化输出。它还指导将建议以最小差异改回 Flow 程序,并在状态变更前执行冒烟验证。
读取本地 DOCA 安装中的 doca-flow 配置与模板,并连接运行中的 doca-flow 应用或读取已捕获的 JSON/CSV 快照;指导执行 dump、monitor、web、analyze 和 visualize 子命令对应的在线或离线流程;解释转储、监控、分析和可视化结果;根据目标管道、调优轴和测量指标提出建议,并指导将建议应用回 Flow 程序。
- BlueField 平台操作员希望在不触碰数据面的情况下查看运行中 Flow 管道的管道、软件计数器和硬件计数器状态。
- 性能工程师已有 doca-flow-perf 基线,想进一步定位规则放置、表大小或硬件卸载模式的优化方向。
- DOCA Flow 开发者希望通过离线分析和可视化理解已捕获的管道布局。
- 运维人员遇到无法连接、空输出、空 Mermaid 图或分析结果与实时计数器不一致的问题。
- 开发者需要把调优建议安全地改回 C/C++ Flow 程序,并在批量应用前完成预热、稳态和前后对比验证。
这个 Skill 有哪些优点和局限?
- 覆盖在线实时观察与离线捕获分析。
- 明确区分调优轴和测量指标,适合已有性能基线的优化工作。
- 包含从快照、分析、可视化到建议落地和冒烟验证的工作流。
- 默认强调读操作,并说明状态变更建议的高风险性质。
- 适用于外部操作员、性能工程师、Flow 开发者和 AI 代理。
- 依赖特定的 DOCA SDK、Linux、BlueField DPU 或 ConnectX NIC,以及现有 doca-flow 应用。
- 不创建 Flow 管道,也不提供 DOCA 安装、Flow API 编程或基线测量方法。
- 未在提供材料中给出固定的命令参数清单、输出字段、脚本封装或预置调优建议。
- 建议和输出依赖设备、固件、NUMA、管道及 DOCA 版本,不能直接跨平台照搬。
- 提供材料未展示独立测试结果或具体平台覆盖数据。
如何安装这个 Skill?
使用仓库 README 支持的 Skills CLI 安装:npx skills add nvidia/skills --skill doca-flow-tune --yes。安装后,代理在遇到相关任务时加载该技能。运行技能前还需要已安装在 /opt/mellanox/doca 的 DOCA SDK、Linux 环境、连接的 BlueField DPU 或 ConnectX NIC,以及运行中或已捕获的 doca-flow 应用。
如何使用这个 Skill?
向代理描述具体的 doca-flow 调优问题,例如:“BlueField 上的 Flow 规则安装速率很低,帮我用 doca_flow_tune 判断是规则放置还是表大小问题。”技能建议先阅读 TASKS.md 的 configure、run 和 test 流程,再根据实际安装版本的帮助信息和 flow_tune_cfg*.json 模板配置并运行。不要将它用于 DOCA 安装、编写 Flow 应用或基线测量;这些任务应转交相关技能。
这个 Skill 与同类方案有什么区别?
与 doca-flow-perf 的边界最明确:前者负责基线测量,doca-flow-tune 负责在已有基线之上推荐优化;doca-flow-dpa-perf 用于 DPA 卸载路径的性能基线。doca-flow 是被观察和调优的基础库,负责创建管道,而本技能不负责编写该应用。