开发与工程 ✓ NVIDIA · 官方 deepstreampipeline-profilingnsight-systemsnvtxnvidia-smifps-benchmarkingvideo-analytics

DeepStream 性能剖析器

用实测数据调优 DeepStream 管线并定位性能瓶颈。

FollowSkills 评估 · FSRS-2.0
不推荐
48/ 100 五分制 2.4 / 5
信任安全14 / 25 · 2.8/5

文档明确限定终端工具、要求先读后改、说明NVTX覆盖边界,并提供配置校验与预构建步骤;但默认不提示即修改用户配置,缺少用户确认、回滚方案、敏感视频/RTSP数据流说明,且失败回退包含sudo或--privileged建议,因此扣分。

可靠稳定7 / 20 · 1.8/5

六阶段流程、失败分支和诊断信号较完整;但存在批大小扫描范围(SKILL.md含32,README.md未含32)、队列深度(×4与×2)等不一致,引用的脚本和测试内容未提供,且静态审查不能复现关键路径,因此不超过静态上限并扣分。

适用触发9 / 15 · 3.0/5

触发条件、非触发场景、输入模型维度和多种源类型描述清楚;但依赖特定DeepStream 9.0容器、Nsight Systems、GPU和nvidia-smi,未说明中文交互支持,核心容器依赖可能受中国大陆网络可达性影响,边界仍不充分。

规范维护8 / 15 · 2.7/5

SKILL.md、README、参考文档和评估文件形成较好的分层结构,包含版本、所有者、许可证、相关技能和限制;但缺少清晰的变更日志、长期维护责任/更新流程,且README宣称的脚本和测试未在所给材料中出现,故扣分。

有效结果6 / 15 · 2.0/5

目标输出包括性能配置、瓶颈分类、容量和补救建议,评估报告也记录了通过及部分正向提升;但报告是仓库内声明,未提供可核验的代表性实际输出,且配置编辑和测量仍依赖用户环境,静态上限为7并扣除不确定性。

证据核验4 / 10 · 2.0/5

包含命令、公式、阈值、决策树和评估摘要,具备一定审计线索;但没有可检查的CI、测试套件或外部交叉证据,参考中的硬件吞吐数字还注明来自非正式基准,静态证据不足,故低于上限。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 执行前应确认是否允许自动修改配置,并建立版本控制或备份以便回滚。
  • 不要把Nsight报告、RTSP地址或视频内容上传到外部服务;文档未充分说明这些数据的处理边界。
  • 应统一批大小扫描和队列深度规则,并补充可审查的脚本、测试、CI和维护更新记录。
  • 在中国大陆环境中先验证nvcr.io镜像、Nsight Systems和相关依赖的可达性;不要默认使用sudo或--privileged。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

这是一个面向 NVIDIA DeepStream 的终端性能剖析技能,使用 Nsight Systems 和 nvidia-smi 测量管线表现。它先通过推理微基准确定批量平台,再推导流复用、推理、解码器、跟踪器和队列配置。随后对端到端管线进行 30 秒剖析,并报告可用 NVTX 数据中的插件耗时。它适用于检测、分类、分割、VLM 和嵌入等管线,但要求运行环境符合 DeepStream 9.0 的指定兼容条件。

读取用户的管线定义和实际配置,识别模型尺寸、目标 FPS 与源属性;检查管线元素的 NVTX 覆盖情况;运行 nvidia-smi 查询 GPU、解码器、编码器和 PCIe 信息;以 batch-size 为变量运行推理阶段微基准并记录 FPS;根据测量结果修改用户配置文件;使用 nsys profile 捕获 CUDA、NVTX 和 GPU 指标,再用 nsys stats 提取内核、NVTX、内存复制和 GPU 利用率统计;将摘要和未直接测量的元素输出到标准输出。

  1. 需要在指定 NVIDIA GPU 上构建高效 DeepStream 管线的工程师。
  2. 想测量多路视频在目标 FPS 下可承载数量的开发者。
  3. 正在调优 nvinfer、nvstreammux、解码器或跟踪器配置的用户。
  4. 需要用 Nsight Systems 定位端到端管线插件耗时的性能工程师。
  5. 希望以终端和无 GUI 方式完成 DeepStream 基准测试的团队。

这个 Skill 有哪些优点和局限?

优点
  • 以实测的推理批量平台和硬件上限为基础推导配置,减少盲目调参。
  • 支持文件、RTSP、USB 摄像头及混合源,并且不限定具体模型、编解码器或分辨率。
  • 完全通过 nsys profile、nsys stats 和 nvidia-smi 无头运行。
  • 能报告已发出 NVTX 的 DeepStream 插件耗时,并明确标记未直接测量的元素。
局限
  • 仅明确支持 DeepStream SDK 9.0、Ubuntu 22.04/24.04 和指定 NVIDIA 容器环境。
  • 不提供 NVTX 自动注入,也不覆盖无 NVTX 元素的直接插件级测量。
  • 不执行迭代式的“调优—测量—再调优”循环。
  • 源材料未提供该单项技能的独立测试套件或实际性能结果。

如何安装这个 Skill?

使用仓库 README 提供的 skills CLI 安装:

npx skills add nvidia/skills --skill deepstream-profile-pipeline --yes

也可以指定目标客户端,例如:

npx skills add nvidia/skills --skill deepstream-profile-pipeline --agent codex

源材料未说明该单项技能的其他手动安装目录要求。

如何使用这个 Skill?

在已存在或即将创建的 DeepStream 管线任务中提出明确的性能诉求,例如:“请为这个 DeepStream 管线进行性能剖析、测量 FPS,并根据结果调优配置。”技能按顺序执行预设应用、NVTX 覆盖检查、硬件发现、推理微基准、配置推导和端到端剖析。运行时应使用 nvcr.io/nvidia/deepstream:9.0-triton-multiarch 开发容器,并确保 nsysnvidia-smi 在 PATH 中。

这个 Skill 与同类方案有什么区别?

它与同仓库的 deepstream-generate-pipeline 技能形成上下游关系:后者负责普通管线生成,本技能针对带有性能意图的创建或已有管线进行测量和调优。若用户带来了新模型,源材料建议先使用 deepstream-byovm 构建 TensorRT 引擎,再使用本技能。

常见问题

它需要图形界面吗?
不需要。技能明确要求仅使用终端、`nsys profile` 和 `nsys stats`,不依赖 Nsight Lens 或其他 GUI。
它会直接修改我的配置吗?
会。源材料要求先读取再编辑,并将推导值写入相关 YAML、Python 或 deepstream-app 配置文件,同时保持编辑具有针对性。
它能测量所有管线元素吗?
不能保证。未覆盖 NVTX 的元素会被标记为“在此构建中无法直接测量”,但技能仍会基于微基准和硬件指标进行诊断与配置推导。
运行它需要哪些关键软件?
需要 DeepStream 9.0 开发容器、Nsight Systems 2024 或更高版本的 `nsys`,以及 PATH 中可用的 `nvidia-smi`。

同仓库的其他 Skills

均来自 NVIDIA/skills

自动化与运维 ✓ NVIDIA · 官方

RTVI-CV 二维检测跟踪运维技能

部署并运维 RTVI-CV 二维视频检测与跟踪微服务。

开发与工程 ✓ NVIDIA · 官方

DeepStream SOP 合规推理服务

帮助构建和调试基于 GPU 的工业视频 SOP 顺序与合规检测服务。

开发与工程 ✓ NVIDIA · 官方

DeepStream 管道构建器

通过交互式需求收集,为 NVIDIA DeepStream 生成并验证可运行的 GStreamer 推理管道。

开发与工程 ✓ NVIDIA · 官方

NVIDIA DeepStream 开发技能

为 Python pyservicemaker 驱动的 DeepStream 视频分析流水线提供可靠开发指导。

自动化与运维 ✓ NVIDIA · 官方

VSS 多摄像头三维检测追踪部署

部署基于 DeepStream 与 BEV Fusion 的多摄像头三维感知服务。

自动化与运维 ✓ NVIDIA · 官方

VSS 视频分析 API 独立部署

帮助运维人员独立部署并验证 VSS 视频分析 REST API。

自动化与运维 ✓ NVIDIA · 官方

NeMo AutoModel 启动配置

为 NeMo AutoModel 配置交互式、多节点与云端任务启动。

自动化与运维 ✓ NVIDIA · 官方

VSS 视频分析报告

为单个视频片段或事件时间范围生成结构化的视频分析报告。

数据与分析 ✓ NVIDIA · 官方

VSS 视频分析查询

通过 VA-MCP 读取视频分析事件、指标、告警与传感器数据。

自动化与运维 ✓ NVIDIA · 官方

VSS 行为分析独立部署

指导你在不启动完整仓库栈的情况下独立部署和运行 VSS 行为分析服务。

自动化与运维 ✓ NVIDIA · 官方

AutoMagicCalib 校准栈启动器

通过 Docker Compose 部署 AutoMagicCalib 微服务与 Web UI,快速启动摄像头自动标定环境。

开发与工程 ✓ NVIDIA · 官方

DeepStream 视觉模型导入助手

将目标检测模型自动接入 NVIDIA DeepStream 并生成基准报告。

自动化与运维 ✓ NVIDIA · 官方

RAG 性能基准测试

用单一 YAML 配置分析已部署 NVIDIA RAG Blueprint 服务的性能瓶颈。

自动化与运维 ✓ NVIDIA · 官方

VSS 视频摘要

通过LVS服务或VLM回退,为录制视频生成带时间戳的叙事摘要。

开发与工程 ✓ NVIDIA · 官方

Omniverse USD 性能调优

为 USD 场景诊断加载、内存、帧率与验证问题,并规划基于证据的优化流程。

自动化与运维 ✓ NVIDIA · 官方

RT-VLM 视频密集描述部署

部署并调用 NVIDIA RT-VLM 微服务,为视频片段生成密集描述并管理实时流。

自动化与运维 ✓ NVIDIA · 官方

VSS 配置文件部署助手

为 NVIDIA 视频搜索与摘要蓝图选择、部署并验证 Compose 配置文件。

数据与分析 ✓ NVIDIA · 官方

TAO DAFT 数据集验证器

用 tao-daft validate 检查 TAO DAFT 数据集的结构、架构与交叉引用错误。

开发与工程 ✓ NVIDIA · 官方

DALI 动态模式开发助手

帮助 AI 代理编写、审查和迁移 NVIDIA DALI 命令式动态模式代码。

开发与工程 ✓ NVIDIA · 官方

DOCA 调试

帮助定位并分层排查 NVIDIA DOCA 的构建、链接、运行时与程序问题。

相关 Skills