数据与分析 ✓ NVIDIA · 官方 video-qnavideo-understandingvlmvssvstvisual-analysis

VSS 视频问答

让智能体直接查看视频片段并回答具体视觉问题。

FollowSkills 评估 · FSRS-2.0
不推荐
52/ 100 五分制 2.6 / 5
信任安全16 / 25 · 3.2/5

技能明确限制为新鲜视频视觉问答,要求先探测 VSS、列出传感器,并在上传前确认;这些措施支持范围控制和部分数据流透明度。扣分原因是上传会产生外部写入,缺少认证、隐私/敏感视频处理、权限隔离和完整回滚说明,且 curl 请求可能将本地视频发送到服务端。

可靠稳定8 / 20 · 2.0/5

SKILL.md 提供了探测、传感器检查、上传、/generate 调用和去除 agent-think 的具体流程,并规定探测失败时停止或请求部署。扣分原因是没有覆盖 HTTP 非 2xx、超时后的诊断、上传冲突、响应格式异常和依赖缺失;BENCHMARK.md 也记录了连接/错误指导不足。静态证据不足以超过 10 分上限。

适用触发9 / 15 · 3.0/5

触发场景、非适用场景、输入标识方式和 VSS profile 前提较清楚,能够区分视觉问题与元数据或既有结果可回答的问题。扣分原因是没有中文交互或本地化说明,且未证明对中国大陆网络环境的可达性;对 URL、sensor-id 和文件名歧义虽有部分处理,但边界仍不完整。

规范维护8 / 15 · 2.7/5

包含名称、描述、Apache-2.0、版本 3.2.0、产品仓库链接、交叉引用、输出约定和评估报告,结构总体可读。扣分原因是缺少 metadata.author,缺少推荐的 Instructions 和 Examples,缺少 changelog、明确维护责任/更新路径,以及更完整的故障排查和已知限制说明;仓库许可证元数据为 NOASSERTION,虽有技能级 Apache-2.0 声明,治理信息仍不完全一致。

有效结果6 / 15 · 2.0/5

技能给出了可直接执行的 VSS agent /generate 请求格式、传感器预检查和最终文本提取方式,理论上能完成单个视频片段的视觉问答。扣分原因是 benchmark 仅有 1 个任务,正确性和效果均为 50%,且静态审查不能验证真实输出、时间戳准确性或视频内容覆盖;结果仍需用户审阅。

证据核验5 / 10 · 2.5/5

存在提交的 benchmark、eval 配置和评估结果,并记录了安全、正确性、发现性及效率信号;这提供了有限的可审计证据。扣分原因是仅覆盖 1 个任务、无负向任务,且没有本技能专属的可复现测试套件或第三方独立 corroboration;静态证据上限为 5 分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 执行前确认 VSS profile、VST 和 video_understanding 工具可用,并验证 HOST_IP、sensor-id 与视频路径。
  • 上传视频是外部写操作;确认视频中不存在不应发送的敏感内容,并在写入前检查冲突和权限。
  • 不要将 VLM 输出视为事实保证,尤其是安全判断和时间戳;应保留人工复核。
  • 中国大陆网络可达性未在源文件中证明,部署依赖和相关服务可能需要本地可达配置。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

VSS 视频问答技能用于调用 VSS Agent 的 video_understanding 工具,对录制视频片段进行一次新的视觉问答。它适合回答视频中的人物、物体、动作、颜色、时间和安全等需要查看画面的事实。使用前必须有提供 video_understanding 工具的 VSS profile,并确认目标视频已作为 VST sensor 存在。该技能版本为 3.2.0,技能许可证为 Apache-2.0。

先探测 VSS Agent 的 /docs 接口,再列出 VST sensors;若目标 sensor 不存在,可在确认后上传视频并重新检查。随后向 VSS Agent 的 /generate 发送包含 sensor ID 和用户问题的请求,要求其调用 video_understanding。最后读取响应中的 value,移除 agent-think 区块,只返回最终答案。

  1. 视频运营人员需要确认某个片段中发生了什么,并要求模型直接查看画面。
  2. 安全分析人员需要核实视频中是否出现特定人员、物体、动作或安全事件。
  3. 用户在已有粗略摘要后追问颜色、时间点或其他内容细节。
  4. 已有搜索结果无法回答具体视觉事实,用户需要基于原始视频进行验证。

这个 Skill 有哪些优点和局限?

优点
  • 针对需要直接查看视频像素的临时问答,流程边界清晰。
  • 包含 VSS profile 探测、sensor 检查、上传确认和响应清理要求。
  • 明确排除可由元数据、搜索结果或既有输出回答的问题,减少误用。
  • 技能本身标注为 Apache-2.0。
局限
  • 必须依赖正在运行的 VSS Agent、video_understanding 工具和 VST sensor 服务。
  • 每次 /generate 前都必须列出 sensors,交互流程不能省略该检查。
  • 技能只处理新鲜的视觉问答,不负责既有工具输出、搜索命中或元数据问答。
  • 提供的材料没有平台矩阵、性能指标或该技能专属测试结果。

如何安装这个 Skill?

使用仓库 README 支持的 skills CLI 安装指定技能:

npx skills add nvidia/skills --skill vss-ask-video --yes

无需手动克隆仓库或复制技能目录。

如何使用这个 Skill?

安装后,向智能体提出针对具体视频 sensor 的视觉问题,例如:"请调用 video_understanding,回答 sensor warehouse_safety_0001 中是否有人进入禁区。"

运行前需要:

  1. 确认 VSS profile 正在运行,并提供 video_understanding;base 为推荐 profile,lvs 也可使用。
  2. 列出 VST sensors,确认 sensor ID 或文件名 stem 存在。
  3. 若 sensor 不存在,先在用户确认后上传视频,再重新列出 sensors。
  4. 让 VSS Agent 通过 /generate 回答问题。

技能不规定具体部署命令或完整上传参数语义;部署和存储细节分别交由 vss-deploy-profile 与 vss-manage-video-io-storage 处理。

常见问题

它能否直接回答视频文件名或元数据问题?
不适合。技能明确要求将其用于需要查看视频画面的视觉事实;若数据库、MCP、既有输出或元数据已经能回答问题,应优先使用这些信息。
使用前是否必须部署 VSS profile?
是。必须有提供 video_understanding 的 VSS profile;材料推荐 base,也列出 lvs。若探测失败,应先询问用户是否部署。
视频尚未出现在 VST sensors 中怎么办?
先列出 sensors 确认不存在,再在交互式运行中征得用户同意后上传视频,并重新列出 sensors 验证。
技能会返回完整的 VSS 内部思考内容吗?
不会。调用者必须从 value 中移除 agent-think 区块,只返回剩余的最终答案文本。

同仓库的其他 Skills

均来自 NVIDIA/skills

自动化与运维 ✓ NVIDIA · 官方

VSS 视频分析报告

为单个视频片段或事件时间范围生成结构化的视频分析报告。

自动化与运维 ✓ NVIDIA · 官方

VSS 视频摘要

通过LVS服务或VLM回退,为录制视频生成带时间戳的叙事摘要。

自动化与运维 ✓ NVIDIA · 官方

VSS 告警管理

为 NVIDIA VSS 部署提供实时告警、订阅、事件查询、Slack 通知和摄像头接入流程。

数据与分析 ✓ NVIDIA · 官方

TAO 图像指代表达式标注管线

将图像和 KITTI 框标注转换为可定位的指代表达式数据。

数据与分析 ✓ NVIDIA · 官方

i4H 数据集标注工作流

使用视觉语言模型验证轨迹是否完成任务,并筛选可用于微调的数据。

自动化与运维 ✓ NVIDIA · 官方

RT-VLM 视频密集描述部署

部署并调用 NVIDIA RT-VLM 微服务,为视频片段生成密集描述并管理实时流。

自动化与运维 ✓ NVIDIA · 官方

VSS 视频分析 API 独立部署

帮助运维人员独立部署并验证 VSS 视频分析 REST API。

数据与分析 ✓ NVIDIA · 官方

TAO VLM 二分类差距分析

从 VLM 是非预测中提取误报和漏报样本,支持后续根因分析。

自动化与运维 ✓ NVIDIA · 官方

VSS 视频自动标定

通过 AutoMagicCalib 为本地视频、RTSP 摄像头或示例数据集执行端到端视频标定。

自动化与运维 ✓ NVIDIA · 官方

VSS 归档视频搜索

通过自然语言搜索归档视频,并摄取文件或 RTSP 流建立可检索索引。

数据与分析 ✓ NVIDIA · 官方

TAO DEFT AOI 检测优化循环

为 PCB 视觉检测模型自动执行评估、缺陷增强、挖掘、重训与部署门控。

数据与分析 ✓ NVIDIA · 官方

TAO 视频推理标注流水线

把原始视频转换为带推理链的训练数据。

数据与分析 ✓ NVIDIA · 官方

TAO ChangeNet 根因分析

基于图像证据定位 NVIDIA TAO Visual ChangeNet 分类实验的模型失败原因。

自动化与运维 ✓ NVIDIA · 官方

VSS 配置文件部署助手

为 NVIDIA 视频搜索与摘要蓝图选择、部署并验证 Compose 配置文件。

开发与工程 ✓ NVIDIA · 官方

cuPyNumeric 迁移就绪度评估

在投入大规模移植工作前,判断 NumPy 代码能否在 GPU 和多 GPU 环境中有效扩展。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE VLM 训练指南

帮助选择并调优 MoE 视觉语言模型的 FSDP 与 3D 并行训练方案。

自动化与运维 ✓ NVIDIA · 官方

VSS 视频嵌入部署技能

部署并运维支持文件、文本和实时视频流的 NVIDIA 视频嵌入服务。

数据与分析 ✓ NVIDIA · 官方

cuOpt 多目标探索

用 cuOpt 展示竞争目标之间的 Pareto 权衡。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 序列打包

为 Megatron-Bridge 配置并验证序列打包与长上下文训练。

自动化与运维 ✓ NVIDIA · 官方

VSS 多摄像头三维检测追踪部署

部署基于 DeepStream 与 BEV Fusion 的多摄像头三维感知服务。

相关 Skills