VSS 视频问答
让智能体直接查看视频片段并回答具体视觉问题。
技能明确限制为新鲜视频视觉问答,要求先探测 VSS、列出传感器,并在上传前确认;这些措施支持范围控制和部分数据流透明度。扣分原因是上传会产生外部写入,缺少认证、隐私/敏感视频处理、权限隔离和完整回滚说明,且 curl 请求可能将本地视频发送到服务端。
SKILL.md 提供了探测、传感器检查、上传、/generate 调用和去除 agent-think 的具体流程,并规定探测失败时停止或请求部署。扣分原因是没有覆盖 HTTP 非 2xx、超时后的诊断、上传冲突、响应格式异常和依赖缺失;BENCHMARK.md 也记录了连接/错误指导不足。静态证据不足以超过 10 分上限。
触发场景、非适用场景、输入标识方式和 VSS profile 前提较清楚,能够区分视觉问题与元数据或既有结果可回答的问题。扣分原因是没有中文交互或本地化说明,且未证明对中国大陆网络环境的可达性;对 URL、sensor-id 和文件名歧义虽有部分处理,但边界仍不完整。
包含名称、描述、Apache-2.0、版本 3.2.0、产品仓库链接、交叉引用、输出约定和评估报告,结构总体可读。扣分原因是缺少 metadata.author,缺少推荐的 Instructions 和 Examples,缺少 changelog、明确维护责任/更新路径,以及更完整的故障排查和已知限制说明;仓库许可证元数据为 NOASSERTION,虽有技能级 Apache-2.0 声明,治理信息仍不完全一致。
技能给出了可直接执行的 VSS agent /generate 请求格式、传感器预检查和最终文本提取方式,理论上能完成单个视频片段的视觉问答。扣分原因是 benchmark 仅有 1 个任务,正确性和效果均为 50%,且静态审查不能验证真实输出、时间戳准确性或视频内容覆盖;结果仍需用户审阅。
存在提交的 benchmark、eval 配置和评估结果,并记录了安全、正确性、发现性及效率信号;这提供了有限的可审计证据。扣分原因是仅覆盖 1 个任务、无负向任务,且没有本技能专属的可复现测试套件或第三方独立 corroboration;静态证据上限为 5 分。
- 执行前确认 VSS profile、VST 和 video_understanding 工具可用,并验证 HOST_IP、sensor-id 与视频路径。
- 上传视频是外部写操作;确认视频中不存在不应发送的敏感内容,并在写入前检查冲突和权限。
- 不要将 VLM 输出视为事实保证,尤其是安全判断和时间戳;应保留人工复核。
- 中国大陆网络可达性未在源文件中证明,部署依赖和相关服务可能需要本地可达配置。
这个 Skill 能做什么,适合哪些场景?
VSS 视频问答技能用于调用 VSS Agent 的 video_understanding 工具,对录制视频片段进行一次新的视觉问答。它适合回答视频中的人物、物体、动作、颜色、时间和安全等需要查看画面的事实。使用前必须有提供 video_understanding 工具的 VSS profile,并确认目标视频已作为 VST sensor 存在。该技能版本为 3.2.0,技能许可证为 Apache-2.0。
先探测 VSS Agent 的 /docs 接口,再列出 VST sensors;若目标 sensor 不存在,可在确认后上传视频并重新检查。随后向 VSS Agent 的 /generate 发送包含 sensor ID 和用户问题的请求,要求其调用 video_understanding。最后读取响应中的 value,移除 agent-think 区块,只返回最终答案。
- 视频运营人员需要确认某个片段中发生了什么,并要求模型直接查看画面。
- 安全分析人员需要核实视频中是否出现特定人员、物体、动作或安全事件。
- 用户在已有粗略摘要后追问颜色、时间点或其他内容细节。
- 已有搜索结果无法回答具体视觉事实,用户需要基于原始视频进行验证。
这个 Skill 有哪些优点和局限?
- 针对需要直接查看视频像素的临时问答,流程边界清晰。
- 包含 VSS profile 探测、sensor 检查、上传确认和响应清理要求。
- 明确排除可由元数据、搜索结果或既有输出回答的问题,减少误用。
- 技能本身标注为 Apache-2.0。
- 必须依赖正在运行的 VSS Agent、video_understanding 工具和 VST sensor 服务。
- 每次 /generate 前都必须列出 sensors,交互流程不能省略该检查。
- 技能只处理新鲜的视觉问答,不负责既有工具输出、搜索命中或元数据问答。
- 提供的材料没有平台矩阵、性能指标或该技能专属测试结果。
如何安装这个 Skill?
使用仓库 README 支持的 skills CLI 安装指定技能:
npx skills add nvidia/skills --skill vss-ask-video --yes
无需手动克隆仓库或复制技能目录。
如何使用这个 Skill?
安装后,向智能体提出针对具体视频 sensor 的视觉问题,例如:"请调用 video_understanding,回答 sensor warehouse_safety_0001 中是否有人进入禁区。"
运行前需要:
- 确认 VSS profile 正在运行,并提供 video_understanding;base 为推荐 profile,lvs 也可使用。
- 列出 VST sensors,确认 sensor ID 或文件名 stem 存在。
- 若 sensor 不存在,先在用户确认后上传视频,再重新列出 sensors。
- 让 VSS Agent 通过 /generate 回答问题。
技能不规定具体部署命令或完整上传参数语义;部署和存储细节分别交由 vss-deploy-profile 与 vss-manage-video-io-storage 处理。