自动化与运维 ✓ NVIDIA · 官方 rt-vlmdense-captioningvideo-streamingdocker-composerest-apirtspkafkanvidia-vss

RT-VLM 视频密集描述部署

部署并调用 NVIDIA RT-VLM 微服务,为视频片段生成密集描述并管理实时流。

FollowSkills 评估 · FSRS-2.0
不推荐
45/ 100 五分制 2.3 / 5
信任安全11 / 25 · 2.2/5

文档明确要求使用Bearer/API密钥、避免泄露凭据、限制sudo为非交互模式、禁止未经确认替换Kafka,并要求干运行与清理;但部署仍涉及Docker、GPU、主机目录所有权和可能重启Docker等高权限外部操作,凭据写入env及外部模型/服务数据流的隔离和用户确认不足,因此扣14分。

可靠稳定8 / 20 · 2.0/5

路由、环境变量、预检、OpenAPI优先、健康检查、错误码和失败反馈较完整,且有评估清单;但关键部署和API路径未在本次静态审查中执行,依赖版本、远程服务、GPU和Compose细节存在不确定性,静态上限内扣12分。

适用触发8 / 15 · 2.7/5

目标用户、部署/API场景、非适用的完整VSS profile边界、输入输出和RTSP失败条件描述清楚;但未说明中文交互或中文输出能力,且核心镜像、模型和部分文档依赖海外网络,可能影响中国大陆可达性,扣7分。

规范维护8 / 15 · 2.7/5

SKILL.md采用目的、前置条件、路由、工作流、限制、故障排除及references分层,含版本和Apache-2.0元数据;但skill-card宣称“Apache 2.0 OR MIT”与主文件不一致,作者元数据缺失,变更记录和明确维护责任不完整,扣7分。

有效结果6 / 15 · 2.0/5

技能覆盖独立部署、上传 caption、RTSP、聊天和Kafka,并规定使用实时OpenAPI、精确模型ID和清理资源;提交的评估报告显示有限的正确性/有效性信号,但无本次静态审查可验证的代表性实际输出,且高昂GPU、镜像、模型和Kafka依赖限制成本效益,扣9分。

证据核验4 / 10 · 2.0/5

存在固定版本、引用文件、eval manifests和一份评估报告,支持有限追溯;但没有可在本次审查中独立复现的执行结果、CI覆盖或第三方交叉证据,且评估样本仅2个任务,扣6分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 执行可能要求Docker组或sudo权限、修改主机目录所有权,甚至重启Docker;应在每次高权限或外部副作用操作前取得明确确认,并保留回滚方案。
  • NGC、Hugging Face、远程VLM和文档服务可能依赖海外网络;应预先确认大陆网络可达性、镜像缓存和替代方案。
  • 主文件与skill-card的许可证声明冲突,且评估报告记录Codex安全得分仅25%;发布前应由维护者统一许可证并复核凭据、Kafka和清理流程。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向独立部署 NVIDIA RT-VLM 密集描述微服务,并调用其 REST API。它覆盖本地视频上传、分段描述生成、RTSP 流管理、OpenAI 兼容聊天补全、健康检查、指标和 Kafka 相关流程。部署需要 Docker Compose、NVIDIA Container Toolkit、可见 GPU 和 NGC 凭据。它不负责完整 VSS 配置文件部署或视频搜索摄取。

指导代理复制并修改 RT-VLM Docker Compose 文件,生成环境文件,执行 GPU、Docker 和 NVIDIA 容器预检,运行 Compose 配置干运行校验,拉取指定镜像并启动服务。它使用 curl 和 jq 调用健康检查、模型列表、文件上传、generate_captions、RTSP 流增删、chat-completions、资产统计和 Prometheus 指标接口,并处理 SSE 描述流、Bearer 认证、常见 HTTP 错误和 Kafka 校验流程。

  1. 需要在单机 NVIDIA GPU 主机上独立运行 RT-VLM 的平台工程师,可按流程完成部署和健康检查。
  2. 需要分析本地仓库或监控视频的开发者,可上传视频并按 10 秒片段生成密集描述和告警。
  3. 需要处理实时摄像头流的运维人员,可注册指定 RTSP 地址、生成描述并注销流。
  4. 需要接入现有 RT-VLM 服务的应用开发者,可调用 REST API、OpenAI 兼容聊天接口和模型探测接口。
  5. 需要验证事件告警发布的工程师,可结合服务配置检查 Kafka 主题和消息流程。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖从独立部署、预检、干运行到健康验证的完整操作链路。
  • 支持本地视频、RTSP 实时流、SSE 描述、OpenAI 兼容聊天补全及 Kafka 相关验证。
  • 明确区分独立 RT-VLM 部署与完整 VSS profile 部署,减少错误路由。
  • 提供模型认证、常见 HTTP 错误、GPU 内存不足和 Docker 快照解包问题的排查方向。
局限
  • 需要 NVIDIA GPU、NVIDIA Container Toolkit、Docker 环境和 NGC 凭据,部署门槛较高。
  • NGC 模型和 NIM 可能受限流、GPU 显存和许可证约束。
  • 并发、显存和存储能力取决于主机硬件及 Compose 配置;来源未规定具体硬件支持矩阵。
  • 不适用于完整 VSS profile 部署或视频搜索摄取;相关流程由其他技能负责。

如何安装这个 Skill?

使用仓库 README 提供的 skills CLI 安装指定技能:

npx skills add nvidia/skills --skill vss-deploy-dense-captioning --yes

CLI 会提示选择安装目标;技能目录应由 CLI 安装到所选目标。README 未给出该技能的固定本地安装路径。

如何使用这个 Skill?

先确保 Docker、Docker Compose、NVIDIA Container Toolkit、可见 GPU、NGC_CLI_API_KEY、curl 和 jq 可用。将 deploy/docker/services/rtvi/rtvi-vlm/rtvi-vlm-docker-compose.yml 复制到可写目录,移除独立运行时无效的 depends_on,创建 gitignored 的 rtvi-vlm.env,并按技能要求设置 NGC_CLI_API_KEY、RTVI_VLM_PORT、HOST_IP、VSS_DATA_DIR、RTVI_VLM_MODEL_TO_USE 等变量。依次执行 GPU/Docker 预检、

docker compose --env-file rtvi-vlm.env -f rtvi-vlm-docker-compose.yml config --quiet

然后拉取精确镜像标签、启动 rtvi-vlm,并等待就绪。设置 BASE_URL 和 API_KEY 后,可先运行:

curl -fsS "$BASE_URL/v1/health/ready"

对本地视频,调用 POST /v1/files 上传,再将返回的 id 传给 POST /v1/generate_captions;实时流必须使用调用方提供且已验证的视频 RTSP_SAMPLE_URL。调用前应读取 /openapi.json,确认可选接口和实际模型 ID。不要在日志或响应中暴露凭据。

常见问题

这个技能是否免费?
来源没有说明服务、NGC 模型或 NIM 的费用;它只说明 NGC 资源可能受许可证限制。
是否必须部署服务才能使用?
不一定。技能既支持独立部署 RT-VLM,也支持调用一个已运行且可通过 BASE_URL 访问的 RT-VLM 服务。
为什么不能直接运行原始 Compose 文件?
来源说明原始文件包含仅在完整 VSS 或 met-blueprints Compose 项目中定义的 sibling 服务依赖;独立部署前必须复制文件并移除该独立运行无效的 depends_on。
如何处理凭据和权限?
NGC_CLI_API_KEY、RTVI_VLM_API_KEY 和 rtvi-vlm.env 不应提交到 Git 或写入日志。Docker 组访问和 sudo 实际上具有 root 级权限;无密码 sudo 不可用时,应让主机所有者手动执行命令。

同仓库的其他 Skills

均来自 NVIDIA/skills

自动化与运维 ✓ NVIDIA · 官方

VSS 视频分析 API 独立部署

帮助运维人员独立部署并验证 VSS 视频分析 REST API。

自动化与运维 ✓ NVIDIA · 官方

VSS 视频嵌入部署技能

部署并运维支持文件、文本和实时视频流的 NVIDIA 视频嵌入服务。

自动化与运维 ✓ NVIDIA · 官方

VSS 多摄像头三维检测追踪部署

部署基于 DeepStream 与 BEV Fusion 的多摄像头三维感知服务。

自动化与运维 ✓ NVIDIA · 官方

VSS 视频摘要

通过LVS服务或VLM回退,为录制视频生成带时间戳的叙事摘要。

自动化与运维 ✓ NVIDIA · 官方

VIOS 视频输入输出与存储管理

通过 VIOS REST API 管理传感器、视频流、录制、快照和视频存储。

自动化与运维 ✓ NVIDIA · 官方

VSS 配置文件部署助手

为 NVIDIA 视频搜索与摘要蓝图选择、部署并验证 Compose 配置文件。

自动化与运维 ✓ NVIDIA · 官方

VSS 行为分析独立部署

指导你在不启动完整仓库栈的情况下独立部署和运行 VSS 行为分析服务。

自动化与运维 ✓ NVIDIA · 官方

VSS 视频自动标定

通过 AutoMagicCalib 为本地视频、RTSP 摄像头或示例数据集执行端到端视频标定。

自动化与运维 ✓ NVIDIA · 官方

RTVI-CV 二维检测跟踪运维技能

部署并运维 RTVI-CV 二维视频检测与跟踪微服务。

自动化与运维 ✓ NVIDIA · 官方

NVIDIA AI-Q 部署助手

部署、验证和运维 NVIDIA AI-Q Blueprint 基础设施。

开发与工程 ✓ NVIDIA · 官方

AutoMagicCalib 视频标定

通过 REST API 将本地多摄像头 MP4 视频转换为 AutoMagicCalib 标定结果。

开发与工程 ✓ NVIDIA · 官方

AMC 样例数据集校准

用 NVIDIA AutoMagicCalib 的内置样例数据端到端验证正在运行的校准服务。

自动化与运维 ✓ NVIDIA · 官方

AutoMagicCalib 校准栈启动器

通过 Docker Compose 部署 AutoMagicCalib 微服务与 Web UI,快速启动摄像头自动标定环境。

开发与工程 ✓ NVIDIA · 官方

cuOpt REST 服务部署与 Python 客户端

帮助用户部署 NVIDIA cuOpt REST 服务并通过 Python 或 curl 提交优化请求。

自动化与运维 ✓ NVIDIA · 官方

NVIDIA RAG Blueprint 运维技能

帮助代理部署、配置、排障和管理 NVIDIA RAG Blueprint。

自动化与运维 ✓ NVIDIA · 官方

VSS 视频分析报告

为单个视频片段或事件时间范围生成结构化的视频分析报告。

自动化与运维 ✓ NVIDIA · 官方

VSS 归档视频搜索

通过自然语言搜索归档视频,并摄取文件或 RTSP 流建立可检索索引。

数据与分析 ✓ NVIDIA · 官方

TAO 视频推理标注流水线

把原始视频转换为带推理链的训练数据。

数据与分析 ✓ NVIDIA · 官方

VSS 视频问答

让智能体直接查看视频片段并回答具体视觉问题。

自动化与运维 ✓ NVIDIA · 官方

cuOpt 安装助手

指导在 Python、C 或 REST 服务中安装并验证 NVIDIA cuOpt。

相关 Skills