自动化与运维 ✓ NVIDIA · 官方 video-data-augmentationauto-labelingosmophysical-aicosmosworkflow-orchestration

OSMO 物理 AI 视频增强编排器

在 OSMO 上安全运行视频增强、自动标注与结果回收流程。

FollowSkills 评估 · FSRS-2.0
不推荐
40/ 100 五分制 2.0 / 5
信任安全10 / 25 · 2.0/5

文档明确列出所需密钥、数据路径、输入保留规则、凭据用途和禁止缩容/删除既有 NIM 等约束,也要求从实际后端推导 storage_url;但执行会自动提交工作流、部署或修复 NIM、安装依赖并访问外部模型源,缺少逐次用户确认、最小权限说明、回滚方案和完整数据流披露,因此扣分。

可靠稳定7 / 20 · 1.8/5

流程、参数、预检、缓存检查、监控和失败时的部分反馈较完整,并使用 set -euo pipefail;但本次仅静态阅读,关键脚本未提供,依赖在线镜像、运行时 apt/pip 安装和 OSMO 环境,未能复现关键路径,异常覆盖有限,因此不超过静态上限并扣分。

适用触发6 / 15 · 2.0/5

触发词、适用场景、四种流程、默认值和若干阻塞条件写得清楚;但能力强依赖 OSMO、GPU 池、NVIDIA/Hugging Face/Google 下载源,未说明中文交互支持或中国大陆网络可达性,非 OSMO 环境基本不适用,因此扣分。

规范维护7 / 15 · 2.3/5

SKILL.md 具备用途、前置条件、脚本表、流程表、示例、限制和版本/负责人元数据,许可证也明确;但 BENCHMARK 明确指出缺少 Examples 推荐章节,作者格式不合规范,维护责任和变更日志/更新路径在技能文件中不充分,因此扣分。

有效结果6 / 15 · 2.0/5

目标是从预检到提交、监控、下载和增强结果对比的端到端 VDA 编排,输出路径和完成产物定义较直接;BENCHMARK 报告提供了单任务的高通过结果,但样本仅一个、无负向任务,且静态审查无法验证真实产物质量或成本收益,因此扣分。

证据核验4 / 10 · 2.0/5

提供固定模型修订哈希、明确配置和一份 NVSkills-Eval 报告,形成有限审计线索;但报告只有一个任务、未提供覆盖关键路径的提交测试套件或 CI 证据,且不能由本次静态材料独立复现,因此扣分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 运行会自动执行云端工作流、部署/修复 NIM、下载模型并产生 GPU/存储/网络成本;应在真实环境中确认授权、预算和回滚策略。
  • 凭据会传递给 NVIDIA 容器及 VLM/LLM/Hugging Face 相关流程;外部 Google Drive、Google Storage 和 Hugging Face 下载源需要单独进行供应链、网络可达性和完整性审查。
  • 仅有一次基准任务,不能据此证明多视频、失败重试、权限隔离或实际输出质量。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

这是 NVIDIA 发布的物理 AI 视频数据增强工作流技能,面向 OSMO 上的视频增强和自动标注任务。它负责流程选择、凭据预检、缓存就绪检查、推理路径决策、提交时参数插值、运行监控和输出下载。支持仅自动标注、增强后标注,以及两种端到端流程。运行依赖 OSMO CLI、可用 GPU 池、相应凭据和实际数据后端。

根据用户意图选择 auto_labeling、augmentation_and_al、e2e 或 e2e_super_resolution 流程;运行凭据和控制平面预检、提交前安全检查及模型缓存准备;从实际数据集后端推导 storage_url;通过 OSMO 提交流程并监控任务状态;下载完整运行产物。增强流程完成后,还会生成增强前后并排对比,并汇总增强和伪标签结果。

  1. 需要只为原始视频生成伪标签的数据团队,可使用 auto_labeling 流程。
  2. 需要生成增强视频并为增强结果自动标注的团队,可使用 augmentation_and_al 流程。
  3. 需要优先吞吐量、并行运行完整流程的团队,可使用 e2e 流程。
  4. 需要先通过超分辨率门控再进行增强的团队,可使用 e2e_super_resolution 流程。
  5. 没有提供输入数据、希望先用 NVIDIA VDA 演示资产验证环境的用户,可使用默认演示路径。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖从预检到输出下载的端到端流程。
  • 支持四种明确的工作流模式,并提供自动缓存修复策略。
  • 要求使用实际数据后端推导存储地址,降低存储配置错误风险。
  • 增强流程要求提供并排对比证据,而不只返回原始输出 URL。
  • 仓库 README 说明技能通过每日同步维护,并提供签名、评估数据集和基准报告治理机制。
局限
  • 需要 OSMO CLI、已登录的 OSMO 配置、数据凭据配置和 ONLINE GPU 池。
  • 通常需要 Hugging Face token;部分可选的 NGC 功能还需要相应 API key。
  • 运行会依赖网络、GPU 调度和模型缓存,冷启动可能需要约 45–80 分钟。
  • SKILL.md 没有提供独立测试套件或具体平台覆盖证据。
  • 该技能只适用于 VDA 执行编排,不适合容器内部的调优问题。

如何安装这个 Skill?

使用 NVIDIA skills CLI 安装整个仓库中的指定技能:

npx skills add nvidia/skills --skill physical-ai-video-data-augmentation --yes

也可以安装到指定 Agent,例如:

npx skills add nvidia/skills --skill physical-ai-video-data-augmentation --agent codex

README 未说明该单项技能需要额外的本地安装步骤。

如何使用这个 Skill?

向 Agent 提出明确任务,例如:“在 OSMO 上运行视频数据增强并为增强视频自动标注”。未指定流程时默认使用 augmentation_and_al;未提供视频时使用 nvidia/video-data-augmentation-demo。实际运行前需要配置 HF_TOKEN、登录 OSMO CLI、注册匹配的数据凭据配置,并确保存在 ONLINE GPU 池。缺少必需凭据、无法推导存储后端前缀或没有可用 GPU 平台时,技能会暂停并要求补充信息。

常见问题

必须提供视频数据吗?
不必须。没有明确输入时,技能默认使用 NVIDIA 的 nvidia/video-data-augmentation-demo;如果用户提供了数据集 URL、本地路径或上传目录,则必须优先使用该输入。
运行需要哪些权限或凭据?
需要 OSMO CLI 访问权限、匹配数据后端的凭据配置、至少一个 ONLINE GPU 池,以及用于拉取 gated Cosmos/SeedVR 权重的 Hugging Face token。某些 NGC 检查或凭据刷新还可能需要 NGC API key。
失败时会发生什么?
缺少凭据时会返回 USER_INPUT_REQUIRED;无法确定存储后端前缀或 GPU 平台时会要求补充信息。缓存检查失败时默认尝试提交模型缓存工作流;插值提交失败时按规范使用相同提交格式重试一次。
运行成本是多少?
源材料没有提供费用信息;它只给出了时间范围。提交后各流程通常约需 6–45 分钟,冷启动端到端运行通常约需 45–80 分钟。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

PAS 人员属性搜索工作流

在 OSMO 上扩增人员图像并自动生成属性标注。

自动化与运维 ✓ NVIDIA · 官方

Physical AI 基础设施与弹性扩展

为合成数据生成工作流搭建、验证并恢复可扩展的 Physical AI 基础设施。

数据与分析 ✓ NVIDIA · 官方

NVIDIA 物理AI缺陷图像生成

在 OSMO 上编排 PCBA、金属表面和玻璃检测的缺陷图像生成、增强与标注流程。

数据与分析 ✓ NVIDIA · 官方

TAO 图像指代表达定位

将图像和文字描述转换为带像素级边界框的短语定位标注。

开发与工程 ✓ NVIDIA · 官方

CAD 到 SimReady 工作流

将 CAD 或其他源资产按阶段转换、赋予仿真属性并验证为可交付的 SimReady USD。

自动化与运维 ✓ NVIDIA · 官方

VSS 视频嵌入部署技能

部署并运维支持文件、文本和实时视频流的 NVIDIA 视频嵌入服务。

数据与分析 ✓ NVIDIA · 官方

VSS 视频分析查询

通过 VA-MCP 读取视频分析事件、指标、告警与传感器数据。

数据与分析 ✓ NVIDIA · 官方

Cosmos Reason 视频问答微调

为 Cosmos3-Nano 视频问答模型提供基于 FSDP 的 SFT、LoRA、评估与 AutoML 工作流指导。

自动化与运维 ✓ NVIDIA · 官方

VSS 归档视频搜索

通过自然语言搜索归档视频,并摄取文件或 RTSP 流建立可检索索引。

数据与分析 ✓ NVIDIA · 官方

TAO VCN 样本路由

将视觉缺陷分析样本按标签资格分流至挖掘和异常生成模块。

数据与分析 ✓ NVIDIA · 官方

TAO VCN 分类缺口分析

定位最脆弱的VCN分类样本并生成增强候选队列。

自动化与运维 ✓ NVIDIA · 官方

TAO 工作流启动门禁

在执行 TAO 作业前完成平台、凭证、数据与容器预检。

开发与工程 ✓ NVIDIA · 官方

DALI 动态模式开发助手

帮助 AI 代理编写、审查和迁移 NVIDIA DALI 命令式动态模式代码。

写作与内容 ✓ NVIDIA · 官方

技能卡生成器

为现有智能体技能生成或更新治理技能卡。

数据与分析 ✓ NVIDIA · 官方

NV-Generate-MR

通过 NVIDIA 的 rflow-mr 流程生成合成体部 MRI 影像体积。

自动化与运维 ✓ NVIDIA · 官方

DOCA Telemetry Utils

发现遥测计数器、转换 Data ID,并在提交导出器配置前验证 BlueField 设备支持情况。

数据与分析 ✓ NVIDIA · 官方

Earth2Studio 气象数据获取

按变量和时间从 Earth2Studio 数据源获取气象与气候数据。

开发与工程 ✓ NVIDIA · 官方

Earth2Studio 组件发现

为天气和气候任务筛选合适的模型、数据源与示例。

自动化与运维 ✓ NVIDIA · 官方

VSS 多摄像头三维检测追踪部署

部署基于 DeepStream 与 BEV Fusion 的多摄像头三维感知服务。

数据与分析 ✓ NVIDIA · 官方

NVIDIA AI-Q 深度研究

通过本地 AI-Q Blueprint 后端执行可追踪的深度研究。

相关 Skills