OSMO 物理 AI 视频增强编排器
在 OSMO 上安全运行视频增强、自动标注与结果回收流程。
文档明确列出所需密钥、数据路径、输入保留规则、凭据用途和禁止缩容/删除既有 NIM 等约束,也要求从实际后端推导 storage_url;但执行会自动提交工作流、部署或修复 NIM、安装依赖并访问外部模型源,缺少逐次用户确认、最小权限说明、回滚方案和完整数据流披露,因此扣分。
流程、参数、预检、缓存检查、监控和失败时的部分反馈较完整,并使用 set -euo pipefail;但本次仅静态阅读,关键脚本未提供,依赖在线镜像、运行时 apt/pip 安装和 OSMO 环境,未能复现关键路径,异常覆盖有限,因此不超过静态上限并扣分。
触发词、适用场景、四种流程、默认值和若干阻塞条件写得清楚;但能力强依赖 OSMO、GPU 池、NVIDIA/Hugging Face/Google 下载源,未说明中文交互支持或中国大陆网络可达性,非 OSMO 环境基本不适用,因此扣分。
SKILL.md 具备用途、前置条件、脚本表、流程表、示例、限制和版本/负责人元数据,许可证也明确;但 BENCHMARK 明确指出缺少 Examples 推荐章节,作者格式不合规范,维护责任和变更日志/更新路径在技能文件中不充分,因此扣分。
目标是从预检到提交、监控、下载和增强结果对比的端到端 VDA 编排,输出路径和完成产物定义较直接;BENCHMARK 报告提供了单任务的高通过结果,但样本仅一个、无负向任务,且静态审查无法验证真实产物质量或成本收益,因此扣分。
提供固定模型修订哈希、明确配置和一份 NVSkills-Eval 报告,形成有限审计线索;但报告只有一个任务、未提供覆盖关键路径的提交测试套件或 CI 证据,且不能由本次静态材料独立复现,因此扣分。
- 运行会自动执行云端工作流、部署/修复 NIM、下载模型并产生 GPU/存储/网络成本;应在真实环境中确认授权、预算和回滚策略。
- 凭据会传递给 NVIDIA 容器及 VLM/LLM/Hugging Face 相关流程;外部 Google Drive、Google Storage 和 Hugging Face 下载源需要单独进行供应链、网络可达性和完整性审查。
- 仅有一次基准任务,不能据此证明多视频、失败重试、权限隔离或实际输出质量。
这个 Skill 能做什么,适合哪些场景?
这是 NVIDIA 发布的物理 AI 视频数据增强工作流技能,面向 OSMO 上的视频增强和自动标注任务。它负责流程选择、凭据预检、缓存就绪检查、推理路径决策、提交时参数插值、运行监控和输出下载。支持仅自动标注、增强后标注,以及两种端到端流程。运行依赖 OSMO CLI、可用 GPU 池、相应凭据和实际数据后端。
根据用户意图选择 auto_labeling、augmentation_and_al、e2e 或 e2e_super_resolution 流程;运行凭据和控制平面预检、提交前安全检查及模型缓存准备;从实际数据集后端推导 storage_url;通过 OSMO 提交流程并监控任务状态;下载完整运行产物。增强流程完成后,还会生成增强前后并排对比,并汇总增强和伪标签结果。
- 需要只为原始视频生成伪标签的数据团队,可使用 auto_labeling 流程。
- 需要生成增强视频并为增强结果自动标注的团队,可使用 augmentation_and_al 流程。
- 需要优先吞吐量、并行运行完整流程的团队,可使用 e2e 流程。
- 需要先通过超分辨率门控再进行增强的团队,可使用 e2e_super_resolution 流程。
- 没有提供输入数据、希望先用 NVIDIA VDA 演示资产验证环境的用户,可使用默认演示路径。
这个 Skill 有哪些优点和局限?
- 覆盖从预检到输出下载的端到端流程。
- 支持四种明确的工作流模式,并提供自动缓存修复策略。
- 要求使用实际数据后端推导存储地址,降低存储配置错误风险。
- 增强流程要求提供并排对比证据,而不只返回原始输出 URL。
- 仓库 README 说明技能通过每日同步维护,并提供签名、评估数据集和基准报告治理机制。
- 需要 OSMO CLI、已登录的 OSMO 配置、数据凭据配置和 ONLINE GPU 池。
- 通常需要 Hugging Face token;部分可选的 NGC 功能还需要相应 API key。
- 运行会依赖网络、GPU 调度和模型缓存,冷启动可能需要约 45–80 分钟。
- SKILL.md 没有提供独立测试套件或具体平台覆盖证据。
- 该技能只适用于 VDA 执行编排,不适合容器内部的调优问题。
如何安装这个 Skill?
使用 NVIDIA skills CLI 安装整个仓库中的指定技能:
npx skills add nvidia/skills --skill physical-ai-video-data-augmentation --yes
也可以安装到指定 Agent,例如:
npx skills add nvidia/skills --skill physical-ai-video-data-augmentation --agent codex
README 未说明该单项技能需要额外的本地安装步骤。
如何使用这个 Skill?
向 Agent 提出明确任务,例如:“在 OSMO 上运行视频数据增强并为增强视频自动标注”。未指定流程时默认使用 augmentation_and_al;未提供视频时使用 nvidia/video-data-augmentation-demo。实际运行前需要配置 HF_TOKEN、登录 OSMO CLI、注册匹配的数据凭据配置,并确保存在 ONLINE GPU 池。缺少必需凭据、无法推导存储后端前缀或没有可用 GPU 平台时,技能会暂停并要求补充信息。