数据与分析 ✓ NVIDIA · 官方 video-embeddingvision-languagevideo-retrievalsemantic-deduplicationfine-tuningdockerhuggingface

Cosmos-Embed 视频检索与微调技能

用 Cosmos-Embed1 将视频与文本嵌入用于检索和微调。

FollowSkills 评估 · FSRS-2.0
不推荐
53/ 100 五分制 2.7 / 5
信任安全16 / 25 · 3.2/5

技能明确声明仅需 Read 与 Bash,并使用容器、只读数据/spec 挂载及 HF_TOKEN 环境变量,且要求不得将令牌写入配置、日志或报告;但 Docker 使用 --network=host、--gpus all,model/results/hf_cache 可写,运行时执行未锁定的 pip install,未说明用户确认、权限隔离、回滚或敏感视频数据处理,因此扣分。

可靠稳定9 / 20 · 2.3/5

SKILL.md 提供 train/evaluate/inference/export 的命令、参数约束、检查点规则和多项故障排查,基于静态证据主路径较清晰;但未提供覆盖关键动作的提交测试,依赖容器、GPU、外部模型下载和 versions.yaml,且运行时修复依赖可能改变环境,因此受静态上限和不确定性限制扣分。

适用触发10 / 15 · 3.3/5

触发语句、适用任务、MSR-VTT 输入格式、模型变体和非适用的 AutoML 路由边界较明确;但主要面向 NVIDIA GPU、Docker 和特定视频数据格式,中文使用场景未说明,HF/模型下载依赖外部服务且未证明中国大陆网络可达,因此扣分。

规范维护8 / 15 · 2.7/5

文档结构较完整,包含快速开始、动作、参数、输出、数据格式、权重、S3 暂存和已知陷阱;技能声明 Apache-2.0、版本为 0.1.0,仓库提供许可证及 NVIDIA 维护/同步说明。但 BENCHMARK 报告指出缺少推荐的 Instructions 和 Examples,未见技能级 changelog、明确维护责任人或更新路径细节,因此扣分。

有效结果6 / 15 · 2.0/5

文档覆盖训练、评估、推理和导出,并给出可直接改写的 Docker 命令、模板参数和输出路径;BENCHMARK 报告记录单个任务通过且 Codex 正确性/有效性结果较高,但只有一个正向任务、无负向触发测试,且本评审未执行验证,因此无法超过静态上限并扣分。

证据核验4 / 10 · 2.0/5

存在固定修订、结构化 skill_info、配置模板、已知错误说明和 BENCHMARK 结果,提供有限可审计依据;但 benchmark 仅覆盖一个计划型任务,未包含关键动作的提交测试或多源复核,报告结果不能替代本次独立执行,因此仅给有限分数。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 运行命令会使用主机网络、全部可见 GPU,并对 model、results 和 HuggingFace 缓存进行写入;使用前应确认数据、网络和文件权限范围。
  • HF_TOKEN、Cosmos-Embed 权重及 google-bert/bert-base-uncased 依赖外部下载和可能的 gated agreement;应预先确认凭据、许可证/模型条款及中国大陆网络可达性。
  • 文档要求每次动作运行 python -m pip install protobuf<7,但未给出完整依赖锁定或回滚方案;建议先在隔离环境中验证并保留可恢复的缓存与结果。
  • BENCHMARK 仅有一个正向任务,不能证明真实训练、推理、导出及负向触发场景均可靠。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能指导 AI 代理使用 NVIDIA Cosmos-Embed1 进行视频—文本嵌入。它覆盖文本搜视频、视频搜视频、零样本或 kNN 分类、语义去重,以及模型训练、评估、推理和导出。运行依赖 Docker、nvidia-container-toolkit、已发布的 Cosmos-Embed TAO 容器,以及下载受限模型权重时所需的 HuggingFace token。它适合已有本地视频和元数据、并具备 NVIDIA GPU 容器环境的团队。

通过 Docker 拉取并运行由 versions.yaml 解析的 Cosmos-Embed TAO 容器,调用 cosmos-embed1 的 train、evaluate、inference 和 export 命令。它读取挂载到容器中的视频、JSON 元数据、模型权重和 YAML 规格文件,支持 MSR-VTT 格式的本地视频 glob 与包含 video、caption 字段的列表元数据。训练生成检查点,评估生成 metrics.json,推理生成 results.json,并可导出 ONNX 或 HuggingFace 格式。它还提供 LoRA、单 GPU 恢复训练、评估嵌入缓存及 S3 数据暂存的配置指导。

  1. 视频平台团队希望用自然语言查询本地视频库时,使用文本到视频检索。
  2. 媒体或安防团队需要根据一个视频查找相似视频时,使用视频到视频搜索。
  3. 数据治理团队需要发现重复或近重复视频时,使用语义去重。
  4. 研究人员希望用自有视频—文本数据适配 Cosmos-Embed1 时,使用直接训练或 LoRA 微调。
  5. 模型部署团队需要把训练检查点转换为 ONNX 或 HuggingFace 格式时,使用导出动作。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖训练、评估、推理和 ONNX/HuggingFace 导出等完整动作链。
  • 明确说明 MSR-VTT 数据格式、检查点解析、LoRA 和常见故障处理。
  • 支持 224p、336p 和 448p 三种分辨率变体。
  • 仓库 README 说明已发布技能包含签名、Tier-3 评测数据集和基准报告。
局限
  • 必须使用 Docker、NVIDIA GPU 容器支持和已发布容器,不能把它视为纯 Python 本地库。
  • Cosmos-Embed 容器中的 wandb 与 protobuf 7.x 存在兼容问题,每次动作前需降级 protobuf。
  • S3 视频不能直接以 s3:// glob 供 CLI 使用,必须先暂存到本地或容器文件系统。
  • 源材料未提供成本、GPU 型号兼容矩阵或独立的 skill-specific 测试报告。

如何安装这个 Skill?

安装整个 NVIDIA 技能集合:npx skills add nvidia/skills。只安装此技能:npx skills add nvidia/skills --skill tao-finetune-cosmos-embed --yes。也可以指定代理,例如:npx skills add nvidia/skills --skill tao-finetune-cosmos-embed --agent codex --yes。源材料未说明单独的 Python 包安装流程。

如何使用这个 Skill?

安装后,可向代理提出“fine-tune Cosmos-Embed1”“run cosmos-embed inference”“embed videos”或“search videos with text”等请求。运行时准备 data、model、specs 和 results 目录,使用 Docker GPU 选项挂载它们;先执行 python -m pip install "protobuf<7",再调用 cosmos-embed1 train、evaluate、inference 或 export。推理示例可覆盖 inference.query.input_texts=["a man is singing on stage"] 和 inference.k=5。模型权重可使用本地 /model/Cosmos-Embed1-224p,或使用 nvidia/Cosmos-Embed1-224p 并通过 HF_TOKEN 提供令牌。

常见问题

这个技能是否适合没有 NVIDIA GPU 的环境?
不适合。其标准 Docker 参数使用 --gpus all,并要求 nvidia-container-toolkit;源材料没有提供 CPU 运行方案。
是否必须使用 HuggingFace token?
下载受限的 nvidia/Cosmos-Embed1-* 权重时需要;即使禁用模型检查点,Q-Former 仍可能下载 google-bert/bert-base-uncased,因此新容器建议提供 HF_TOKEN 或持久化缓存。
能否直接使用 AutoML?
不能按当前技能策略路由到 AutoML。由于 schemas/ 下没有 Cosmos-Embed schema,应始终使用该模型技能的 train、evaluate、inference 和 export 动作。
训练失败时最先应检查什么?
先检查 protobuf 是否低于 7、视频 glob 是否指向容器内的 /data 路径、元数据文件名是否匹配视频,并确认 HF_TOKEN 和模型许可协议状态。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

Cosmos Reason 视频问答微调

为 Cosmos3-Nano 视频问答模型提供基于 FSDP 的 SFT、LoRA、评估与 AutoML 工作流指导。

数据与分析 ✓ NVIDIA · 官方

Nemotron 检索配方助手

帮助规划、调试、微调、评估和部署 Nemotron 嵌入与重排检索流程。

数据与分析 ✓ NVIDIA · 官方

TAO CLIP 微调与部署

为图文检索、零样本分类和嵌入提取训练并部署 NVIDIA TAO CLIP 模型。

开发与工程 ✓ NVIDIA · 官方

TAO HuggingFace 模型集成助手

将 HuggingFace 计算机视觉模型接入 NVIDIA TAO 的训练、导出与 TensorRT 部署流程。

数据与分析 ✓ NVIDIA · 官方

Nemotron 模型定制流水线

为 Nemotron 模型规划、配置并串联数据处理、训练、对齐、转换、优化与评测步骤。

自动化与运维 ✓ NVIDIA · 官方

RTVI-CV 二维检测跟踪运维技能

部署并运维 RTVI-CV 二维视频检测与跟踪微服务。

自动化与运维 ✓ NVIDIA · 官方

VSS 视频分析报告

为单个视频片段或事件时间范围生成结构化的视频分析报告。

数据与分析 ✓ NVIDIA · 官方

VSS 视频分析查询

通过 VA-MCP 读取视频分析事件、指标、告警与传感器数据。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 配方推荐器

根据模型、GPU规模和训练目标推荐可调整的Megatron Bridge配方。

自动化与运维 ✓ NVIDIA · 官方

VIOS 视频输入输出与存储管理

通过 VIOS REST API 管理传感器、视频流、录制、快照和视频存储。

数据与分析 ✓ NVIDIA · 官方

TAO SegFormer 语义分割技能

为 TAO SegFormer 提供语义分割训练、评估与部署指导。

数据与分析 ✓ NVIDIA · 官方

NV 脑部 MRI 扩散模型微调

从 NIfTI 脑部 MRI 数据微调 NV-Generate-CTMR 的扩散 UNet。

数据与分析 ✓ NVIDIA · 官方

TAO AutoML + DEFT 三阶段训练管线

为 AOI 与其他 DEFT 应用串联超参数优化、数据改进和最终模型精调。

自动化与运维 ✓ NVIDIA · 官方

VSS 视频自动标定

通过 AutoMagicCalib 为本地视频、RTSP 摄像头或示例数据集执行端到端视频标定。

自动化与运维 ✓ NVIDIA · 官方

VSS 告警管理

为 NVIDIA VSS 部署提供实时告警、订阅、事件查询、Slack 通知和摄像头接入流程。

自动化与运维 ✓ NVIDIA · 官方

VSS 归档视频搜索

通过自然语言搜索归档视频,并摄取文件或 RTSP 流建立可检索索引。

数据与分析 ✓ NVIDIA · 官方

临床语音识别微调

用 NeMo 对 Parakeet TDT v2 进行临床词汇微调,并以离线 KER 评估闭环效果。

数据与分析 ✓ NVIDIA · 官方

TAO Depth Anything v2 深度估计

使用 NVIDIA TAO 从单张 RGB 图像训练、评估、导出和推理单目深度模型。

数据与分析 ✓ NVIDIA · 官方

TAO NVPanoptix3D 三维全景重建

训练和运行基于 RGB 图像的三维全景分割与占用补全模型。

数据与分析 ✓ NVIDIA · 官方

Hugging Face 本地 GPU 微调助手

在本地 NVIDIA GPU 上,以可复现流程微调 Hugging Face 模型。

相关 Skills