数据与分析 ✓ NVIDIA · 官方 video-question-answeringcosmos3-nanosupervised-fine-tuninglorafsdpcosmos-rlhuggingfaceautoml

Cosmos Reason 视频问答微调

为 Cosmos3-Nano 视频问答模型提供基于 FSDP 的 SFT、LoRA、评估与 AutoML 工作流指导。

FollowSkills 评估 · FSRS-2.0
不推荐
53/ 100 五分制 2.7 / 5
信任安全18 / 25 · 3.6/5

文档明确披露 HF_TOKEN、门控模型、Docker 传递、数据路径、模型下载来源,并要求在训练前进行预检和部分用户确认;但 allowed-tools 允许 Bash,缺少统一的最小权限边界、完整的训练启动确认、回滚方案和敏感令牌生命周期说明,因此扣分。未见恶意软件、隐蔽外传、凭据窃取或破坏性默认行为。

可靠稳定7 / 20 · 1.8/5

训练、评估、数据校验、错误模式和检查点处理均有较丰富说明;但仅凭静态材料不能超过 10 分,且存在明显冲突,例如 model_max_length 在不同参考文件中为 40960 与 81920,数据格式出现 llava 与 daft 差异,多个被引用的 schema、skill_info、脚本和平台技能未在所给材料中提供,因此扣分。

适用触发10 / 15 · 3.3/5

触发短语、目标模型、训练/评估/推理/量化场景和部分非适用范围较清晰,也说明 GPU、Docker 和数据要求;但没有中文交互或本地化说明,核心流程依赖 Hugging Face、Docker、S3 和高端 NVIDIA GPU,未证明在中国大陆网络环境中的可达性,因此扣分。

规范维护8 / 15 · 2.7/5

文档采用渐进式引用结构,包含凭据、数据契约、参数、错误模式、AutoML 和检查点说明,并声明 Apache-2.0 许可、版本 0.1.0 和 NVIDIA 作者;但缺少标准 Instructions/Examples 部分,作者格式不完整,存在目录层级和文件命名不一致,未提供明确 changelog、维护负责人或更新流程,因此扣分。

有效结果6 / 15 · 2.0/5

该技能覆盖 Cosmos3-Nano 视频问答 SFT/LoRA、评估、AutoML、数据预检和故障排查,理论上能生成较直接的配置和操作计划;但静态评审下有效性最高只能给 7 分,实际基准只有一个正向任务,且报告中 Codex 的正确性、可发现性和效率较弱,没有足够的代表性可执行结果验证,因此扣分。

证据核验4 / 10 · 2.0/5

提供了版本固定的仓库上下文、一个评估任务、预期行为和 NVSkills-Eval 报告,具备有限审计线索;但只有单任务、无负向触发覆盖,报告不能独立复现关键训练路径,且缺少提交的测试套件和 CI 覆盖,因此扣分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 不同参考文件对 model_max_length、数据格式和模板行为存在冲突;发布前应统一权威配置并补充一致性检查。
  • 训练依赖门控 Hugging Face 模型、HF_TOKEN、Docker/NVIDIA Container Toolkit、S3 或高端 GPU;应在中国大陆网络和目标平台上单独验证可达性与资源兼容性。
  • 文档建议执行训练和下载,但未形成统一的不可逆操作确认、令牌最小权限和失败后回滚流程。
  • 基准仅覆盖一个正向任务,且 Codex 的正确性、可发现性和效率结果较弱,不能视为完整执行验证。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向使用 Cosmos-RL 训练或评估 Cosmos3-Nano 及兼容 Cosmos Reason 模型的场景。它覆盖视频问答数据准备、配置生成、FSDP 并行、监督微调、LoRA 评估和 AutoML/HPO。默认基础模型为 Hugging Face 上的 nvidia/Cosmos3-Nano,受限模型需要 HF_TOKEN。运行环境需要 Docker、nvidia-container-toolkit 和 NVIDIA GPU。

读取对应操作的打包 YAML 模板、JSON schema 和参考文档,基于用户覆盖项生成嵌套配置;检查标注 JSON 及视频媒体路径;通过 Cosmos-RL 执行训练、评估、推理或量化;在启用 AutoML 时运行推荐流程;当镜像无法读取原生 Cosmos3 检查点时,调用打包的 Python 脚本将其转换为 Qwen3-VL HF safetensors 目录;训练产生检查点,评估产生结果和指标。

  1. 需要在单机或多节点 NVIDIA GPU 上对 Cosmos3-Nano 视频问答模型进行 SFT 的团队。
  2. 希望使用 LoRA 微调并评估视频问答模型的研究人员。
  3. 需要用自有 llava 或 daft 格式视频问答数据进行训练或评估的工程师。
  4. 希望通过 AutoML/HPO 搜索学习率、批大小、训练轮数等参数的用户。
  5. 遇到原生 Cosmos3 检查点无法被选定 Cosmos-RL 镜像加载,需要先转换模型的用户。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖训练、评估、推理、量化、LoRA、AutoML 和检查点转换等完整操作路径。
  • 明确规定 FSDP 的 dp_shard_size 与 dp_replicate_size 用法,并提供单机和多节点相关指导。
  • 包含数据标注、媒体可见性、视频帧数、模型路径和常见错误的具体约束。
  • 支持通过 NVIDIA skills CLI 单独安装。
局限
  • 必须具备 Docker、nvidia-container-toolkit 和合适的 NVIDIA GPU;文档推荐 8×80GB A100 或 H100。
  • 默认模型是受限 Hugging Face 模型,需要接受模型协议并提供有读取权限的 HF_TOKEN。
  • 部分 Cosmos-RL 镜像不能直接读取原生 Cosmos3 格式,可能必须先完成检查点转换。
  • 提供的材料没有展示该单项技能的独立基准结果或平台覆盖验证。

如何安装这个 Skill?

使用 NVIDIA skills CLI 安装指定技能:

npx skills add nvidia/skills --skill tao-finetune-cosmos-reason --yes

README 未说明该技能的独立源码仓库或额外手工安装步骤。

如何使用这个 Skill?

安装后,在加载该技能的代理中提出例如:"fine-tune Cosmos3 Nano on my video QA dataset"、"Run Cosmos-RL SFT for nvidia/Cosmos3-Nano" 或 "Evaluate my Cosmos3-Nano video QA checkpoint"。准备 Docker、nvidia-container-toolkit、NVIDIA GPU、数据集路径和受限 Hugging Face 模型所需的 HF_TOKEN;训练阶段默认使用 AutoML,明确提出“disable AutoML”或“plain training”可仅对本次运行关闭。

常见问题

这个技能是否免费?
来源没有说明技能本身的收费方式;它说明 NVIDIA skills 集合可通过 npx skills CLI 安装。运行所需的 GPU、Docker 环境、模型访问权限和数据资源成本未在材料中说明。
必须使用 nvidia/Cosmos3-Nano 吗?
这是打包的默认基础模型。只有用户明确要求其他模型时才覆盖,并且需要取得目标 Hugging Face 模型的相应访问协议和权限。
为什么训练时需要 HF_TOKEN?
当使用受限 Hugging Face 模型时需要 HF_TOKEN;默认的 nvidia/Cosmos3-Nano 还要求用户接受 Hugging Face 上的模型协议并提供读取权限。
数据集应采用什么格式?
技能声明支持 vlm 数据集类型和 llava、daft 格式,并接受 training、evaluation、testing 意图。数据可以使用数据集根目录,也可以在标注与媒体分离时使用直接 spec-key 路径。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

Hugging Face 本地 GPU 微调助手

在本地 NVIDIA GPU 上,以可复现流程微调 Hugging Face 模型。

数据与分析 ✓ NVIDIA · 官方

Cosmos-Embed 视频检索与微调技能

用 Cosmos-Embed1 将视频与文本嵌入用于检索和微调。

数据与分析 ✓ NVIDIA · 官方

TAO MAL 弱监督分割

用点或框标注训练模型,生成弱监督语义分割掩码。

数据与分析 ✓ NVIDIA · 官方

TAO MAE 视觉预训练技能

指导 NVIDIA TAO 使用掩码自编码器进行视觉预训练与微调。

数据与分析 ✓ NVIDIA · 官方

TAO 视频动作识别训练

用 NVIDIA TAO 训练、评估、导出并推理 RGB、光流或多流视频动作识别模型。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

数据与分析 ✓ NVIDIA · 官方

TAO DINO 目标检测

指导使用 NVIDIA TAO 训练、评估和部署 DINO 目标检测器。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE VLM 训练指南

帮助选择并调优 MoE 视觉语言模型的 FSDP 与 3D 并行训练方案。

数据与分析 ✓ NVIDIA · 官方

TAO Grounding DINO 开放词汇检测

用文本提示训练和部署无需固定类别词表的目标检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO AutoML 调参技能

为 NVIDIA TAO 网络运行可审查的自动超参数优化流程。

数据与分析 ✓ NVIDIA · 官方

TAO OneFormer 通用分割技能

用单一任务条件化模型训练并部署全景、实例和语义图像分割。

数据与分析 ✓ NVIDIA · 官方

TAO SegFormer 语义分割技能

为 TAO SegFormer 提供语义分割训练、评估与部署指导。

数据与分析 ✓ NVIDIA · 官方

TAO 标准训练流程

为 TAO 模型执行标准的训练、评估与导出流程。

开发与工程 ✓ NVIDIA · 官方

TAO HuggingFace 模型集成助手

将 HuggingFace 计算机视觉模型接入 NVIDIA TAO 的训练、导出与 TensorRT 部署流程。

数据与分析 ✓ NVIDIA · 官方

TAO AutoML + DEFT 三阶段训练管线

为 AOI 与其他 DEFT 应用串联超参数优化、数据改进和最终模型精调。

数据与分析 ✓ NVIDIA · 官方

Mask Grounding DINO 训练与部署技能

用文本提示训练、评估并部署开放词汇实例分割模型。

开发与工程 ✓ NVIDIA · 官方

Earth2Studio 预报模型封装技能

指导开发 Earth2Studio 的时序天气预报模型封装。

数据与分析 ✓ NVIDIA · 官方

TAO CenterPose 姿态估计技能

帮助代理训练、评估、导出和部署用于6自由度物体姿态估计的CenterPose模型。

数据与分析 ✓ NVIDIA · 官方

TAO NVPanoptix3D 三维全景重建

训练和运行基于 RGB 图像的三维全景分割与占用补全模型。

数据与分析 ✓ NVIDIA · 官方

TAO 人员重识别训练技能

训练和部署用于跨摄像头人员匹配的 TAO ReID 模型。

相关 Skills