Cosmos Reason 视频问答微调
为 Cosmos3-Nano 视频问答模型提供基于 FSDP 的 SFT、LoRA、评估与 AutoML 工作流指导。
文档明确披露 HF_TOKEN、门控模型、Docker 传递、数据路径、模型下载来源,并要求在训练前进行预检和部分用户确认;但 allowed-tools 允许 Bash,缺少统一的最小权限边界、完整的训练启动确认、回滚方案和敏感令牌生命周期说明,因此扣分。未见恶意软件、隐蔽外传、凭据窃取或破坏性默认行为。
训练、评估、数据校验、错误模式和检查点处理均有较丰富说明;但仅凭静态材料不能超过 10 分,且存在明显冲突,例如 model_max_length 在不同参考文件中为 40960 与 81920,数据格式出现 llava 与 daft 差异,多个被引用的 schema、skill_info、脚本和平台技能未在所给材料中提供,因此扣分。
触发短语、目标模型、训练/评估/推理/量化场景和部分非适用范围较清晰,也说明 GPU、Docker 和数据要求;但没有中文交互或本地化说明,核心流程依赖 Hugging Face、Docker、S3 和高端 NVIDIA GPU,未证明在中国大陆网络环境中的可达性,因此扣分。
文档采用渐进式引用结构,包含凭据、数据契约、参数、错误模式、AutoML 和检查点说明,并声明 Apache-2.0 许可、版本 0.1.0 和 NVIDIA 作者;但缺少标准 Instructions/Examples 部分,作者格式不完整,存在目录层级和文件命名不一致,未提供明确 changelog、维护负责人或更新流程,因此扣分。
该技能覆盖 Cosmos3-Nano 视频问答 SFT/LoRA、评估、AutoML、数据预检和故障排查,理论上能生成较直接的配置和操作计划;但静态评审下有效性最高只能给 7 分,实际基准只有一个正向任务,且报告中 Codex 的正确性、可发现性和效率较弱,没有足够的代表性可执行结果验证,因此扣分。
提供了版本固定的仓库上下文、一个评估任务、预期行为和 NVSkills-Eval 报告,具备有限审计线索;但只有单任务、无负向触发覆盖,报告不能独立复现关键训练路径,且缺少提交的测试套件和 CI 覆盖,因此扣分。
- 不同参考文件对 model_max_length、数据格式和模板行为存在冲突;发布前应统一权威配置并补充一致性检查。
- 训练依赖门控 Hugging Face 模型、HF_TOKEN、Docker/NVIDIA Container Toolkit、S3 或高端 GPU;应在中国大陆网络和目标平台上单独验证可达性与资源兼容性。
- 文档建议执行训练和下载,但未形成统一的不可逆操作确认、令牌最小权限和失败后回滚流程。
- 基准仅覆盖一个正向任务,且 Codex 的正确性、可发现性和效率结果较弱,不能视为完整执行验证。
这个 Skill 能做什么,适合哪些场景?
该技能面向使用 Cosmos-RL 训练或评估 Cosmos3-Nano 及兼容 Cosmos Reason 模型的场景。它覆盖视频问答数据准备、配置生成、FSDP 并行、监督微调、LoRA 评估和 AutoML/HPO。默认基础模型为 Hugging Face 上的 nvidia/Cosmos3-Nano,受限模型需要 HF_TOKEN。运行环境需要 Docker、nvidia-container-toolkit 和 NVIDIA GPU。
读取对应操作的打包 YAML 模板、JSON schema 和参考文档,基于用户覆盖项生成嵌套配置;检查标注 JSON 及视频媒体路径;通过 Cosmos-RL 执行训练、评估、推理或量化;在启用 AutoML 时运行推荐流程;当镜像无法读取原生 Cosmos3 检查点时,调用打包的 Python 脚本将其转换为 Qwen3-VL HF safetensors 目录;训练产生检查点,评估产生结果和指标。
- 需要在单机或多节点 NVIDIA GPU 上对 Cosmos3-Nano 视频问答模型进行 SFT 的团队。
- 希望使用 LoRA 微调并评估视频问答模型的研究人员。
- 需要用自有 llava 或 daft 格式视频问答数据进行训练或评估的工程师。
- 希望通过 AutoML/HPO 搜索学习率、批大小、训练轮数等参数的用户。
- 遇到原生 Cosmos3 检查点无法被选定 Cosmos-RL 镜像加载,需要先转换模型的用户。
这个 Skill 有哪些优点和局限?
- 覆盖训练、评估、推理、量化、LoRA、AutoML 和检查点转换等完整操作路径。
- 明确规定 FSDP 的 dp_shard_size 与 dp_replicate_size 用法,并提供单机和多节点相关指导。
- 包含数据标注、媒体可见性、视频帧数、模型路径和常见错误的具体约束。
- 支持通过 NVIDIA skills CLI 单独安装。
- 必须具备 Docker、nvidia-container-toolkit 和合适的 NVIDIA GPU;文档推荐 8×80GB A100 或 H100。
- 默认模型是受限 Hugging Face 模型,需要接受模型协议并提供有读取权限的 HF_TOKEN。
- 部分 Cosmos-RL 镜像不能直接读取原生 Cosmos3 格式,可能必须先完成检查点转换。
- 提供的材料没有展示该单项技能的独立基准结果或平台覆盖验证。
如何安装这个 Skill?
使用 NVIDIA skills CLI 安装指定技能:
npx skills add nvidia/skills --skill tao-finetune-cosmos-reason --yes
README 未说明该技能的独立源码仓库或额外手工安装步骤。
如何使用这个 Skill?
安装后,在加载该技能的代理中提出例如:"fine-tune Cosmos3 Nano on my video QA dataset"、"Run Cosmos-RL SFT for nvidia/Cosmos3-Nano" 或 "Evaluate my Cosmos3-Nano video QA checkpoint"。准备 Docker、nvidia-container-toolkit、NVIDIA GPU、数据集路径和受限 Hugging Face 模型所需的 HF_TOKEN;训练阶段默认使用 AutoML,明确提出“disable AutoML”或“plain training”可仅对本次运行关闭。