TAO AOI 图像挖掘
使用统一图像编码器嵌入目标与源图像,并挖掘用于增强训练的近邻 AOI 图像。
文档明确要求使用固定容器、工作区挂载、GPU和数据流步骤,并声明Apache-2.0许可及NVIDIA来源;但允许Bash执行、以容器root运行、挂载整个工作区、自动拉取镜像并复制会话日志和配置,未要求用户确认、最小化挂载、敏感数据处理或可靠回滚,因此扣分。
三步顺序、输入输出、常见错误和多个检查hook描述较清晰;但依赖Docker、NVIDIA Container Toolkit、CUDA GPU、外部镜像和未提供的versions.yaml及references文件,缺少覆盖关键路径的提交测试,且部分失败仍需用户自行诊断,因此静态评分受限。
目标用户、输入parquet、filepath/label要求、输出artifact和非迭代边界较明确;但仅适用于VCN AOI扩增场景,要求高端GPU和Docker,未说明更广泛的非适用场景、中文交互或中国大陆网络可达性,且核心镜像依赖外部NVIDIA注册表,因此扣分。
SKILL.md具有Inputs、Setup、Method、Outputs、Common pitfalls和Execution Order等分层结构,包含版本、作者和许可元数据;但版本仅为0.1.0,无变更日志、明确维护责任或更新路径,且引用的setup.md、troubleshooting.md和reference-invocation.md未出现在提供材料中,示例和FAQ也不完整。
流程明确产出可供下游训练使用的mined.parquet,并保留中间embedding和summary以支持审计;但实际结果质量依赖编码器、数据质量、外部容器和GPU,缺少代表性输出的可核验内容,基准仅有一个任务且结果包含Codex正确率20%,因此只能给出有限静态效用分。
文件包含固定命令、输出布局、检查hook、评测任务和一份单任务基准报告,提供了有限可审计线索;但没有实际运行日志、CI测试结果或独立复现证据,基准覆盖极薄,关键效果声明无法由静态材料充分验证。
- 执行会以容器root身份并通过-v挂载整个工作区,运行前应人工确认挂载范围、数据敏感性和输出覆盖风险。
- 默认流程会拉取并运行外部tao_toolkit.data_services镜像;应锁定并审查versions.yaml中的具体镜像来源和凭据要求。
- filter_by_label缺失label时会静默降级为不过滤;必须检查日志和mining_summary.txt,不能仅凭成功退出判断结果正确。
- 核心功能依赖CUDA GPU、Docker和NVIDIA容器工具链,且未提供大陆网络可达性或离线镜像方案。
- 自动打包claude_session.jsonl及.claude配置可能泄露会话或环境信息,应在共享结果前审查并清理。
这个 Skill 能做什么,适合哪些场景?
该技能执行面向 VCN AOI 迭代的 DEFT“先嵌入、后挖掘”流程。它读取目标 parquet 和源图像池 parquet,分别生成嵌入,再按指定指标检索每个目标的近邻源图像。流程由三个 Docker 调用组成,结果包括去重后的源图像路径 parquet 和挖掘摘要。运行需要 Docker、nvidia-container-toolkit 和 CUDA GPU。
解析 versions.yaml 中的 tao_toolkit.data_services 镜像,检查 Docker、GPU 和镜像缓存;使用同一个 embedding_spec.yaml 对目标 parquet 和源池 parquet 执行 image_embeddings;使用 mining_spec.yaml 执行 tmm nearest_neighbors;按 topn、knn_metric 和可选的标签过滤挖掘近邻;输出包含唯一 filepath 的 mined parquet、两个中间嵌入 parquet 和 mining_summary.txt。
- 负责 VCN AOI 数据增强的工程师,需要根据 gap-analysis 输出扩展真实图像训练队列。
- 拥有目标弱样本 parquet 和候选源图像池,想按视觉相似度寻找可复用训练图像的数据科学家。
- 需要对多个 topn 或标签过滤设置进行重复挖掘的视觉模型团队。
- 需要保留嵌入中间结果,以便调查挖掘图像与目标不相关问题的工程团队。
这个 Skill 有哪些优点和局限?
- 流程固定且确定性强,包含两个嵌入步骤和一个近邻挖掘步骤。
- 支持 topn、距离指标和标签过滤等运行时覆盖。
- 保留中间嵌入 parquet,便于复用和排查编码器问题。
- 输出会记录查询数、近邻数和去重数量等摘要信息。
- 必须使用 CUDA GPU,CPU 环境无法完成编码和 cuML/cuDF k-NN 搜索。
- 依赖 Docker、nvidia-container-toolkit 以及 tao_toolkit.data_services 镜像。
- 两个嵌入步骤若使用不同编码器,会产生不可比较的结果。
- 源材料未提供该技能独立测试套件或跨平台验证证据。
如何安装这个 Skill?
使用仓库 README 支持的 skills CLI 安装指定技能:
npx skills add nvidia/skills --skill tao-mine-aoi-images --yes
README 未说明该技能的独立发布包或手动复制后的具体目录路径。
如何使用这个 Skill?
准备包含 filepath 的目标 parquet 和源池 parquet,并在工作区中准备 embedding_spec.yaml 与 mining_spec.yaml。向已加载该技能的代理提出类似请求:“对我的 VCN AOI 目标 parquet 和源池执行 tao-mine-aoi-images 的 DEFT 嵌入与近邻挖掘流程。”运行前需解析 DS_IMAGE、检查 Docker/nvidia-smi,并按顺序执行目标嵌入、源池嵌入和 nearest_neighbors 三步。两个嵌入步骤必须使用完全相同的编码器配置;SigLIP 或 CLIP 通常使用 cosine 指标。