开发与工程 ✓ NVIDIA · 官方 cutilegpu-kerneltilegymdispatchpytestbenchmarking

TileGym cuTile 内核开发指南

指导开发者在 TileGym 中注册、实现、测试并基准评测新的 cuTile GPU 内核。

FollowSkills 评估 · FSRS-2.0
不推荐
53/ 100 五分制 2.7 / 5
信任安全14 / 25 · 2.8/5

技能将修改范围限定在算子注册、cuTile实现、导出、测试和基准文件,未见凭据处理、隐蔽外传或破坏性默认操作,并要求运行测试与 lint。但未要求用户确认代码写入或高影响 GPU 操作,也未说明数据流、权限边界、回滚方案或依赖安全,因此扣分。

可靠稳定7 / 20 · 1.8/5

六步流程顺序明确,包含测试、基准和 lint 验证,并提供异常后跳过后端的测试模式。但示例使用未定义的 stream、kernel 和参数,依赖、前置条件、边界情况及失败诊断不足;且静态审查不能证明可运行,按校准限制不超过10分。

适用触发10 / 15 · 3.3/5

描述明确面向在 TileGym 中新增 cuTile GPU 算子,覆盖注册、实现、测试和基准,且评测包含正向与负向触发任务。未明确支持的 TileGym/cuTile/PyTorch/Triton版本、GPU架构、输入约束、非适用场景或中文使用说明;也未提供中国大陆网络环境适配信息,因此扣分。

规范维护10 / 15 · 3.3/5

SKILL.md有元数据、分步结构、文件路径、代码模板和验证命令;skill-card补充了CC-BY-4.0与Apache-2.0、所有者、版本和评测信息,仓库还有维护与发布工作流。评测报告指出缺少Examples、Purpose、prerequisites和limitations,且未见清晰的变更日志或技能专属更新路径,因此扣分。

有效结果7 / 15 · 2.3/5

目标和六步输出较清楚,能为新增算子提供直接的文件清单、模板、测试模式和基准要求,静态上具备完成核心任务的潜力。模板存在未定义符号和可能需要按实际仓库调整的接口,未提供可验证的代表性最终产物或第三方执行证据;静态校准因此不超过7分。

证据核验5 / 10 · 2.5/5

文件给出具体路径、现有实现参考、测试命令,并包含固定修订下的评测报告、评测任务和真实CI发布/DCO工作流,具备一定审计线索。评测结果主要是作者提供的报告,未提供覆盖该技能关键路径的已提交测试套件或可独立复现的执行日志;静态校准上限为5分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
使用前请注意
  • 不要直接照抄cuTile实现模板:stream、kernel、参数和后端接口未定义,必须依据目标TileGym版本及现有算子实现核对。
  • 执行前应确认GPU、CUDA/cuTile、PyTorch和Triton版本及依赖来源,并先取得用户对文件写入和运行命令的确认;保留可回滚的版本控制变更。
  • 该技能未明确输入形状、dtype、设备、架构限制和失败处理;应补充前置条件、已知限制、Examples和故障排查。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

这是 NVIDIA skills 仓库中的一个 TileGym 开发技能,专门覆盖新增 cuTile 算子或 GPU 内核的完整流程。它要求依次修改 dispatch 接口、cuTile 后端、导出文件、测试和基准脚本,并执行验证。内容包含涉及的文件路径、代码模板、测试模式和基准测试规则。它适合已经使用 TileGym、PyTorch 和 cuTile 的 GPU 开发者,但提供的是实施指南,不是现成的内核实现。

指导代理在 src/tilegym/ops/ops.py 中添加 dispatch 入口,在 src/tilegym/ops/cutile/ 下实现 cuTile 内核,在 __init__.py 中注册和导出算子,在 tests/ops/ 下创建 PyTorch 参考测试,并在 tests/benchmark/ 下创建包含 cuTile 与 PyTorch 后端的 Triton 基准脚本。流程还要求运行 pytest、可选的基准命令以及 pre-commit lint。

  1. TileGym 开发者需要新增一个由 cuTile 实现的算子时,按步骤完成注册、实现和导出。
  2. GPU 内核开发者需要为新 cuTile 算子补充多形状、多数据类型的 PyTorch 对照测试时,使用指定的测试结构。
  3. 性能工程师需要为 TileGym 算子建立 cuTile 与 PyTorch 后端基准比较时,按照 benchmark 规则生成 Triton 报告。
  4. 维护者需要排查 cuTile 实现未加载的问题时,检查 cutile/__init__.py 中的条件导入、函数导入和 __all__。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖从 dispatch 注册到测试和性能基准的端到端文件级流程。
  • 明确指出 cuTile 实现必须在 __init__.py 中加载,降低注册遗漏风险。
  • 提供测试后端参数化、PyTorch 参考实现和 Triton benchmark 的具体模式。
  • 仓库 README 说明该技能目录属于 NVIDIA 验证技能目录,并支持签名和评估工件。
局限
  • 技能只提供模板和流程,不包含某个具体算子的完整实现。
  • 需要现有 TileGym 源码结构以及可用的 PyTorch、cuTile、CUDA GPU 和 Triton 环境。
  • 提供的材料没有给出具体软件版本、支持的 GPU 型号或已通过测试的平台矩阵。
  • 基准测试命令被标记为可选,材料没有展示实际性能结果。

如何安装这个 Skill?

使用仓库 README 中提供的命令安装指定技能:npx skills add nvidia/skills --skill tilegym-adding-cutile-kernel --yes。README 未说明具体客户端之外的手工安装路径;安装后,技能会在代理加载技能并遇到相关任务时可用。

如何使用这个 Skill?

在已安装该技能的代理中提出类似“在 TileGym 中添加一个新的 cuTile 算子,并完成测试和基准测试”的请求。技能内容要求先建立六步待办清单,再按顺序处理 ops.py、cuTile 后端、__init__.py、测试、benchmark 和验证;具体算子名称、数学逻辑及参数需要由任务补充。

常见问题

这个技能会自动生成可运行的 cuTile 内核吗?
不会。它提供内核文件结构、注册方式和示例模板,但具体计算逻辑、参数和 launch 配置仍需根据新算子实现。
是否必须同时添加测试和 benchmark?
流程将测试和 benchmark 分为独立步骤,并要求每一步产生文件写入或明确跳过决定;验证步骤还包括 pytest 和 lint。
没有 cuTile 后端时能否使用?
内容针对 cuTile 后端;测试模板允许在后端不可用时跳过,但材料没有说明无 CUDA 或无 cuTile 环境下如何完成实现验证。
安装这个技能是否收费?
提供的材料没有列出技能安装费用。仓库 README 给出了通过 npx skills CLI 安装的命令。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

TileGym cuTile 内核性能优化

通过剖析、瓶颈诊断和逐项调优,系统降低 TileGym cuTile GPU 内核延迟。

开发与工程 ✓ NVIDIA · 官方

CuTile 自动调优指南

为 CuTile GPU 内核设计、实现并验证低开销的自动调优流程。

开发与工程 ✓ NVIDIA · 官方

cuTile Python 到 Julia 转换助手

将 cuTile Python GPU 内核迁移为可测试的 cuTile.jl Julia 实现。

开发与工程 ✓ NVIDIA · 官方

cuTile Python 内核助手

帮助开发者编写、调试、验证和优化高性能 cuTile GPU 内核。

开发与工程 ✓ NVIDIA · 官方

cuTile 到 Triton 内核转换助手

将 cuTile GPU 内核转换为可验证、可调优的 Triton 实现。

开发与工程 ✓ NVIDIA · 官方

Megatron-Bridge 通信重叠调优指南

帮助分布式训练用户配置并验证 TP、DP 与 PP 通信重叠。

开发与工程 ✓ NVIDIA · 官方

Megatron-Core 测试指南

帮助你在 Megatron-Core 中设计、运行并复现分布式测试。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 分层上下文并行

帮助在 Megatron-Bridge 中启用、排查并验证分层上下文并行。

开发与工程 ✓ NVIDIA · 官方

TileGym Transformers 内核集成

将 TileGym 高性能内核接入 Hugging Face Transformers 模型。

开发与工程 ✓ NVIDIA · 官方

DOCA Bench 扩展开发技能

帮助工程师为 doca-bench 构建、加载并调试自定义基准测试插件。

自动化与运维 ✓ NVIDIA · 官方

Megatron-Core CI 故障转 Issue

调查失败的 GitHub Actions 任务,并为 NVIDIA Megatron-LM 创建结构化缺陷 Issue。

数据与分析 ✓ NVIDIA · 官方

RAGAS 检索增强生成评测

用本地语料和训练数据评估 RAG 检索与生成质量。

开发与工程 ✓ NVIDIA · 官方

DeepStream 视觉模型导入助手

将目标检测模型自动接入 NVIDIA DeepStream 并生成基准报告。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

金融与投行 ✓ NVIDIA · 官方

cuFOLIO 投资组合优化技能

用 NVIDIA GPU 进行 CVaR 投资组合优化与回测。

开发与工程 ✓ NVIDIA · 官方

Megatron Bridge 激活重计算

在 Megatron Bridge 中用额外计算换取更低的 GPU 激活内存占用。

开发与工程 ✓ NVIDIA · 官方

DALI 动态模式开发助手

帮助 AI 代理编写、审查和迁移 NVIDIA DALI 命令式动态模式代码。

开发与工程 ✓ NVIDIA · 官方

Jetson BSP 源码构建

根据 Jetson BSP 源码变更重建设备树、内核和模块,并生成可部署清单。

开发与工程 ✓ NVIDIA · 官方

Jetson BSP 源码工作区初始化

为 NVIDIA Jetson BSP 定制与构建准备可追踪的源码工作区和交叉编译工具链。

数据与分析 ✓ NVIDIA · 官方

NVIDIA cuDF 数据帧指南

帮助熟悉 pandas 的开发者编写正确、高性能的 NVIDIA GPU 数据帧代码。

相关 Skills