TileGym cuTile 内核开发指南
指导开发者在 TileGym 中注册、实现、测试并基准评测新的 cuTile GPU 内核。
技能将修改范围限定在算子注册、cuTile实现、导出、测试和基准文件,未见凭据处理、隐蔽外传或破坏性默认操作,并要求运行测试与 lint。但未要求用户确认代码写入或高影响 GPU 操作,也未说明数据流、权限边界、回滚方案或依赖安全,因此扣分。
六步流程顺序明确,包含测试、基准和 lint 验证,并提供异常后跳过后端的测试模式。但示例使用未定义的 stream、kernel 和参数,依赖、前置条件、边界情况及失败诊断不足;且静态审查不能证明可运行,按校准限制不超过10分。
描述明确面向在 TileGym 中新增 cuTile GPU 算子,覆盖注册、实现、测试和基准,且评测包含正向与负向触发任务。未明确支持的 TileGym/cuTile/PyTorch/Triton版本、GPU架构、输入约束、非适用场景或中文使用说明;也未提供中国大陆网络环境适配信息,因此扣分。
SKILL.md有元数据、分步结构、文件路径、代码模板和验证命令;skill-card补充了CC-BY-4.0与Apache-2.0、所有者、版本和评测信息,仓库还有维护与发布工作流。评测报告指出缺少Examples、Purpose、prerequisites和limitations,且未见清晰的变更日志或技能专属更新路径,因此扣分。
目标和六步输出较清楚,能为新增算子提供直接的文件清单、模板、测试模式和基准要求,静态上具备完成核心任务的潜力。模板存在未定义符号和可能需要按实际仓库调整的接口,未提供可验证的代表性最终产物或第三方执行证据;静态校准因此不超过7分。
文件给出具体路径、现有实现参考、测试命令,并包含固定修订下的评测报告、评测任务和真实CI发布/DCO工作流,具备一定审计线索。评测结果主要是作者提供的报告,未提供覆盖该技能关键路径的已提交测试套件或可独立复现的执行日志;静态校准上限为5分。
- 不要直接照抄cuTile实现模板:stream、kernel、参数和后端接口未定义,必须依据目标TileGym版本及现有算子实现核对。
- 执行前应确认GPU、CUDA/cuTile、PyTorch和Triton版本及依赖来源,并先取得用户对文件写入和运行命令的确认;保留可回滚的版本控制变更。
- 该技能未明确输入形状、dtype、设备、架构限制和失败处理;应补充前置条件、已知限制、Examples和故障排查。
这个 Skill 能做什么,适合哪些场景?
这是 NVIDIA skills 仓库中的一个 TileGym 开发技能,专门覆盖新增 cuTile 算子或 GPU 内核的完整流程。它要求依次修改 dispatch 接口、cuTile 后端、导出文件、测试和基准脚本,并执行验证。内容包含涉及的文件路径、代码模板、测试模式和基准测试规则。它适合已经使用 TileGym、PyTorch 和 cuTile 的 GPU 开发者,但提供的是实施指南,不是现成的内核实现。
指导代理在 src/tilegym/ops/ops.py 中添加 dispatch 入口,在 src/tilegym/ops/cutile/ 下实现 cuTile 内核,在 __init__.py 中注册和导出算子,在 tests/ops/ 下创建 PyTorch 参考测试,并在 tests/benchmark/ 下创建包含 cuTile 与 PyTorch 后端的 Triton 基准脚本。流程还要求运行 pytest、可选的基准命令以及 pre-commit lint。
- TileGym 开发者需要新增一个由 cuTile 实现的算子时,按步骤完成注册、实现和导出。
- GPU 内核开发者需要为新 cuTile 算子补充多形状、多数据类型的 PyTorch 对照测试时,使用指定的测试结构。
- 性能工程师需要为 TileGym 算子建立 cuTile 与 PyTorch 后端基准比较时,按照 benchmark 规则生成 Triton 报告。
- 维护者需要排查 cuTile 实现未加载的问题时,检查 cutile/__init__.py 中的条件导入、函数导入和 __all__。
这个 Skill 有哪些优点和局限?
- 覆盖从 dispatch 注册到测试和性能基准的端到端文件级流程。
- 明确指出 cuTile 实现必须在 __init__.py 中加载,降低注册遗漏风险。
- 提供测试后端参数化、PyTorch 参考实现和 Triton benchmark 的具体模式。
- 仓库 README 说明该技能目录属于 NVIDIA 验证技能目录,并支持签名和评估工件。
- 技能只提供模板和流程,不包含某个具体算子的完整实现。
- 需要现有 TileGym 源码结构以及可用的 PyTorch、cuTile、CUDA GPU 和 Triton 环境。
- 提供的材料没有给出具体软件版本、支持的 GPU 型号或已通过测试的平台矩阵。
- 基准测试命令被标记为可选,材料没有展示实际性能结果。
如何安装这个 Skill?
使用仓库 README 中提供的命令安装指定技能:npx skills add nvidia/skills --skill tilegym-adding-cutile-kernel --yes。README 未说明具体客户端之外的手工安装路径;安装后,技能会在代理加载技能并遇到相关任务时可用。
如何使用这个 Skill?
在已安装该技能的代理中提出类似“在 TileGym 中添加一个新的 cuTile 算子,并完成测试和基准测试”的请求。技能内容要求先建立六步待办清单,再按顺序处理 ops.py、cuTile 后端、__init__.py、测试、benchmark 和验证;具体算子名称、数学逻辑及参数需要由任务补充。