开发与工程 ✓ NVIDIA · 官方 cutiletritongpu-kernelskernel-conversiontmaautotuningcuda-debugging

cuTile 到 Triton 内核转换助手

将 cuTile GPU 内核转换为可验证、可调优的 Triton 实现。

FollowSkills 评估 · FSRS-2.0
不推荐
38/ 100 五分制 1.9 / 5
信任安全7 / 25 · 1.4/5

技能明确限定在 cuTile 到 Triton 转换,并要求测试和性能门禁;但授予 Bash、Write 等广泛工具权限,未要求逐次确认、最小权限、敏感数据处理、变更回滚或外部副作用隔离,因此扣分。

可靠稳定7 / 20 · 1.8/5

流程结构清晰,包含分析、转换、验证、测试、基准测试及失败后修复要求;但静态材料未证明关键路径可运行,且示例和依赖环境存在未验证假设,异常输入和可诊断失败信息覆盖有限,因此扣分。

适用触发8 / 15 · 2.7/5

目标用户、触发场景、TMA、布局标志、性能回退和调试场景描述较明确;但主要依赖 CUDA、cuTile、Triton 和 TileGym 测试环境,未说明非 CUDA 环境、版本边界或中文使用支持,因此扣分。

规范维护8 / 15 · 2.7/5

具备名称、版本、描述、许可证、作者、标签、分层参考文档、检查清单和多个示例;但缺少该技能自身的变更日志、明确维护责任与更新路径,且报告指出缺少推荐的 Examples 章节,因此扣分。

有效结果5 / 15 · 1.7/5

工作流、API 映射、TMA 规则、性能陷阱和完成门禁对转换任务具有直接帮助,示例提供可参考输出;但静态审查无法确认转换结果正确或性能达标,示例仍需环境验证和人工复核,因此扣分。

证据核验3 / 10 · 1.5/5

提供源代码示例、测试函数、基准函数和一份 NVSkills-Eval 报告;但报告缺少可独立核验的原始日志、CI 或覆盖关键路径的可复现实验,结论主要仍是声明,因此扣分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 该技能可执行 Bash 和写入文件,但未规定命令白名单、用户确认、备份或回滚;转换前应隔离工作树并人工审阅命令。
  • TMA 必须性、性能回退倍数和示例正确性未由本次静态审查独立验证;不要将文档中的性能门槛视为已证明结果。
  • 技能依赖 NVIDIA CUDA/cuTile/Triton 及 TileGym 测试环境,未说明在中国大陆网络或无 NVIDIA GPU 环境中的可用替代方案。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向将 cuTile 的 @ct.kernel GPU 内核迁移到 Triton @triton.jit 的开发者。它提供分阶段的分析、转换、验证、测试和基准测试流程,并覆盖 API 映射、TMA 张量描述符、自动调优网格及双布局内核。它还指导排查非法地址、形状不匹配和数值不匹配等运行时问题。技能由 NVIDIA TileGym 团队维护,采用 CC BY 4.0 与 Apache 2.0 双许可。

读取 cuTile 源码并通过 grep 检查内核数量、加载存储操作、布局标志和其他特殊模式;根据内置参考文档将 ct.load、ct.store、ct.Constant、ct.launch、ct.mma 等模式映射到 Triton;创建或修改 Triton 内核及主机端启动代码;使用语法检查和 TileGym pytest 目标验证结果;运行性能测试并比较 Triton 与 cuTile 的表现;针对 CUDA 非法地址、形状、数据类型、步幅和数值问题提供调试路径。

  1. TileGym 开发者需要把现有的 cuTile 算子迁移到 Triton,并希望按阶段完成验证和性能确认。
  2. GPU 内核工程师遇到 cudaErrorIllegalAddress、形状不匹配或数值不匹配,需要根据 cuTile 到 Triton 的对应关系排查。
  3. 性能工程师转换 GEMM、BMM 或注意力内核后发现 Triton 变慢,需要检查 TMA、自动调优、网格布局和尾部处理。
  4. 开发者处理带 transpose、transpose_v 或 MLA 风格路径的内核,需要实现不同布局对应的独立 Triton 内核。
  5. 注意力或 Gemma FMHA/GQA 开发者需要在转换内层循环前执行专门的优化检查清单。

这个 Skill 有哪些优点和局限?

优点
  • 流程明确,要求在分析、转换、验证、测试和基准测试之间设置阶段门。
  • 覆盖 cuTile 与 Triton 的常见 API 映射及运行时错误排查。
  • 明确要求二维及以上块状访问优先使用 tl.make_tensor_descriptor,并关注严重性能回归。
  • 针对双布局、自动调优、注意力和 Blackwell 优化提供专门参考路径。
局限
  • 技能本身不包含具体 CUDA、Triton、cuTile 或 TileGym 环境的安装说明。
  • 必须依赖实际的 TileGym 测试和性能环境;源材料没有提供测试通过结果或平台覆盖证据。
  • 转换流程较严格,简单迁移也需要执行清单、测试和基准测试等步骤。
  • README 所述签名、评测数据和 BENCHMARK.md 是集合发布要求,但给定 SKILL.md 内容未展示这些文件。

如何安装这个 Skill?

使用 NVIDIA skills CLI 安装:

npx skills add nvidia/skills --skill tilegym-converting-cutile-to-triton --yes

也可以指定目标客户端,例如:

npx skills add nvidia/skills --skill tilegym-converting-cutile-to-triton --agent codex --yes

README 未说明该单个技能的独立源码仓库地址;技能随 NVIDIA/skills 集合安装。

如何使用这个 Skill?

安装后,在相关任务中明确提出转换或调试请求,例如:“将这个 @ct.kernel cuTile 内核转换为 Triton,并完成测试和性能基准。”技能要求先建立转换清单,再依次执行 analyze → convert → validate → test → benchmark。常用验证命令包括 pytest tests/ops/test_<op>.py -k "triton" -vs;具体文件路径、算子名称和环境配置需由使用者提供,源码未给出统一的安装或硬件配置步骤。

这个 Skill 与同类方案有什么区别?

相较于继续使用 cuTile,该技能适合需要 Triton 目标实现、Triton 启动方式或 Triton 性能调优的场景;它不是新的 GPU 内核框架,而是围绕 cuTile 到 Triton 迁移的工作流和参考文档。

常见问题

安装这个技能需要付费吗?
源材料没有说明服务费用。技能文件标注 CC BY 4.0 与 Apache 2.0,NVIDIA/skills README 说明整个项目采用 Apache 2.0 与 CC BY 4.0 双许可。
它能自动完成并保证转换正确吗?
不能从材料中推断自动保证正确。它要求运行语法检查、pytest 和性能测试,并在任何门失败后修复和重新验证。
必须使用 TMA 吗?
对于适用的二维及以上块状 tile 加载和存储,技能将 tl.make_tensor_descriptor 作为强制要求;若有意例外,需要记录原因。
它适合哪些输入?
它面向包含 @ct.kernel 的 cuTile GPU 内核,尤其适合存在 ct.load、ct.store、ct.launch、常量、布局标志或注意力路径的代码。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

CuTile 自动调优指南

为 CuTile GPU 内核设计、实现并验证低开销的自动调优流程。

开发与工程 ✓ NVIDIA · 官方

cuTile Python 到 Julia 转换助手

将 cuTile Python GPU 内核迁移为可测试的 cuTile.jl Julia 实现。

开发与工程 ✓ NVIDIA · 官方

cuTile Python 内核助手

帮助开发者编写、调试、验证和优化高性能 cuTile GPU 内核。

开发与工程 ✓ NVIDIA · 官方

TileGym cuTile 内核性能优化

通过剖析、瓶颈诊断和逐项调优,系统降低 TileGym cuTile GPU 内核延迟。

开发与工程 ✓ NVIDIA · 官方

TileGym cuTile 内核开发指南

指导开发者在 TileGym 中注册、实现、测试并基准评测新的 cuTile GPU 内核。

开发与工程 ✓ NVIDIA · 官方

DeepStream SOP 合规推理服务

帮助构建和调试基于 GPU 的工业视频 SOP 顺序与合规检测服务。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

开发与工程 ✓ NVIDIA · 官方

Megatron Bridge 激活重计算

在 Megatron Bridge 中用额外计算换取更低的 GPU 激活内存占用。

开发与工程 ✓ NVIDIA · 官方

cuPyNumeric 迁移就绪度评估

在投入大规模移植工作前,判断 NumPy 代码能否在 GPU 和多 GPU 环境中有效扩展。

开发与工程 ✓ NVIDIA · 官方

DOCA GPUNetIO 开发技能

指导开发者将 NVIDIA GPU 上的 CUDA 内核连接到 DOCA 网络队列,实现 GPU 侧收发包与调试。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CUDA 图优化

在 Megatron Bridge 训练中配置、验证并评估 CUDA Graph,以降低主机驱动开销。

自动化与运维 ✓ NVIDIA · 官方

TAO NVIDIA GPU 主机配置

为 TAO 的 Docker 与 Kubernetes GPU 主机检查并配置 NVIDIA 驱动、CUDA 和容器运行时。

开发与工程 ✓ NVIDIA · 官方

CUDA-Q 量子入门指南

帮助开发者安装 CUDA-Q、编写量子内核,并使用 GPU 模拟器或真实 QPU。

开发与工程 ✓ NVIDIA · 官方

NVIDIA 技能发现器

帮助代理在 NVIDIA 产品与工作流中发现并选择合适的技能。

开发与工程 ✓ NVIDIA · 官方

DOCA GPI GPU 直驱 RDMA 技能

指导 CUDA 内核绕过主机 CPU,直接从 GPU 内存驱动 RDMA 队列。

开发与工程 ✓ NVIDIA · 官方

Holoscan Conda 安装助手

在 Linux x86_64 的 CUDA 13 环境中,通过 Conda 安装并验证 Holoscan SDK。

自动化与运维 ✓ NVIDIA · 官方

Holoscan NGC 容器安装助手

通过 NGC Docker 容器安装、验证并启动 NVIDIA Holoscan SDK。

开发与工程 ✓ NVIDIA · 官方

Holoscan Ubuntu 原生安装助手

在 Ubuntu 上通过 NVIDIA apt 仓库安装并验证 Holoscan SDK C++ 环境。

自动化与运维 ✓ NVIDIA · 官方

cuOpt 安装助手

指导在 Python、C 或 REST 服务中安装并验证 NVIDIA cuOpt。

开发与工程 ✓ NVIDIA · 官方

导管导航设置验证

验证导管导航工作流的主机、GPU与Python路径配置。

相关 Skills