开发与工程 ✓ NVIDIA · 官方 cudacutilegpu-kernelsautotuningkernel-performancepythonpytorch

CuTile 自动调优指南

为 CuTile GPU 内核设计、实现并验证低开销的自动调优流程。

FollowSkills 评估 · FSRS-2.0
不推荐
52/ 100 五分制 2.6 / 5
信任安全16 / 25 · 3.2/5

未见恶意代码、凭据窃取或隐蔽外传;范围明确为 CuTile 自动调优,并提供 DISABLE_AUTOTUNE 回退和原位 split-buffer。扣分在于未要求用户确认 GPU 编译/基准测试等外部资源消耗,未说明数据流、依赖版本、并发缓存安全或回滚机制,且来源归属虽可由 NVIDIA 元数据和仓库信息支持,但缺少更细的责任与安全说明。

可靠稳定8 / 20 · 2.0/5

工作流、缓存模式、架构过滤、异常陷阱和示例测试较完整,且示例覆盖 occupancy、matmul 与原位 RoPE。静态审查不能确认 API 与硬件兼容性;错误处理主要依赖 assert,缺少空搜索空间、编译失败、缓存失效和基准异常的诊断反馈,因此不超过静态上限并扣分。

适用触发10 / 15 · 3.3/5

触发词、目标用户场景、决策树、覆盖范围及明确的非目标范围均清楚。扣分在于依赖 CUDA/CuTile/NVIDIA GPU 环境,未给出输入前置条件、版本矩阵、更多架构边界或中文使用支持;大陆网络可达性也未说明。

规范维护8 / 15 · 2.7/5

文档分层、任务路由、参考资料、示例、常见陷阱、许可证和缓存/禁用开关说明较好。扣分在于缺少 metadata.author、版本号、变更日志、维护责任与更新路径;评估报告还指出缺少推荐 Examples 章节及重复内容、深层引用等维护问题。

有效结果6 / 15 · 2.0/5

该技能为自动调优配置提供了可直接套用的 exhaustive_search、缓存、launch、回退和验证流程,边际价值明显。扣分在于静态材料无法证明示例真实可运行或性能收益,基准报告整体 verdict 为 FAIL,且只含一个正向任务,收益和适用范围仍需人工验证。

证据核验4 / 10 · 2.0/5

提交了多个代码示例、固定配置对照、参考实现、测试函数和 benchmark 报告,形成一定可审计链路。扣分在于本次未执行,报告未提供可核验的外部链接或完整复现环境/日志,测试覆盖与第三方交叉佐证有限,因此不超过静态上限。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 使用前应确认 CUDA、CuTile API、GPU 架构和依赖版本;首次调用会编译并基准测试多个配置,可能消耗显著时间和 GPU 资源。
  • 不要把示例测试或 benchmark 报告视为已在当前环境复现;应分别验证正确性、DISABLE_AUTOTUNE 回退、原位输入以及缓存并发行为。
  • 补充作者、版本、变更日志、维护/更新路径,并改进编译失败、空配置和硬件不匹配时的可诊断错误信息。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向使用 CuTile 编写 GPU 内核的开发者,指导为内核加入自动调优。它围绕 `exhaustive_search`、缓存和直接 `ct.launch` 构建一次调优、后续快速执行的模式。内容涵盖占用率搜索、可调 tile 尺寸、`num_ctas`、多架构配置以及常见故障排查。技能只处理自动调优配置,不修改内核算法或内存访问实现。

指导代理分类内核类型,选择搜索维度,生成不超过 30 个候选配置,调用 exhaustive_search,缓存最佳配置和调优后的内核,并通过 ct.launch 直接启动。它还规定如何为原地写入内核使用分离缓冲区、如何用 DISABLE_AUTOTUNE=1 运行正确性测试,以及如何与固定最佳配置进行 A/B 基准比较。

  1. CuTile 开发者为新的逐元素、归约或 LayerNorm 内核加入占用率自动调优。
  2. GPU 内核开发者为 matmul、FMHA、FP8 或多 GEMM 内核设计 tile 尺寸、占用率和 `num_ctas` 搜索空间。
  3. 维护者排查首次运行后数据损坏、搜索空间为空或编译耗时过长的问题。
  4. 性能工程师优化已有自动调优配置,并清理从未胜出的候选配置。

这个 Skill 有哪些优点和局限?

优点
  • 提供从内核分类、搜索空间设计到 A/B 验证的完整流程。
  • 明确覆盖原地内核、缓存、架构过滤、编译成本和 `replace_hints` 热路径等常见风险。
  • 支持 sm80–sm120 的架构相关配置思路,并要求保留原固定配置作为候选。
局限
  • 仅覆盖自动调优配置,不处理数学标志、性能提示、内存访问模式或算法改造。
  • 首次调优需要编译和搜索,CuTile 编译成本较高;文档要求最终配置控制在 30 个以内。
  • 来源未提供独立测试套件、实际硬件覆盖范围或该具体技能的量化基准报告。

如何安装这个 Skill?

按 NVIDIA/skills 仓库 README 的方式安装技能:npx skills add nvidia/skills --skill tilegym-cutile-autotuning --yes。也可以指定 Codex:npx skills add nvidia/skills --skill tilegym-cutile-autotuning --agent codex。来源未说明独立于该技能集合的其他安装步骤。

如何使用这个 Skill?

安装后,在相关 CuTile 代码任务中明确请求使用该技能,例如:“为这个包含 cuda.tile.tune 的 CuTile 内核设计并实现 autotune,并验证正确性和性能。” 触发信号包括 exhaustive_searchreplace_hintshints_fncuda.tile.tune、文件名中的 autotune,以及自动调优内核的正确性或性能问题。

这个 Skill 与同类方案有什么区别?

技能明确将 CuTile 自动调优与 Triton 自动调优比较:Triton 使用 @triton.autotuneConfig,而 CuTile 使用 exhaustive_searchSimpleNamespace 配置、用户管理的缓存和 ct.launch;CuTile 没有 num_warpsnum_stages

常见问题

这个技能会改写我的 CuTile 内核算法吗?
不会。范围限定为搜索空间、`exhaustive_search`、缓存、调优提示和启动路径;算法、内存访问和代码生成优化明确不在范围内。
自动调优会不会让后续调用变慢?
设计目标是首次调用调优,随后复用缓存的配置和内核并直接调用 `ct.launch`,避免重复调优和 `replace_hints` 编译。
原地写入内核有什么特别要求?
搜索阶段必须使用分离缓冲区,以避免候选配置之间的数据污染;最终启动时才使用真实的原地参数。
需要什么运行环境?
来源示例使用 Python、PyTorch、CUDA CuTile、GPU 流和设备属性,并展示了 shell 中的 Python 探索命令;具体版本要求未说明。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

cuTile Python 内核助手

帮助开发者编写、调试、验证和优化高性能 cuTile GPU 内核。

开发与工程 ✓ NVIDIA · 官方

TileGym cuTile 内核性能优化

通过剖析、瓶颈诊断和逐项调优,系统降低 TileGym cuTile GPU 内核延迟。

开发与工程 ✓ NVIDIA · 官方

cuTile 到 Triton 内核转换助手

将 cuTile GPU 内核转换为可验证、可调优的 Triton 实现。

开发与工程 ✓ NVIDIA · 官方

cuTile Python 到 Julia 转换助手

将 cuTile Python GPU 内核迁移为可测试的 cuTile.jl Julia 实现。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

开发与工程 ✓ NVIDIA · 官方

DALI 动态模式开发助手

帮助 AI 代理编写、审查和迁移 NVIDIA DALI 命令式动态模式代码。

自动化与运维 ✓ NVIDIA · 官方

Jetson 软件包与环境助手

为 Jetson 选择匹配架构的容器与 GPU 软件包。

自动化与运维 ✓ NVIDIA · 官方

cuOpt 安装助手

指导在 Python、C 或 REST 服务中安装并验证 NVIDIA cuOpt。

开发与工程 ✓ NVIDIA · 官方

Holoscan Python Wheel 安装助手

在 Linux NVIDIA GPU 环境中,将 Holoscan SDK Python 绑定安装到虚拟环境并完成基础验证。

开发与工程 ✓ NVIDIA · 官方

Earth2Studio 诊断模型构建器

为 Earth2Studio 创建单步数据转换诊断模型包装器。

开发与工程 ✓ NVIDIA · 官方

Holoscan SDK 安装向导

根据主机环境选择并引导完成 Holoscan SDK 的合适安装方式。

开发与工程 ✓ NVIDIA · 官方

Earth2Studio 确定性预报

为 Earth2Studio 构建单成员天气预报推理脚本。

开发与工程 ✓ NVIDIA · 官方

Earth2Studio 预报模型封装技能

指导开发 Earth2Studio 的时序天气预报模型封装。

开发与工程 ✓ NVIDIA · 官方

CUDA-Q 量子入门指南

帮助开发者安装 CUDA-Q、编写量子内核,并使用 GPU 模拟器或真实 QPU。

开发与工程 ✓ NVIDIA · 官方

TileGym cuTile 内核开发指南

指导开发者在 TileGym 中注册、实现、测试并基准评测新的 cuTile GPU 内核。

开发与工程 ✓ NVIDIA · 官方

cuPyNumeric 迁移就绪度评估

在投入大规模移植工作前,判断 NumPy 代码能否在 GPU 和多 GPU 环境中有效扩展。

开发与工程 ✓ NVIDIA · 官方

DOCA GPUNetIO 开发技能

指导开发者将 NVIDIA GPU 上的 CUDA 内核连接到 DOCA 网络队列,实现 GPU 侧收发包与调试。

自动化与运维 ✓ NVIDIA · 官方

TAO NVIDIA GPU 主机配置

为 TAO 的 Docker 与 Kubernetes GPU 主机检查并配置 NVIDIA 驱动、CUDA 和容器运行时。

开发与工程 ✓ NVIDIA · 官方

NVIDIA 技能发现器

帮助代理在 NVIDIA 产品与工作流中发现并选择合适的技能。

开发与工程 ✓ NVIDIA · 官方

DOCA GPI GPU 直驱 RDMA 技能

指导 CUDA 内核绕过主机 CPU,直接从 GPU 内存驱动 RDMA 队列。

相关 Skills