开发与工程 ✓ NVIDIA · 官方 cutilegpu-kernelperformance-optimizationprofilingautotuningcudatilegym

TileGym cuTile 内核性能优化

通过剖析、瓶颈诊断和逐项调优,系统降低 TileGym cuTile GPU 内核延迟。

FollowSkills 评估 · FSRS-2.0
不推荐
44/ 100 五分制 2.2 / 5
信任安全12 / 25 · 2.4/5

技能明确限制可修改范围、要求正确性验证并在失败时回退,且披露了 Ampere 上 TMA 越界可能静默损坏的风险;但包含 git checkout/reset、提交和 rm -rf 临时目录等外部或破坏性操作,用户确认、未提交改动保护、回滚边界及数据流说明不足,并且仓库许可证元数据为 NOASSERTION,与文件许可证声明存在不一致,因此扣分。

可靠稳定6 / 20 · 1.5/5

三阶段流程、单变量实验、基准记录和失败回退规则较清楚,引用了测试命令及异常诊断方法;但依赖特定 GPU、cuda-tile、tileiras、仓库测试和外部环境,部分命令与路径为占位符,Blackwell/Hopper/Ampere 支持说明不完全一致,未提供可静态确认的 CI 覆盖,因此按静态校准限制在 6 分。

适用触发8 / 15 · 2.7/5

目标用户、cuTile 性能优化场景、主要触发词、输入位置和优化范围基本明确,也说明了部分不适用情形;但缺少系统化的非目标边界、结果格式说明和环境前置检查失败时的替代路径,且没有中文使用说明,GPU 节点要求限制了通用性,因此扣分。

规范维护8 / 15 · 2.7/5

文档分层较完整,包含 API、模式、性能模型、调优手册、日志格式、版本字段和作者信息;但引用的部分文件未在给定材料中呈现,存在重复内容,版本日期为未来式格式但无变更日志,维护责任与更新路径不够明确,且许可证元数据冲突,因此扣分。

有效结果6 / 15 · 2.0/5

技能提供了可执行的 profiling、一次一项优化、正确性测试、性能比较和 keep/revert 决策流程,目标指标和记录表直接可用;但其效果高度依赖可用 GPU、完整 TileGym 测试和真实 benchmark,示例收益未在本技能文件中得到可独立验证,且评估报告总体 verdict 为 FAIL,因此未超过静态上限并扣分。

证据核验4 / 10 · 2.0/5

提交了评估任务、结果摘要、命令模板、性能记录格式和诊断步骤,具备一定审计线索;但没有真实 CI 工作流、可核验的测试结果或多来源复现材料,BENCHMARK 主要是报告性证据,静态审查无法执行关键路径,因此按静态上限给 4 分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 执行前应明确确认分支创建、提交、回退和临时目录清理操作,并保护用户已有未提交改动。
  • 应验证实际 GPU 架构、cuTile/tileiras 版本、测试路径和 TMA 越界语义,尤其避免 Ampere 上未设置 ZERO padding 导致静默数据损坏。
  • 应修正许可证元数据冲突、补充真实 CI/测试复现证据,并重新运行评估;当前 BENCHMARK 总体结论为 FAIL。
  • 当前文档未提供中文说明,且核心功能依赖特定 GPU 与 NVIDIA 软件环境。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向 TileGym 项目中的 cuTile GPU 内核性能优化。它要求先建立基线,再以单项实验为单位修改内核或启动配置,验证正确性并重新基准测试。优化范围包括 tile 大小、占用率、自动调优配置、TMA、延迟提示、持久化调度、num_ctas 和 flush_to_zero。核心指标是延迟,且每次优化都必须保持数值正确性。

它指导代理创建性能优化分支,定位 TileGym 中的 cuTile 内核、启动包装器、注册信息和自动调优配置;读取相关优化参考资料;创建并维护 @sandbox/perf_results.md;运行 pytest 正确性测试和性能基准测试;比较每次实验的 latency (ms),决定保留、回退或停止;必要时检查 IR、分析瓶颈并提交保留的修改。

  1. TileGym 开发者需要降低某个 cuTile 内核的 GPU 延迟。
  2. 内核已有实现和测试,但需要通过 profiling 找出内存、计算或调度瓶颈。
  3. 工程师希望逐项评估 TMA、tile 大小、占用率或持久化调度等参数。
  4. 团队需要保留正确性测试、延迟数据和优化决策的可追踪实验记录。
  5. 开发者需要比较 cuTile 内核的 IR,以诊断编译或性能问题。

这个 Skill 有哪些优点和局限?

优点
  • 提供从基线、单项实验到回退决策的明确流程。
  • 将 latency (ms) 设为核心指标,并要求每次修改验证正确性。
  • 覆盖 TMA、tile 大小、占用率、自动调优、IR 调试等具体 cuTile 参数。
  • 要求使用表格记录每轮延迟、正确性和状态,便于追踪。
局限
  • 依赖 TileGym 项目结构、cuTile、Python pytest、Git 和 GPU 节点。
  • 基准测试要求 Blackwell、Hopper 或 Ampere GPU,未提供无 GPU 环境的替代流程。
  • 技能本身未包含具体内核、测试数据或实测性能提升证据。
  • 每轮实验有十分钟限制,整体最多执行 25 轮,可能限制复杂优化任务。

如何安装这个 Skill?

使用 NVIDIA/skills 的 skills CLI 安装指定技能:

npx skills add nvidia/skills --skill tilegym-improve-cutile-kernel-perf --yes

也可以使用 --agent codex 或 --agent claude-code 指定客户端。README 未说明将该技能文件夹手动复制到特定目录的步骤。

如何使用这个 Skill?

在已加载该技能的代理中提出具体请求,例如:

"Optimize this cuTile kernel performance in TileGym."

或:"Improve kernel perf by profiling and iteratively tuning the cuTile kernel."

开始前需要准备 TileGym 仓库、可用 GPU 节点和测试环境,并在设置阶段确认后进入实验循环。

常见问题

这个技能适合哪些 GPU 环境?
源文档要求用于基准测试的 GPU 节点,列出的平台包括 Blackwell、Hopper 和 Ampere。
它会不会为了速度改变内核的数值语义?
流程明确禁止改变功能语义,并要求每次优化运行正确性测试;若失败,应立即回退。
它会自动持续优化到什么时候?
实验会在达到性能目标、收益趋于停滞、所有尝试完成、超过 25 轮或用户中断时结束;连续两轮没有提升也应停止。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

CuTile 自动调优指南

为 CuTile GPU 内核设计、实现并验证低开销的自动调优流程。

开发与工程 ✓ NVIDIA · 官方

TileGym cuTile 内核开发指南

指导开发者在 TileGym 中注册、实现、测试并基准评测新的 cuTile GPU 内核。

开发与工程 ✓ NVIDIA · 官方

cuTile Python 内核助手

帮助开发者编写、调试、验证和优化高性能 cuTile GPU 内核。

开发与工程 ✓ NVIDIA · 官方

cuTile 到 Triton 内核转换助手

将 cuTile GPU 内核转换为可验证、可调优的 Triton 实现。

开发与工程 ✓ NVIDIA · 官方

cuTile Python 到 Julia 转换助手

将 cuTile Python GPU 内核迁移为可测试的 cuTile.jl Julia 实现。

自动化与运维 ✓ NVIDIA · 官方

cuOpt 安装助手

指导在 Python、C 或 REST 服务中安装并验证 NVIDIA cuOpt。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

开发与工程 ✓ NVIDIA · 官方

cuPyNumeric 迁移就绪度评估

在投入大规模移植工作前,判断 NumPy 代码能否在 GPU 和多 GPU 环境中有效扩展。

开发与工程 ✓ NVIDIA · 官方

DOCA GPUNetIO 开发技能

指导开发者将 NVIDIA GPU 上的 CUDA 内核连接到 DOCA 网络队列,实现 GPU 侧收发包与调试。

自动化与运维 ✓ NVIDIA · 官方

TAO NVIDIA GPU 主机配置

为 TAO 的 Docker 与 Kubernetes GPU 主机检查并配置 NVIDIA 驱动、CUDA 和容器运行时。

开发与工程 ✓ NVIDIA · 官方

NVIDIA 技能发现器

帮助代理在 NVIDIA 产品与工作流中发现并选择合适的技能。

开发与工程 ✓ NVIDIA · 官方

DOCA GPI GPU 直驱 RDMA 技能

指导 CUDA 内核绕过主机 CPU,直接从 GPU 内存驱动 RDMA 队列。

开发与工程 ✓ NVIDIA · 官方

GPUNetIO RDMA 写延迟基准技能

指导测量 CUDA 内核发起的 GPUNetIO RDMA WRITE 延迟与尾延迟。

自动化与运维 ✓ NVIDIA · 官方

Holoscan NGC 容器安装助手

通过 NGC Docker 容器安装、验证并启动 NVIDIA Holoscan SDK。

开发与工程 ✓ NVIDIA · 官方

Holoscan Ubuntu 原生安装助手

在 Ubuntu 上通过 NVIDIA apt 仓库安装并验证 Holoscan SDK C++ 环境。

开发与工程 ✓ NVIDIA · 官方

导管导航设置验证

验证导管导航工作流的主机、GPU与Python路径配置。

开发与工程 ✓ NVIDIA · 官方

TileGym Transformers 内核集成

将 TileGym 高性能内核接入 Hugging Face Transformers 模型。

开发与工程 ✓ NVIDIA · 官方

Holoscan Python Wheel 安装助手

在 Linux NVIDIA GPU 环境中,将 Holoscan SDK Python 绑定安装到虚拟环境并完成基础验证。

开发与工程 ✓ NVIDIA · 官方

Holoscan SDK 源码构建

在 Docker 容器中从源码构建 Holoscan SDK,并生成可供 CMake 使用的本地安装目录。

数据与分析 ✓ NVIDIA · 官方

脑部 MRI 合成生成

通过 NVIDIA 工作流生成合成脑部 MRI 体积。

相关 Skills