开发与工程 ✓ NVIDIA · 官方 cutilegpu-kernelscudapython-dslkernel-optimizationtile-based-programming

cuTile Python 内核助手

帮助开发者编写、调试、验证和优化高性能 cuTile GPU 内核。

FollowSkills 评估 · FSRS-2.0
不推荐
44/ 100 五分制 2.2 / 5
信任安全13 / 25 · 2.6/5

技能明确要求将生成文件写入当前工作目录,并允许克隆 TileGym 到缓存目录;这些外部写入、依赖获取和 GPU 执行影响虽有说明,但没有用户确认、回滚或最小权限机制。未见凭据窃取、隐蔽外泄、恶意代码或破坏性默认行为,因此保留中等分数;来源归属和许可证写明,但仓库许可证元数据为 NOASSERTION,且要求代码不保留来源引用,故扣分。

可靠稳定6 / 20 · 1.5/5

步骤、示例和验证循环较完整,但关键依赖、硬件要求、安装方式和异常输入处理不足;文档要求实际执行验证,而本评估只能静态阅读。已提交示例和 benchmark 提供一定可审计线索,但 benchmark 总体 FAIL,且重复内容和潜在 API/边界问题未被静态消除,因此不超过静态上限10并明显扣分。

适用触发8 / 15 · 2.7/5

触发场景、复杂度分流、输入参数和不适用的单/多 kernel 工作流描述较清楚,因此具备较好的语义触发基础。可是能力高度依赖 NVIDIA GPU、CUDA/cuTile、TileGym 和可访问的远程文档或仓库;未说明中文交互支持,也未处理中国大陆网络可达性,故扣分。

规范维护8 / 15 · 2.7/5

包含名称、版本、作者、许可证、目录化参考资料、示例和维护流程提示,结构较清晰。NVSkills-Eval 明确指出缺少 Purpose、前置条件和限制说明,且没有明确 changelog、维护责任或更新路径;benchmark 还报告长描述和复杂企业化语言,因此未接近满分。

有效结果5 / 15 · 1.7/5

目标是生成、调试、优化并验证 cuTile GPU kernel,示例包含可直接改编的 kernel、launcher 和参考校验逻辑;benchmark 中 codex 的技能辅助有效性为86%,说明有实际价值。但总体 benchmark verdict 为 FAIL,且静态阅读无法确认关键 kernel 能编译、通过边界测试或稳定优于替代方案,因此按静态上限保守扣分。

证据核验4 / 10 · 2.0/5

SKILL.md 引用了官方语言规范,仓库包含示例、评测任务和带结果的 benchmark,形成有限的审计链。可是没有本次静态审查之外的独立复现,benchmark 仅覆盖3个任务且总体失败,重复检测也暴露维护问题;因此只能给有限分数,不能达到独立可复现等级。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
使用前请注意
  • 使用前确认 CUDA/cuTile、兼容 NVIDIA GPU、PyTorch 和 TileGym 的安装及版本;技能未给出完整前置条件。
  • 执行其工作流会写入当前目录并可能克隆远程依赖,先确认路径、网络访问和缓存策略,并准备手动清理或恢复方案。
  • 不要把文档中的“验证通过”视为本次审查已执行;应在目标硬件上自行编译、运行并测试未对齐形状和异常输入。
  • benchmark 总体 verdict 为 FAIL,且报告缺少限制说明、前置条件和多处重复内容;发布前应修订并重新评测。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

这是 NVIDIA skills 仓库中的 cuTile Python 编程技能,专注于 NVIDIA GPU 的基于 tile 的内核开发。它指导智能体从示例和参考资料开始,完成内核设计、实现、启动与数值验证。对于单内核任务,它提供分步骤工作流;对于多内核或多层模型任务,它支持深度代理编排。该技能适合需要直接使用 cuTile Python DSL 编写 GPU 计算内核的开发者。

读取 TileGym 与随附 examples/ 中的相关示例,参考 cuTile 语言规范和 guidelines/ 文档,分析输入输出形状与数据类型,设计 tile 和 grid,生成包含 @ct.kernel、ct.load、ct.store 与 ct.launch 的 Python 代码,并运行代码将结果与参考实现比较。复杂任务还可按分析器、并行内核代理和组合器流程拆分工作。

  1. 需要从零实现 ReLU、softmax 或单个矩阵乘法等 cuTile GPU 内核的 CUDA/Python 开发者。
  2. 希望将 PyTorch 张量操作转换为 cuTile 实现的机器学习工程师。
  3. 遇到 cuTile 编译、运行时或数值验证错误,需要定位并修复内核代码的开发者。
  4. 需要针对指定张量形状、数据类型或性能目标优化现有 cuTile 内核的工程师。
  5. 需要将包含注意力、前馈网络和归一化等多个操作的模型拆分为多个内核的开发者。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖 cuTile Python 内核的编写、调试、优化和验证流程。
  • 明确要求搜索现有示例、使用幂次为 2 的 tile 尺寸并为常量添加类型注解。
  • 为单内核任务和多内核编排任务提供不同工作流。
  • 包含边界条件、未对齐尺寸、CUDA 设备和参考实现比较等验证要求。
局限
  • 依赖 cuTile Python、CUDA-capable NVIDIA GPU、Python 和通常用于验证的 PyTorch 环境。
  • 提供的材料没有列出支持的 GPU 架构、CUDA/cuTile 版本矩阵或性能保证。
  • 深度编排流程会增加多内核任务的实现复杂度。
  • 技能本身是指导性 SKILL.md;具体示例文件和实现代码未包含在给定材料中。

如何安装这个 Skill?

使用仓库 README 支持的 skills CLI 安装指定技能:

npx skills add nvidia/skills --skill tilegym-cutile-python --yes

README 未提供该技能独立安装包或版本锁定命令。

如何使用这个 Skill?

安装后,在相关任务中直接向智能体提出具体请求,例如:“Write a cuTile ReLU kernel for shape (1024, 1024).” 复杂任务应说明目标形状、数据类型、性能要求和约束;技能要求先搜索现有示例,并在生成代码后执行验证。

常见问题

这个技能适合普通 Python 或 CPU 编程吗?
不适合。它面向 NVIDIA GPU 上的 cuTile Python 内核开发,重点是 tile、CUDA 内存访问、编译和 GPU 验证。
安装技能后是否还需要 TileGym?
技能支持两种上下文:在 TileGym checkout 中直接搜索其 cuTile 操作;在其他位置安装时,说明要求将 TileGym 克隆到指定缓存位置,但给定材料没有提供具体克隆命令。
它会自动保证内核性能吗?
不会。技能提供 tile 设计、内存访问、融合和验证方面的指导,但材料没有承诺固定性能提升或特定硬件上的基准结果。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

CuTile 自动调优指南

为 CuTile GPU 内核设计、实现并验证低开销的自动调优流程。

开发与工程 ✓ NVIDIA · 官方

cuTile Python 到 Julia 转换助手

将 cuTile Python GPU 内核迁移为可测试的 cuTile.jl Julia 实现。

开发与工程 ✓ NVIDIA · 官方

TileGym cuTile 内核性能优化

通过剖析、瓶颈诊断和逐项调优,系统降低 TileGym cuTile GPU 内核延迟。

开发与工程 ✓ NVIDIA · 官方

cuTile 到 Triton 内核转换助手

将 cuTile GPU 内核转换为可验证、可调优的 Triton 实现。

自动化与运维 ✓ NVIDIA · 官方

cuOpt 安装助手

指导在 Python、C 或 REST 服务中安装并验证 NVIDIA cuOpt。

开发与工程 ✓ NVIDIA · 官方

DOCA GPUNetIO 开发技能

指导开发者将 NVIDIA GPU 上的 CUDA 内核连接到 DOCA 网络队列,实现 GPU 侧收发包与调试。

开发与工程 ✓ NVIDIA · 官方

TileGym cuTile 内核开发指南

指导开发者在 TileGym 中注册、实现、测试并基准评测新的 cuTile GPU 内核。

开发与工程 ✓ NVIDIA · 官方

Holoscan Python Wheel 安装助手

在 Linux NVIDIA GPU 环境中,将 Holoscan SDK Python 绑定安装到虚拟环境并完成基础验证。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

开发与工程 ✓ NVIDIA · 官方

cuPyNumeric 迁移就绪度评估

在投入大规模移植工作前,判断 NumPy 代码能否在 GPU 和多 GPU 环境中有效扩展。

自动化与运维 ✓ NVIDIA · 官方

Jetson 软件包与环境助手

为 Jetson 选择匹配架构的容器与 GPU 软件包。

开发与工程 ✓ NVIDIA · 官方

Holoscan SDK 安装向导

根据主机环境选择并引导完成 Holoscan SDK 的合适安装方式。

自动化与运维 ✓ NVIDIA · 官方

TAO NVIDIA GPU 主机配置

为 TAO 的 Docker 与 Kubernetes GPU 主机检查并配置 NVIDIA 驱动、CUDA 和容器运行时。

开发与工程 ✓ NVIDIA · 官方

NVIDIA 技能发现器

帮助代理在 NVIDIA 产品与工作流中发现并选择合适的技能。

开发与工程 ✓ NVIDIA · 官方

Earth2Studio 确定性预报

为 Earth2Studio 构建单成员天气预报推理脚本。

开发与工程 ✓ NVIDIA · 官方

DOCA GPI GPU 直驱 RDMA 技能

指导 CUDA 内核绕过主机 CPU,直接从 GPU 内存驱动 RDMA 队列。

自动化与运维 ✓ NVIDIA · 官方

Holoscan NGC 容器安装助手

通过 NGC Docker 容器安装、验证并启动 NVIDIA Holoscan SDK。

开发与工程 ✓ NVIDIA · 官方

Holoscan Ubuntu 原生安装助手

在 Ubuntu 上通过 NVIDIA apt 仓库安装并验证 Holoscan SDK C++ 环境。

开发与工程 ✓ NVIDIA · 官方

导管导航设置验证

验证导管导航工作流的主机、GPU与Python路径配置。

开发与工程 ✓ NVIDIA · 官方

Holoscan SDK 源码构建

在 Docker 容器中从源码构建 Holoscan SDK,并生成可供 CMake 使用的本地安装目录。

相关 Skills