cuTile Python 内核助手
帮助开发者编写、调试、验证和优化高性能 cuTile GPU 内核。
技能明确要求将生成文件写入当前工作目录,并允许克隆 TileGym 到缓存目录;这些外部写入、依赖获取和 GPU 执行影响虽有说明,但没有用户确认、回滚或最小权限机制。未见凭据窃取、隐蔽外泄、恶意代码或破坏性默认行为,因此保留中等分数;来源归属和许可证写明,但仓库许可证元数据为 NOASSERTION,且要求代码不保留来源引用,故扣分。
步骤、示例和验证循环较完整,但关键依赖、硬件要求、安装方式和异常输入处理不足;文档要求实际执行验证,而本评估只能静态阅读。已提交示例和 benchmark 提供一定可审计线索,但 benchmark 总体 FAIL,且重复内容和潜在 API/边界问题未被静态消除,因此不超过静态上限10并明显扣分。
触发场景、复杂度分流、输入参数和不适用的单/多 kernel 工作流描述较清楚,因此具备较好的语义触发基础。可是能力高度依赖 NVIDIA GPU、CUDA/cuTile、TileGym 和可访问的远程文档或仓库;未说明中文交互支持,也未处理中国大陆网络可达性,故扣分。
包含名称、版本、作者、许可证、目录化参考资料、示例和维护流程提示,结构较清晰。NVSkills-Eval 明确指出缺少 Purpose、前置条件和限制说明,且没有明确 changelog、维护责任或更新路径;benchmark 还报告长描述和复杂企业化语言,因此未接近满分。
目标是生成、调试、优化并验证 cuTile GPU kernel,示例包含可直接改编的 kernel、launcher 和参考校验逻辑;benchmark 中 codex 的技能辅助有效性为86%,说明有实际价值。但总体 benchmark verdict 为 FAIL,且静态阅读无法确认关键 kernel 能编译、通过边界测试或稳定优于替代方案,因此按静态上限保守扣分。
SKILL.md 引用了官方语言规范,仓库包含示例、评测任务和带结果的 benchmark,形成有限的审计链。可是没有本次静态审查之外的独立复现,benchmark 仅覆盖3个任务且总体失败,重复检测也暴露维护问题;因此只能给有限分数,不能达到独立可复现等级。
- 使用前确认 CUDA/cuTile、兼容 NVIDIA GPU、PyTorch 和 TileGym 的安装及版本;技能未给出完整前置条件。
- 执行其工作流会写入当前目录并可能克隆远程依赖,先确认路径、网络访问和缓存策略,并准备手动清理或恢复方案。
- 不要把文档中的“验证通过”视为本次审查已执行;应在目标硬件上自行编译、运行并测试未对齐形状和异常输入。
- benchmark 总体 verdict 为 FAIL,且报告缺少限制说明、前置条件和多处重复内容;发布前应修订并重新评测。
这个 Skill 能做什么,适合哪些场景?
这是 NVIDIA skills 仓库中的 cuTile Python 编程技能,专注于 NVIDIA GPU 的基于 tile 的内核开发。它指导智能体从示例和参考资料开始,完成内核设计、实现、启动与数值验证。对于单内核任务,它提供分步骤工作流;对于多内核或多层模型任务,它支持深度代理编排。该技能适合需要直接使用 cuTile Python DSL 编写 GPU 计算内核的开发者。
读取 TileGym 与随附 examples/ 中的相关示例,参考 cuTile 语言规范和 guidelines/ 文档,分析输入输出形状与数据类型,设计 tile 和 grid,生成包含 @ct.kernel、ct.load、ct.store 与 ct.launch 的 Python 代码,并运行代码将结果与参考实现比较。复杂任务还可按分析器、并行内核代理和组合器流程拆分工作。
- 需要从零实现 ReLU、softmax 或单个矩阵乘法等 cuTile GPU 内核的 CUDA/Python 开发者。
- 希望将 PyTorch 张量操作转换为 cuTile 实现的机器学习工程师。
- 遇到 cuTile 编译、运行时或数值验证错误,需要定位并修复内核代码的开发者。
- 需要针对指定张量形状、数据类型或性能目标优化现有 cuTile 内核的工程师。
- 需要将包含注意力、前馈网络和归一化等多个操作的模型拆分为多个内核的开发者。
这个 Skill 有哪些优点和局限?
- 覆盖 cuTile Python 内核的编写、调试、优化和验证流程。
- 明确要求搜索现有示例、使用幂次为 2 的 tile 尺寸并为常量添加类型注解。
- 为单内核任务和多内核编排任务提供不同工作流。
- 包含边界条件、未对齐尺寸、CUDA 设备和参考实现比较等验证要求。
- 依赖 cuTile Python、CUDA-capable NVIDIA GPU、Python 和通常用于验证的 PyTorch 环境。
- 提供的材料没有列出支持的 GPU 架构、CUDA/cuTile 版本矩阵或性能保证。
- 深度编排流程会增加多内核任务的实现复杂度。
- 技能本身是指导性 SKILL.md;具体示例文件和实现代码未包含在给定材料中。
如何安装这个 Skill?
使用仓库 README 支持的 skills CLI 安装指定技能:
npx skills add nvidia/skills --skill tilegym-cutile-python --yes
README 未提供该技能独立安装包或版本锁定命令。
如何使用这个 Skill?
安装后,在相关任务中直接向智能体提出具体请求,例如:“Write a cuTile ReLU kernel for shape (1024, 1024).” 复杂任务应说明目标形状、数据类型、性能要求和约束;技能要求先搜索现有示例,并在生成代码后执行验证。