开发与工程 ✓ NVIDIA · 官方 cutilejuliagpu-kernelscudakernel-conversionnumerical-testing

cuTile Python 到 Julia 转换助手

将 cuTile Python GPU 内核迁移为可测试的 cuTile.jl Julia 实现。

FollowSkills 评估 · FSRS-2.0
不推荐
47/ 100 五分制 2.4 / 5
信任安全16 / 25 · 3.2/5

技能范围明确,主要指导本地内核文件编写、依赖安装和测试;未见恶意行为、凭据窃取或数据外传。扣分原因是流程要求直接写文件、安装依赖并运行测试而未要求用户确认,调试文档还给出 rm -rf 编译缓存命令,缺少回滚和数据流说明;依赖 CUDA、Julia、GPU,且未讨论依赖安全。

可靠稳定7 / 20 · 1.8/5

文档提供转换步骤、错误模式、示例和测试命令,且说明若遇内部编译器错误应提交最小复现。静态证据不足,未展示该技能路径对应的 Julia 源码、测试套件或 CI;存在基准报告整体 FAIL、重复内容和若干未验证 API 断言。因此按静态上限保守扣分。

适用触发8 / 15 · 2.7/5

目标用户、输入类型和主要转换场景清楚,涵盖内核转换、调试和优化,并列出硬件与版本前提。扣分原因是未明确非适用边界、触发排除条件、中文使用支持或大陆网络可达性;依赖本地 Blackwell GPU,适用环境较窄。

规范维护8 / 15 · 2.7/5

目录结构、工作流、API 映射、关键规则、测试和调试文档较完整,技能声明了 CC-BY-4.0 AND Apache-2.0、作者和标签,仓库也提供许可证及官方组织归属。扣分原因是缺少明确版本、变更日志、维护责任和更新路径;基准报告指出重复内容、缺少推荐 Examples 章节及脚本表格,且引用层级较深。

有效结果5 / 15 · 1.7/5

技能给出从分析、编写、测试到验证的端到端流程,并提供 add、matmul、softmax 示例和静态验证命令,理论上可减少手工迁移成本。扣分原因是本次仅静态阅读,Julia canonical kernels、测试文件和 validator 实现未随证据提供;基准报告总体 FAIL,无法确认输出可直接使用。

证据核验3 / 10 · 1.5/5

技能包含可审计的规则、命令、示例验证代码和一份基准报告。扣分原因是没有提交的 Julia 测试、CI 日志或独立复现结果,基准报告仅给出汇总指标且总体判定 FAIL;因此只能获得有限静态可验证性。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 不要在未确认前自动写入项目、安装依赖或运行 GPU 测试;先检查目标文件和工作区状态。
  • rm -rf ~/.julia/compiled/cuTile* 具有破坏性,应改为可恢复或更精确的缓存清理,并明确确认要求。
  • 必须核实 cuTile.jl、CUDA、Julia 版本、驱动和 Blackwell GPU 是否实际兼容;当前材料未证明 Julia 转换示例已通过执行测试。
  • 基准报告整体 FAIL,且报告的正向样本仅 1 个,不能据此推断广泛有效性。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向需要把 cuTile Python 内核转换为 cuTile.jl Julia 内核的开发者。它覆盖语法、索引、广播、内存布局、类型系统和启动 API 的差异,并提供转换、调试、测试和验证流程。技能要求 Julia 内核独立运行,不依赖 Python 桥接或 pytest 集成。运行环境需要兼容版本的 Julia、CUDA 13.1 以上驱动和 Blackwell GPU。

分析 Python 的 @ct.kernel 内核及其形状、数据类型和运算;生成 julia/kernels/<op>.jl 中的 cuTile.jl 内核和桥接函数;编写 Julia Test 与 NNlib.jl 测试;注册测试;运行 scripts/validate_cutile_jl.py 静态验证器;使用 julia --project=julia/ julia/test/runtests.jl 执行测试;针对 MethodError、IRError 和数值不匹配提供调试指引。

  1. GPU 内核开发者需要把现有的 cuTile Python 加法、矩阵乘法或 softmax 内核迁移到 Julia。
  2. Julia 开发者遇到 0/1 索引、行主序/列主序、广播或 ct.load order 导致的转换错误。
  3. 团队需要为新转换的 cuTile.jl 内核补充 Julia 原生测试和 NNlib.jl 参考结果。
  4. 开发者需要在运行 Julia 测试前检查常见 cuTile.jl 反模式和启动参数错误。
  5. 维护者需要诊断 MethodError、IRError 或转换后数值不匹配问题。

这个 Skill 有哪些优点和局限?

优点
  • 专门覆盖 cuTile Python 到 cuTile.jl 的实际语义差异。
  • 提供 add、matmul 和 softmax 的示例及 Julia ground-truth 内核和测试。
  • 包含 17 条关键规则、API 映射、调试和测试参考资料。
  • 包含静态验证脚本和完整的 Julia 原生测试流程。
局限
  • 仅针对 cuTile Python 到 cuTile.jl,不是通用 Python 到 Julia 转换器。
  • 要求兼容版本的 Julia、CUDA 13.1 以上驱动和 Blackwell GPU。
  • 源材料没有说明在其他 GPU 架构或较旧 CUDA 驱动上的支持情况。
  • 仓库元数据的许可证标记为 NOASSERTION,而技能声明为 CC-BY-4.0 AND Apache-2.0,采用前应核对许可要求。

如何安装这个 Skill?

在支持 Agent Skills 的客户端中运行:npx skills add nvidia/skills --skill tilegym-converting-cutile-to-julia --yes。README 未说明该命令的具体安装目录;CLI 会处理安装目标。安装 Julia 依赖:julia --project=julia/ -e 'using Pkg; Pkg.instantiate()'。

如何使用这个 Skill?

让代理处理类似请求:“将这个 @ct.kernel cuTile Python GPU 内核转换为 cuTile.jl Julia 内核,并按照该技能的测试和验证流程检查结果。”标准流程包括分析内核、编写 julia/kernels/<op>.jl、编写并注册 julia/test/test_<op>.jl、运行 python <skill-dir>/scripts/validate_cutile_jl.py <file.jl>,以及运行 julia --project=julia/ julia/test/runtests.jl。

常见问题

是否需要 Python 和 Julia 同时作为运行时桥接?
不需要运行时 Python 桥接;Julia 内核是独立的。不过转换流程会使用 Python 验证脚本,因此环境中仍需 Python。
遇到 IRStructurizer 相关 IRError 应如何处理?
技能将其标记为编译器问题,建议用最小复现向上游提交问题,而不是把它当作普通语法转换错误。
可以在没有 Blackwell GPU 的机器上完整运行吗?
源材料要求 Blackwell GPU(计算能力 10+)和 CUDA 13.1 以上驱动;未说明其他硬件上的完整测试支持。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

cuTile 到 Triton 内核转换助手

将 cuTile GPU 内核转换为可验证、可调优的 Triton 实现。

开发与工程 ✓ NVIDIA · 官方

CuTile 自动调优指南

为 CuTile GPU 内核设计、实现并验证低开销的自动调优流程。

开发与工程 ✓ NVIDIA · 官方

cuTile Python 内核助手

帮助开发者编写、调试、验证和优化高性能 cuTile GPU 内核。

开发与工程 ✓ NVIDIA · 官方

TileGym cuTile 内核性能优化

通过剖析、瓶颈诊断和逐项调优,系统降低 TileGym cuTile GPU 内核延迟。

开发与工程 ✓ NVIDIA · 官方

TileGym cuTile 内核开发指南

指导开发者在 TileGym 中注册、实现、测试并基准评测新的 cuTile GPU 内核。

开发与工程 ✓ NVIDIA · 官方

导管导航设置验证

验证导管导航工作流的主机、GPU与Python路径配置。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

开发与工程 ✓ NVIDIA · 官方

cuPyNumeric 迁移就绪度评估

在投入大规模移植工作前,判断 NumPy 代码能否在 GPU 和多 GPU 环境中有效扩展。

开发与工程 ✓ NVIDIA · 官方

DOCA GPUNetIO 开发技能

指导开发者将 NVIDIA GPU 上的 CUDA 内核连接到 DOCA 网络队列,实现 GPU 侧收发包与调试。

自动化与运维 ✓ NVIDIA · 官方

TAO NVIDIA GPU 主机配置

为 TAO 的 Docker 与 Kubernetes GPU 主机检查并配置 NVIDIA 驱动、CUDA 和容器运行时。

开发与工程 ✓ NVIDIA · 官方

NVIDIA 技能发现器

帮助代理在 NVIDIA 产品与工作流中发现并选择合适的技能。

开发与工程 ✓ NVIDIA · 官方

DOCA GPI GPU 直驱 RDMA 技能

指导 CUDA 内核绕过主机 CPU,直接从 GPU 内存驱动 RDMA 队列。

自动化与运维 ✓ NVIDIA · 官方

Holoscan NGC 容器安装助手

通过 NGC Docker 容器安装、验证并启动 NVIDIA Holoscan SDK。

开发与工程 ✓ NVIDIA · 官方

Holoscan Ubuntu 原生安装助手

在 Ubuntu 上通过 NVIDIA apt 仓库安装并验证 Holoscan SDK C++ 环境。

自动化与运维 ✓ NVIDIA · 官方

cuOpt 安装助手

指导在 Python、C 或 REST 服务中安装并验证 NVIDIA cuOpt。

开发与工程 ✓ NVIDIA · 官方

Holoscan Python Wheel 安装助手

在 Linux NVIDIA GPU 环境中,将 Holoscan SDK Python 绑定安装到虚拟环境并完成基础验证。

开发与工程 ✓ NVIDIA · 官方

Holoscan SDK 源码构建

在 Docker 容器中从源码构建 Holoscan SDK,并生成可供 CMake 使用的本地安装目录。

数据与分析 ✓ NVIDIA · 官方

脑部 MRI 合成生成

通过 NVIDIA 工作流生成合成脑部 MRI 体积。

数据与分析 ✓ NVIDIA · 官方

NV-Segment-CT 医学影像分割技能

在 CT NIfTI 体数据上运行 VISTA3D 分割,并生成可核验的标签图证据。

数据与分析 ✓ NVIDIA · 官方

NV-Segment-CT 微调

为 CT NIfTI 标注执行 NV-Segment-CT VISTA3D 微调。

相关 Skills