开发与工程 ✓ NVIDIA · 官方 tilegymhugging-face-transformerscuda-kernelsmonkey-patchingllm-inferencellm-training

TileGym Transformers 内核集成

将 TileGym 高性能内核接入 Hugging Face Transformers 模型。

FollowSkills 评估 · FSRS-2.0
不推荐
51/ 100 五分制 2.6 / 5
信任安全16 / 25 · 3.2/5

文档要求用户在实验开始前确认,限定GPU UUID、Docker容器、允许修改的路径,并要求基线比较、正确性检查和必要时回退;同时涉及分支创建、提交、reset、GPU执行、Web查找及自动生成代码,最小权限、数据流披露和恢复边界仍不完整,因此扣9分。

可靠稳定7 / 20 · 1.8/5

工作流、环境约束、超时、基线、性能指标和失败分支均有说明,且要求异常候选失效时放弃;但缺少该技能路径下可复现的实现测试,依赖可用性和错误信息覆盖有限,静态评估不超过10分,因此扣13分。

适用触发9 / 15 · 3.0/5

目标用户、触发语义、主要输入(模型ID)和GPU/Docker环境较明确,也声明了支持的GPU架构;未充分说明不适用模型、无GPU时的替代路径,且未提供中文交互或中国大陆网络可达性说明,因此扣6分。

规范维护10 / 15 · 3.3/5

文档分为主流程、环境、集成、自动kernel化和库存schema,包含版本、作者、许可证、依赖和已知风险;但缺少推荐的Examples章节,变更记录、持续维护责任和更新路径不够明确,故扣5分。

有效结果6 / 15 · 2.0/5

核心目标、实验循环、覆盖率与吞吐约束及输出记录格式均有定义,理论上可指导集成;但没有该技能自身的直接可用实现示例,模型适配成本高,性能与正确性结果主要来自静态提供的声明而非可复现证据,因此扣9分。

证据核验3 / 10 · 1.5/5

提供了引用规范、仓库内路径约束、基准报告和评测任务;但引用未在本材料中实际核验,缺少覆盖关键路径的提交测试套件或CI,且基准结果不能替代独立复现,因此扣7分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 该技能会引导分支操作、Docker/GPU实验、自动生成和提交代码;执行前应确认工作树确实干净并明确可接受的修改、资源和回退范围。
  • 性能、覆盖率和正确性结论主要来自报告性材料,静态审查未执行任何实验;应在目标模型、CUDA/cuTile版本和GPU上独立验证。
  • 依赖NVIDIA GPU、Docker、CUDA工具链、Transformers/Hugging Face及可能的海外文档或模型服务;未说明中国大陆网络不可达时的替代方案。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能指导 AI Agent 将 TileGym 内核集成到 Hugging Face transformers 模型中。它通过非侵入式 monkey patch 替换目标模型使用的模块、类及部分初始化、前向传播和权重加载方法,无需直接修改 transformers 源码。工作流还包括为未覆盖的 PyTorch 代码创建新的 cuTile 内核,并评估端到端功能正确性和性能。技能明确面向 TileGym 与 transformers 集成任务,并注明已在 Claude Code、Codex 和 Cursor 的特定模型环境中验证。

引导 Agent 准备实验环境,读取并遵循环境设置、内核集成和自动内核化流程;针对指定的 Hugging Face 模型替换 transformers 中的相关模块、类和方法;在模型实例化前应用补丁,使运行时调用 TileGym 实现;为未覆盖的 PyTorch 代码创建新的 cuTile 内核;按照 FlashInfer-Bench 风格记录内核 Definition 和 Solution 元数据;最后汇总并报告结果。

  1. 需要在指定 Hugging Face 语言模型中验证 TileGym 内核功能正确性的工程师。
  2. 希望在不修改 transformers 源码的情况下替换模型核心组件的开发者。
  3. 需要评估 TileGym 内核对 LLM 训练或推理端到端吞吐影响的性能工程师。
  4. 需要为目标模型中尚未覆盖的 PyTorch 运算创建 cuTile 内核的研究人员。

这个 Skill 有哪些优点和局限?

优点
  • 采用不直接修改 transformers 源码的 monkey-patch 集成方式。
  • 覆盖已有 TileGym 内核集成和新 cuTile 内核自动创建两个阶段。
  • 同时关注端到端功能正确性、内核覆盖率和吞吐改进。
  • 明确要求使用结构化的内核 Definition 和 Solution 元数据。
局限
  • 提供的材料没有列出已支持的具体模型或 transformers 版本。
  • 环境设置、内核集成和自动内核化细节位于未提供的 references 文件中。
  • 没有提供具体性能提升数字或测试结果。
  • monkey patch 依赖目标 transformers 模型的内部模块和方法结构,模型实现变化可能影响集成。

如何安装这个 Skill?

使用 NVIDIA/skills 的 skills CLI 安装该技能:

npx skills add nvidia/skills --skill tilegym-monkey-patch-kernels-to-transformers --yes

也可以指定 Codex:

npx skills add nvidia/skills --skill tilegym-monkey-patch-kernels-to-transformers --agent codex

源材料未说明手动复制后的具体目录。

如何使用这个 Skill?

向已加载该技能的 Agent 提供技能名和目标模型 ID,例如:

Hi, please /monkey-patch-kernels-to-transformers Qwen/Qwen3.5-0.8B.

Agent 可能会提出澄清问题,确认后再开始执行。具体环境命令、支持的模型清单和失败恢复步骤未在提供的 SKILL.md 中展开。

这个 Skill 与同类方案有什么区别?

明确的替代方式是直接修改 transformers 源码;本技能选择在模型实例化前替换模块、类和方法的非侵入式 monkey-patch 方式。

常见问题

它会修改 transformers 源码吗?
不会。技能描述的方案是在模型实例化前替换相关模块、类和方法。
我可以指定任意 Hugging Face 模型吗?
材料只给出目标模型 ID 作为输入示例,没有承诺任意模型都受支持;实际可行性取决于目标模型的实现和可集成内核。
安装该技能是否需要克隆仓库?
README 的默认安装流程使用 npx skills add,不需要克隆 NVIDIA/skills 仓库。
该技能是否保证性能提升?
不保证。它用于验证功能正确性和性能改进,但提供的材料没有给出具体提升数据。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

TileGym cuTile 内核性能优化

通过剖析、瓶颈诊断和逐项调优,系统降低 TileGym cuTile GPU 内核延迟。

开发与工程 ✓ NVIDIA · 官方

TileGym cuTile 内核开发指南

指导开发者在 TileGym 中注册、实现、测试并基准评测新的 cuTile GPU 内核。

自动化与运维 ✓ NVIDIA · 官方

Jetson LLM 服务部署技能

为 NVIDIA Jetson 配置并启动 vLLM 或 SGLang 的 LLM/VLM 服务。

开发与工程 ✓ NVIDIA · 官方

NV-Reason-CXR 胸部X光推理测试技能

为胸部X光模型执行可复现的命令形状与在线推理冒烟测试。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 模型接入指南

指导开发者将新的 LLM、MoE 或 VLM 架构接入 NeMo AutoModel。

开发与工程 ✓ NVIDIA · 官方

Megatron Bridge 激活重计算

在 Megatron Bridge 中用额外计算换取更低的 GPU 激活内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE VLM 训练指南

帮助选择并调优 MoE 视觉语言模型的 FSDP 与 3D 并行训练方案。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CUDA 图优化

在 Megatron Bridge 训练中配置、验证并评估 CUDA Graph,以降低主机驱动开销。

开发与工程 ✓ NVIDIA · 官方

Earth2Studio 确定性预报

为 Earth2Studio 构建单成员天气预报推理脚本。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 性能优化工作流

系统化定位并优化 Megatron Bridge 中 MoE 训练吞吐瓶颈。

开发与工程 ✓ NVIDIA · 官方

CuTile 自动调优指南

为 CuTile GPU 内核设计、实现并验证低开销的自动调优流程。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 分层上下文并行

帮助在 Megatron-Bridge 中启用、排查并验证分层上下文并行。

开发与工程 ✓ NVIDIA · 官方

Jetson 推理内存调优

根据 Jetson 设备内存和工作负载选择推理服务栈并生成启动参数。

自动化与运维 ✓ NVIDIA · 官方

NeMo-RL Brev 运行规范

帮助 NeMo-RL 代理在 Brev 上安全管理实验存储、缓存、日志与认证。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 长上下文训练

为 Megatron Bridge 的长上下文 MoE 训练提供并行配置、重计算与性能调优建议。

数据与分析 ✓ NVIDIA · 官方

脑部 MRI 合成生成

通过 NVIDIA 工作流生成合成脑部 MRI 体积。

开发与工程 ✓ NVIDIA · 官方

cuTile Python 到 Julia 转换助手

将 cuTile Python GPU 内核迁移为可测试的 cuTile.jl Julia 实现。

开发与工程 ✓ NVIDIA · 官方

cuTile Python 内核助手

帮助开发者编写、调试、验证和优化高性能 cuTile GPU 内核。

开发与工程 ✓ NVIDIA · 官方

cuTile 到 Triton 内核转换助手

将 cuTile GPU 内核转换为可验证、可调优的 Triton 实现。

相关 Skills