TileGym Transformers 内核集成
将 TileGym 高性能内核接入 Hugging Face Transformers 模型。
文档要求用户在实验开始前确认,限定GPU UUID、Docker容器、允许修改的路径,并要求基线比较、正确性检查和必要时回退;同时涉及分支创建、提交、reset、GPU执行、Web查找及自动生成代码,最小权限、数据流披露和恢复边界仍不完整,因此扣9分。
工作流、环境约束、超时、基线、性能指标和失败分支均有说明,且要求异常候选失效时放弃;但缺少该技能路径下可复现的实现测试,依赖可用性和错误信息覆盖有限,静态评估不超过10分,因此扣13分。
目标用户、触发语义、主要输入(模型ID)和GPU/Docker环境较明确,也声明了支持的GPU架构;未充分说明不适用模型、无GPU时的替代路径,且未提供中文交互或中国大陆网络可达性说明,因此扣6分。
文档分为主流程、环境、集成、自动kernel化和库存schema,包含版本、作者、许可证、依赖和已知风险;但缺少推荐的Examples章节,变更记录、持续维护责任和更新路径不够明确,故扣5分。
核心目标、实验循环、覆盖率与吞吐约束及输出记录格式均有定义,理论上可指导集成;但没有该技能自身的直接可用实现示例,模型适配成本高,性能与正确性结果主要来自静态提供的声明而非可复现证据,因此扣9分。
提供了引用规范、仓库内路径约束、基准报告和评测任务;但引用未在本材料中实际核验,缺少覆盖关键路径的提交测试套件或CI,且基准结果不能替代独立复现,因此扣7分。
- 该技能会引导分支操作、Docker/GPU实验、自动生成和提交代码;执行前应确认工作树确实干净并明确可接受的修改、资源和回退范围。
- 性能、覆盖率和正确性结论主要来自报告性材料,静态审查未执行任何实验;应在目标模型、CUDA/cuTile版本和GPU上独立验证。
- 依赖NVIDIA GPU、Docker、CUDA工具链、Transformers/Hugging Face及可能的海外文档或模型服务;未说明中国大陆网络不可达时的替代方案。
这个 Skill 能做什么,适合哪些场景?
该技能指导 AI Agent 将 TileGym 内核集成到 Hugging Face transformers 模型中。它通过非侵入式 monkey patch 替换目标模型使用的模块、类及部分初始化、前向传播和权重加载方法,无需直接修改 transformers 源码。工作流还包括为未覆盖的 PyTorch 代码创建新的 cuTile 内核,并评估端到端功能正确性和性能。技能明确面向 TileGym 与 transformers 集成任务,并注明已在 Claude Code、Codex 和 Cursor 的特定模型环境中验证。
引导 Agent 准备实验环境,读取并遵循环境设置、内核集成和自动内核化流程;针对指定的 Hugging Face 模型替换 transformers 中的相关模块、类和方法;在模型实例化前应用补丁,使运行时调用 TileGym 实现;为未覆盖的 PyTorch 代码创建新的 cuTile 内核;按照 FlashInfer-Bench 风格记录内核 Definition 和 Solution 元数据;最后汇总并报告结果。
- 需要在指定 Hugging Face 语言模型中验证 TileGym 内核功能正确性的工程师。
- 希望在不修改 transformers 源码的情况下替换模型核心组件的开发者。
- 需要评估 TileGym 内核对 LLM 训练或推理端到端吞吐影响的性能工程师。
- 需要为目标模型中尚未覆盖的 PyTorch 运算创建 cuTile 内核的研究人员。
这个 Skill 有哪些优点和局限?
- 采用不直接修改 transformers 源码的 monkey-patch 集成方式。
- 覆盖已有 TileGym 内核集成和新 cuTile 内核自动创建两个阶段。
- 同时关注端到端功能正确性、内核覆盖率和吞吐改进。
- 明确要求使用结构化的内核 Definition 和 Solution 元数据。
- 提供的材料没有列出已支持的具体模型或 transformers 版本。
- 环境设置、内核集成和自动内核化细节位于未提供的 references 文件中。
- 没有提供具体性能提升数字或测试结果。
- monkey patch 依赖目标 transformers 模型的内部模块和方法结构,模型实现变化可能影响集成。
如何安装这个 Skill?
使用 NVIDIA/skills 的 skills CLI 安装该技能:
npx skills add nvidia/skills --skill tilegym-monkey-patch-kernels-to-transformers --yes
也可以指定 Codex:
npx skills add nvidia/skills --skill tilegym-monkey-patch-kernels-to-transformers --agent codex
源材料未说明手动复制后的具体目录。
如何使用这个 Skill?
向已加载该技能的 Agent 提供技能名和目标模型 ID,例如:
Hi, please /monkey-patch-kernels-to-transformers Qwen/Qwen3.5-0.8B.
Agent 可能会提出澄清问题,确认后再开始执行。具体环境命令、支持的模型清单和失败恢复步骤未在提供的 SKILL.md 中展开。
这个 Skill 与同类方案有什么区别?
明确的替代方式是直接修改 transformers 源码;本技能选择在模型实例化前替换模块、类和方法的非侵入式 monkey-patch 方式。