开发与工程 ✓ NVIDIA · 官方 cupynumericnumpy-migrationgpu-scalingdistributed-computingcudastatic-analysis

cuPyNumeric 迁移就绪度评估

在投入大规模移植工作前,判断 NumPy 代码能否在 GPU 和多 GPU 环境中有效扩展。

FollowSkills 评估 · FSRS-2.0
不推荐
57/ 100 五分制 2.9 / 5
信任安全19 / 25 · 3.8/5

技能明确限定为静态、只读检查,禁止执行用户代码、写文件、输出环境变量或秘密,并将 Legate/Doctor 命令交由用户运行;数据流和外部边界较透明。扣分在于没有明确的敏感源码脱敏建议、用户确认流程、回滚方案,以及运行用户提供命令时的额外安全防护。

可靠稳定8 / 20 · 2.0/5

五步流程、API 清单、失败处理和 Doctor 交接说明较完整,且说明了默认值与无法判断时的处理方式。静态审查未执行关键路径,缺少技能自身的测试套件或可复现运行证据,并依赖多个未随本提示提供的引用文件,因此不能超过静态上限并扣分。

适用触发10 / 15 · 3.3/5

触发条件、拒绝范围、输入默认值、四档结论和非适用场景写得清楚,覆盖稠密 NumPy、稀疏/图/ML 等边界。扣分在于没有中文输出或中文用户支持说明,也没有证明在中国大陆网络环境下对外部文档和上游服务的可达性;核心分析仍可依赖这些海外链接。

规范维护10 / 15 · 3.3/5

信息架构、渐进式阅读顺序、兼容性、许可证、版本号、上游地址、示例、脚本和故障排查均有说明。扣分在于没有明确 changelog、长期维护责任人与版本更新承诺,且存在较深的引用链和较长的触发描述,增加维护与发现成本。

有效结果6 / 15 · 2.0/5

技能定义了 READY、LIGHT REFACTOR、SIGNIFICANT REFACTOR、NOT RECOMMENDED 四类可操作结论,并要求逐项定位、配方和八段式报告,静态使用价值较高。扣分在于不执行代码、不提供自动重构或真实性能验证,最终结果仍需用户运行 Doctor、基准测试和人工复核。

证据核验4 / 10 · 2.0/5

提交的 API 支持快照含来源、抓取时间、计数和 glyph 规则,并要求逐 API 对照、区分事实与推断。扣分在于提示中的技能文本没有附带真实 CI、测试套件或独立复现实验;外部引用虽列出但本次静态材料无法独立核验。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
使用前请注意
  • 该技能不会执行代码或验证真实性能;READY 仍需用户运行 cuPyNumeric Doctor 并进行基准测试。
  • 技能要求读取多个外部引用和上游文档,但未说明离线镜像或中国大陆网络不可达时的替代路径。
  • 用户源码可能包含敏感信息;技能未明确要求脱敏、最小化读取或避免将源码内容发送到外部服务。
  • API 支持清单带有抓取时间,可能过期;刷新脚本由用户运行,刷新过程本身缺少静态证据验证。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

这是 NVIDIA Agent Skills 仓库中的一个 cuPyNumeric 迁移前评估技能,专门分析现有 NumPy 代码是否适合迁移。它通过静态读取源代码、查找 NumPy API,并对照 cuPyNumeric 支持清单,识别可扩展模式、迁移阻塞因素和需要重构的区域。技能会输出 READY、LIGHT REFACTOR、SIGNIFICANT REFACTOR 或 NOT RECOMMENDED 四级结论,并提供具体的重构建议。它属于一个由 NVIDIA 维护并每日同步的技能集合,技能本身采用 CC-BY-4.0 或 Apache-2.0 许可。

读取用户指定目录中的源代码,使用 Read、Grep 和 Glob 进行静态检查;分析数组运算、循环、标量同步、主机往返、Python 控制流、MPI 使用、混合运行时和原地修改等模式;查询 NumPy API 在 cuPyNumeric 中的支持状态;根据代码规模、计算模式和发现的问题生成结构化迁移评估;指出文件与行号、适用的重构方案,并建议迁移后运行 cuPyNumeric Doctor 进行运行时验证。它不执行用户代码,也不修改文件。

  1. 正在把 NumPy 科学计算程序迁移到 NVIDIA GPU,想先判断是否值得投入工程时间的开发者。
  2. 准备扩展到多 GPU 或多节点,但需要先发现标量同步、主机往返或不支持 API 的团队。
  3. 希望在正式移植前定位元素级循环、Python 内置函数迭代和 MPI 数据通信问题的工程师。
  4. 需要按模块规划重构工作量,并决定先迁移哪个模块的项目负责人。
  5. 已经完成重构、准备首次运行 cuPyNumeric Doctor 进行验证的开发者。

这个 Skill 有哪些优点和局限?

优点
  • 面向迁移前决策,而不是只给出笼统的 GPU 加速建议。
  • 覆盖多 GPU 扩展中的常见阻塞因素,并要求提供文件与行号依据。
  • 将 API 支持状态、可扩展模式、阻塞项和重构项分开处理。
  • 不要求安装 cuPyNumeric,适合在正式移植前做只读检查。
局限
  • 不执行代码、不进行性能基准测试,也不替用户生成重构后的代码。
  • 评估依赖源代码语义分析,可能遗漏日志、装饰器或运行时数据导致的隐式同步。
  • 实际运行仍需要用户自行准备相应的 cuPyNumeric、Legate、CUDA 和 NVIDIA GPU 环境。
  • 源材料没有提供该单项技能独立的测试套件或实测性能数据。

如何安装这个 Skill?

使用默认 skills CLI 安装指定技能:npx skills add nvidia/skills --skill cupynumeric-migration-readiness --yes。也可以指定 Codex:npx skills add nvidia/skills --skill cupynumeric-migration-readiness --agent codex --yes。源材料未说明其他客户端的具体安装目录。

如何使用这个 Skill?

在加载该技能的代理中提出迁移前评估请求,例如:“评估当前目录中的 NumPy 代码是否适合迁移到 cuPyNumeric,分析 GPU/多 GPU 扩展性并列出需要重构的地方。”技能默认检查当前工作目录;未提供规模、硬件或计算模式时,会使用其规定的默认值并明确说明。完成重构且代码可运行后,按技能建议运行 CUPYNUMERIC_DOCTOR=1 CUPYNUMERIC_DOCTOR_FORMAT=json CUPYNUMERIC_DOCTOR_FILENAME=doctor-report.json legate --gpus 1 main.py。

常见问题

使用这个技能必须安装 cuPyNumeric 吗?
不必。技能本身是静态、只读的知识驱动评估,不要求安装 cuPyNumeric;运行验证和性能测量需要在后续环境中自行完成。
它会直接修改我的代码吗?
不会。它只读取和分析源代码,提供重构指引,不执行用户代码,也不写入文件。
什么情况下它会建议不采用 cuPyNumeric?
当热路径数组低于每 GPU 65,536 个元素且没有批处理路径,或工作负载属于稀疏、图、机器学习、顺序或字符串计算模式时,结论可能为 NOT RECOMMENDED。大量可修复阻塞项本身不会自动导致该结论。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

开发与工程 ✓ NVIDIA · 官方

cuPyNumeric 安装助手

指导在受支持环境中安装并验证 cuPyNumeric。

数据与分析 ✓ NVIDIA · 官方

cuPyNumeric 分片并行加载

为分片磁盘数据构建按处理器并行的 cuPyNumeric 加载路径。

开发与工程 ✓ NVIDIA · 官方

NVIDIA 技能发现器

帮助代理在 NVIDIA 产品与工作流中发现并选择合适的技能。

自动化与运维 ✓ NVIDIA · 官方

TAO NVIDIA GPU 主机配置

为 TAO 的 Docker 与 Kubernetes GPU 主机检查并配置 NVIDIA 驱动、CUDA 和容器运行时。

开发与工程 ✓ NVIDIA · 官方

DOCA GPI GPU 直驱 RDMA 技能

指导 CUDA 内核绕过主机 CPU,直接从 GPU 内存驱动 RDMA 队列。

自动化与运维 ✓ NVIDIA · 官方

Holoscan NGC 容器安装助手

通过 NGC Docker 容器安装、验证并启动 NVIDIA Holoscan SDK。

开发与工程 ✓ NVIDIA · 官方

Holoscan Ubuntu 原生安装助手

在 Ubuntu 上通过 NVIDIA apt 仓库安装并验证 Holoscan SDK C++ 环境。

开发与工程 ✓ NVIDIA · 官方

CuTile 自动调优指南

为 CuTile GPU 内核设计、实现并验证低开销的自动调优流程。

自动化与运维 ✓ NVIDIA · 官方

cuOpt 安装助手

指导在 Python、C 或 REST 服务中安装并验证 NVIDIA cuOpt。

开发与工程 ✓ NVIDIA · 官方

导管导航设置验证

验证导管导航工作流的主机、GPU与Python路径配置。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 分层上下文并行

帮助在 Megatron-Bridge 中启用、排查并验证分层上下文并行。

开发与工程 ✓ NVIDIA · 官方

Holoscan Python Wheel 安装助手

在 Linux NVIDIA GPU 环境中,将 Holoscan SDK Python 绑定安装到虚拟环境并完成基础验证。

开发与工程 ✓ NVIDIA · 官方

Holoscan SDK 源码构建

在 Docker 容器中从源码构建 Holoscan SDK,并生成可供 CMake 使用的本地安装目录。

数据与分析 ✓ NVIDIA · 官方

脑部 MRI 合成生成

通过 NVIDIA 工作流生成合成脑部 MRI 体积。

开发与工程 ✓ NVIDIA · 官方

cuTile Python 到 Julia 转换助手

将 cuTile Python GPU 内核迁移为可测试的 cuTile.jl Julia 实现。

开发与工程 ✓ NVIDIA · 官方

cuTile Python 内核助手

帮助开发者编写、调试、验证和优化高性能 cuTile GPU 内核。

开发与工程 ✓ NVIDIA · 官方

TileGym cuTile 内核性能优化

通过剖析、瓶颈诊断和逐项调优,系统降低 TileGym cuTile GPU 内核延迟。

数据与分析 ✓ NVIDIA · 官方

cuPyNumeric 并行 HDF5 I/O

让分布式 cuPyNumeric 数组高效读写单文件 HDF5。

数据与分析 ✓ NVIDIA · 官方

NV-Segment-CT 医学影像分割技能

在 CT NIfTI 体数据上运行 VISTA3D 分割,并生成可核验的标签图证据。

相关 Skills