数据与分析 ✓ NVIDIA · 官方 cudfgpu-dataframespandasdask-cudfetlparquetnullable-semantics

NVIDIA cuDF 数据帧指南

帮助熟悉 pandas 的开发者编写正确、高性能的 NVIDIA GPU 数据帧代码。

FollowSkills 评估 · FSRS-2.0
不推荐
57/ 100 五分制 2.9 / 5
信任安全18 / 25 · 3.6/5

技能限定于本地 cuDF/数据处理指导,未见恶意行为、凭据窃取、隐蔽外传或破坏性默认操作,并明确 GPU/CPU 边界和数据转换边界;但未明确用户确认、敏感数据处理、依赖安全、回滚机制或外部文档访问的数据流,因此扣分。

可靠稳定9 / 20 · 2.3/5

路径选择、兼容性提示、语义校验建议和 OOM/不支持操作排障较完整;但依赖环境、引用文件和关键 API 未在所给材料中完全复现,存在 silent fallback,且无静态可验证的 CI/测试覆盖,因此按静态上限保守扣分。

适用触发10 / 15 · 3.3/5

目标用户、cuDF/cudf.pandas/dask-cuDF 场景、100K 行门槛和 PyTorch 负向案例边界较清楚;但描述较宽泛、缺少明确负触发条件,未说明中文交互或中国大陆网络可达性,环境适配证据有限,因此扣分。

规范维护10 / 15 · 3.3/5

文档包含兼容性、三条路径、内存策略、排障、引用文件、版本号和许可证信息,且 benchmark 报告维护刷新建议;但缺少推荐的 Instructions、Examples、Purpose 章节,安装/依赖、变更历史、维护责任和更新路径不够明确,因此扣分。

有效结果6 / 15 · 2.0/5

内容直接覆盖 ETL、连接、聚合、空值、reshape、时序和多 GPU 等核心任务,并提供可改写的代码模式;benchmark 和评测任务显示潜在实用价值,但静态审查无法确认输出正确性、性能收益或运行可用性,按静态上限给分。

证据核验4 / 10 · 2.0/5

有固定发布版本、引用文档、提交的评测任务和 benchmark 报告,形成一定审计线索;但缺少可独立复核的完整执行日志、CI 工作流、测试结果和多来源交叉证据,因此只能给中低分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
使用前请注意
  • 评测报告中的性能、正确性和安全指标是提交材料中的声明;本次静态审查未执行 cuDF、CUDA、dask-cuDF 或任何评测。
  • 实际使用前应确认 GPU 架构、CUDA/驱动、Python、cuDF 版本及引用 reference 文件可用,并对代表性数据执行 pandas/cuDF 结果对比。
  • 技能未说明敏感数据、外部 WebFetch、网络不可达和回滚处理;在中国大陆或受限网络环境中,外部文档获取可能失败。
  • cudf.pandas 对不支持操作可能静默回退到 CPU,不能仅凭成功运行声称获得 GPU 加速。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

这是 NVIDIA 编写的 cuDF 与 dask-cuDF 实施指南,面向使用 GPU 数据帧进行数据处理的开发者。它覆盖 cudf.pandas 加速器、显式 cuDF API,以及超出单 GPU 显存时的 dask-cuDF 多 GPU 工作流。指南还涉及 ETL、连接、分组、CSV/Parquet I/O、可空语义、内存溢出和 pandas 对照验证。其跟踪的 cuDF 版本为 26.04,并给出 CUDA、驱动和 Python 兼容范围。

指导用户通过 cudf.pandas 或显式 cuDF 读取 CSV/Parquet 数据、执行筛选、连接、分组、字符串处理、重塑和时间序列操作,并在数据超过 GPU 显存时使用 dask-cuDF。它提供启用 spill、配置 RMM 内存资源、检查 cudf.pandas 回退和建立 pandas 对照路径的代码示例。它还要求比较形状、标签、空值数量、排序、代表性数值和数据类型,以检查 CPU/GPU 语义一致性。

  1. 熟悉 pandas 的开发者希望以较小代码改动尝试 GPU 加速时,使用 cudf.pandas。
  2. 需要迁移命名 DataFrame 逻辑、优化 ETL 热路径或控制不支持操作时,使用显式 cuDF。
  3. 处理超过单块 GPU 显存的数据集时,使用启用 spill 的 dask-cuDF。
  4. 涉及连接、分组、重塑、空值或时间序列语义时,使用 pandas 参考路径进行结果校验。
  5. GPU 内存不足或频繁分配导致性能问题时,按照指南启用 spill 或配置 RMM。

这个 Skill 有哪些优点和局限?

优点
  • 同时覆盖最小改动加速、显式 API 迁移和多 GPU 大数据路径。
  • 明确强调 100K 行规模门槛、GPU 到 CPU 的边界转换和语义验证。
  • 提供空值、排序稳定性、浮点差异、回退和 OOM 的具体排查规则。
  • 包含 cudf.pandas、dask-cuDF 和内存管理的可复制代码示例。
局限
  • 低于 100K 行时 GPU 传输开销通常可能超过收益。
  • 需要兼容的 NVIDIA GPU、CUDA、驱动和 Python 版本。
  • 部分 pandas 操作可能回退到 CPU 或尚未实现,需要查阅参考文件并设置兼容边界。
  • 源材料没有提供独立测试套件、基准结果或实际平台验证数据。

如何安装这个 Skill?

使用 skills CLI 安装指定技能:

npx skills add nvidia/skills --skill accelerated-computing-cudf --yes

README 未说明 cuDF、CUDA、驱动或 Python 的具体安装命令;这些运行时依赖需要按其各自文档准备。

如何使用这个 Skill?

在已加载该技能的 Agent 中提出具体任务,例如:“请把这段 pandas ETL 代码迁移到显式 cuDF,并比较 pandas 与 GPU 结果的空值、排序和代表性数值。”如果只需最小改动,可要求使用 cudf.pandas;如果需要跨 GPU 或数据超过显存,可要求使用 dask-cuDF。指南跟踪的 cuDF 版本为 26.04。

这个 Skill 与同类方案有什么区别?

指南明确比较 cudf.pandas、显式 cuDF 和 dask-cuDF:前者适合兼容性和最小改动,显式 cuDF 适合控制和热点路径,dask-cuDF 适合超出 GPU 显存的多 GPU 数据集。

常见问题

这个技能会自动安装 cuDF 吗?
不会。源材料只说明如何通过 skills CLI 安装技能本身,没有提供 cuDF 或 CUDA 的安装流程。
什么时候不适合使用 GPU 加速?
指南将 100K 行设为最低规模门槛,并指出更小数据集通常会受到 GPU 传输开销影响。
cudf.pandas 出现 CPU 回退怎么办?
使用 cudf.pandas profiler 检查热点路径;如果关键操作在 CPU 上运行,则改用显式 cuDF,并参考 api-patterns.md 的已知缺口和变通方案。
它能保证结果与 pandas 完全一致吗?
不能直接保证。指南要求对空值、排序、聚合、形状、标签、数据类型和代表性数值进行验证,并说明浮点运算可能因非结合性产生差异。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

cuPyNumeric 分片并行加载

为分片磁盘数据构建按处理器并行的 cuPyNumeric 加载路径。

数据与分析 ✓ NVIDIA · 官方

TAO VCN 样本路由

将视觉缺陷分析样本按标签资格分流至挖掘和异常生成模块。

数据与分析 ✓ NVIDIA · 官方

TAO AOI 图像挖掘

使用统一图像编码器嵌入目标与源图像,并挖掘用于增强训练的近邻 AOI 图像。

数据与分析 ✓ NVIDIA · 官方

TAO VCN 分类缺口分析

定位最脆弱的VCN分类样本并生成增强候选队列。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

金融与投行 ✓ NVIDIA · 官方

cuFOLIO 投资组合优化技能

用 NVIDIA GPU 进行 CVaR 投资组合优化与回测。

开发与工程 ✓ NVIDIA · 官方

Megatron Bridge 激活重计算

在 Megatron Bridge 中用额外计算换取更低的 GPU 激活内存占用。

开发与工程 ✓ NVIDIA · 官方

DALI 动态模式开发助手

帮助 AI 代理编写、审查和迁移 NVIDIA DALI 命令式动态模式代码。

开发与工程 ✓ NVIDIA · 官方

cuPyNumeric 迁移就绪度评估

在投入大规模移植工作前,判断 NumPy 代码能否在 GPU 和多 GPU 环境中有效扩展。

自动化与运维 ✓ NVIDIA · 官方

VSS 视频嵌入部署技能

部署并运维支持文件、文本和实时视频流的 NVIDIA 视频嵌入服务。

开发与工程 ✓ NVIDIA · 官方

cuPyNumeric 安装助手

指导在受支持环境中安装并验证 cuPyNumeric。

开发与工程 ✓ NVIDIA · 官方

Jetson 时钟定制

在刷写 Jetson 镜像前,锁定或限制 CPU、GPU 与 EMC 的时钟行为。

自动化与运维 ✓ NVIDIA · 官方

Jetson 健康快照

以只读方式汇总 Jetson 的硬件、资源与服务状态。

自动化与运维 ✓ NVIDIA · 官方

Megatron-LM 集群训练启动助手

帮助你在 SLURM GPU 集群上可靠启动、监控和排查多节点 Megatron-LM 训练任务。

自动化与运维 ✓ NVIDIA · 官方

VSS 多摄像头三维检测追踪部署

部署基于 DeepStream 与 BEV Fusion 的多摄像头三维感知服务。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CPU Offload

为 Megatron Bridge 配置、验证并排查 CPU 卸载,以缓解 GPU 显存压力。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CUDA 图优化

在 Megatron Bridge 训练中配置、验证并评估 CUDA Graph,以降低主机驱动开销。

自动化与运维 ✓ NVIDIA · 官方

TAO SLURM 集群运行

通过 SSH、SLURM 和 Pyxis/Enroot 在远程 GPU 集群上运行 TAO 作业。

开发与工程 ✓ NVIDIA · 官方

TAO 平台执行 SDK

在多种 GPU 平台上提交、监控并管理 NVIDIA TAO 训练任务。

自动化与运维 ✓ NVIDIA · 官方

TAO NVIDIA GPU 主机配置

为 TAO 的 Docker 与 Kubernetes GPU 主机检查并配置 NVIDIA 驱动、CUDA 和容器运行时。

相关 Skills