NeMo 数据设计器合成数据技能
用 NeMo Data Designer 构建符合描述的合成数据集与数据生成流水线。
技能明确要求未经用户许可不得安装依赖,并在网络错误时请求重试许可;skill-card还要求不在日志或输出中暴露秘密。扣分在于会生成包含姓名、地址等潜在个人信息的数据,且可能调用外部推理服务,但未充分说明数据流、凭据权限、隔离边界或回滚机制。
文档给出了交互式/自动驾驶分支、CLI缺失提示和网络失败反馈,并强调本地与集群上下文差异。扣分在于关键 workflow 文件未提供,依赖版本与接口兼容性未锁定,且没有覆盖该技能关键路径的测试;静态评估不支持更高分。
触发条件、目标用户和Python脚本输出格式较明确,也说明了种子数据、人物采样和集群提交等部分边界。扣分在于非适用场景、中文使用支持和中国大陆网络可达性未说明,核心能力可能依赖外部模型服务。
SKILL.md包含元数据、依赖提示、引用文档、故障排查和输出模板;skill-card提供Apache 2.0、所有者、版本0.2.0和风险说明。扣分在于缺少明确作者、变更日志、维护责任/更新路径和示例;基准报告也指出缺少Instructions与Examples推荐章节。
目标是生成可直接保存的Data Designer配置脚本,输出函数、PEP 723依赖和模型配置要求较具体,评测用例也定义了预期文件与字段。扣分在于没有实际生成结果或第三方执行证据,数据质量、兼容性和相对手工方案的收益无法静态验证;按规则上限为7。
源文件提供了具体命令、配置模式、评测用例和静态验证报告,具备一定审计线索。扣分在于评测任务和Tier 3细节不可用,结果指标均为N/A,且没有该技能专属测试套件或独立复现证据;静态评估上限为5。
- 执行前确认data-designer、Python版本、模型提供商和网络/凭据配置;默认不要把真实个人数据或秘密放入种子数据、提示词、日志或生成结果。
- 缺少关键workflow文件和实际执行结果,建议在隔离环境中先验证本地配置,再人工检查生成数据的隐私、偏差、质量和许可适用性。
- 未证明中国大陆网络可达性;依赖的外部推理服务或平台资源可能需要额外网络配置。
这个 Skill 能做什么,适合哪些场景?
该技能面向需要创建数据集、生成合成数据或构建数据生成流水线的用户。它根据用户描述选择交互式或自动驾驶模式,并读取对应工作流继续执行。技能要求将配置写入当前目录中的 Python 文件,该文件提供返回 DataDesignerConfigBuilder 的 load_config_builder() 函数。它适合希望以声明式方式生成数据、但需要注意环境安装、模型配置和网络可用性的用户。
接收用户的数据集描述;在交互式模式和自动驾驶模式之间进行选择;仅读取所选模式对应的工作流文件,并按条件读取人员采样、种子数据集或 NeMo Platform 插件参考资料;生成一个带有 PEP 723 依赖元数据的 Python 配置文件;使用 NeMo Data Designer 的 DataDesignerConfigBuilder 构建合成数据生成配置;在涉及 LLM 列时可在脚本中声明模型配置;默认保留输出列,并处理采样器、模板和 LLM 评审分数的配置规则。
- 数据工程师根据自然语言描述生成客户评论、对话或其他结构化合成数据集。
- 机器学习团队需要快速搭建用于训练或评估的数据生成流水线。
- 不希望反复回答配置问题的用户,让技能根据合理假设自动生成数据设计脚本。
- 需要从已有记录构建数据集的用户,在明确提供种子数据后使用种子数据参考流程。
这个 Skill 有哪些优点和局限?
- 专门覆盖合成数据集和数据生成流水线场景。
- 同时提供交互式和自动驾驶工作流。
- 明确规定列保留、采样器参数、Jinja2 模板和 LLM 评审分数的常见配置规则。
- 脚本中的模型配置路径可兼容本地运行和集群提交。
- 需要 Python >= 3.11 和 NeMo Data Designer 环境。
- 涉及 LLM 列时通常还需要可用的模型配置或推理提供商;SKILL.md 未给出具体模型名称。
- 未提供完整的安装命令、工作流文件内容或特定数据集模板。
- 网络受限时预览可能失败,且技能要求用户自行决定是否重试或安装依赖。
如何安装这个 Skill?
使用仓库 README 支持的 skills CLI 安装指定技能:
npx skills add nvidia/skills --skill nemo-data-designer-plugin --yes
README 未说明该命令安装后的具体目录;技能会在下次代理加载技能并遇到相关任务时可用。
如何使用这个 Skill?
向代理描述想生成的数据集,例如:“创建一个包含客户姓名、城市、产品、评分和评论的合成客户评论数据集”。技能会默认使用交互式模式;如果明确要求“你来决定”“直接构建”或类似表述,则使用自动驾驶模式。输出应是当前目录中的描述性 Python 文件,其中包含 load_config_builder() 函数。