Kaggle 全流程 Agent 技能
为 AI 编码代理提供端到端 Kaggle 集成:竞赛调研、数据集/模型下载、Notebook 执行、提交、讨论抓取与徽章收集,一条技能全部覆盖。
证据显示较完善的安全设计:最小权限声明(allowed-tools 限定)、写操作需明确用户意图、默认 dry-run、凭据不回显、zip-slip 防护、不可信内容包裹标记,并有测试文件名佐证(未读到全部测试正文)。扣分点:竞赛提交、徽章刷取等行为直接修改用户 Kaggle 账户且提交占位预测文件(如 Titanic 全 0 预测),虽需确认但存在账户配额/可见性风险;发布者身份未经验证。
脚本逻辑自洽、错误处理与状态追踪(badge_tracker)较完整,失败信息可读,具有跳过/回退逻辑。扣分点:静态审查下未执行,关键路径(kaggle CLI 解析、kagglehub 上传、Playwright 阶段)依赖外部服务且输出格式假设较脆弱;badge-catalog 自身数字不一致(标题 55 vs 汇总 59);部分脚本文件被截断,无法确认完整性。
触发描述精确(明确排除非 Kaggle 任务),模块划分清晰,兼容性声明广泛,非适用范围(17 个不可自动化徽章)明确。扣分点:核心功能完全依赖 api.kaggle.com/www.kaggle.com 等海外服务,对中国大陆网络可达性构成实质限制且未讨论;Playwright MCP 依赖宿主代理提供,环境适配有附加条件。
文档分层良好(SKILL.md→模块 README→references),MIT 许可明确、版本号 2.4.0、pyproject 元数据一致、明确声明非官方、有 SECURITY.md 与隐私声明。扣分点:未见 CHANGELOG 与明确维护者承诺;徽章数量等细节不一致;测试与诊断文档覆盖情况部分仅靠 README 描述。
核心工作流(竞赛页摘要、数据集下载、讨论检索)有具体命令示例与 demo 录像声明,边际价值明确(自动搜索/汇总 Kaggle 内容)。扣分点:静态审查无法验证输出质量;徽章自动化的实际收益有限且部分步骤标为手动;demo 为作者自录不可独立核验。
仓库含测试目录、安全测试清单、pyproject 测试标记(live/destructive/manual),并有可复现的命令路径。扣分点:提供的证据中未读到实际测试正文与 CI 配置内容,demo 录像与 MCP 70 工具清单为作者声明,静态审查下不 award 超过 5。
- 徽章收集与竞赛提交流程会直接修改用户的 Kaggle 账户(创建私有资源、占用提交次数),执行前务必逐项确认。
- 提交的预测文件为占位数据(如 Titanic 全 0 预测),可能影响账户信誉或违反个别竞赛规则,请勿用于真实竞赛。
- 核心功能依赖 api.kaggle.com 与 www.kaggle.com,中国大陆网络可能无法直连,需自备可达网络环境。
- 静态审查未执行任何代码;badge-catalog 中徽章数量(55 vs 59)等细节不一致,使用前请自行核对。
- 发布者身份未经 FollowSkills 注册表验证,属未知而非可疑;如需企业级采用请另行尽调。
这个 Skill 能做什么,适合哪些场景?
这是一个面向代理式编码系统的非官方 Kaggle 技能,由 shepsci 维护,MIT 许可。它把 Kaggle 账户配置、竞赛报告、数据集与模型操作、Notebook 发布与执行、讨论与方案 writeup 检索、基准测试和徽章工作流整合为一套模块化脚本。支持 Claude Code、Codex、OpenClaw、Antigravity CLI、Gemini CLI 等已测试平台,并可通过 skills.sh 或 ClawHub 分发到 35+ 代理。安全设计较为严谨:凭据不外泄、外部内容以不可信数据标记包裹、写入类操作需显式确认。项目独立开发,与 Kaggle 或 Google 无关联。
运行凭据检查脚本验证 KAGGLE_API_TOKEN;调用 Kaggle CLI、kagglehub 与远程 MCP 端点(README 称经核验有 70 个工具)拉取竞赛页面、生成竞赛格局报告、下载与发布数据集/模型、发布并轮询 Kaggle Notebook 执行结果、抓取论坛帖与排行榜 writeup、驱动 kaggle benchmarks CLI 创建和运行基准任务,以及按阶段执行徽章收集编排器(支持 --dry-run)。所有输出 Kaggle 内容的脚本会用 <untrusted-content> 标记包裹文本。
- 数据科学参赛者想让代理总结 Titanic 等竞赛的规则与评估指标,快速判断是否参赛。
- 方案作者需要抓取某竞赛排行榜前几名提交对应的 writeup 作为学习或写作素材。
- 研究者想通过命令行批量下载 Kaggle 数据集或模型到本地供 Notebook 使用。
- 习惯在 Kaggle Kernels 上训练的用户想让代理推送 Notebook、轮询执行状态并取回输出。
- Kaggle 徽章收集者希望以 API 优先、先干跑再执行的方式安全完成徽章任务。
这个 Skill 有哪些优点和局限?
- 功能覆盖 Kaggle 全生命周期:账户、竞赛、数据集、模型、Notebook、讨论、基准、徽章。
- 安全测试有实际测试文件支撑:无凭据泄漏、无动态 eval、zip-slip 防护、slug 校验等。
- 外部内容统一以 untrusted-content 标记包裹,降低提示注入风险。
- 多平台分发渠道齐全(Claude、Codex、skills.sh、ClawHub),并有 asciinema 演示可回放验证。
- 独立非官方项目,与 Kaggle/Google 无关联,API 变动可能随时导致脚本失效。
- 竞赛模块的部分 SPA 抓取步骤依赖宿主代理提供 Playwright MCP 工具,技能本身不捆绑。
- Hermes、Cursor、GitHub Copilot 等仅标注"兼容",未见测试证据;徽章阶段可能产生个人主页可见的状态变更。
- 基准生命周期命令会消耗配额并创建资源,使用门槛需要阅读额外文档。
如何安装这个 Skill?
Claude Code:在会话中执行 /plugin marketplace add shepsci/kaggle-skill,再 /plugin install kaggle@shepsci。Codex:codex plugin marketplace add shepsci/kaggle-skill --ref main 然后 codex plugin add kaggle@shepsci。skills.sh:npx skills add shepsci/kaggle-skill。ClawHub:clawhub install kaggle。手动方式:git clone https://github.com/shepsci/kaggle-skill.git 后 pip 安装 kagglehub>=1.0.0、kaggle>=2.2.3、kagglesdk>=0.1.33,<1.0、python-dotenv、requests;若代理不支持插件安装,把 skills/kaggle/ 目录复制到代理的 skills 目录。
如何使用这个 Skill?
先在 kaggle.com/settings 生成 token,写入 ~/.kaggle/access_token(chmod 600)或导出 KAGGLE_API_TOKEN,然后运行 python3 modules/setup/scripts/check_all_credentials.py 验证。之后可用自然语言触发,例如"用 Kaggle 技能总结 Titanic 竞赛的规则和评估指标"或"获取 Vesuvius Challenge 排行榜前三名提交的 writeup";也可以直接调用模块脚本,如 python3 modules/competitions/scripts/competition_pages.py --competition titanic --summary。任何提交、发布或徽章等写入操作前,技能会要求显式确认并先做干跑。