GEO 爬虫访问分析技能(geo-crawlers)
检测 robots.txt、meta 标签与 HTTP 响应头,判断 14 个主流 AI 爬虫能否访问你的网站,并给出最大化 AI 搜索可见性的配置建议。
工具面较克制:Read/Grep/Glob/Bash/WebFetch/Write,主要做只读分析并生成一份报告文件 GEO-CRAWLER-ACCESS.md,不直接修改用户 robots.txt,建议以配置片段形式给出。扣分点:Bash 权限范围未限定、无明确用户确认步骤、未说明 WebFetch 数据流向、未提供回滚说明,Write 边界未显式约束。
分析流程(robots.txt、meta、headers、llms.txt、JS 渲染、Content-Signal)步骤清晰、自洽,输出模板明确。扣分点:纯静态审阅无法验证关键路径可运行;该 skill 自身无测试覆盖(仓库测试只针对 fetch_page.py 的 SSR 检测);对 robots.txt 解析异常、WebFetch 失败、非标准语法等错误处理与失败反馈描述薄弱。
目标场景明确(GEO 审计中的 AI 爬虫可达性分析),触发语义与 /geo crawlers 命令对应良好,十四个爬虫的分级建议实用。扣分点:未声明非适用边界(如 JS 重度 SPA、登录墙站点);未提供中文界面或中文场景说明;核心价值依赖 ChatGPT/Claude/Perplexity 等境外平台,对以国内 AI 搜索(如豆包、Kimi)为主的用户覆盖不足。
文档结构清晰:分层列出爬虫参考、矩阵、步骤、输出格式、评分方法;仓库有 MIT LICENSE 和卸载脚本。扣分点:SKILL.md 本身无版本号或变更记录,无已知限制章节(如统计数据的时效性),引用的 Originality.ai 研究未给可查证来源,维护责任仅体现于仓库层面。
产出(访问地图 + 建议 + 评分)格式完整、可直接使用,边际价值在于系统化覆盖 14 个 AI 爬虫与新兴 Content-Signal 标准,优于人工逐项检查。扣分点:静态审阅无法验证实际输出正确性;评分权重(Tier1 50% 等)为作者自定义,合理性未论证;某些 UA 字符串可能随版本过期需人工维护。
分析步骤可由用户自行复现,爬虫 UA 与用途描述大体可交叉核对。扣分点:35% 屏蔽率、300M 用户、2B 设备等关键数字无出处链接,属作者断言;该 skill 关键路径无提交测试,无 CI 覆盖,静态审阅下无法给更高分。
- 静态审阅,未执行:所有评分置信度低,实际产出质量未经验证。
- skill 授予 Bash 与 Write 权限但未限定范围,建议在受控环境中使用并审查其生成的文件。
- 引用的市场统计(35% 屏蔽率等)无出处,勿直接用于对外报告。
- 核心价值面向境外 AI 平台,国内 AI 搜索场景覆盖有限。
- robots.txt 建议为通用配置,应用前需结合站点实际(如 CCBot Disallow 属策略选择)复核。
这个 Skill 能做什么,适合哪些场景?
这是 geo-seo-claude 仓库(MIT 协议)捆绑的 16 个技能之一,路径为 skills/geo-crawlers/SKILL.md。该技能专门分析网站对 AI 爬虫(GPTBot、ClaudeBot、PerplexityBot 等)的可访问性——这是生成式引擎优化(GEO)的技术前提:爬虫被拦截,内容就无法出现在 AI 回答中。它解析 robots.txt、抽查页面 meta 标签与 X-Robots-Tag 头、检查 llms.txt 等新兴标准,并输出带评分(0-100)和具体 robots.txt 修改建议的 GEO-CRAWLER-ACCESS.md 报告。仓库整体通过一键脚本安装到 Claude Code,可用 /geo crawlers <url> 命令调用。
1) 用 WebFetch 抓取目标域名的 robots.txt,解析每个 AI 爬虫的 Allow/Disallow 规则(含通配符继承和 Crawl-delay);2) 抽查 5-10 个关键页面的 meta robots 标签(noindex/noai/noimageai 及 GPTBot 专属标签)和 X-Robots-Tag 响应头;3) 检查 /llms.txt、/ai.txt、/.well-known/ai-plugin. 是否存在;4) 评估站点是否依赖 JavaScript 渲染(GPTBot/ClaudeBot/PerplexityBot 的 JS 渲染能力有限);5) 解析 robots.txt 中的 Content-Signal: 指令(IETF 草案 draft-romm-aipref-contentsignals);6) 按 Tier 1(50%)、Tier 2(25%)、无全局拦截(15%)、AI 专用文件(10%)加权计算 AI 可见性评分,并生成含 14 个爬虫访问矩阵和完整 robots.txt 建议的 GEO-CRAWLER-ACCESS.md 报告。
- SEO/GEO 顾问在给客户做 AI 可见性诊断时,需要一份逐爬虫的访问状态报告和可直接部署的 robots.txt 改动清单
- 内容站点负责人发现网站在 ChatGPT Search 或 Perplexity 中完全不被引用,想排查是否误拦了 GPTBot 或 PerplexityBot
- 技术团队承接了沿用旧版 SEO 配置的网站,需要核查历史 robots.txt 规则是否顺带拦截了 AI 爬虫
- 发布商想在保留对训练数据控制权的同时开放 AI 搜索(区分 Tier 1 搜索爬虫与 Tier 3 纯训练爬虫如 CCBot)
- 面向中国市场的业务需要判断 Bytespider 应放行还是拦截,获取情境化建议
这个 Skill 有哪些优点和局限?
- 覆盖 14 个 AI 爬虫并按 Tier 1/2/3 分级,明确区分搜索爬虫(拦截直接影响 AI 搜索可见性)与纯训练爬虫(拦截不影响搜索),建议有策略依据
- 检查面较全面:robots.txt 之外还查 meta 标签、X-Robots-Tag 头、llms.txt/ai.txt、JS 渲染依赖和 IETF 草案的 Content-Signal
- 输出为带 0-100 加权评分和可直接部署的 robots.txt 配置的 Markdown 报告,便于交付客户
- MIT 协议,免费使用,代码可审计
- 评分中部分依据(如'300M+ ChatGPT 周活用户'、Originality.ai 35% 拦截率)引自外部研究,未附验证链接,时效性依赖作者更新
- 爬虫 User-Agent 识别完全依赖 robots.txt 字符串匹配,无法检测服务器层面(防火墙、CDN 规则)的拦截
- JS 渲染能力评估只是基于静态知识的定性判断,来源未提供实测验证或测试套件
- 6 步分析流程中抓取页面数量(5-10 个抽样页)由模型自行决定,结果可复现性无保证
- 单独安装该子技能的方法未在来源中说明
如何安装这个 Skill?
仓库提供一键安装(把整套 16 个技能装进 ~/.claude/skills/geo/):curl -fsSL https://raw.githubusercontent.com/zubair-trabzada/geo-seo-claude/main/install.sh | bash(Windows 用户在 Git Bash 中运行 install-win.sh)。要求 Python 3.8+(Debian/Ubuntu 另需 python3-venv)、Claude Code CLI 和 Git;依赖装入独立虚拟环境 ~/.claude/skills/geo/.venv/,不改动系统 Python。来源未说明能否单独安装 geo-crawlers 这一个子技能。卸载用 ./uninstall.sh。
如何使用这个 Skill?
安装整套技能后,在 Claude Code 中运行:/geo crawlers https://example.com。技能会抓取并分析该域名的 robots.txt、meta 标签、HTTP 头和 llms.txt,然后在当前目录生成 GEO-CRAWLER-ACCESS.md 报告。报告包含每个爬虫的状态(Allowed/Blocked/Not Mentioned)、0-100 的 AI 可见性评分、关键问题列表和完整的推荐 robots.txt 内容。