Bright Data Web MCP 网页访问技能
为 MCP 兼容智能体提供可靠的网页访问:搜索、抓取、结构化提取与浏览器自动化,自动绕过反爬和 CAPTCHA。
文档明确说明工具分组/按需选择实现最小授权(groups/tools参数)、提供安全与合规章节(将抓取内容视为不可信、robots.txt、避免抓取个人数据),数据流向(API token、SSE/HTTP端点)披露清楚。扣分项:无回滚或确认机制说明;远程端点把API token放在URL查询串中存在泄漏到日志的风险;对Bright Data商业服务及其60+工具的实际行为无控制力;工具描述本身可能被当作指令执行。
文档自洽、结构一致,含故障排查(npx ENOENT、超时、鉴权)与可验证设置步骤,但静态审阅无执行证据,未达静态上限;无测试、对错误响应格式和异常输入行为描述薄弱,失败反馈依赖上游服务。
触发条件明确(description给出清晰的适用场景:实时网页内容、绕过封锁/CAPTCHA、电商/社媒数据),场景表和工具选择指南完整,'When to Use'边界较清楚。扣分项:核心功能完全依赖mcp.brightdata.com海外端点,未说明中国大陆可达性;无中文支持;Pro模式需付费,免费额度边界只部分说明。
文档分层良好(SKILL.md + references/五个主题文件),渐进披露、安装说明、参数表、FAQ式troubleshooting齐全,仓库MIT许可证明确。扣分项:技能本身无版本号/变更记录,未声明维护责任与更新路径,'60+工具'等动态能力可能与上游版本漂移。
声称能完成搜索、抓取、结构化提取,示例丰富且格式说明明确,但静态审阅下无执行验证,封顶于7。扣分项:所有输出依赖第三方付费/配额服务,未注册Bright Data账户则完全不可用;对比替代方案(手动或Firecrawl等)的边际价值未论证。
有可审计的一手材料(引用Bright Data官方GitHub、文档、Smithery)和社区演示链接,但均为外部声明,无提交的测试套件或CI覆盖本技能关键路径,'30-60% token节省'等数字无独立复现,扣分明显。
- 本技能是Bright Data商业MCP服务的封装,需注册并配置API token方可使用;未注册时完全不可用。
- 远程端点将API token置于URL查询参数中,可能泄漏到日志、历史记录或代理层;建议优先使用本地模式与环境变量。
- 核心依赖mcp.brightdata.com海外端点,中国大陆可达性未验证,FollowSkills中文用户需自行测试网络连通性。
- Pro模式与多数结构化工具需付费;免费额度(5000请求/月)仅覆盖基础搜索与抓取。
- 技能内容为静态文档,无提交的测试或CI验证;'60+工具'等能力描述可能随上游服务版本变化而失效。
- 抓取行为涉及目标网站服务条款与合规风险;绕过反爬/CAPTCHA功能在部分司法辖区可能有法律争议,使用前请自行评估。
这个 Skill 能做什么,适合哪些场景?
该技能封装了 Bright Data 的 Web MCP 服务,让智能体能够搜索网页、把任意 URL 抓取为 Markdown/HTML、用 AI 提取结构化 JSON,以及在需要时驱动完整浏览器。它内置反爬虫与 CAPTCHA 处理,并提供针对 Amazon、eBay、LinkedIn、Instagram 等平台的预制结构化数据提取器。免费 Rapid 模式每月提供 5,000 次请求,Pro 模式解锁 60 多个高级工具,可按工具组订阅。安装支持远程 SSE/HTTP 端点(无需本地安装)或本地 npx 运行。
调用 search_engine 获取 Google/Bing/Yandex 搜索结果(Google 返回 JSON,其余返回 Markdown);用 scrape_as_markdown 将网页转为干净的 Markdown 并绕过反爬;用 extract 按自定义 prompt 做基于 AI 的 JSON 提取;用 search_engine_batch 和 scrape_batch 并行处理最多 10 个请求;通过 scraping_browser_* 系列工具在真实浏览器会话中导航、点击、输入、截图、读取网络请求;用 web_data_* 预制提取器获取电商平台、社交媒体、金融和商业平台的结构化数据。
- 构建研究型智能体的开发者:需要获取实时网页内容且标准 HTTP 请求被反爬拦截或遇到 CAPTCHA 时,用此技能做搜索加抓取。
- 做电商比价或市场分析的用户:需要从 Amazon、eBay、Walmart 等平台批量拉取商品名称、价格、评论等结构化数据。
- 监控社交媒体的人员:需要提取 LinkedIn 帖子、Instagram 主页、TikTok 内容等平台的结构化信息。
- 需要操作 JavaScript 重度渲染网站的用户:网页内容依赖动态加载或需要点击、滚动等交互时,使用浏览器自动化工具。
- 需要批量数据管道的工程师:用 scrape_batch 和 search_engine_batch 一次处理多达 10 个 URL 或查询,提高效率。
这个 Skill 有哪些优点和局限?
- 免费 Rapid 模式每月 5,000 次请求,无需安装即可通过远程端点使用
- 自动处理反爬和 CAPTCHA,对动态内容和 JS 重度站点也能抓取
- 工具粒度可配置:可按组(电商、社交、金融等 9 个组)或单个工具订阅,避免加载全部 60+ Pro 工具
- 提供 Amazon、LinkedIn、Instagram、YouTube 等主流平台的预制结构化提取器,比裸抓取更快更可靠
- SKILL.md 含完整的故障排查(如 spawn npx ENOENT、超时调整)和工作流模式,文档质量高
- 依赖第三方商业服务 Bright Data,需要 API token,Pro 功能和多数 web_data_* 工具为付费功能
- 仓库采用 MIT 许可,但该技能本身是服务封装,实际使用受 Bright Data 服务条款约束
- 复杂站点建议 180 秒超时,浏览器自动化操作需保持紧凑,否则可能不稳定
- 源材料未提供任何自动化测试或独立基准数据,可靠性声明来自文档自身
如何安装这个 Skill?
方式一(推荐,远程):在 MCP 客户端中配置 SSE 端点 https://mcp.brightdata.com/sse?token=YOUR_API_TOKEN 或流式 HTTP 端点 https://mcp.brightdata.com/mcp?token=YOUR_API_TOKEN,无需本地安装。方式二(本地):运行 API_TOKEN=<token> npx @brightdata/mcp,需要 Node.js。两种方式都需要先获取 Bright Data API token;仓库中该技能属于 patchy631/ai-engineering-hub 的 hugging-face-skills/skills/brightdata-web-mcp/ 路径,如何将其放入具体客户端的 skills 目录未在源材料中说明。
如何使用这个 Skill?
配置完成后,在支持 MCP 的客户端中直接按需调用工具。典型研究流程:先调用 search_engine(输入如 {"query": "latest AI news", "engine": "google"})找到相关 URL,再用 scrape_as_markdown 抓取内容,需要结构化数据时用 extract 加自定义 prompt。要启用 Pro 模式,远程端点加 &pro=1,本地设 PRO_MODE=true;也可用 GROUPS(如 ecommerce,social)或 TOOLS 参数只订阅特定工具。
这个 Skill 与同类方案有什么区别?
仓库的 MCP 项目合集(如 MCP Agentic RAG Firecrawl、Cursor Linkup MCP)展示了对 Firecrawl 和 Linkup 等同类网页抓取 MCP 的用法,可作为替代方案参考;但源材料未提供直接对比数据。