开发与工程 web-scrapingmcp-serverbright-dataserp-searchbrowser-automationstructured-extractionanti-bot-bypass

Bright Data Web MCP 网页访问技能

为 MCP 兼容智能体提供可靠的网页访问:搜索、抓取、结构化提取与浏览器自动化,自动绕过反爬和 CAPTCHA。

FollowSkills 评估 · FSRS-2.0
谨慎使用
51/ 100 五分制 2.6 / 5
1 2 3 4 5 6
1信任安全13 / 25 · 2.6/5

文档明确说明工具分组/按需选择实现最小授权(groups/tools参数)、提供安全与合规章节(将抓取内容视为不可信、robots.txt、避免抓取个人数据),数据流向(API token、SSE/HTTP端点)披露清楚。扣分项:无回滚或确认机制说明;远程端点把API token放在URL查询串中存在泄漏到日志的风险;对Bright Data商业服务及其60+工具的实际行为无控制力;工具描述本身可能被当作指令执行。

2可靠稳定9 / 20 · 2.3/5

文档自洽、结构一致,含故障排查(npx ENOENT、超时、鉴权)与可验证设置步骤,但静态审阅无执行证据,未达静态上限;无测试、对错误响应格式和异常输入行为描述薄弱,失败反馈依赖上游服务。

3适用触发9 / 15 · 3.0/5

触发条件明确(description给出清晰的适用场景:实时网页内容、绕过封锁/CAPTCHA、电商/社媒数据),场景表和工具选择指南完整,'When to Use'边界较清楚。扣分项:核心功能完全依赖mcp.brightdata.com海外端点,未说明中国大陆可达性;无中文支持;Pro模式需付费,免费额度边界只部分说明。

4规范维护10 / 15 · 3.3/5

文档分层良好(SKILL.md + references/五个主题文件),渐进披露、安装说明、参数表、FAQ式troubleshooting齐全,仓库MIT许可证明确。扣分项:技能本身无版本号/变更记录,未声明维护责任与更新路径,'60+工具'等动态能力可能与上游版本漂移。

5有效结果6 / 15 · 2.0/5

声称能完成搜索、抓取、结构化提取,示例丰富且格式说明明确,但静态审阅下无执行验证,封顶于7。扣分项:所有输出依赖第三方付费/配额服务,未注册Bright Data账户则完全不可用;对比替代方案(手动或Firecrawl等)的边际价值未论证。

6证据核验4 / 10 · 2.0/5

有可审计的一手材料(引用Bright Data官方GitHub、文档、Smithery)和社区演示链接,但均为外部声明,无提交的测试套件或CI覆盖本技能关键路径,'30-60% token节省'等数字无独立复现,扣分明显。

证据充分度: 评估于 2026年9月9日 审查版本 2c9b106168d4
使用前请注意
  • 本技能是Bright Data商业MCP服务的封装,需注册并配置API token方可使用;未注册时完全不可用。
  • 远程端点将API token置于URL查询参数中,可能泄漏到日志、历史记录或代理层;建议优先使用本地模式与环境变量。
  • 核心依赖mcp.brightdata.com海外端点,中国大陆可达性未验证,FollowSkills中文用户需自行测试网络连通性。
  • Pro模式与多数结构化工具需付费;免费额度(5000请求/月)仅覆盖基础搜索与抓取。
  • 技能内容为静态文档,无提交的测试或CI验证;'60+工具'等能力描述可能随上游服务版本变化而失效。
  • 抓取行为涉及目标网站服务条款与合规风险;绕过反爬/CAPTCHA功能在部分司法辖区可能有法律争议,使用前请自行评估。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能封装了 Bright Data 的 Web MCP 服务,让智能体能够搜索网页、把任意 URL 抓取为 Markdown/HTML、用 AI 提取结构化 JSON,以及在需要时驱动完整浏览器。它内置反爬虫与 CAPTCHA 处理,并提供针对 Amazon、eBay、LinkedIn、Instagram 等平台的预制结构化数据提取器。免费 Rapid 模式每月提供 5,000 次请求,Pro 模式解锁 60 多个高级工具,可按工具组订阅。安装支持远程 SSE/HTTP 端点(无需本地安装)或本地 npx 运行。

调用 search_engine 获取 Google/Bing/Yandex 搜索结果(Google 返回 JSON,其余返回 Markdown);用 scrape_as_markdown 将网页转为干净的 Markdown 并绕过反爬;用 extract 按自定义 prompt 做基于 AI 的 JSON 提取;用 search_engine_batch 和 scrape_batch 并行处理最多 10 个请求;通过 scraping_browser_* 系列工具在真实浏览器会话中导航、点击、输入、截图、读取网络请求;用 web_data_* 预制提取器获取电商平台、社交媒体、金融和商业平台的结构化数据。

  1. 构建研究型智能体的开发者:需要获取实时网页内容且标准 HTTP 请求被反爬拦截或遇到 CAPTCHA 时,用此技能做搜索加抓取。
  2. 做电商比价或市场分析的用户:需要从 Amazon、eBay、Walmart 等平台批量拉取商品名称、价格、评论等结构化数据。
  3. 监控社交媒体的人员:需要提取 LinkedIn 帖子、Instagram 主页、TikTok 内容等平台的结构化信息。
  4. 需要操作 JavaScript 重度渲染网站的用户:网页内容依赖动态加载或需要点击、滚动等交互时,使用浏览器自动化工具。
  5. 需要批量数据管道的工程师:用 scrape_batch 和 search_engine_batch 一次处理多达 10 个 URL 或查询,提高效率。

这个 Skill 有哪些优点和局限?

优点
  • 免费 Rapid 模式每月 5,000 次请求,无需安装即可通过远程端点使用
  • 自动处理反爬和 CAPTCHA,对动态内容和 JS 重度站点也能抓取
  • 工具粒度可配置:可按组(电商、社交、金融等 9 个组)或单个工具订阅,避免加载全部 60+ Pro 工具
  • 提供 Amazon、LinkedIn、Instagram、YouTube 等主流平台的预制结构化提取器,比裸抓取更快更可靠
  • SKILL.md 含完整的故障排查(如 spawn npx ENOENT、超时调整)和工作流模式,文档质量高
局限
  • 依赖第三方商业服务 Bright Data,需要 API token,Pro 功能和多数 web_data_* 工具为付费功能
  • 仓库采用 MIT 许可,但该技能本身是服务封装,实际使用受 Bright Data 服务条款约束
  • 复杂站点建议 180 秒超时,浏览器自动化操作需保持紧凑,否则可能不稳定
  • 源材料未提供任何自动化测试或独立基准数据,可靠性声明来自文档自身

如何安装这个 Skill?

方式一(推荐,远程):在 MCP 客户端中配置 SSE 端点 https://mcp.brightdata.com/sse?token=YOUR_API_TOKEN 或流式 HTTP 端点 https://mcp.brightdata.com/mcp?token=YOUR_API_TOKEN,无需本地安装。方式二(本地):运行 API_TOKEN=<token> npx @brightdata/mcp,需要 Node.js。两种方式都需要先获取 Bright Data API token;仓库中该技能属于 patchy631/ai-engineering-hub 的 hugging-face-skills/skills/brightdata-web-mcp/ 路径,如何将其放入具体客户端的 skills 目录未在源材料中说明。

如何使用这个 Skill?

配置完成后,在支持 MCP 的客户端中直接按需调用工具。典型研究流程:先调用 search_engine(输入如 {"query": "latest AI news", "engine": "google"})找到相关 URL,再用 scrape_as_markdown 抓取内容,需要结构化数据时用 extract 加自定义 prompt。要启用 Pro 模式,远程端点加 &pro=1,本地设 PRO_MODE=true;也可用 GROUPS(如 ecommerce,social)或 TOOLS 参数只订阅特定工具。

这个 Skill 与同类方案有什么区别?

仓库的 MCP 项目合集(如 MCP Agentic RAG Firecrawl、Cursor Linkup MCP)展示了对 Firecrawl 和 Linkup 等同类网页抓取 MCP 的用法,可作为替代方案参考;但源材料未提供直接对比数据。

常见问题

使用这个技能需要付费吗?
Rapid 模式免费,每月 5,000 次请求,仅含 search_engine 和 scrape_as_markdown。Pro 模式(60+ 高级工具、批量、浏览器自动化、web_data_* 提取器)需要 Bright Data 付费订阅,通过 &pro=1 或 PRO_MODE=true 启用。
必须本地安装吗?
不必。推荐使用远程 SSE 或 Streamable HTTP 端点,无需本地安装。只有本地模式需要 Node.js 并运行 npx @brightdata/mcp。
如果网页抓取失败或超时怎么办?
文档建议将客户端超时调到 180 秒,优先使用专用的 web_data_* 工具(通常更快),并把浏览器自动化操作集中执行。遇到 spawn npx ENOENT 错误时改用 Node.js 完整路径。
抓取的数据能直接喂给 LLM 吗?
文档明确提醒应将抓取内容视为不可信数据,先过滤和验证再传给模型,并建议优先用结构化提取而非原始文本,同时遵守 robots.txt 和服务条款,未经同意不抓取个人数据。

同仓库的其他 Skills

均来自 patchy631/ai-engineering-hub

开发与工程

Hugging Face Jobs 运行技能

让 AI 助手直接把任意 Python 工作负载提交到 Hugging Face 全托管云算力,无需本地 GPU 或环境配置,并安全处理认证、超时与结果持久化。

数据与分析

Hugging Face 数据集管理技能

在 Hugging Face Hub 上创建、配置、流式写入数据集,并用 DuckDB SQL 直接查询、转换、再发布任意公开数据集。

开发与工程

Hugging Face CLI 技能

让 AI 助手直接在终端执行 Hugging Face Hub 的模型下载、上传、仓库管理、缓存清理与云端 GPU 任务。

开发与工程

Hugging Face 模型评测管理技能

把评测基准分数结构化写入 Hugging Face 模型卡:从 README 提取、从 Artificial Analysis 导入,或用 vLLM/lighteval 自行跑分。

数据与分析

Trackio 实验追踪技能

在模型训练时记录指标、在训练后检索分析,并将仪表板同步到 Hugging Face Spaces,实现实时监控。

开发与工程

HF 模型训练器(TRL on Hugging Face Jobs)

无需本地 GPU,通过 Hugging Face Jobs 云端基础设施使用 TRL 完成语言模型的微调、GGUF 转换与 Hub 持久化。

开发与工程

Hugging Face API 工具构建器

把与 Hugging Face API 的交互打包成可复用、可管道组合的命令行脚本,免去每次重复写一次性抓取代码。

开发与工程

HF 论文发布助手

把 arXiv 论文索引到 Hugging Face Hub,并将其关联到模型、数据集卡片,一站管理作者身份与引用。

开发与工程

GRPO 微调技能(Qwen3 / Fireworks)

用一句自然语言任务描述和数据集,即可在 Fireworks 托管 GPU 上启动 GRPO 强化学习微调,全程无需手动配置训练脚本。

相关 Skills