Bright Data MCP
为 AI 客户端提供搜索、抓取、结构化提取与浏览器自动化。
证据显示可通过 GROUPS 和 TOOLS 缩小启用范围,发布工作流使用只读 contents 权限、OIDC、npm provenance 与签名审计;README 也说明请求会经过 Bright Data 基础设施并披露计费方式。扣分原因是五个基础工具始终启用,浏览器点击、输入和提交等外部效果没有逐步确认机制,也没有通用撤销方案。令牌既可放在环境变量中,也被示例放入 URL 查询参数,源码材料没有说明日志脱敏、令牌轮换、保留期或抓取数据处理政策。发布流程还通过未经固定版本或校验和验证的 latest 下载并执行发布器。作者、仓库、包名和 MIT 版权归属基本一致,但注册表未验证发布者身份,因此归属证据并非最高强度。
README、package.json 与测试对搜索、结构校验和 stdio 健康路径形成了基本一致的产品轮廓;依赖版本、Node 启动命令、托管与本地部署路径也写得清楚。测试覆盖未知数据集、无效过滤器、非 JSON 响应和 session_stats,可见部分明确失败消息。扣分在于证据只覆盖少量工具,69 个工具的大部分错误行为、远程服务中断、重试、超时和降级未由所给文件证明;产品还依赖 Bright Data 服务、账户及外部网站可用性。
面向研究、电商、竞品分析、编码、社交监测和内容创作等受众与场景的说明非常完整,并为多种 MCP 客户端、本地和托管环境给出配置。工具组、URL 类型校验、批量上限、过滤深度、浏览器快照顺序和静态页面替代方案提供了较好的边界与选择提示。扣分在于基础工具无法完全禁用,部分能力边界主要停留在 README 声明,且未充分说明登录墙、站点条款、地区限制和不同客户端行为差异。
README 的快速开始、定价、场景、分组和工具参考结构清晰,安装示例覆盖八类以上客户端;MIT 文本与 package.json 元数据一致,故许可证获满分。命名总体稳定,并有版本号、仓库、问题入口和自动发布路径。扣分在于没有提供所给修订对应的 changelog 或版本迁移说明,FAQ 与故障排查有限,已知限制分散在工具说明中而非集中列出;维护责任主要由 Bright Data 作者字段、版权和 issue 地址间接表达,未列维护者或支持承诺。README 中的仓库链接还使用 brightdata-com,而对象名称为 brightdata,形成轻微命名差异。
输出类型、字段示例、批量限制、回退方式和工具选择指南使结果较易直接用于代理流程;统一搜索、抓取、结构化提取与浏览器自动化相较单一抓取器具有明确增量价值。免费额度、按结果或流量计价、请求耗尽停止和消费上限提高了成本可控性。扣分在于大量效果优势与竞品对比是营销性声明,未由基准或覆盖测试支持;浏览器按 GB 计费、结构化结果按记录计费以及大型返回可能带来成本和上下文负担。
核心身份、版本、许可证、依赖、发布方法和少量行为可在 README、package.json、工作流及测试之间交叉核对;测试具体证明了部分 schema、解析错误和健康接口。扣分在于 CAPTCHA 绕过、69 项工具可靠性、竞品差异、免费层和广泛平台返回字段等多数主张没有在所给源码或测试中逐项追踪,且事实描述与宣传性比较没有始终清楚分隔。静态材料不足以独立验证远程服务行为。
- 多个快速开始示例把 API 令牌置于 URL 查询参数中;查询字符串可能进入客户端历史、代理或服务器日志,部署前应确认脱敏并优先采用更安全的密钥传递方式。
- 浏览器工具能够导航、点击、输入并提交,但材料没有显示逐步授权或撤销机制;应在 MCP 客户端侧限制工具并为有副作用的操作加入人工确认。
- 所有请求均经过第三方托管基础设施;在发送受监管、个人或机密数据前,应另行核实数据保留、处理地点、访问控制和合规条款。
- 发布工作流执行从 latest URL 下载且未显示校验和验证的二进制;供应链审查应固定版本并验证制品完整性。
- 定价、免费额度、平台覆盖及绕过封锁等主张来自 README,静态材料未独立证明,采用前需单独核验。
这个 Agent 能做什么,适合哪些场景?
Bright Data MCP 是一个面向 MCP 兼容客户端的公共网页数据服务器,共暴露 69 个工具。它覆盖 Google、Bing 和 Yandex 搜索,网页转 Markdown 或 HTML,AI 驱动的 JSON 提取,以及远程浏览器交互。针对 Amazon、LinkedIn、Instagram、TikTok、YouTube、X、Reddit、Crunchbase、npm 和 PyPI 等来源,它还提供返回结构化数据的专用工具。请求经由 Bright Data 的解封基础设施处理,包括代理轮换、验证码处理、反机器人和地理限制应对。用户可以连接托管 MCP 地址,也可以通过 `npx @brightdata/mcp` 在本地启动服务器;两种方式都需要 Bright Data API 令牌。它适合需要广泛实时网页访问能力、并能接受外部服务依赖及按量计费模式的团队。
MCP 客户端调用 search_engine 或 search_engine_batch 查询 Google、Bing、Yandex,也可用 discover 按意图、时间和相关性寻找来源。已知 URL 可交给 scrape_as_markdown、scrape_batch 或 scrape_as_html,任意页面还可通过 extract 转为结构化 JSON。Amazon、Walmart、LinkedIn、TikTok、YouTube、Crunchbase、npm、PyPI 等受支持来源由对应的 web_data_* 工具读取并返回专门字段。需要交互时,服务器维护远程浏览器会话:先用 scraping_browser_navigate 导航和 scraping_browser_snapshot 获取元素引用,再执行点击、输入、滚动、截图、正文或 HTML 读取以及网络请求检查。它还能向 ChatGPT、Grok 和 Perplexity提交提示,并以结构化数据收集回答。所有结果通过 MCP 返回给调用方,实际网页访问及解封过程由 Bright Data 基础设施执行。
- 使用 Claude Code 或其他 MCP 客户端的研究人员,需要搜索最新资料、批量读取来源,并按相关性筛选结果。
- 电商分析团队需要从 Amazon、Walmart、eBay、Best Buy 或 Google Shopping 获取价格、库存、评分和卖家数据。
- 市场情报人员需要联合分析公司融资、招聘信息、定价页面、应用商店评价和社交平台反馈。
- 数据工程师需要从受支持平台直接获得结构化 JSON,或从任意网页用
extract生成自定义结构。 - 自动化开发者遇到动态页面、无限滚动或必须点击输入的流程,需要使用远程浏览器完成交互和采集。
- 品牌与 GEO 团队需要比较 ChatGPT、Grok 和 Perplexity 如何描述品牌、引用来源或给出推荐。
这个 Agent 有哪些优点和局限?
- 单个 MCP 服务提供 69 个工具,包括搜索、批量抓取、45 个平台专用结构化提取器和 13 个远程浏览器工具。
- 每次请求内置代理轮换、验证码处理及反机器人和地理限制应对,无需自行维护代理或无头浏览器。
- 同时提供免安装的托管端点和基于
npx @brightdata/mcp的本地服务器,且可用工具组控制上下文规模。 - 支持一次最多 10 项的搜索和抓取批处理,并提供带意图与相关性评分的
discover。 - 每月提供 5,000 次免费请求,无需信用卡,浏览器自动化也包含在免费额度内。
- 所有实际网页访问依赖 Bright Data 服务和有效 API 令牌;即使本地运行 MCP 服务器,也不是独立离线抓取方案。
- 免费额度用完后请求会停止;若账户已充值,超额部分按结果或浏览流量计费。
- 专用
web_data_*工具对 URL 格式有严格要求,例如 Amazon 必须包含/dp/,Walmart 必须包含/ip/。 - 启用完整工具集会增加客户端需要处理的工具上下文,因此可能需要配置
GROUPS或TOOLS。 - 复杂网站可能超时,文档建议提高客户端超时;本地模式还要求安装 Node.js。
如何安装或部署这个 Agent?
最快方式无需安装:先在 Bright Data 账户设置中取得 API 令牌,然后把 https://mcp.brightdata.com/mcp?token=YOUR_API_TOKEN_HERE 添加为客户端的 MCP 服务器。Claude Code 可执行:claude mcp add --transport http brightdata "https://mcp.brightdata.com/mcp?token=YOUR_API_TOKEN"。本地部署需要安装 Node.js,并在 MCP 配置中加入:{"mcpServers":{"Bright Data":{"command":"npx","args":["@brightdata/mcp"],"env":{"API_TOKEN":"<your-api-token-here>"}}}}。可通过托管 URL 的 groups、tools 参数,或本地环境变量 GROUPS、TOOLS,只启用所需工具组或工具。
如何使用这个 Agent?
连接后,先按任务选择工具:查找信息用 search_engine,读取一个已知 URL 用 scrape_as_markdown,最多 10 个查询或 URL 分别使用 search_engine_batch、scrape_batch。需要意图驱动、按日期过滤的研究时使用 discover;支持的平台应优先使用对应 web_data_* 工具获得结构化 JSON。任意页面的自定义结构化输出使用 extract,原始 HTML 使用 scrape_as_html,两者属于 advanced_scraping 组。交互页面先调用 scraping_browser_navigate,再调用 scraping_browser_snapshot;之后使用最新快照中的引用执行 scraping_browser_click_ref 或 scraping_browser_type_ref。页面变化后必须重新获取快照。若专用 web_data_* 工具失败,可改用同一 URL 的 scrape_as_markdown。
这个 Agent 与同类方案有什么区别?
与通常只有 2 至 10 个工具、主要提供通用抓取的网页 MCP 服务器相比,Bright Data MCP 声称提供 69 个工具,其中包括 45 个平台专用结构化提取器、13 个远程浏览器工具、三个搜索引擎、批处理和地理定位。其主要差异是每次请求都使用 Bright Data 的解封基础设施,并额外覆盖 LLM 回答采集及 npm、PyPI 数据。代价是对 Bright Data 账户、令牌、服务可用性和计费体系的依赖。
常见问题
免费额度和超额费用如何计算?
必须自行运行服务器吗?
npx @brightdata/mcp 启动本地 MCP 进程。两种模式都使用 Bright Data 的网页访问基础设施。为什么某个 web_data_* 工具没有返回数据?
/dp/。如果格式正确但仍失败,可用 scrape_as_markdown 读取相同 URL。是否需要启用全部 69 个工具?
discover 始终启用;其余能力可通过 groups/GROUPS 按电商、社交、浏览器、代码等分组加载,也可用 tools/TOOLS 单独添加。它能处理需要点击或滚动的动态页面吗?
browser 组提供远程导航、快照、点击、输入、滚动、等待、截图和网络请求查看工具。引用式操作必须基于最新快照,页面变化后需重新获取快照。