← 返回目录
F

Fetcher MCP Server

社区
使用 Playwright 无头浏览器抓取网页内容的 MCP 服务器。
GitHub 源仓库 ↗
★ 1.1k Stars 分类 · 浏览器自动化 热门 源版本 8754aff66e3d
43FMRS · D
可靠性
6/20
安全与权限
10/20
维护活跃度
8/20
文档质量
12/20
安装易用性
7/20

Fetcher MCP 是一个功能强大的网页抓取服务器,利用 Playwright 支持动态内容,并提供智能提取、批量抓取等功能。适合需要处理现代 Web 应用的开发者,但需注意反爬机制和资源消耗。

查看 FMRS 评分方法 →

Fetcher MCP 是一个基于 Playwright 无头浏览器的 MCP 服务器,用于获取网页内容。它支持执行 JavaScript,能够处理动态网页和现代 Web 应用;内置 Readability 算法,可智能提取主要内容,去除广告和导航等非核心元素;支持 HTML 和 Markdown 两种输出格式;提供并发抓取多个 URL 的工具 fetch_urls;自动阻止不必要资源(图片、样式、字体、媒体)以节省带宽;具备完善的错误处理和日志;可配置超时、内容提取和输出格式等参数。

工具能力

fetch_url
从指定 URL 获取网页内容,支持 JavaScript 渲染、智能内容提取、Markdown 转换、超时和内容提取配置。
fetch_urls
并行批量获取多个 URL 的网页内容,提高批处理效率。
browser_install
自动安装 Playwright Chromium 浏览器二进制文件,可带系统依赖和强制安装选项。

安装接入

  1. 通过在终端运行 npx -y fetcher-mcp 直接使用。
  2. 首次使用需安装浏览器:运行 npx playwright install chromium
  3. 如需 HTTP 和 SSE 传输,使用 --transport=http --host=0.0.0.0 --port=3000 启动。
  4. 在 Claude Desktop 配置文件中添加配置(见上方)。
claude_desktop_config.json
{
  "mcpServers": {
    "fetcher": {
      "command": "npx",
      "args": [
        "-y",
        "fetcher-mcp"
      ]
    }
  }
}

选型与风险

适合谁

  • 需要抓取现代 JavaScript 渲染网站的开发者
  • 需要批量抓取网页内容的数据采集场景
  • 希望自动提取网页主要内容的用户

不适合谁

  • 需要完整原始 HTML 且禁止内容提取的场景(可通过设置绕过,但默认提取)
  • 需要长期登录会话但无法提供自定义 Cookie 的用户
  • 没有 Node.js 环境且不想使用 Docker 的部署场景

所需权限

  • 访问网络以下载网页资源
  • 运行无头浏览器(Playwright Chromium)
  • 读取和写入临时文件(用于浏览器缓存)

风险与副作用

  • 可能被目标网站识别为爬虫并触发反爬机制
  • 无头浏览器运行可能消耗较多内存和 CPU
  • 抓取的内容可能受版权或使用条款限制

常见排障

  1. 如果遇到浏览器未安装错误,运行 `npx playwright install chromium`
  2. 如果页面加载超时,增加 `timeout` 参数或设置 `waitUntil` 为 'networkidle'
  3. 如果内容提取不完整,尝试设置 `extractContent: false` 并 `returnHtml: true` 获取原始 HTML

使用场景

抓取渲染 JavaScript 的动态网页内容
批量抓取多个网页以进行数据收集
将网页内容转换为 Markdown 以集成到文档或知识库
处理带有反爬虫机制(如验证码)的网站

支持客户端

Claude Desktop完整支持