← 返回目录
S

ScrapeGraph MCP Server

社区
AI 驱动的网页抓取与数据提取,通过 ScrapeGraph API 提供企业级可靠性。
GitHub 源仓库 ↗
★ 96 Stars 分类 · 开发工具 热门 源版本 8372895aa6ea
52FMRS · D
可靠性
5/20
安全与权限
9/20
维护活跃度
12/20
文档质量
14/20
安装易用性
12/20

该 MCP 服务器提供 AI 驱动的网页抓取功能,工具丰富,覆盖抓取、提取、搜索、爬取和监控。配置简单,但需要付费 API 密钥。注意工具名称在 v3 中有重命名,使用前需对照文档。

查看 FMRS 评分方法 →

ScrapeGraph MCP 服务器是一个生产就绪的 Model Context Protocol (MCP) 服务器,提供与 ScrapeGraph AI API 的无缝集成。它使语言模型能够利用先进的 AI 网页抓取能力,支持多种工具:网页抓取(多格式)、基于提示的提取、搜索、多页面异步爬取(开始/状态/停止/恢复)、JSON Schema 生成、计划监控任务(创建/列表/获取/暂停/恢复/删除/活动)、账户额度与历史记录。该服务器采用 stdio 传输,通过环境变量(SGAI_API_KEY、SGAI_API_URL、SGAI_TIMEOUT)配置 API 密钥、基础 URL 和超时。注意:版本 v3 已将工具重命名,例如 smartscraper 改为 extract,smartcrawler_initiate 改为 crawl_start。

工具能力

scrape
抓取网页并输出多种格式:markdown、html、screenshot、branding、links、images、summary。
extract
根据提示提取结构化数据,需提供 website_url 和 user_prompt,可选 output_schema。
search
执行搜索,返回最多 20 条结果,支持 country_search、time_range 和 output_schema。
crawl_start
启动多页面异步爬取,支持 extraction_mode:markdown、html、links、images、summary、branding、screenshot。
crawl_get_status
查询爬取任务的状态,轮询直至 status 为 completed。
crawl_stop
停止正在进行的爬取任务。
crawl_resume
恢复已暂停的爬取任务。
schema
根据提示生成或增强 JSON Schema。
credits
获取账户剩余额度。
history
获取分页的使用历史记录,可按 service 过滤。
monitor_create
创建计划任务,定期执行提取或抓取。
monitor_list
列出所有监控任务。
monitor_get
获取特定监控任务的详情。
monitor_pause
暂停监控任务。
monitor_resume
恢复监控任务。
monitor_delete
删除监控任务。
monitor_activity
获取监控任务的分页活动历史(id、createdAt、status、changed、elapsedMs、diffs)。

安装接入

  1. 在 ScrapeGraph Dashboard 获取 API 密钥。2. 使用 Smithery 快速安装:npx -y @smithery/cli install @ScrapeGraphAI/scrapegraph-mcp --client claude。3. 或者本地安装:克隆仓库、pip install -e .,然后设置环境变量 SGAI_API_KEY,通过 scrapegraph-mcppython -m scrapegraph_mcp.server 运行。4. 配置 Claude Desktop 或 Cursor,参考 README 中的 JSON 配置。
claude_desktop_config.json
{
  "mcpServers": {
    "scrapegraph-mcp": {
      "command": "npx",
      "args": [
        "-y",
        "@smithery/cli@latest",
        "run",
        "@ScrapeGraphAI/scrapegraph-mcp",
        "--config",
        "\"{\\\"scrapegraphApiKey\\\":\\\"YOUR-SGAI-API-KEY\\\"}\""
      ]
    }
  }
}

选型与风险

适合谁

  • 需要通过自然语言进行网页抓取和结构化数据提取的 AI 助手开发者。
  • 需要从多个页面自动提取数据的爬虫和数据分析工作流。
  • 需要监控网站变化并定期提取信息的用户。

不适合谁

  • 不需要 AI 辅助抓取、只需简单直接 HTTP 请求的开发者。
  • 没有 ScrapeGraph AI 付费订阅或额度有限的用户,因为 API 调用可能产生费用。
  • 需要本地渲染 JavaScript 但不使用 ScrapeGraph API 渲染功能的用户。

所需权限

  • 需要 ScrapeGraph API 密钥(SGAI_API_KEY)以访问 ScrapeGraph 服务。
  • 需要网络访问以连接到 ScrapeGraph API(默认 https://v2-api.scrapegraphai.com/api)。
  • 通过环境变量或 MCP 配置传递API密钥,可能涉及密钥管理。

风险与副作用

  • API 密钥泄露可能导致账户被盗用和额度损失。
  • API 调用受速率限制和配额管理,可能因超额产生额外费用。
  • 抓取网站可能违反目标网站的条款或法律,需自行判断。

常见排障

  1. 如果工具未出现在客户端中,检查服务器是否正常启动以及 API 密钥是否正确。
  2. 遇到 401 Unauthorized 错误,请验证 API 密钥是否有效。
  3. 遇到 402 Payment Required 错误,请检查账户额度。
  4. 爬取长时间未完成,请持续调用 crawl_get_status 直到 completed。
  5. 在 Windows 上使用特定命令或检查 PATH 设置。

使用场景

将网页转换为 Markdown 摘要,便于 LLM 处理。
从电商页面提取所有产品名称、价格和评分。
搜索最新 AI 进展并生成结构化摘要。
多页面爬取网站以映射内容或捕获 API 端点。
设置每日定时任务监控特定数据变化。

支持客户端

Claude Desktop完整支持
Cursor完整支持