← 返回目录
I

io.github.D4Vinci/Scrapling

官方
支持隐身请求、真实浏览器与自适应选择器的网页抓取 MCP 服务器
GitHub 源仓库 ↗
★ 71.0k Stars 分类 · 其他 非常热门
52FMRS · D
可靠性
9/20
安全与权限
7/20
维护活跃度
13/20
文档质量
12/20
安装易用性
11/20

官方仓库内置的 Scrapling MCP Server,版本为 0.4.12,采用 stdio 传输,面向 AI 辅助网页抓取和数据提取。支持 PyPI 与 OCI 分发;来源未提供具体工具名称或客户端兼容性列表。

查看 FMRS 评分方法 →

Scrapling MCP Server 为 AI 辅助网页抓取和数据提取提供能力,支持隐身 HTTP 请求、真实浏览器、Playwright、Cloudflare Turnstile 绕过,以及 CSS 选择器。Scrapling 同时支持从单次请求到全规模爬取、自适应元素定位、XPath 和会话管理。

工具能力

暂未整理工具清单。

安装接入

使用 uvx 运行 PyPI 包 scrapling,并传入固定参数 mcp。也可使用 OCI 包 ghcr.io/d4vinci/scrapling,并传入参数 mcp。该服务器通过 stdio 通信。

选型与风险

适合谁

  • 需要 AI 辅助网页数据提取的用户
  • Python 网页抓取和自动化开发者
  • 需要浏览器、会话、代理轮换或自适应选择器的项目

不适合谁

  • 不需要访问外部网站的本地数据处理
  • 只需要静态文件或云存储操作的工作流
  • 没有合法抓取权限或不愿遵守网站条款和 robots.txt 的场景

所需权限

  • 需要访问目标网站并发送 HTTP 请求或启动浏览器的权限
  • 如果配置代理、会话或浏览器功能,可能需要相应的网络和本地运行环境权限
  • 来源未说明账户认证或特定 API 凭据要求

风险与副作用

  • 抓取行为可能违反网站服务条款、隐私法规或数据抓取法律
  • 隐身请求、浏览器自动化和 Cloudflare 绕过可能触发目标网站的安全措施
  • 代理、Cookie、会话状态和抓取内容可能包含敏感信息
  • 高并发或大规模爬取可能给目标网站造成负载

常见排障

  1. 确认已安装 scrapling 及 MCP 相关依赖
  2. 确认客户端支持 stdio MCP 服务器
  3. 使用浏览器或抓取功能时,确认浏览器依赖已通过 scrapling install 安装
  4. 检查目标 URL、CSS 或 XPath 选择器是否有效
  5. 若请求被阻断,检查代理、会话、隐身模式、robots.txt 和目标站点限制

使用场景

提取网页中的结构化数据
抓取需要 JavaScript 渲染的网站
使用 CSS 或 XPath 选择器定位内容
处理具有反爬机制的网站
执行从单页请求到并发爬取的任务

支持客户端

暂未确认支持的客户端。