← 返回目录
C

CRW Web Scraper

社区
面向 AI 智能体的开源网页抓取 MCP 服务器,支持抓取、爬取与站点地图发现
GitHub 源仓库 ↗
★ 967 Stars 分类 · 开发工具 非常热门
54FMRS · D

CRW Web Scraper(fastCRW)是一个用 Rust 编写的开源网页抓取与搜索 MCP 服务器,提供抓取、爬取、站点地图发现、搜索与结构化提取能力,并兼容 Firecrawl 的 /scrape、/crawl、/search API。它以单二进制、低内存占用和自托管为卖点,同时提供托管云选项,适合需要数据可控且希望接入 AI 智能体的开发者。需要注意的是,它并非 Firecrawl、Tavily 或 Anthropic 的官方项目,引擎采用 AGPL-3.0 许可,使用时需遵守目标网站政策与 robots.txt。

可靠性
10/20
安全与权限
11/20
维护活跃度
12/20
文档质量
10/20
安装易用性
11/20
查看 FMRS 评分方法 →

CRW Web Scraper(fastCRW)是一个用 Rust 编写的开源网页抓取、爬虫与搜索工具,并提供 MCP 服务器供 AI 智能体使用。它可以把 URL 转换成干净的 Markdown 或结构化 JSON,支持抓取(scrape)、爬取(crawl)、站点地图发现(map)、搜索(search)与结构化提取(extract)等操作。它提供与 Firecrawl 兼容的 API(/scrape、/crawl、/search),可自托管运行单个二进制文件(约 6 MB 内存占用),也可使用托管云服务。引擎与 MCP 服务器采用 AGPL-3.0 许可,Python 和 TypeScript SDK 采用 MIT 许可。该项目并非由 Firecrawl、Tavily 或 Anthropic 官方维护。

安装接入

方式一(一键安装):运行 curl -fsSL https://fastcrw.com/install | sh,本地使用无需账号。若要连接云端,可在同一命令中传入密钥:curl -fsSL https://fastcrw.com/install | CRW_API_KEY=crw_live_... sh,安装脚本会在检测到的 AI 编码工具中注册 MCP 服务器。方式二(MCP 专用安装):运行 npx -y crw-mcp@latest install,在已检测到的 AI 工具中安装 CRW 技能与 MCP 服务器。也可单独运行 crw setup 进行交互式配置。容器方式:使用镜像 ghcr.io/us/crw:latest,以 stdio 传输启动,位置参数为 crw-mcp

选型与风险

适合谁

  • 需要自托管、数据可控的网页抓取能力的团队
  • 使用 Claude Code、Cursor、Codex、Gemini CLI、OpenCode 或 Windsurf 的开发者
  • 希望以单个 Rust 二进制文件低资源运行的场景
  • 需要 Firecrawl 兼容 REST API 的迁移项目

不适合谁

  • 需要官方 Firecrawl、Tavily 或 Anthropic 背书或支持的用户
  • 不愿遵守网站政策与 robots.txt 的抓取需求
  • 需要托管型 SaaS 完全免运维且不自行部署的团队

所需权限

  • 网络访问权限:需要对外发起 HTTP/HTTPS 请求以抓取、爬取和搜索网页
  • 本地文件系统读写权限:用于写入 ~/.config/crw/config.toml 等配置
  • 安装脚本可能需要修改已检测到的 AI 工具的 MCP 配置
  • 使用托管云服务时需要 CRW_API_KEY 凭据

风险与副作用

  • 抓取第三方网站可能涉及目标站点的服务条款、版权或 robots.txt 限制;项目声明 crawl 与 map 默认遵循 robots.txt
  • 一键安装脚本从网络下载并执行,存在供应链风险
  • API 密钥存放在 ~/.config/crw/config.toml,需注意本机文件权限与泄露风险
  • 容器镜像标签使用 latest,可能带来版本不可复现的问题
  • 托管云与本地的能力及响应结构可能不同,迁移前需核对 capabilities 与响应格式

常见排障

  1. 命令不可用:确认已通过安装脚本或包管理器安装 crw 二进制,并检查 PATH
  2. 搜索不可用:搜索功能需要先运行 crw setup 进行配置
  3. 云端调用失败:检查 CRW_API_KEY 是否已导出或写入配置文件,以及密钥是否有效
  4. 不想自动注册到 AI 工具:设置环境变量 CRW_NO_AGENTS=1 跳过该步骤
  5. MCP 客户端未识别:运行 npx -y crw-mcp@latest install 或 crw setup 重新注册,并参考文档中的 mcp-clients 手动配置说明
  6. 从源码构建失败:确认 Rust 版本不低于 1.85,并运行 make check-fast

使用场景

让 AI 智能体抓取单个网页并转换为 Markdown 或结构化 JSON
对站点进行有边界的爬取并收集页面内容
在不逐页抓取的情况下发现站点 URL
执行网页搜索并可选地抓取搜索结果
从一个或多个 URL 中提取结构化字段
作为 Firecrawl 的兼容替代方案接入现有 /scrape、/crawl、/search 调用