← 返回目录
W

Webclaw

社区
将任意 URL 转换为干净的 Markdown、JSON 和 LLM 就绪的内容。
GitHub 源仓库 ↗
★ 2.3k Stars 分类 · 开发工具 非常热门 源版本 55c6dd18343f
65FMRS · C
可靠性
10/20
安全与权限
12/20
维护活跃度
14/20
文档质量
15/20
安装易用性
14/20

webclaw 是一个专为 AI/LLM 工作流设计的强大的网页提取工具。它提供广泛的格式和工具,本地优先的方式很有吸引力。需要注意托管 API 依赖和网站抓取的法律/道德风险。

查看 FMRS 评分方法 →

webclaw 是一个快速的、本地优先的网页内容提取工具,专为 LLM 和 AI 智能体设计。它通过 CLI、REST API 和 MCP 服务器提供抓取、爬取和结构化数据提取功能。核心提取逻辑用 Rust 编写,支持本地运行,无需账户即可处理大多数网站。对于受保护或 JavaScript 渲染的页面,可选用托管的 API(webclaw.io)。

工具能力

scrape
将单个 URL 提取为 Markdown、文本、JSON、LLM 格式或 HTML。
crawl
跟随同源链接并提取发现的页面。
map
发现 URL 而不提取每个页面。
batch
并行抓取多个 URL。
extract
将页面内容转换为结构化数据。
summarize
总结页面内容。
diff
比较页面内容快照。
brand
提取颜色、字体、徽标和元数据。
search
搜索网络并抓取结果(托管 API)。
research
多源研究流程(托管 API)。

安装接入

对于 MCP 客户端,使用 npx 启动器配置服务器,如示例 JSON 所示,或运行 npx create-webclaw 自动检测并配置。也可通过 Homebrew(brew tap 0xMassi/webclaw && brew install webclaw)、预构建二进制文件、Docker(docker run --rm ghcr.io/0xmassi/webclaw https://example.com)或 Cargo 安装 CLI。

claude_desktop_config.json
{
  "mcpServers": {
    "webclaw": {
      "command": "npx",
      "args": [
        "-y",
        "@webclaw/mcp"
      ]
    }
  }
}

选型与风险

适合谁

  • 开发者构建 AI 智能体或 RAG 管道,需要干净的网页内容。
  • 喜欢本地优先、无需账户即可处理大多数网站的用户。
  • 需要快速、Rust 驱动的提取和可脚本化 CLI 的用户。

不适合谁

  • 需要大规模、托管提取且无需自托管基础设施的用户。
  • 需要处理大量受保护或 JavaScript 渲染页面的用户,而无需托管 API 密钥。
  • 非技术用户希望无需配置的 GUI 工具。

所需权限

  • 文件系统访问:CLI 读取本地文件用于 diff 操作,写入输出文件。
  • 网络访问:用于抓取网页和可选连接到托管 API。
  • 环境变量:可能读取 API 密钥(WEBCLAW_API_KEY、OPENAI_API_KEY 等)和代理配置。

风险与副作用

  • 抓取网站可能违反其服务条款或 robots.txt;请负责任地使用。
  • 托管 API 需要网络请求,数据可能发送至远程服务器。
  • 自托管需要维护和监控。
  • 代理配置不正确可能导致连接失败。

常见排障

  1. 确保安装了 Cargo 构建依赖(如 pkg-config、libssl-dev、cmake)。
  2. 检查 WEBCLAW_API_KEY 是否设置以访问托管功能。
  3. 验证页面 URL 可公开访问且未阻止请求。
  4. 查看 CLI 输出和日志以获取提取错误详细信息。

使用场景

为 Claude、Cursor 等 AI 智能体提供干净的网页内容上下文。
为 RAG 管道抓取文档、帮助中心和知识库。
监控竞争对手的定价页面、更新日志和产品页面。
将杂乱的页面转换为类型化的 JSON 以实现自动化。
研究流程:搜索、抓取、总结多个来源。

支持客户端

Claude Desktop完整支持
Claude Code完整支持
Cursor完整支持
Windsurf完整支持
OpenCode完整支持
Codex CLI完整支持