适合谁
- 开发者构建 AI 智能体或 RAG 管道,需要干净的网页内容。
- 喜欢本地优先、无需账户即可处理大多数网站的用户。
- 需要快速、Rust 驱动的提取和可脚本化 CLI 的用户。
webclaw 是一个专为 AI/LLM 工作流设计的强大的网页提取工具。它提供广泛的格式和工具,本地优先的方式很有吸引力。需要注意托管 API 依赖和网站抓取的法律/道德风险。
webclaw 是一个快速的、本地优先的网页内容提取工具,专为 LLM 和 AI 智能体设计。它通过 CLI、REST API 和 MCP 服务器提供抓取、爬取和结构化数据提取功能。核心提取逻辑用 Rust 编写,支持本地运行,无需账户即可处理大多数网站。对于受保护或 JavaScript 渲染的页面,可选用托管的 API(webclaw.io)。
对于 MCP 客户端,使用 npx 启动器配置服务器,如示例 JSON 所示,或运行 npx create-webclaw 自动检测并配置。也可通过 Homebrew(brew tap 0xMassi/webclaw && brew install webclaw)、预构建二进制文件、Docker(docker run --rm ghcr.io/0xmassi/webclaw https://example.com)或 Cargo 安装 CLI。
{
"mcpServers": {
"webclaw": {
"command": "npx",
"args": [
"-y",
"@webclaw/mcp"
]
}
}
}