← 返回目录
X

Xberg

官方
多语言文档智能提取引擎,支持多种文件格式与编程语言的 MCP 服务器。
GitHub 源仓库 ↗
★ 9.2k Stars 分类 · 文件系统 非常热门 源版本 e598e83ee266
58FMRS · C
可靠性
8/20
安全与权限
12/20
维护活跃度
16/20
文档质量
12/20
安装易用性
10/20

适合需要从多种文档和代码中提取信息的用户,提供丰富的功能和多种集成方式。

查看 FMRS 评分方法 →

Xberg 是一个基于 Rust 核心的文档智能框架,支持从 101 种格式(115 种文件扩展名)中提取文本、表格、元数据和图像,同时支持 371 种编程语言的代码智能。它具有 15 种语言绑定(Rust、Python、Node.js、Go、Java、C#、Ruby、PHP、Elixir、Dart、Swift、Zig、WASM、Kotlin、C FFI),并提供 CLI、REST API 和 MCP 服务器。该 MCP 服务器提供 9 个工具(extract、extract_batch、detect_mime_type 等)、3 个提示词(extract_document、extract_with_ocr、semantic_search)和 4 个资源(formats、models、OCR languages、embedding presets)。

工具能力

extract
从单个文档中提取文本、表格、元数据和图像。
extract_batch
批量提取多个文档的内容。
detect_mime_type
检测文件的 MIME 类型。
cache_stats
查看提取缓存的统计信息。
list_formats
列出所有支持的文件格式和 MIME 类型。
cache_clear
清除提取缓存。
get_version
获取 Xberg 版本信息。
cache_manifest
查看缓存清单。
cache_warm
预热缓存以加速后续提取。

安装接入

使用 Homebrew 安装 CLI:brew install xberg-io/tap/xberg,然后配置客户端。例如,在 Claude Desktop 或 Cursor 的配置文件中添加:{ "mcpServers": { "xberg": { "command": "xberg", "args": ["mcp"] } } }。

claude_desktop_config.json
{
  "mcpServers": {
    "xberg": {
      "command": "xberg",
      "args": [
        "mcp"
      ]
    }
  }
}

选型与风险

适合谁

  • 需要处理多种文档格式并提取结构化数据的开发者和数据工程师。
  • 需要在 MCP 环境中集成文档处理功能的 AI 代理。
  • 需要从代码库中提取语义信息的 RAG 管道。

不适合谁

  • 不需要文档提取或 OCR 的通用 MCP 场景。
  • 需要实时交互式文档编辑的用户,因为 Xberg 专注于提取。
  • 仅需简单文本转换且对性能要求不高的场景。

所需权限

  • 读取本地文件系统以访问要提取的文档。
  • 可能访问网络以获取 URL 或调用远程 OCR/LLM API(如果配置)。
  • 写入缓存目录以存储提取结果。

风险与副作用

  • 处理恶意文件时可能存在安全风险,建议限制文件来源。
  • OCR 或 LLM 调用可能需要额外的 API 密钥或网络连接。
  • 大文件处理可能消耗较多内存和 CPU 资源。

常见排障

  1. 确保 xberg CLI 已正确安装并加入 PATH。
  2. 检查配置文件中的命令路径是否准确。
  3. 运行 `xberg doctor` 检查后端依赖(如 Tesseract)是否可用。
  4. 查看日志以获取详细错误信息。

使用场景

从 PDF、Office 文档、图像等中提取文本和表格,用于 RAG 或数据处理。
对扫描文档进行 OCR 识别,支持 Tesseract、PaddleOCR 等后端。
从源代码中提取函数、类、导入等结构,用于代码分析。
通过本地或远程 LLM 进行结构化数据提取和文档理解。

支持客户端

Claude Desktop完整支持
Cursor完整支持