← 返回目录
C

CLIO Parquet

社区
Apache Parquet 文件的模型上下文协议服务器
GitHub 源仓库 ↗
★ 26 Stars 分类 · 文件系统 热门 源版本 a0bc2ef89393
55FMRS · C

CLIO Parquet 是一个专门的 MCP 服务器,用于读取 Apache Parquet 文件。它提供基本的工具,用于摘要、行读取、列预览和聚合统计。它是 CLIO Kit 生态的一部分,支持科学和高性能计算场景。其功能清晰,但深度有限;对于仅为摘要和读取而设计的目标用户而言,它很适合,但可能无法涵盖复杂完整的数据分析需求。

可靠性
8/20
安全与权限
12/20
维护活跃度
13/20
文档质量
10/20
安装易用性
12/20
查看 FMRS 评分方法 →

CLIO Parquet 是 CLIO Kit(IoWarp 平台工具层的一部分)提供的 MCP 服务器,用于读取和分析 Apache Parquet 文件。它提供工具来获取模式摘要、读取行切片、预览列值以及计算列统计信息。此服务器通过 Python 包 clio-kit 分发,通过 stdio 通信。适合在本地或 HPC 环境中分析存储在 Parquet 格式中的科学或表格数据。

工具能力

summarize_tool
返回 Parquet 文件的模式、行数和文件大小。
read_slice_tool
从 Parquet 文件中读取行切片,支持列选择和过滤。
get_column_preview_tool
预览特定列的值,支持分页。
aggregate_column_tool
计算 Parquet 列上的聚合统计信息(最小值、最大值、平均值等)。

安装接入

  1. 确保已安装 Python 3.10+ 和 uv(包管理器)。\n2. 使用 uv tool install 'clio-kit==2.10.6' 安装 clio-kit。\n3. 如果可执行文件不在 PATH 中,运行 uv tool update-shell。\n4. 验证服务器列表:clio-kit mcp-servers。\n5. 启动服务器:clio-kit mcp-server parquet

选型与风险

适合谁

  • 科学计算与高性能计算环境中的数据探索。
  • 需要从 Parquet 文件快速获取摘要信息的 AI 代理。
  • 与 CLIO Kit 集成的工作流,其中其他服务器提供互补功能。

不适合谁

  • 需要复杂数据处理(如分组聚合)的全方位数据分析,这可能需要专用工具。
  • 处理极大型文件时,所有数据可能无法完全加载到内存。

所需权限

  • 读取用户提供的本地文件系统中的 Parquet 文件。
  • 执行文件 I/O,以读取文件元数据和内容。

风险与副作用

  • 如果输入包含意外文件路径,可能会暴露敏感数据。
  • 通过大型文件或复杂查询进行的内存或计算密集型操作可能导致资源耗尽。

常见排障

  1. 如果服务器未找到,请验证服务器名称为 `parquet`(不是 `parquet-mcp`)。
  2. 如果出现导入错误,请在 `clio-kit-mcp-servers/parquet` 目录下运行 `uv sync --all-extras --dev` 进行本地开发。
  3. 如果命令 `clio-kit` 未找到,请安装 uv 并运行 `uv tool install 'clio-kit==2.10.6'`,然后使用 `uv tool update-shell` 更新 shell。

使用场景

快速获取 Parquet 文件的模式、行数和大小。
选择性地读取 Parquet 文件的行切片以进行数据检查。
预览指定列的值,便于初步了解数据。
在 Parquet 列上计算统计摘要,如均值或最大值。

支持客户端

Claude Desktop完整支持
Claude Code完整支持
Cursor完整支持
VS Code完整支持