← 返回目录
H

Human MCP

社区
为 AI 代理带来人类能力
GitHub 源仓库 ↗
★ 295 Stars 分类 · 开发工具 热门 源版本 e65a87855811
46FMRS · D
可靠性
4/20
安全与权限
8/20
维护活跃度
9/20
文档质量
13/20
安装易用性
12/20

Human MCP 是一个功能丰富的 MCP 服务器,提供了广泛的类似人类能力。它结构良好,并支持多种提供商,使其灵活。然而,它并非官方,需要外部 API 密钥,且可能不适用于仅文本工作流。

查看 FMRS 评分方法 →

Human MCP 是一个全面的 Model Context Protocol 服务器,为 AI 编码代理提供类似人类的能力,包括视觉分析、文档处理、语音生成、内容创建、图像编辑、浏览器自动化和高级推理。它支持多种 AI 提供商(Google Gemini、Minimax、ZhipuAI、ElevenLabs),并提供 29 个工具,分为四类:眼睛(视觉)、手(内容生成)、嘴巴(语音)和大脑(推理)。该服务器通过 npx 安装,需要 API 密钥进行配置。

工具能力

eyes_analyze
分析图像、视频和 GIF 中的 UI 错误、问题和无障碍性
eyes_compare
比较两张图像以发现视觉差异
eyes_read_document
从 PDF、DOCX、XLSX、PPTX 等文档中提取文本和数据
eyes_summarize_document
生成文档摘要和见解
gemini_gen_image
使用 Imagen API 从文本生成图像
gemini_gen_video
使用 Veo 3.0 从文本生成视频
gemini_image_to_video
将图像动画化为视频
minimax_gen_music
使用 Minimax Music 2.5 生成带人声的音乐
elevenlabs_gen_music
使用 ElevenLabs 音乐 API 生成音乐
elevenlabs_gen_sfx
从文本描述生成音效
gemini_edit_image
使用 Gemini 进行全面的 AI 图像编辑(修复、扩展、风格迁移等)
gemini_inpaint_image
在不使用蒙版的情况下添加或修改图像区域
gemini_outpaint_image
扩展图像边界
gemini_style_transfer_image
将艺术风格应用于图像
gemini_compose_images
组合多张图像
jimp_crop_image
裁剪图像(支持手动、居中等多种模式)
jimp_resize_image
调整图像大小,支持多种算法
jimp_rotate_image
旋转图像
jimp_mask_image
应用灰度蒙版
rmbg_remove_background
AI 背景移除,支持三种质量级别
playwright_screenshot_fullpage
捕获完整网页截图,包括滚动内容
playwright_screenshot_viewport
捕获当前视口截图
playwright_screenshot_element
捕获特定元素的截图
mouth_speak
将文本转换为语音,支持 30+ 语音和 24 种语言
mouth_narrate
长篇内容叙述,支持章节拆分
mouth_explain
生成带有技术分析的代码口头解释
mouth_customize
测试和比较不同的语音和风格
mcp__reasoning__sequentialthinking
本地顺序思考,支持思维修订
brain_analyze_simple
基于模式的快速分析(问题解决、根本原因、SWOT 等)
brain_patterns_info
列出可用的推理模式和框架
brain_reflect_enhanced
AI 驱动的元认知反思,用于复杂分析

安装接入

  1. 在 Google AI Studio 获取 Google Gemini API 密钥。
  2. 通过 echo 'export GOOGLE_GEMINI_API_KEY="your_api_key"' >> ~/.zshrc 设置环境变量,或直接在客户端配置中提供。
  3. 对于 Claude Desktop,编辑配置文件(macOS: ~/Library/Application Support/Claude/claude_desktop_config.json)添加 mcpServers 条目,使用 npx 命令。
  4. 对于 Claude Code,使用 claude mcp add --scope user human-mcp npx @goonnguyen/human-mcp --env GOOGLE_GEMINI_API_KEY=your_key
  5. 有关其他客户端,请参阅 README 中的具体配置。
claude_desktop_config.json
{
  "mcpServers": {
    "human-mcp": {
      "command": "npx",
      "args": [
        "@goonnguyen/human-mcp"
      ],
      "env": {
        "GOOGLE_GEMINI_API_KEY": "your_gemini_api_key_here"
      }
    }
  }
}

选型与风险

适合谁

  • 需要视觉调试功能的 AI 编码代理
  • 需要自动化截图和视觉分析的开发人员
  • 对内容生成(图像、视频、音乐、语音)感兴趣的用户
  • 需要高级推理能力的用户

不适合谁

  • 只需要文本功能的用户(过度设计)
  • 在没有 API 密钥的情况下寻求完全本地解决方案的用户(依赖外部 AI 提供商)
  • 需要音频处理的用户(耳朵尚未实现)

所需权限

  • 需要 Google Gemini API 密钥(必需)
  • 可选 API 密钥:Minimax、ZhipuAI、ElevenLabs
  • 可选 Cloudflare R2 凭证用于 HTTP 传输文件上传
  • 网络访问外部 AI 服务
  • 本地文件访问以读取输入文件

风险与副作用

  • API 密钥泄露:密钥存储在配置中,可能被意外共享
  • 成本:生成式 AI 使用可能产生费用,尤其是在生产环境中
  • 数据隐私:文件可能被上传到第三方服务(Cloudflare R2)进行处理
  • 依赖外部服务:依赖 Google、Minimax 等服务的可用性
  • 配置错误:API 密钥无效或网络问题导致失败

常见排障

  1. 连接失败:检查 Node.js/npm 或 Bun 是否安装,验证 API 密钥,检查网络连接
  2. 工具未找到:重启 MCP 客户端,检查服务器日志
  3. API 错误:验证 API 密钥,检查配额,审查网络
  4. 权限错误:检查 npm 全局安装权限,使用 npx
  5. Vertex AI 认证:验证 GCP 项目 ID、ADC 状态和 IAM 角色

使用场景

调试 UI 问题:分析截图以找到布局问题
错误调查:分析屏幕录制以检测错误
无障碍审计:检查 UI 的无障碍合规性
图像生成用于设计原型
视频生成用于营销材料
代码解释音频:为代码审查生成口头解释
文档叙述:将技术文档转换为音频
高级问题解决:使用多步骤推理分析复杂技术问题
自动网页截图用于文档和测试

支持客户端

Claude Desktop完整支持
Claude Code完整支持
OpenCode完整支持
Cline完整支持
Cursor完整支持
Windsurf完整支持