← 返回目录
L

Lm

社区
将Claude Code的例行任务卸载到本地或云端LLM,节省令牌费用。
GitHub 源仓库 ↗
★ 112 Stars 分类 · 开发工具 非常热门 源版本 1a0d97c20a20
52FMRS · D
可靠性
6/20
安全与权限
9/20
维护活跃度
9/20
文档质量
15/20
安装易用性
13/20

Houtini LM为Claude Code用户提供了一种实用的令牌节省方案,通过将边界清晰的任务卸载到本地或云端LLM。它提供了自主模型路由、性能跟踪和结构化输出支持,显着减少了Claude的令牌消耗。对于希望控制成本的开发者来说,这是一个有价值的工具,但需要注意安全风险并确保正确配置。

查看 FMRS 评分方法 →

Houtini LM是一个MCP服务器,它连接Claude Code到任何兼容OpenAI的LLM端点(如LM Studio、Ollama、vLLM、DeepSeek、Groq、Cerebras),通过将边界清晰的任务(如生成样板代码、代码审查、提交消息、格式转换等)委托给更便宜的本地或云端模型,从而节省Claude的令牌消耗。Claude保留架构规划、多文件更改等复杂推理工作,而本地模型处理重复性工作。它提供自动模型路由、性能跟踪、结构化JSON输出和模型发现功能。

工具能力

chat
向本地或云端LLM发送任务并获取回答,是主要的卸载工具。
custom_prompt
使用系统、上下文、指令三部分分离的提示词,减少上下文污染。
code_task
针对代码分析,提供预配置的系统提示和输出约束。
code_task_files
让本地LLM直接从磁盘读取文件进行分析,源文件不经过MCP客户端的上下文窗口。
embed
通过OpenAI兼容的embedding端点生成文本嵌入。
discover
检查LLM服务器的健康状态和速度,包括模型名称、上下文窗口、连接延迟和实测tok/s。
list_models
列出服务器上所有已加载和已下载的模型,包含来自HuggingFace的元数据。
stats
以markdown格式导出卸载统计信息,包括会话和生命周期总值。

安装接入

  1. 确保已安装Node.js ≥ 22.5(推荐≥ 22.13)。
  2. 对于Claude Code,运行:claude mcp add houtini-lm -- npx -y @houtini/lm
  3. 对于其他客户端,在MCP客户端配置中添加类似配置(如claude_desktop_config.json中的示例)。
  4. 可选:如果LLM在其他机器上,设置环境变量HOUTINI_LM_ENDPOINT_URL为你的LLM服务器的URL(例如http://192.168.1.50:1234)。
  5. 如果端点需要认证,设置HOUTINI_LM_API_KEY。
  6. 如果使用OpenRouter,可设置HOUTINI_LM_MODEL来指定模型。
claude_desktop_config.json
{
  "mcpServers": {
    "houtini-lm": {
      "command": "npx",
      "args": [
        "-y",
        "@houtini/lm"
      ],
      "env": {
        "HOUTINI_LM_ENDPOINT_URL": "http://localhost:1234"
      }
    }
  }
}

选型与风险

适合谁

  • 已将Claude Code用于大型重构、希望降低令牌费用的开发者。
  • 拥有本地GPU服务器并希望利用本地模型处理重复任务的用户。
  • 需要从Claude卸载边界清晰且时间要求不高的任务。
  • 熟悉MCP和OpenAI兼容API的开发者。

不适合谁

  • 需要强推理或工具访问的任务,应保留在Claude上。
  • 需要实时交互且延迟敏感的场景,因为本地推理可能比前端模型慢3-30倍。
  • 用户不需要MCP服务器,而是希望直接调用LLM API的用例。
  • 不打算使用Claude Code或Claude Desktop作为MCP客户端的用户。

所需权限

  • 读取系统上的本地文件(当使用code_task_files工具时)。
  • 创建与读取本地SQLite数据库文件(~/.houtini-lm/model-cache.db)。
  • 发送网络请求到LLM端点(本地或云)。
  • 运行Node.js过程。

风险与副作用

  • 将代码或数据发送到本地或云LLM可能导致信息泄露,尤其是使用云API时。
  • 在本地模型上运行不受信任的代码可能引入安全漏洞。
  • 过度依赖本地模型可能降低输出质量,因为本地模型可能能力较弱。
  • MCP服务器可能意外暴露本地文件系统路径,因此使用code_task_files时需谨慎。
  • 令牌节省可能被低估,因为本地推理可能消耗更多时间或资源。

常见排障

  1. 启动时如果无法连接LLM端点,检查HOUTINI_LM_ENDPOINT_URL是否正确且LLM服务器正在运行。
  2. 如果收到空响应或超时,检查模型是否未加载或上下文窗口是否过小。
  3. 如果使用推理模型,请确保HOUTINI_LM_THINKING设置为适当值,或检查后端是否支持推理分离。
  4. 如果code_task_files拒绝文件,检查文件大小是否超过HOUTINI_LM_MAX_FILE_MB或路径是否在允许的根目录内。
  5. 运行npm run shakedown进行端到端自检,以验证安装和模型能力。

使用场景

生成测试存根、代码审查、提交消息、格式转换、模拟数据、类型定义等边界清晰的任务。
通过本地推理节省令牌成本,尤其是使用LM Studio或Ollama运行本地模型时。
云端API(如DeepSeek、Groq、Cerebras)与OpenRouter的300+模型。
文本嵌入用于语义搜索或RAG流水线。

支持客户端

Claude Desktop完整支持
Claude Code完整支持