ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

把 MTPLX 接入 OpenCode、Cursor 与 Claude Code:OpenAI 兼容 API 完整使用指南

把 MTPLX 接入 OpenCode、Cursor 与 Claude Code:OpenAI 兼容 API 完整使用指南 把 MTPLX 接入 OpenCode、Cursor 与 Claude Code:OpenAI 兼容 API 完整使用指南【免费下载链接】MTPLXThe fastest way to run Qwen 3.8 Flash Next, Qwen 3.8 27B and Ternary Bonsai 2 27B on a Mac: 125 tok/s in OpenCode on an M5 Max, and a 27B model on 16 GB Macs. Native MTP speculative decoding on Apple Silicon, exact at any temperature. OpenAI and Anthropic compatible local server.项目地址: https://gitcode.com/gh_mirrors/mt/MTPLXMTPLX 是一个在 Apple Silicon 上运行 Qwen 3.8 Flash Next、Qwen 3.8 27B 与 Ternary Bonsai 2 27B 的本地大模型引擎它内置一个OpenAI 兼容 Anthropic 兼容的本地 API 服务可以让你把 OpenCode、Cursor、Claude Code 等编程 AI 工具全部指向自己 Mac 上的模型——代码不出本机解码速度还比直连 API 更快。本文带你从零完成安装、启动服务再到三大客户端的完整配置。 第一步:安装 MTPLX(两种方式任选)MTPLX 需要Apple Silicon(M1 及以上) macOS 14 以上。安装二选一:方式一:Homebrew(推荐)brew install youssofal/mtplx/mtplx方式二:pip 安装python3 -m pip install mtplx装好后可以先体检一下环境:mtplx doctor --summary它会检查硬件、模型缓存和运行时依赖,遇到问题会直接告诉你下一步该做什么,而不是一堆报错堆栈。更多细节见 docs/quickstart.md。⚡ 第二步:启动本地 OpenAI 兼容服务MTPLX 的核心卖点:它用模型自带的 MTP(多 token 预测)头做推测解码,一次批量前向验证多个草稿 token,解码速度约为普通解码的 2 倍,而且在任意温度下都保持精确采样——不是贪心取巧。启动命令只有一条,默认把服务挂在127.0.0.1:8000:mtplx serve --host 127.0.0.1 --port 8000 --no-stats-footer也可以直接mtplx start,交互式选择模型、模式后自动起服务。如果你已经装了 MTPLX 的 Mac App,点 App 上的播放键即可,mtplx start会自动附加到 App 正在运行的模型上,不会重复加载一份模型。服务启动后会提供这些端点(完整说明见 docs/server.md):端点协议用途/v1/chat/completionsOpenAI对话补全,支持流式与工具调用/v1/responsesOpenAICodex Responses 兼容/v1/completionsOpenAI传统补全/v1/modelsOpenAI列出当前模型 ID/v1/messagesAnthropicAnthropic Messages 兼容(流式 工具)/health/metrics—健康检查与运行时 KPI--no-stats-footer会把基准测试文本挡在响应之外,避免污染客户端消息,建议 API 客户端接入时始终加上。 用 curl 30 秒验证连通性第一次接入前,先用 curl 打一发心跳确认服务活着。完整脚本在 examples/curl-chat-completions.sh:curl http://127.0.0.1:8000/v1/chat/completions \ -H Content-Type: application/json \ -d {model:mtplx,messages:[{role:user,content:hello}],stream:true}看到 token 一个个流式吐出来,就说明 OpenAI 兼容 API 完全就绪。模型 ID 可以先查/v1/models确认(例如 Qwen 3.8 27B 优化速度版对应的缓存 ID)。 接入 OpenCode:把 Agent 会话提速到 125 tok/sOpenCode 是走 OpenAI 协议的 AI 编程代理,也是 MTPLX 官方重点加固的客户端——工具调用契约、长上下文深度策略都为它单独优化过。在 OpenCode 的 provider 设置里新增一个OpenAI-compatible类型的提供方;Base URL 填:http://127.0.0.1:8000/v1API Key 随意填(如local),本地回环地址下 MTPLX 不校验;模型 ID 填/v1/models返回的 ID。接入后的体验差距主要来自 MTPLX 的会话缓存:暖前缀会话库让第 N 轮对话直接恢复上一轮状态,而不是把越来越长的历史重新 prefill 一遍;默认开启的 SSD 会话缓存甚至能在服务重启后毫秒级恢复整段会话。官方在 M5 Max 上用 OpenCode 跑 Qwen 3.8 Flash Next 实测到了125.8 tok/s(18.5k token 提示词、其中 18.3k 命中缓存)。一个来自实战的小提示:OpenCode 会在每个新用户回合重建系统提示词(含目录树、日期等易变内容),文件写入后的下一轮偶发停顿多半是客户端在重建提示词导致前缀缓存失效,属于正常现象,见 docs/perf/opencode-system-prompt-churn-20260906.md。 接入 Claude Code:走 Anthropic 兼容协议Claude Code 原生走 Anthropic Messages 协议,MTPLX 的/v1/messages端点完整兼容它,包括流式、工具调用和 thinking 块(Qwen 的推理内容会映射为 Anthropic 的thinking块)。只需设置两个环境变量,让 Claude Code 指向本地:export ANTHROPIC_BASE_URLhttp://127.0.0.1:8000 export ANTHROPIC_API_KEYlocal⚠️最容易踩的坑:Anthropic 客户端的 base URL不要带/v1后缀。SDK 会自己拼接/v1/messages,如果你填http://127.0.0.1:8000/v1,实际请求会变成/v1/v1/messages,直接 404。如果你更喜欢用 Python SDK 验证,官方示例在 examples/anthropic-python-client.py:client Anthropic(api_keylocal, base_urlhttp://127.0.0.1:8000) message client.messages.create( modelmtplx, max_tokens256, messages[{role: user, content: Write a tiny Python function that clamps a number.}], )⚡ 接入 Cursor:OpenAI 兼容自定义端点Cursor 支持自定义 OpenAI 兼容端点,配置和 OpenCode 几乎一样:Cursor Settings → Models(或 API 提供方设置)→ 添加自定义模型;类型选OpenAI Compatible;API Base URL:http://127.0.0.1:8000/v1;API Key 填任意占位值;模型 ID 与/v1/models保持一致。配置完成后,Cursor 的 Agent 模式与 Chat 都会走本地 MTPLX 推理。 进阶:让局域网设备/虚拟机也能用默认绑定127.0.0.1,只有本机能连。如果想从同一台 Mac 上的 Parallels/UTM 虚拟机访问,绑定所有网卡即可(非本机访问必须提供 API Key,启动时会打印一次):mtplx serve --host 0.0.0.0 --port 8000 --api-key-file ~/.mtplx/api-key启动日志会给出Network OpenAI API Base URL(例如http://192.168.1.20:8000/v1),其他设备上的任意 OpenAI 兼容客户端配上这个地址和密钥即可。详细说明见 docs/server.md。 常见问题速查现象排查方法客户端连不上先curl http://127.0.0.1:8000/health,再跑mtplx doctorAnthropic 客户端 404检查 base URL 是否多写了/v1多轮对话变慢看/health中session_bank.last_miss_reason,确认会话是否命中缓存模型没装好mtplx models查看缓存状态;mtplx pull 模型仓库下载想看实时性能浏览器打开http://127.0.0.1:8000/metrics模型源码位于 mtplx/ 目录,HTTP 端点与路由实现在 mtplx/server/,采样与推理逻辑在 mtplx/sampling.py;如果你要写自己的客户端,推荐直接参考 examples/openai-python-client.py。 写在最后OpenCode / Cursor:Base URL 用http://127.0.0.1:8000/v1(OpenAI 协议);Claude Code:Base URL 用http://127.0.0.1:8000(Anthropic 协议,不带 /v1);服务端只需一条mtplx serve命令,会话缓存与 MTP 精确解码自动生效。把这三个变量记牢,你的编程 AI 工作流就彻底搬回了本地:代码私有、速度翻倍、成本为零。【免费下载链接】MTPLXThe fastest way to run Qwen 3.8 Flash Next, Qwen 3.8 27B and Ternary Bonsai 2 27B on a Mac: 125 tok/s in OpenCode on an M5 Max, and a 27B model on 16 GB Macs. Native MTP speculative decoding on Apple Silicon, exact at any temperature. OpenAI and Anthropic compatible local server.项目地址: https://gitcode.com/gh_mirrors/mt/MTPLX创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表