
4 台 Mac 跑通 DeepSeek 671Bexo 本地大模型分布式推理完整实操指南【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo周五晚上你在 32GB 的 MacBook 上试跑一个 235B 模型屏幕上一行内存不足把兴致浇灭——模型比整台机器的内存还大。而同一张桌子上家庭那台 iMac、吃灰的 Mac mini、公司发的旧笔记本全都闲着。exo 是一个本地大模型分布式推理框架把这些闲置的 Apple Silicon 设备拼成多设备集群设备自动互相发现、模型自动分片接的设备越多跑得越快4 台 Mac 就能把 671B 参数的 DeepSeek 稳稳跑起来。核心机制一句话说透原理像一条流水线大师傅按每个工位设备的内存和工位间带宽把模型切块派活每台设备只算自己那块算完经 RDMA绕过操作系统的内存直连大幅降低机器间延迟把接力棒传给下一站。你不用做任何手动配置每台设备装上 exo 启动它们就自己组好集群。硬件门槛你的设备够不够设备类型最低内存/配置推荐配置可承载模型上手难度Apple Silicon 笔记本16GB 统一内存32GB 统一内存1B–8B 量化对话模型★★☆☆☆Apple Silicon 台式机64GB 统一内存512GB 统一内存70B–1T 大模型★★★★☆Linux 电脑CPU 推理16GB 内存32GB 及以上小模型实验性质★★★☆☆Windows 电脑—暂不支持——有台 32GB 的 MacBook 就能起步不用急着花钱换硬件想跑 671B 级别就看带 TB5 口、统一内存大的机器。从零搭建完整部署流程逐台安装 exo 并等待自动发现做什么在每台要入网的设备上克隆仓库git clone https://gitcode.com/GitHub_Trending/exo8/exo然后uv run exo启动macOS 用户也可以直接装菜单栏 App。为什么这样做节点通过局域网自动发现彼此不用配 IP、不用填集群名同一网络下插电即组网。关键结果仪表盘直接画出集群拓扑每台机器的内存占用、温度、功耗一眼可见。让拓扑感知调度器选分片策略做什么在仪表盘里选好目标模型选 Pipeline按层切分或 Tensor张量切分分片点一下启动实例。为什么这样做分片逻辑 会结合每台节点的可用内存和链路时延/带宽实时计算落位挑一个不爆内存又最快的方案省去人工拍脑袋。关键结果4 台 512GB 的 Mac Studio 上DeepSeek V3.1 8-bit 和 Kimi-K2 Thinking 4-bit 两个大模型可以同时加载运行。验证推理服务可用做什么浏览器打开http://localhost:52415或在终端 curl 一下 OpenAI 兼容接口也可以直接把现有客户端的 base URL 指过来。为什么这样做exo 同时兼容 OpenAI、Claude、Responses、Ollama 四种 API 格式存量脚本和工具零改造接口清单见 docs/api.md。关键结果流式输出吐字就说明集群健康了再查/state端点能确认模型落在哪几台节点上。实测数据不吹不黑以下数据来自 4× M3 Ultra Mac Studio每台 512GB集群、开启雷电 5 RDMA 的公开测试exo 侧用仓库自带的 bench/exo_bench.py 测得Qwen3 235B A22B8-bit单节点 19.5 t/s → 2 节点 26.2 t/s → 4 节点 31.9 t/s比单节点高 63.6%。DeepSeek V3.1 671B8-bit21.1 t/s → 27.8 t/s → 32.5 t/s比单节点高 54.0%。Kimi K2 Thinking 1T A32B4-bit2 节点 21.6 t/s → 4 节点 28.3 t/s提升 31.0%。有几处得说实话⚠️ Kimi 从 2 节点加到 4 节点只快了 31.0%MoE 类模型每个 token 只激活部分专家加节点的收益明显小于稠密模型别指望完美线性翻倍另一边走 TCP 的 llama.cpp 反而是节点越多越慢Qwen3 从 20.4 t/s 掉到 15.2 t/s网络协议常常才是真正的瓶颈。另外以上数字全部建立在 Apple Silicon GPU 之上Linux 目前只能 CPU 推理别期待同样的成绩。踩坑与排错发现不了同伴节点→ 不在同一网段或集群命名空间不一致 → 接同一台路由器各节点EXO_LIBP2P_NAMESPACE保持一致RDMA 不生效→ 需要 TB5 硬件、节点两两直连且 macOS 版本完全一致 → TB5 线全互联系统版本对齐到补丁号模型加载失败→ 磁盘空间不足或trust_remote_code未开启 → 查模型目录剩余空间在设置里显式打开该选项Linux 节点特别慢→ 目前仅 CPU 推理GPU 支持开发中 → 非 Mac 设备暂时别期待太多给行动派的一句话挑出手头最旧的一台 Mac 装上 exo浏览器打开http://localhost:52415/state看看有哪些设备加入了集群。先跑一个 1B 小模型找找感觉等第二台机器入网你会在仪表盘上亲眼看到 tokens/s 往上涨。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考