ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

Exo 把闲置 Mac 拼成分布式推理集群:从单台到四节点实战

Exo 把闲置 Mac 拼成分布式推理集群:从单台到四节点实战 Exo 把闲置 Mac 拼成分布式推理集群从单台到四节点实战【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exoExoexo是一个把闲置 Mac 和 Linux 机器串起来做分布式推理的开源项目解决的是模型太大、单台机器装不下的问题。本文覆盖从单台跑通、多设备组网、扩展到四节点再到解读基准数据的完整路径。最终效果4 台 M3 Ultra Mac Studio 跑 Qwen3-235B 达到 31.9 t/s是 TCP 方案的 2 倍以上。 先跑起来本地 AI 推理最小可用配置最低要求只有一台设备。Apple Silicon 的 Mac如 M4 Pro Mac Mini、M3 Ultra Mac Studio即可Linux 机器也支持目前跑 CPU 推理。最快的路径是用 Homebrew 安装 macOS 版 App要求 macOS Tahoe 26.2 以上或者从源码构建克隆仓库https://gitcode.com/GitHub_Trending/exo8/exo构建好 dashboard 后执行一行命令uv run exo启动后浏览器打开 http://localhost:52415这就是内置的仪表板。选一个 Llama-3.2-1B 这样的小模型开始对话5 分钟内就能看到第一次本地推理的回复。 它是怎么把多台设备串成一个集群的设备启动后会在局域网内广播自动发现其他运行 exo 的机器不需要手动配置任何 IP这就是机器放桌上就能用的机制。背后是一个master调度器它实时掌握整个拓扑——每个节点剩余内存、每条链路带宽与延迟并据此决定把模型怎么切到各台机器上用流水线或张量并行。想深入时从 src/exo/master/ 的调度放置逻辑和 src/exo/worker/ 的推理执行看起即可。在带 Thunderbolt 5 的 Mac 上还能启用雷雳 RDMA官方给出的数字是设备间延迟降低约 99%。从 1 台扩展到 4 台加节点的实操路径新设备装同款 exomacOS 用同一个 AppLinux 走源码安装。连上同一局域网后自动加入集群仪表板里会出现新节点。检查网络节点间要能互通并放行 52415 端口多个团队共用网络时用EXO_LIBP2P_NAMESPACE环境变量隔离出不同集群防止误加入。Mac 想走高速链路用 TB5 线缆把每台机器点对点全互联进恢复模式执行rdma_ctl enable且所有机器的 macOS 版本必须完全一致。验证状态拓扑视图里每个节点都会显示 CPU 占用、内存、温度与功耗确认新节点读数正常即可。 性能怎么衡量基准数据与 3 个调优抓手公开数据4 × M3 Ultra Mac Studio 实测硬件模型协议生成速度1 节点Qwen3-235B8-bitllama.cppTCP20.4 t/s2 节点Qwen3-235B8-bitExoRDMA26.2 t/s4 节点Qwen3-235B8-bitllama.cppTCP15.2 t/s4 节点Qwen3-235B8-bitExoRDMA31.9 t/s可操作的调优抓手有三个协议选择走 TCP 时节点越多反而越慢4 节点 15.2 t/s 低于单台 20.4而 RDMA 让同样的 4 台机器达到 31.9 t/s。分片策略张量并行官方数据 2 台最高 1.8 倍、4 台 3.2 倍加速内存紧张时先用流水线并行把模型摊开。先测量再调优用自带的 bench/exo_bench.py 在你自己的拓扑上对比不同放置方案的 prefill 与生成速度。⚖️ 什么时候该用什么时候别硬上适合的场景本地跑 200B 大模型做批量推理4 节点跑 235B 有 31.9 t/s适合夜间批量处理文档。单机装不下的超大模型4 台 512GB 内存能加载 671B8-bit单台机器连启动都做不到。私网离线部署设置EXO_OFFLINEtrue后只使用本地模型数据不出局域网。不适合的场景对尾延迟敏感的在线服务集群推理依赖所有节点在线任何一台掉线都可能让整条请求卡住SLA 难保证。单台跑小模型70B 以下在 128GB 的 MacBook 上单台就够快组集群纯属增加通信开销——同一测试里单台 exo 19.5 t/s还不如 llama.cpp 的 20.4。 常见卡点与快速排查新节点一直显示 pending大概率是防火墙没放行节点间端口先检查 52415 端口和 macOS 的本地网络权限。RDMA 没生效、速度停留在 TCP 水平检查所有机器 macOS 版本是否完全一致精确到 beta 编号、线缆是否支持 TB5Mac Studio 上是否误用了紧挨网口的 TB5 口。同一局域网的节点互相发现不了查命名空间所有机器的EXO_LIBP2P_NAMESPACE必须一致不一致就是两个集群。模型下载中途失败先看磁盘空间用EXO_MODELS_DIRS把模型指到空间充足的盘再重试。这套机制的价值很具体它把大模型自动切到你拥有的所有机器上跑四台 M3 Ultra 把 Qwen3-235B 推进 30 t/s 以上这是任何单台设备做不到的。下一步建议先在仪表板 http://localhost:52415 加载一个小模型跑通对话再按仓库 README 的 Quick Start 把第二台机器接进来。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表