4 台 Mac Studio 在家跑出 671B 模型:exo 分布式推理实战指南

📅 发布时间:2026/8/31 10:41:53
4 台 Mac Studio 在家跑出 671B 模型:exo 分布式推理实战指南 4 台 Mac Studio 在家跑出 671B 模型exo 分布式推理实战指南【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exoexo 是一个免费开源的工具把家里所有 Apple Silicon 设备拼成一个分布式推理集群单机装不下的模型会被自动拆开多机跑设备间如果走 Thunderbolt 5加机器还会变快。 5 分钟拉起家庭推理节点源码方式三条命令起步前提是先装好 uv管 Python 依赖和 node编译网页仪表盘git clone https://gitcode.com/GitHub_Trending/exo8/exo cd exo/dashboard npm install npm run build cd .. uv run exo启动后打开http://localhost:52415你的分布式推理集群仪表盘和 OpenAI 兼容 API 就都在这一页里。同网络的其它机器只要也跑着 exo就会被自动发现不需要手动填 IP、不用开端口映射。macOS 上还有一个常驻菜单栏的 App一行安装要求 macOS 26.2 及以上brew install --cask exo 它到底在做什么拆模型的三步棋exo 不会让你指定哪台设备干什么placement 算法源码 替你做了三件事先画地图。每个节点互相探测网络得到一张带延迟、带宽的拓扑图拓扑模型。因为做分布式推理第一步永远是回答“模型该放哪台机器”。再选切法。流水线并行把模型按层切成连续段张量并行把每一层都拆开多设备算。后者带来真实加速——2 台设备最多 1.8 倍4 台 3.2 倍。最后按内存分活。层数按各设备空闲内存占比分配512GB 的 Mac Studio 多拿几层16GB 的 MacBook 少拿几层不用手调。 让它真正用起来三个部署动作1. 有 TB5 设备的组全互联再开 RDMA。关机进恢复模式执行rdma_ctl enable后重启。Thunderbolt 5 加 RDMA 能把设备间延迟降低约 99%。为什么模型拆开后网络就是瓶颈网络够快加机器才是真加速而不是互相拖累。2. 别猜放置方案跑测。建实例前先用/instance/previews端点列出所有合法放置方式再用内置基准工具对比每秒出多少 tokenuv run bench/exo_bench.py --model Llama-3.2-1B-Instruct-4bit --pp 128,256 --tg 128为什么同一个模型放 2 台还是 4 台、走流水线还是张量快慢不靠直觉。3. 客户端直接复用。API 兼容 OpenAI Chat Completions、Claude Messages 和 Ollama 三种格式。为什么把你现有应用的地址指到localhost:52415就能对话不用改一行代码。⚖️ 什么时候该用 / 什么时候别用适合不适合Apple Silicon 家庭集群想跑单机内存装不下的模型期待 Linux 上 GPU 加速目前仅 CPU 模式有 TB5 设备想要张量并行加速设备跨子网、网络不稳定数据要留在本地的隐私敏感推理多人共享的高并发生产服务想继续用现成 OpenAI / Ollama 客户端单台高端 GPU 服务器单干更划算想再往下挖API 参考 里列了全部端点想看真实大模型数字bench/ 目录里有现成的实测脚本和数据。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考