
单机部署 70B 级模型已经不算新闻真正的分水岭是多机协同。两台 DGX Spark 通过高速网络组成小型集群后能不能跑 200B 级模型能不能在 int4 量化下保持可用吞吐单位 token 成本能不能压过按量计费的 API这些才是开发者真正关心的问题。最近一次海外开发者公开的双 DGX 测试把 DeepSeek V4 Flash、Gemini 1.5 Flash 和 GLM-4-Plus 放在同一组评测里结论被概括为一句话DeepSeek V4 Flash 在价格维度上明显领先。下面按环境搭建、部署方式、压测脚本、结果解读和排错路径的顺序把这次测试完整还原出来。1. 测试背景双 DGX 为什么成为关注焦点1.1 双 DGX Spark 连接后能跑多大模型大模型推理的第一道门槛是显存墙。70B 模型在 FP16 下权重约 140GB单张 H100 的 80GB 显存放不下但量化到 int4 后权重降到约 45GB