↓ 跳过正文
  1. Posts/

两台 DGX Spark 跑 Agent:跑分一时爽,干活卡成狗

·7 分钟· · · #Dgx-Spark #Llm #Inference #Agent
目录

网上到处都是两台 DGX Spark(GB10)跑大模型的压测视频,标题一个比一个唬人,动辄「170+ token/s 吞吐」「把数据中心搬上桌面」。

前几天我也把两台 Spark 拿 QSFP 铜缆直连,照着网上的双机配方把 MiMo-V2.6-Flash(TP=2)拉了起来。但我折腾这套环境不是为了测 Hello World,纯粹是想知道:这玩意儿到底能不能接进我日常的 Coding Agent 里当主力模型用?

直接说结论:单人一问一答还能凑合,想开多 Agent 协同或者重度扫代码,劝你趁早死心。


先泼盆冷水:别被 200G 网口和跑分骗了
#

很多人看到机器上两个 200G 的网口,第一反应就是「双线聚合 400G,机间通信起飞」。

实际拿 ethtool 和 lspci 一看就露馅了:

  1. 机间带宽物理上限就 200 Gb/s:两台机器没有机间 NVLink,也没接交换机,靠两条 QSFP 铜缆直连。虽然 ethtool 里协商速率是 200000Mb/s,但每块 ConnectX-7 在主板上只分到了 PCIe Gen5 x4(32GT/s, Width x4)。单向物理带宽算下来顶天也就 126 Gb/s:

    32 × 4 × (128/130) ÷ 8 ≈ 15.8 GB/s ≈ 126 Gb/s

    拿 ib_write_bw 实测,单线打满 99.7 Gb/s,双线同时跑是 97.9 + 97.9 ≈ 196 Gb/s。

  2. 访存带宽才是真正的死穴:DGX Spark 用的统一内存是 128 GB LPDDR5X,带宽只有 273 GB/s。 对比一下主流设备:

    • RTX 4090:1008 GB/s(可惜显存只有 24 GB)
    • Mac Studio M4 Max:410–546 GB/s
    • Mac Studio M3 Ultra:819 GB/s

Spark 的卖点从来都是「统一内存够大」,不是「访存带宽够高」。200G 的网线只够保证把大模型切成 TP=2 装进两台机器,至于解码速度,照样被 273 GB/s 的内存带宽死死摁住。


跑分看着很猛:短 Prompt 压测
#

先用脚本做常规的基准压测:固定 128 token 短 Prompt,打开 ignore_eos,测不同并发下的总吞吐:

并发数 总吞吐 (token/s) 耗时与单路情况
1 37.1 单路解码约 43.8 token/s
2 73.6 吞吐基本翻倍
4 127.4 多路扩展性尚可
6 172.7 总吞吐峰值,整批耗时 4.5s
8 79.8 墙钟拉到 12.8s,单路散在 10–47 token/s

从表上看,6 并发是高点,合计 172.7 token/s。到 8 并发,合计掉到 79.8,单路也散了,没有看到调度器报错。单路空载最快能摸到 54 token/s;平时一个人单聊、系统 Prompt 能吃上 90% 前缀缓存的时候,生成大约在 35–45 token/s。

这也是为什么网上很多评测动不动就吹「170+ token/s」——因为他们测的全是这种几百字节的空载短请求,大家各自解自己的 token,各走各的,互不干扰。


真实上工:5 个子 Agent 扫项目直接原地卡死
#

测完跑分,我把它挂进常用的 Coding Agent 里,上来就开了 5 个子 Agent 去探索一个中型开源项目的代码库。

后台监控看上去一片健康:HTTP 请求全是 200,排队数是 0。

但从终端这边一看就露馅了:单路生成速度一下子掉到 15–25 token/s,整整跑了 6 分钟,连一个子 Agent 的总结都没吐完。

这次会话里对得上的数就这些:请求是 200,排队是 0,每路 15–25 token/s,六分钟没有最终结果。另外一次两路同时解码,合计大约 65–75 token/s,每路大约 30–37。短测的 173 是 128 token、ignore_eos 的合计,和这次不是同一种输入。

长预填是另一次观察,不是这次五路的日志。大约 25 万 token 的预填可以自己占掉几分钟,并且会把同一段统计里的生成速度拉低。这次没有记下每路的输入长度,也没有记下前缀命中率。单人聊天大约 90% 的命中来自重复的系统提示;子 Agent 各读各的文件,命中会低,这是推断,不是这次量出来的。


别人的双机记录也在这个区间
#

公开的 GLM-5.3-Flash NVFP4,双机单路大约 20–30 token/s,四台大约 36。显卡从 1500 MHz 拉到 2100 MHz,解码大约多 4%,这是三台那篇,不要和四台的 35.7 算成同一次。标题写 43.4 的那篇,正文中位数是 21.8。六十多 token/s 来自更低比特的 EXL3,加上结构化输出和短上下文。DeepSeek V4.1 Flash 的正式权重按四台配方在跑;两台 EXL3 的目录有了,仓库标的是还没跑分。每条数字的链接在文末。


彩蛋:换成魔改卡,总账真算得过来吗
#

肯定有人想问:同样的预算,买魔改卡不香吗?先别急着掏钱——裸卡只是个开头,配套的流水账还在后头:

  • 魔改 RTX 4090(48G):单卡 1008 GB/s,带宽是 Spark 的三倍还多。但这是一张卡,不是一台机器,板 U、内存、千瓦电源、机箱散热都得配齐,2026 年内存是什么价大家心里有数。而且你得先有台能插卡的机器——本来就攒着台式机的另说,那确实等于白捡。
  • 魔改 RTX 5090(96G):速桥在阿里巴巴的报价是 3888 美元,只是裸卡价。报道同时指出商品页把显存写成 GDDR6X 14Gbps,和 96GB 对不上,第一批质量没有第三方拆机兜底。cnBeta,Tom’s Hardware
  • 两台 Spark:不用装机。NVIDIA 标的是整机电源 240W、GB10 芯片 TDP 140W,还带原厂保修。128 GB 内存折在整机价里。

带宽差是规格页上的。整机和裸卡加板 U、内存、电源的总账,我没有列价,这里比不出谁更便宜。


总结:这玩意儿到底该怎么用?
#

如果你手里也有两台 DGX Spark,我对它的定位建议是:

  • 可以用的场景:单人、一问一答、单任务写代码。配合稳定的系统 Prompt 和高命中率的前缀缓存,35–45 token/s 属于勉强能用的状态,至少不依赖云端 API(当然,前提是你的代码和数据敏感到根本不能出本地,否则犯不上受这个罪)。
  • 天然契合的场景:富哥(或接商单的博主)买来当大玩具发评测、刷跑分视频。摆在桌面上既有极客感又有牌面,跑个短 Prompt 压测录个屏,数据好看得很。
  • 千万别指望的场景:丢给多 Agent 当后端、大代码库整仓分析、重度并发长任务。一上这种负载,LPDDR5X 的访存带宽和长上下文 Prefill 耗时会立刻教做人。

继续堆机器,解决的只是**「能不能把模型装进内存」,根本改变不了「单路解码就是很慢」**的物理事实。别拿短 Prompt 跑分忽悠自己,在真实的 Agent 负载下,物理瓶颈从来不会说谎。

来源
#

本文自己的数,和别人帖子里的数分开。

这两台机器,2026 年 9 月测的,没有对外日志。 MiMo 用的是 tonyd2wild 的双机配方,TP=2,mimo-v2.6-flash,max_model_len 30 万,max_num_seqs 8,服务在头节点 :8888。短 Prompt 表是本机打的 128 token、ignore_eos。五子 Agent 是同一次服务上的真实会话:没有排队,每路大约 15–25 token/s,六分钟没有最终结果。ethtool 两条口都报 200000Mb/s、Direct Attach Copper;lspci 两条都是 PCIe Gen5 x4(32GT/s, Width x4)。126 Gb/s 是用这个链路参数算的:32 × 4 × (128/130) ÷ 8。ib_write_bw 一条大约 99.7 Gb/s,两条同时大约 97.9 + 97.9。

规格页,不是实测速度。

  • DGX Spark 内存带宽 273 GB/s、128 GB LPDDR5X、电源 240W、GB10 TDP 140W:NVIDIA 规格
  • RTX 4090 显存带宽 1008 GB/s、24 GB:NVIDIA GeForce。48G 是魔改容量,带宽数字仍是这张原卡的规格,没有一份统一的 48G 规格书。
  • Mac Studio:M4 Max 410 GB/s,40 核 GPU 那一档 546 GB/s;M3 Ultra 819 GB/s。Apple 技术规格

社区跑分。 升频大约 4% 来自三台那篇,四台 35.7 是另一篇。

  • 双机 NVFP4,正文中位数 21.8 token/s,峰值 22.7;标题写 43.4。同一篇末尾四台 TP4 是 35.7。NVIDIA 论坛
  • 另一组双机:代码 24.7,结构化 30.3,散文 19.6;关掉推测解码 14.6。单路、temperature 0。论坛,配方
  • 三台 TP3:1500 MHz 解码 35.2,2100 MHz 是 36.8。大约 16 万 token 上下文时,2 路每路 7.5,3 路每路 6.1。NVIDIA 论坛
  • 双机 EXL3 4bpw:结构化单路 62.9,散文中位数 26.9。MiaAI
  • 单机 EXL3 2.05bpw:结构化大约 64,散文大约 25。跟帖提到空转和质量问题。论坛,模型卡
  • DeepSeek V4.1 Flash 四台环网,单路大约 43–50 token/s。记录。另一篇四台帖的散文是 23 token/s。论坛。两台 EXL3 标成未跑分;四台 EXL3 散文 30.2、代码 33.4。配方