杂技浅尝

DeepSeek-V4-Flash 实测:八卡 RTX 3090 与双卡 RTX PRO 6000 差多少?

上一篇我把 DeepSeek-V4-Flash 塞进了八张 RTX 3090,结尾留下两件事:给 3090 测 DSpark 投机解码,再找两张 RTX PRO 6000 跑官方权重。 现在两个坑都填上了。 结果比我预想得更夸张: 八卡 RTX 3090 把 DSpark 参数调对后,固定长输出的单路 Decode 从约 36 tok/s 提升到 61.26 tok/s。 双卡 RTX PRO 6000 的最快方案跑到了约 204 tok/s,长输入 Prefill 也稳定在约 3K tok/s。 不过先说清楚:这不是一场严格控制变量的 GPU 跑分。两边使用的权重、推理引擎、DSpark 配置和虚拟化环境都不同。本文比较的是我实际能部署出来的两套方案,不是单纯比较 RTX 3090 和 RTX PRO 6000 的理论算力。 ...

2026-08-08 · 10 分钟 · 4736 字 ·