标签 大模型开发 下的文章

结论

联机优势,跑大尺寸模型,对单个请求延迟有高要求。否则单机部署更灵活。

测试项单机双机实际提升
并发 3 路10.63 tok/s15.07 tok/s+42%
长文本3.76 tok/s6.10 tok/s+62%
短文本3.52 tok/s5.15 tok/s+46%

背景

        本次采购两台 NVIDIA DGX Spark,搭载 GB10 Blackwell GPU,128GB 统一内存。本次测试旨在验证在这套硬件上运行大型语言模型的推理能力,并对比单机与双机分布式部署的性能差异。spark交火.jpg

- 阅读剩余部分 -