发生了什么
[NVIDIA团队] [公布] [GB200 NVL72推理成本优化](降低2.5倍,70天)
为什么值得关注
该优化仅通过软件实现,对MoE模型推理成本下降有启发性,值得研究技术细节。
信息来源
以下内容来自公开来源,可打开原文继续核验。
01
GB200 NVL72推理成本降低2.5倍
NVIDIA团队在70天内通过软件优化(重写NVFP4 MoE内核)将GB200 NVL72的推理服务成本降低2.5倍,利用铜背板带宽优势,该架构与xAI的Cursor Composer 2.5相同。
打开原始来源 ↗