发生了什么
Azure 发布 Llama 3.1 405B 训练(8,192 GPU,7.07 分钟)
为什么值得关注
新基准显示在大规模 GPU 集群上可显著缩短训练时长,值得关注后续 Azure 与 NVIDIA 的协同进展。
信息来源
以下内容来自公开来源,可打开原文继续核验。
01
Azure 创 MLPerf 训练纪录
Azure 与 NVIDIA 合作,在 NVIDIA Blackwell 平台上使用 8,192 块 GPU(GB200 NVL72 系统)完成 Llama 3.1 405B 模型的训练,仅用时 7.07 分钟,创下迄今为止规模最大、最快的 MLPerf Training 成绩。此成绩展示了全栈创新在硅片、系统、网络和软件层面的协同效应。Satya Nadella 在推文中称其为 Azure 的新里程碑。
打开原始来源 ↗