发生了什么
SGLang团队 公布 Ling-2.6-1T 优化成果(延迟降53%,吞吐提1.77倍)
为什么值得关注
差异点:相比常规MoE推理,该优化通过Pallas内核实现计算与通信深度重叠,值得关注其技术方案。
信息来源
以下内容来自公开来源,可打开原文继续核验。
01
SGLang优化Ling-2.6-1T性能
SGLang团队与Ant Ling合作优化Ling-2.6-1T(1T参数混合MoE模型)在TPU v7x上的推理性能,采用Fused MoE V2内核等技术,实现MoE pre-fill延迟降低53%,在16芯片TPU v7x上的解码吞吐量比类似H200集群提高1.77倍。
打开原始来源 ↗