← 返回精选动态
精选动态

SGLang优化Ling-2.6-1T性能

SGLang团队 公布 Ling-2.6-1T 优化成果(延迟降53%,吞吐提1.77倍)

更新于 2026年06月18日 11:40 1 条公开来源

发生了什么

SGLang团队 公布 Ling-2.6-1T 优化成果(延迟降53%,吞吐提1.77倍)

为什么值得关注

差异点:相比常规MoE推理,该优化通过Pallas内核实现计算与通信深度重叠,值得关注其技术方案。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

SGLang优化Ling-2.6-1T性能

twitter关注列表 2026年06月18日 11:02

SGLang团队与Ant Ling合作优化Ling-2.6-1T(1T参数混合MoE模型)在TPU v7x上的推理性能,采用Fused MoE V2内核等技术,实现MoE pre-fill延迟降低53%,在16芯片TPU v7x上的解码吞吐量比类似H200集群提高1.77倍。

打开原始来源 ↗
← 返回精选动态