发生了什么
Hao AI Lab 发布 JetSpec (9.64x MATH-500, 4.58x 开放式聊天, 1000 TPS B200)
为什么值得关注
新增了基于 CUDA graph 的并行树草拟 decoding 方法,可在保持 lossless 的前提下显著降低推理延迟。
信息来源
以下内容来自公开来源,可打开原文继续核验。
JetSpec 加速
Hao AI Lab 介绍 JetSpec,实现相较于以往 speculative decoding 与 block diffusion 的 9.64 倍 MATH-500 与 4.58 倍开放式聊天速度提升,单卡 B200 达 1000 TPS,保持 lossless。
打开原始来源 ↗