发生了什么
Hao AI Lab 发布 JetSpec(9.64x end-to-end speedup, open-sourced)
为什么值得关注
无需复现,值得关注其开源代码,因果并行树草稿的优化思路对 LLM 推理延迟改进有参考价值。
信息来源
以下内容来自公开来源,可打开原文继续核验。
Hao AI Lab 推出 JetSpec 实现最高 9.64 倍推理加速
Hao AI Lab 推出 JetSpec,一种轻量级、保持因果性的草稿头,通过因果并行树草稿实现推测解码,在 MATH-500 上达到 9.64 倍端到端加速,在开放式聊天上达到 4.58 倍加速,且保持无损。结合 CUDA 图和内核优化,在单块 B200 上可达约 1000 TPS。论文、代码、检查点和 vLLM 引擎均已开源。
打开原始来源 ↗JetSpec: 推测解码实现 LLM 生成极致加速
Hao AI Lab 发布 JetSpec,通过因果并行树草稿实现推测解码,联合优化草稿成本和质量。在 MATH-500 上达到 9.64x 端到端加速,开放聊天 4.58x,保持无损。结合 CUDA graph 和 kernel 优化,单 B200 可达约 1000 TPS。
打开原始来源 ↗