← 返回精选动态
精选动态

Hao AI Lab 推出 JetSpec 实现最高 9.64 倍推理加速

Hao AI Lab 发布 JetSpec(9.64x end-to-end speedup, open-sourced)

更新于 2026年06月27日 02:41 2 条公开来源

发生了什么

Hao AI Lab 发布 JetSpec(9.64x end-to-end speedup, open-sourced)

为什么值得关注

无需复现,值得关注其开源代码,因果并行树草稿的优化思路对 LLM 推理延迟改进有参考价值。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

Hao AI Lab 推出 JetSpec 实现最高 9.64 倍推理加速

twitter关注列表 2026年06月26日 13:42

Hao AI Lab 推出 JetSpec,一种轻量级、保持因果性的草稿头,通过因果并行树草稿实现推测解码,在 MATH-500 上达到 9.64 倍端到端加速,在开放式聊天上达到 4.58 倍加速,且保持无损。结合 CUDA 图和内核优化,在单块 B200 上可达约 1000 TPS。论文、代码、检查点和 vLLM 引擎均已开源。

打开原始来源 ↗
02

JetSpec: 推测解码实现 LLM 生成极致加速

twitter关注列表 2026年06月27日 00:07

Hao AI Lab 发布 JetSpec,通过因果并行树草稿实现推测解码,联合优化草稿成本和质量。在 MATH-500 上达到 9.64x 端到端加速,开放聊天 4.58x,保持无损。结合 CUDA graph 和 kernel 优化,单 B200 可达约 1000 TPS。

打开原始来源 ↗
← 返回精选动态