← 返回精选动态
精选动态

JetSpec实现1000 TPS推理性能:20亿参数伦理模型首次达到单卡千TPS量

HaoAI Lab 开源 JetSpec(1000 TPS模型服务)

更新于 2026年06月26日 03:33 1 条公开来源

发生了什么

HaoAI Lab 开源 JetSpec(1000 TPS模型服务)

为什么值得关注

量化超越当前推理解方方案,值得复现与部署验证

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

JetSpec实现1000 TPS推理性能:20亿参数伦理模型首次达到单卡千TPS量

twitter关注列表 2026年06月26日 03:18

Hao AI Lab的JetSpec项目通过推测性解码在cartesian tree搜索期间并行生成多个推理路径,基于CUDA图优化实现1000 TPS单卡Qwen3-8B推理,在MATH-500基准测试中达到964%端到端速度提升和458×开放式对话生成速率,技术突破了当前8亿模型100 TPS的行业标准。

打开原始来源 ↗
← 返回精选动态