← 返回精选动态
精选动态

Gemma-4-26B 16路并行推理演示

Onur Solmaz 演示 Gemma-4-26B 并行推理(16路300 tok/s)

更新于 2026年06月24日 00:49 1 条公开来源

发生了什么

Onur Solmaz 演示 Gemma-4-26B 并行推理(16路300 tok/s)

为什么值得关注

展示了 MoE 模型在统一内存设备上的并行推理性能,未使用 flashinfer 仍有 18 tok/s,值得关注该模型在消费级硬件的部署潜力。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

Gemma-4-26B 16路并行推理演示

twitter关注列表 2026年06月24日 00:09

Onur Solmaz 在单台 DGX Spark(128GB 统一内存)上成功运行 NVIDIA 的 Gemma-4-26B-A4B-NVFP4 模型,实现 16 路并行推理,单路 18 tokens/s,聚合 300 tokens/s,最高可扩展至 32 路,且尚未使用 flashinfer 优化。

打开原始来源 ↗
← 返回精选动态