← 返回精选动态
精选动态

Kog AI 推理提速

Kog AI 发表 推理加速技术预览(8× AMD MI300X 3000 tokens/s 8× NVIDIA H200 2100 tokens/s 2B 模型)

更新于 2026年05月30日 01:27 1 条公开来源

发生了什么

Kog AI 发表 推理加速技术预览(8× AMD MI300X 3000 tokens/s 8× NVIDIA H200 2100 tokens/s 2B 模型)

为什么值得关注

值得关注其 monokernel、同步重构与 Delayed Tensor Parallelism 的组合式实现,以及在 AMD MI300X 与 NVIDIA H200 上的可复现速度差异。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

Kog AI 推理提速

twitter关注列表 2026年05月30日 01:14

Kog AI 在 8× AMD MI300X GPU 上实现了单用户 3,000 tokens/s,在 8× NVIDIA H200 上实现了 2,100 tokens/s,测试条件为 FP16、未使用 speculative decoding,且当前技术预览基于 2B 模型。其方法把 LLM 解码视为内存流式传输问题,并通过联合优化 runtime、低层 GPU 代码和模型架构来提升速度;文中还提到常见低 batch 的 2B 到 8B 模型推理速度通常只有每请求约 100 到 300 tokens/s。

打开原始来源 ↗
← 返回精选动态