← 返回精选动态
精选动态

Kog 推出 2B 编码模型 Tech Preview

Kog 发布 2B coding model Tech Preview(3,000+ tokens/s; 8× AMD MI300X; 2,100 tokens/s; 8× NVIDIA H200; FP16)

更新于 2026年05月29日 07:52 1 条公开来源

发生了什么

Kog 发布 2B coding model Tech Preview(3,000+ tokens/s; 8× AMD MI300X; 2,100 tokens/s; 8× NVIDIA H200; FP16)

为什么值得关注

值得点开其公开的 monokernel deep dive 和 Delayed Tensor Parallelism 研究,重点看高吞吐推理、GPU 调度与模型并行的协同设计是否可复现。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

Kog 推出 2B 编码模型 Tech Preview

twitter关注列表 2026年05月29日 07:11

Kog (@Kog__AI) 开放了一个 2B coding model 的 Tech Preview,并表示其在单次请求下可在 8× AMD MI300X 上达到 3,000+ output tokens/s、在 8× NVIDIA H200 上达到 2,100 tokens/s,测试条件为 FP16 且未使用 speculative decoding。作为对比,文中指出高端 GPU 上 2B 到 8B 模型的典型解码速度约为 100 到 300 tokens/s。Kog 还称其将 LLM decoding 视为 memory-streaming 问题,通过 monokernel、减少同步开销、按 MI300X chiplet 拓扑映射内存访问,以及延迟 tensor-parallel communication 的模型设计,实现了 runtime、GPU code 与 model design 的协同优化。

打开原始来源 ↗
← 返回精选动态