← 返回精选动态
精选动态

MiniMax Sparse Attention

MiniMax 发表 Sparse Attention 架构(M3,100万 tokens,prefilling 9.7倍,decoding 15.6倍)

更新于 2026年05月27日 00:37 1 条公开来源

发生了什么

MiniMax 发表 Sparse Attention 架构(M3,100万 tokens,prefilling 9.7倍,decoding 15.6倍)

为什么值得关注

可重点关注其两阶段稀疏注意力设计,以及它在 100 万 tokens 长上下文下相对 M2 的加速幅度,适合判断长上下文推理优化的可复现路径。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

MiniMax Sparse Attention

twitter关注列表 2026年05月26日 23:54

MiniMax 预告了用于 M3 的 Sparse Attention 架构,并给出基准结果:在 100 万 tokens 场景下,相比 M2,prefilling 速度提升 9.7 倍,decoding 速度提升 15.6 倍。MiniMax 此前在 M2 上曾刻意回退到 full attention,因为当时 efficient attention 还不适合生产环境;其 pretrain lead 在 3 月曾专门发文解释这一点。新方案采用两阶段设计:先用轻量 index branch 做 block 选择,再只对相关 KV blocks 应用 sparse attention。

打开原始来源 ↗
← 返回精选动态