Signal Brief

Kimi开源FlashKDA内核

Kimi团队开源了FlashKDA(基于CUTLASS的Delta Attention内核),在H20上相比flash-linear-attention基线实现了1.72x-2.22x的预填充加速,可作为即插即用后端。

twitter关注列表 Kimi.ai (@Kimi_Moonshot) 发布 2026-07-27 收录 2026-07-27 观察

一句话判断

开源实现提供了具体的加速数据,值得关注并尝试集成到现有框架中。

核心信息

Kimi团队开源了FlashKDA(基于CUTLASS的Delta Attention内核),在H20上相比flash-linear-attention基线实现了1.72x-2.22x的预填充加速,可作为即插即用后端。

原始内容

We've open-sourced FlashKDA, our high-performance CUTLASS-based implementation of Kimi Delta Attention kernels. It delivers 1.72×–2.22× prefill speedup over the flash-linear-attention baseline on H20, and works as a drop-in backend for flash-linear-attention. Explore on GitHub: https://t.co/QScjWsJqSy

相关动态

03

Kimi K3 开源模型发布

Kimi.ai 发布 Kimi K3,一个 2.8T 参数的 MoE 开源模型,具备原生视觉理解和 1M token 上下文窗口。采用新架构实现每单位计算智能提升 2.5 倍,并开源高性能注意力内核、MoE 通信库和 Agent 运行基础设施。这是目前最大的开源模型。

twitter关注列表2026-07-27#模型发布#开源#大模型
值得跟进
04

月之暗面开源AgentENV

月之暗面与kvcache-ai合作开源AgentENV,这是一个用于大规模运行智能体环境的分布式系统,支持快速快照、恢复和分支,已用于Kimi K3的智能体强化学习训练。

twitter关注列表2026-07-27#开源#大模型
观察
05

Kimi K3 全球首个开源 3T 级模型发布

Moonshot 发布 Kimi K3,为全球首个开源 3T 级模型,拥有 2.8T 参数、1M token 上下文、16/896 专家激活,性能仅次于 Fable 5 和 GPT-5.6 Sol,原生支持文本、图像和视频理解,缩放效率是 Kimi K2 的约 2.5 倍,已在 ModelScope 上线。

twitter关注列表2026-07-27#模型发布#开源#大模型
观察