发生了什么
Kimi.ai 发布 Kimi K3 技术报告(2.8T MoE, 百万上下文, 2.5x效率)
为什么值得关注
该报告详细披露了KDA架构、NoPE、跨深度注意力等具体技术实现,与已知Kimi K2形成显著差异,值得深入阅读原文。
信息来源
以下内容来自公开来源,可打开原文继续核验。
01
Kimi K3技术报告发布
Kimi.ai发布Kimi K3技术报告,该模型为2.8T参数MoE,原生支持视觉理解,拥有百万token上下文窗口。报告详细描述了新架构Kimi Delta Attention,通过移除位置编码、注意力残差、分层训练等技术,实现约2.5倍于Kimi K2的扩展效率。
打开原始来源 ↗