一句话判断
该报告详细披露了KDA架构、NoPE、跨深度注意力等具体技术实现,与已知Kimi K2形成显著差异,值得深入阅读原文。
核心信息
Kimi.ai发布Kimi K3技术报告,该模型为2.8T参数MoE,原生支持视觉理解,拥有百万token上下文窗口。报告详细描述了新架构Kimi Delta Attention,通过移除位置编码、注意力残差、分层训练等技术,实现约2.5倍于Kimi K2的扩展效率。
原始内容
相关动态
Microsoft 公布 MAI-Cyber-1-Flash 网络安全模型
Microsoft 公布其网络安全模型 MAI-Cyber-1-Flash 与 MDASH 系统在 CyberGym 上达到 95.95% 的成绩,超过次优的 GPT-5.5 Cyber(85.6%),并能以领先模型一半的成本自动查找和修复代码漏洞。MDASH 协调超过 100 个专门代理,且将模型与安全上下文分离,实现模型可替换。
Kimi K3 开源权重发布
Moonshot 开源 Kimi K3 模型权重,参数规模 2.6T,在 Artificial Analysis Intelligence Index 得分 57,成为领先的开源权重模型。许可协议限制商用,要求营收超 2000 万美元的模型即服务企业另行协商,月活超 1 亿或月营收超 2000 万美元的商业产品需在界面显示“Kimi K3...
Microsoft 发布 MAI-Cyber-1-Flash 与 MDASH 多代理安全套件
微软发布 MAI-Cyber-1-Flash 模型和 MDASH 多代理安全套件。MAI-Cyber-1-Flash 在 CyberGym 基准上获得 96% 分数 Auss 领跑其他模型。
Kimi K3: 2.8T MoE开源模型发布
Kimi(月之暗面)发布并开源其最强模型Kimi K3,采用2.8T MoE架构,具备原生视觉理解能力和1M token上下文窗口,新架构使智能每计算单元提升2.5倍。同时开放技术报告、高性能注意力内核、MoE通信库及agent基础设施。
Kimi K3 在 Agent Arena 排名第一并开源
Arena.ai 公布榜单,Kimi K3 (Max) 在 Agent Arena 中以净改进 +9.75% 排名开源权重第一,超过 GLM-5.2 (Max) 的 +7.12%,并在 Frontend Code(1682 pts)和 Text(1485 pts)Arenas 中也位居开源第一。Kimi K3 本身为 2.8T MoE 模...