发生了什么
Ant Ling 发布 Ling-3.0-flash 混合推理 MoE 模型(124B 参数,5.1B 激活)
为什么值得关注
相比 1T 旗舰模型,仅用 1/12 的活跃参数即达到同等性能,值得关注其 MoE 架构效率。
信息来源
以下内容来自公开来源,可打开原文继续核验。
01
Ant Ling 发布 Ling-3.0-flash 混合推理 MoE 模型
Ant Ling 团队发布 Ling-3.0-flash 混合推理 MoE 模型,124B 总参数,每个 token 仅激活 5.1B 参数,在多数基准测试中匹敌或超越其 1T 参数的旗舰模型。
打开原始来源 ↗