发生了什么Meta 发布 Llama 3 8B (8B 参数, MMLU 85) 为什么值得关注该模型在MMLU上超越前代并具备8B参数规模,值得深入评估 信息来源 以下内容来自公开来源,可打开原文继续核验。 01 Meta发布Llama 3 8B模型 twitter关注列表 2026年06月01日 21:44 Meta发布Llama 3 8B模型,MMLU基准85分,超过Llama 2 7B的78分。该模型参数量为8B,较前代提升显著。 打开原始来源 ↗ ← 返回精选动态
01 Meta发布Llama 3 8B模型 twitter关注列表 2026年06月01日 21:44 Meta发布Llama 3 8B模型,MMLU基准85分,超过Llama 2 7B的78分。该模型参数量为8B,较前代提升显著。 打开原始来源 ↗
01 Kimi 开放 2.8T 参数模型 K3 并发布技术报告 Kimi 正式发布开放权重模型 K3,采用 2.8T 参数 MoE 架构,原生支持视觉理解和 1M token 上下文窗口,智能密度较前代提升 2.5 倍。该模型在 Web 开发、代码执行和 Agent 任务上接近顶级闭源模型,但在研究级推理和复杂桌面操作上仍有差距。 twitter关注列表2026年07月28日 13:29#模型发布#大模型#开源 值得跟进
02 Kimi K3 技术报告解读 Kimi K3 技术报告解读指出,该模型拥有 2.8 万亿参数,采用 896 个 MoE 专家(每次激活 16 个),通过三处架构改动将算力效率提升至 2.5 倍,训练使用了 5122 万个沙箱。 twitter关注列表2026年07月28日 13:29#大模型#技术报告#模型优化 观察
03 Kimi 开源 K3 模型,2.8T 参数全权重放送 月之暗面开源 K3 模型,总参数 2.8T,MoE 架构,激活参数 104B,原生支持 100 万上下文,并开源 FlashKDA 推理内核、MoE 通信库、Agent 训练环境等底层技术栈。通过 KDA 注意力和 AttnRes 架构创新,单位算力智能密度提升 2.5 倍,长上下文解码速度提升 6 倍。 twitter关注列表2026年07月28日 13:43#技术#大模型#开源 值得跟进