← 返回精选动态
精选动态

NVIDIA 压缩混合 MoE 模型论文

NVIDIA 发表 模型压缩论文 (Puzzle-75B-A9B)

更新于 2026年07月08日 01:48 1 条公开来源

发生了什么

NVIDIA 发表 模型压缩论文 (Puzzle-75B-A9B)

为什么值得关注

值得读原文,它展示了联合剪枝优化方法,对降低 MoE 推理成本有直接参考价值。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

NVIDIA 压缩混合 MoE 模型论文

twitter关注列表 2026年07月08日 01:20

NVIDIA 发布论文,将混合 MoE 模型 Nemotron-3-Super 压缩为 Puzzle-75B-A9B,通过联合结构搜索(异构 MoE 剪枝、活跃参数预算、Mamba 剪枝联合优化),结合蒸馏、RL、量化和多 token 预测头,在 8×B200 节点上实现约 2 倍父模型服务器吞吐量,在 H100 上将 1M token 并发从 1 提升至 8,保持推理、编码、长上下文和智能体基准准确率。

打开原始来源 ↗
← 返回精选动态