一句话判断
首次提出面向TPU的JAX内核优化基准JAXBench,并展示了文档条件化带来的显著提升,值得TPU优化领域从业者阅读原文。
核心信息
Google、哈佛和UC Berkeley联合发布JAXBench,包含50个基于真实MaxText架构的JAX工作负载。使用Gemini 3 Flash并配合文档条件化,将正确率从5.8%提升至37.3%,解决48/50个基准,速度提升1.28倍,波束搜索进一步优化至1.36倍。
原始内容
相关动态
NVIDIA 创始人心法
Jensen Huang 在访谈中分享 NVIDIA 的创始人心法,包括深入算法域、坚持第一性原理以及组织围绕创始人长处演化的方法。
NVIDIA 研究:AdamW 在大批量训练中存在规模上限
NVIDIA 研究发现,AdamW 在批量大小达到 1 亿 token 时训练稳定性下降,而 SOAP 和 Muon 保持稳定。团队通过每步 QR 正交化和改进预处理策略消除了 SOAP 在大批量下的 loss spikes,并在多十亿参数模型上训练数万亿 token 后,SOAP 和 Muon 一致优于 AdamW。
Kimi K3: 2.8万亿参数开源模型发布
Kimi.ai 发布 Kimi K3 模型,拥有 2.8 万亿参数、100 万上下文、原生多模态能力。采用 Kimi Delta Attention 技术,在百万 token 上下文中实现高达 6.3 倍解码加速;Attention Residuals 以低于 2% 的额外成本带来约 25% 的训练效率提升。模型已上线官网、Kimi Wo...
From Memory to Skills: Evidence-Grounded Co-Evolution Governance for Long-Horizon LLM Agents
论文指出大多数代理记忆系统只保存事件并在上下文召回,导致重复推理错误。作者提出MSCE方法,将经验组织为声明性事实、诱导程序化策略和基础步骤轨迹,仅将重复模式提升为可调用的过程(如pip安装失败时运行规则),每个策略需具备触发条件、边界、正向收益估计和证据支持。
Understanding Reasoning from Pretraining to Post-Training
论文通过象棋实验(5M-1B参数模型,36种预训练-RL组合)发现:预训练验证损失能高精度预测后RL的pass@1(相关性从0.93到0.99),RL计算量每10倍增益与预训练token数对数正相关(r=+0.84);RL最优计算量份额在50M参数时为20%,680M时为28%,且RL会放大模型在困难问题上的错误模式。