GLM-5.2在CritPt基准上匹配Claude Opus 4.8
Z ai的GLM-5.2(最大推理努力)在CritPt基准上得分为20.9%,与Claude Opus 4.8持平,远超其他开放权重模型(DeepSeek V4 Pro为12.9%),并超越GPT-5.5、Gemini 3.1 Pro等专有模型。相比10周前GLM-5.1的4.6%,实现4.5倍跃升。CritPt由Argonne和UIUC...
围绕 研究突破 的精选动态、来源摘要和重要性判断。
Z ai的GLM-5.2(最大推理努力)在CritPt基准上得分为20.9%,与Claude Opus 4.8持平,远超其他开放权重模型(DeepSeek V4 Pro为12.9%),并超越GPT-5.5、Gemini 3.1 Pro等专有模型。相比10周前GLM-5.1的4.6%,实现4.5倍跃升。CritPt由Argonne和UIUC...
主体包括机器人领域和世界模型研究者,动作是分析当前瓶颈并指出创业机会。关键数据包括50亿美元用于世界模型、180亿美元投入机器人以及约10万年数据差距的对比,以及与大语言模型预训练、微调、推理RL的并行关系,指出缺乏共享基准和架构收敛的现状。
Xichen Pan 提出 RepFusion 方法,解决当前 text-to-image 模型中 LLM 仅编码 prompt 一次而新训练生成骨干独立处理噪声隐状态的不匹配问题,使预训练多模态先验能参与去噪过程。论文和项目主页已公开。
Hy-Embodied 团队发布 Apache 2.0 开源的全栈 VLA 系统 Hy-Embodied-0.5-VLA,包含两个检查点:VLA-RoboTwin 在 50 个双手任务上微调,在 RoboTwin 2.0 基准上达到 90.9% Clean / 90.1% Randomized SOTA;VLA-UMI 基于 10,000...
论文提出 AdaCoM:在不重新训练主 agent 的情况下,用一个独立的小型 LLM 在每一步动作前编辑 agent 的工作上下文。该方法把上下文管理外置为一个训练过的 manager,对任务历史进行 rewrite、merge、prune 或 preserve,再把清理后的上下文交给冻结的 agent。作者在 web search 和...
斯坦福、麻省理工、英伟达、谷歌等顶尖实验室提出 AutoLab 基准,包含 36 项任务,让 17 款强大模型在固定时间内从弱代码开始进行改进。实验显示,模型的首次想法质量不是成功的主要预测因子,而持续测试、及时利用反馈才是关键,Claude Opus 4.6 凭借这一特质在基准中领先。其他前沿模型要么在时间剩余时提前退出,要么思考过长导...
Anthropic 表示,其新增生产代码中有 80% 由 Claude 生成。Google 的一篇新论文显示,通用 LLM 通过“规划证明并逐步检查”可以解决形式化数学问题,将通用 LLM 的表现从 10% 以下提升到 70%。Google 还发布了开源 Gemma 4 12B,可在本地消费级 16GB GPU 上分析音频和视频;Alib...
NVIDIA Research 在 CVPR2026 上展示了 3 篇关于 physical AI 的论文,覆盖大规模训练与具身智能应用。其内容包括 GraspGen-X、LCDrive 和 NitroGen:其中 GraspGen-X 被称为首个用于 zero-shot grasping 的 foundation model,训练于数十...
论文《Harness-1: Reinforcement Learning for Search Agents with State-Externalizing Harnesses》提出把搜索智能体中的记忆与状态管理从模型内部移到外部 harness 中。作者指出,普通搜索智能体需要在同一上下文里同时完成下一步搜索决策和记录文档、线索、失败...
Anthropic发布关于AI递归自我改进的研究报告,其Claude系统用于开发下一代AI的速度显著提升,代码产出超80%,实验执行加速达52倍,研究判断优于人类比例从51%升至64%。模型可靠完成任务的时长正以每4个月翻倍的速度增长,而SWE-bench和CORE-Bench分别在两年和15个月内从低分趋于饱和。人类在AI研发流程中的角...
Google 开发的 LEAP 框架通过 Agentic 方法解决形式数学问题,将 LLM 性能从小于 10% 提升至 70%。该方法将证明存储为目标和子目标的图结构,复用之前的引理而非每次重新发现。LEAP 在 Putnam 2025 竞赛中解决了所有 12 个问题,在 60 题 IMO 风格基准上将表现从不到 10% 提升至 70%。
研究人员 @alexwei_、@HongxunWu、@wjmzbmr1 在 OpenAI 播客中说明其模型发现了一个关于恩斯特·艾尔德斯猜想的反例,该猜想已有 80 年历史。该合作展示了数学家与模型共同进行的发现过程。
ModelScope 新增了 Stable Video Infinity,来源为 VITA@EPFL,论文标注为 ICLR 2026 Oral,主打无限长度视频生成,采用 Error Recycling Fine Tuning。原文给出多项指标:SVI-Shot 在一致性视频生成上达到 93.52% 的主体一致性和 95.86% 的背景一...
Meta AI 研究团队发布新研究文献,提出 dMoE dLLMs 架构并集成可学习块级专家技术,公司报告结构包含实验数据与模型性能分析结果,具体指出了规模扩展效率提升空间等关键指标变化。
Microsoft MAI 发布 MAI-Thinking-1 35B MoE 模型,配有 256K 上下文窗、97% AIME 2025 准确率、53% SWE Bench Pro 得分, outperformed Sonnet 4.6 和 Opus 4.6。在无合成数据和蒸馏的前提下训练,提供完整扩展 ladder 配方和 MFU 数...
某人观察了uild模型在游戏中使蛇意识自身,并影响游戏进程,展示了AI在创意决策与逻辑调整中的突破。
This paper introduces a method for LLMs to save memory by pruning key-value cache using a predictor that scores token usefulness. The model keeps recent tokens and older ...
论文提出 FluxMem,将智能体记忆从静态存储改为图结构连接:把事实、历史任务片段和可复用技能作为相互关联的节点管理。系统在执行任务时先检索可能有用的记忆,再根据任务反馈修补连接关系,包括补充缺失链接、删除错误链接,以及把记忆改写到合适的细节层级;同时会把重复成功的任务路径沉淀为可复用技能。作者在长对话记忆、网页导航和通用助手任务上测试...
顾全全教授(2026年6月2日)离开字节跳动Seed,前三年带领团队在AI驱动药物发现领域推出SeedFold(首个全面超越AlphaFold 3的生物结构预测模型)、SeedProteo(蛋白质结合设计模型)和DPLM系列蛋白质语言模型,并在大模型训练领域搭建可扩展预训练技术栈支持Seed 2.0训练。该工作将AI应用于真实医疗场景并推...
MiniMax 发布开源模型 M3,集成前沿 Coding 能力、1M 超长上下文和原生多模态,SWE-Bench Pro 得分 59.0% 超越 GPT-5.5;xAI 前负责人预测视频生成将演化为视频 Agent;Chromium 构建 AI Coding 规范体系;Rishabh Bhargava 介绍语音智能体工程化实践。