一句话判断
新增了多个前沿模型在IMO上的具体表现对比,包括Fable速度、Sol成本、Axiom的Lean证明能力,值得关注原文的详细数据和推理过程。
核心信息
Claude Fable 5、GPT 5.6 Sol、Kimi K3和Axiom Math四款AI模型在IMO 2026中获得满分42/42。Fable 5用1次尝试最快,Sol用1次尝试最便宜,K3用4次尝试消耗大量token,Axiom Math在Lean中证明了所有题目。学生需9小时完成6题,Fable和Sol用时不到4小时。
原始内容
相关动态
NVIDIA Vera Rubin 平台发布
NVIDIA 发布 Vera Rubin 平台,性能功耗比提升 10 倍;CoreWeave 等云服务商部署 Vera Rubin NVL72,每兆瓦 token 数比 Blackwell 多 10 倍;DeepInfra 基准测试显示 Vera CPU 速度是其他 CPU 的 2 倍以上,支持更多并发 AI 代理。
Laguna S 2.1 from @poolsideai is live on OpenRouter!
Poolside AI发布了Laguna S 2.1,一个面向agentic编码和长时域工作的开放权重118B-A8B MoE模型,支持1M上下文窗口。该模型在Terminal-Bench 2.1上获得70.2%的分数,在DeepSWE上获得40.4%的分数。
Google DeepMind 发布 Gemini 3.6 Flash 等三款新模型
Google DeepMind 发布三款新模型:Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。Browser Use 评测显示,Gemini 3.6 Flash 在 BU 基准上达到 68%,超越 GPT-5.6-sol(67%)和 Sonnet 4.6(62%),仅次于 Opus 4...
Grok 4.5 集成 Microsoft Outlook
Grok 4.5 现可直接在 Microsoft Outlook 中使用,支持总结邮件线程与附件、识别决策与待办任务、以用户语气起草回复、搜索网络和 𝕏,以及整理、归档、删除或标记邮件。
Anthropic 1.5亿美元和解作者版权诉讼
美国法官批准Anthropic支付1.5亿美元给作者,作为其使用盗版书籍训练Claude的版权和解金。这是美国版权案件中最大和解,涉及700万本盗版书,91%作者已领取份额。法院裁定训练属于合理使用,但存储盗版副本构成侵权。