一句话判断
值得关注这些模型在数学推理上的突破,建议进一步查看独立评测或官方结果验证。
核心信息
Berryxia.AI博主测试了GPT-SOL-5.6-High、Qwen3.8-Max-Preview、KIMI K3和Claude-Fable-5在IMO 2026大赛中的表现,前三个模型均获得满分42分(6道题),耗时分别为14分58秒、45分钟、1小时32分6秒,而Claude-Fable-5未完成任务。去年只有Gemini Deep Think和OpenAI模型获得35分,今年多个主流模型稳定满分。
原始内容
相关动态
NVIDIA Vera Rubin 平台发布
NVIDIA 发布 Vera Rubin 平台,性能功耗比提升 10 倍;CoreWeave 等云服务商部署 Vera Rubin NVL72,每兆瓦 token 数比 Blackwell 多 10 倍;DeepInfra 基准测试显示 Vera CPU 速度是其他 CPU 的 2 倍以上,支持更多并发 AI 代理。
Laguna S 2.1 from @poolsideai is live on OpenRouter!
Poolside AI发布了Laguna S 2.1,一个面向agentic编码和长时域工作的开放权重118B-A8B MoE模型,支持1M上下文窗口。该模型在Terminal-Bench 2.1上获得70.2%的分数,在DeepSWE上获得40.4%的分数。
Google DeepMind 发布 Gemini 3.6 Flash 等三款新模型
Google DeepMind 发布三款新模型:Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。Browser Use 评测显示,Gemini 3.6 Flash 在 BU 基准上达到 68%,超越 GPT-5.6-sol(67%)和 Sonnet 4.6(62%),仅次于 Opus 4...
Grok 4.5 集成 Microsoft Outlook
Grok 4.5 现可直接在 Microsoft Outlook 中使用,支持总结邮件线程与附件、识别决策与待办任务、以用户语气起草回复、搜索网络和 𝕏,以及整理、归档、删除或标记邮件。
NVIDIA Vera Rubin平台发布:性能功耗比提升10倍
NVIDIA发布Vera Rubin平台,性能功耗比较Blackwell提升10倍;CoreWeave实测显示其每兆瓦token数较Blackwell提升10倍;DeepInfra基准测试表明NVIDIA Vera CPU性能是其他CPU的2倍以上,可支持更多并发AI智能体。