Signal Brief

多个模型IMO 2026满分

Berryxia.AI博主测试了GPT-SOL-5.6-High、Qwen3.8-Max-Preview、KIMI K3和Claude-Fable-5在IMO 2026大赛中的表现,前三个模型均获得满分42分(6道题),耗时分别为14分58秒、45分钟、1小时32分6秒,而Claude-Fable-...

twitter关注列表 Berryxia.AI (@berryxia) 发布 2026-07-21 收录 2026-07-21 观察

一句话判断

值得关注这些模型在数学推理上的突破,建议进一步查看独立评测或官方结果验证。

核心信息

Berryxia.AI博主测试了GPT-SOL-5.6-High、Qwen3.8-Max-Preview、KIMI K3和Claude-Fable-5在IMO 2026大赛中的表现,前三个模型均获得满分42分(6道题),耗时分别为14分58秒、45分钟、1小时32分6秒,而Claude-Fable-5未完成任务。去年只有Gemini Deep Think和OpenAI模型获得35分,今年多个主流模型稳定满分。

原始内容

这个是题目官网,感兴趣的自己可以去测试一下: https://www.imo-official.org/problems/2026/ > **引用原帖 Berryxia.AI (@berryxia):** > 兄弟们,国产模型高光时刻来了。结果有点牛逼。 > 去年IMO大赛,只有Gemini Deep Think和一个实验性OpenAI模型勉强拿到35分。 > 而就在今年刚刚结束IMO 2026 大赛中,我实测了模型GPT-SOL-5.6-High 、Claude-Fable-5 、Qwen3.8-Max-Preview、KIMI K3 模型,满分为42分,6道题目。 > 结论: 3个模型全部执行完成任务并且得分为满分42分,Fable 5 把我的额度干没了还没有完成任务。 > 因为结果都正确,时间排序如下: > 1、 GPT-SOL-5.6-High (14m58s), > 2、Qwen3.8-Max-Preview (45mins), > 3、Kimi K3 (1h32m6s) > 每个模型都是一次性解决所有问题,与博主@@deedydas 测试的时间和次数有点不同。基本都是一次性在CLI终端跑完。 > 去年还是“接近人类顶尖水平”,今年已经变成多个主流模型都能稳定一次过。 > 数学竞赛这种需要严密推理、多步推导、创造性解题的顶级人类挑战,现在对前沿模型来说已经不是障碍了。 > 速度的问题也可能受到API速率和算力的影响,真的没有想到如今已经IMO都可以轻松完赛啊! > 真的是感慨AI的前沿领域已经正式远远超越了国际数学奥林匹克竞赛(I​​MO)的数学范畴啊。 > https://x.com/berryxia/status/2079580532682440772

相关动态

01

NVIDIA Vera Rubin 平台发布

NVIDIA 发布 Vera Rubin 平台,性能功耗比提升 10 倍;CoreWeave 等云服务商部署 Vera Rubin NVL72,每兆瓦 token 数比 Blackwell 多 10 倍;DeepInfra 基准测试显示 Vera CPU 速度是其他 CPU 的 2 倍以上,支持更多并发 AI 代理。

twitter关注列表2026-07-21#技术突破#产品发布#AI
值得跟进
04

Grok 4.5 集成 Microsoft Outlook

Grok 4.5 现可直接在 Microsoft Outlook 中使用,支持总结邮件线程与附件、识别决策与待办任务、以用户语气起草回复、搜索网络和 𝕏,以及整理、归档、删除或标记邮件。

twitter关注列表2026-07-21#AI#产品更新#大模型
观察