一句话判断
展示了模型在解决前沿数学/密码学难题上的逻辑推理能力。
核心信息
GPT-5.6 Sol Ultra 通过 Codex 生成了构造方案和主要证明思路,协助人类专家解决了量子密码学领域一个存在六年的未解之谜。
原始内容
This was one of the bigger open questions in quantum cryptography
> **引用原帖 Chayanka_42 (@42_gravity):**
> GPT-5.6 Sol Ultra helped solve a six-year-old open problem in quantum cryptography by generating the construction and main proof ideas through Codex.
> Human experts refined and verified the result. https://t.co/aPVBNl8fQ3
> https://x.com/42_gravity/status/2080507627952562189
相关动态
01
开源模型协作推动行业进步
一群强大的共识推出声明称“我们相信、我们关心”,被认为是开源生态的重要宣言。原文基于作者情感表达,未包含技术数据或具体事件
值得跟进
02
Claude Opus 5 发布:接近 Fable 5 的智能程度,价格只有一半,与 Opus 4.8 保持同价
Anthropic 发布 Claude Opus 5,定价与 Opus 4.8 持平(输入 $5/M tokens,输出 $25/M tokens),性能接近 Fable 5 但成本仅为其半数,定位为高频可用的高端模型。基准测试显示其在 Frontier-Bench v0.1 编码任务中超越 Opus 4.8 超过一倍,ARC-AGI-3...
值得跟进
03
Opus 5 性能大幅提升
在发布仅两个月内,Opus 5模型在ARC-AGI 3基准上从Opus 4.8的低于5%提升至超过30%,并在Artificial Analysis基准上以比Fable 5低26%的成本提供相当智能。
观察
04
Atomic Agent GAIA基准胜Hermes
Atomic Agent在GAIA Level 1基准测试中以69.8%正确率超越Hermes的58.5%,速度快1.6倍(3h12m vs 5h10m),使用相同4-bit Qwen-3.6-35B模型和Apple M4 Max硬件,开源MIT许可。
观察
05
Grok 4.5 在发票处理测试中击败竞品
Ramp 测试了 Grok 4.5 等模型在 150k 张真实发票上的表现,Grok 4.5 获得最高完美提取率,击败了 Gemini Flash 3.6、GPT 5.6 Terra 和 Sonnet 5。
观察