一句话判断
提供首次数学反例证明,展示AI在形式化数学验证中的突破性应用
核心信息
Levent Alpöge在Anthropic完成对87年前未解决数学猜想的反例发现,证明yaqūjīzé jiāujiàn(雅各比猜想)存在无法恢复单一输入的多项式映射,验证已通过Lean数学形式化检查。与人类研究者相比,AI通过计算数学探索发现此反例,展现数学证明领域AI能力增强。
原始内容
相关动态
Qwen-Image-3.0 发布
Alibaba Qwen 团队发布了第三代图像生成基座模型 Qwen-Image-3.0。该模型支持高达 4.5k tokens 的长提示词,可实现复杂的布局生成(如报纸、分镜脚本、3x3 信息图),具备 10px 级别清晰的文本渲染能力,并支持 12 种语言和 100 多种艺术风格。
Codex 1000万付费用户推动OpenAI进军企业市场
OpenAI的Codex已突破1000万付费用户,其中大量用户选择Pro层套餐,这直接冲击了Anthropic在B2B和企业市场的收入优势。文章指出,OpenAI正通过Codex向高价值专业客户市场渗透,而Anthropic因竞争压力被迫保留Fable 5在Max层套餐中,这种竞争有望加速Opus 5和Fable 5.5的发布。
Nanbeige4.2 发布 Looped Transformer 和 Agent 模型
Nanbeige 在 ModelScope 发布 Nanbeige4.2 系列,包含一个 28T-token 的 Looped Transformer base 模型和一个 3B 参数的 SFT+RL agent 模型。团队声称在 agent 基准测试上超越 Qwen3.5-9B 和 Gemma4-12B。
dots-note-3.0获IMO满分金牌
小红书dots团队的大模型dots-note-3.0在第67届IMO中获得42分满分,超过金牌线13分,成为全球首个在IMO官方评卷中斩获满分的大模型,也是中国首个IMO金牌大模型。此前Gemini Deep Think曾获35分。该模型采用智能体化推理系统和加强归纳法,并计划近期开源。
Anthropic 用 Claude Code 实现百万行代码迁移新模式
Anthropic 团队使用 Claude Code 将 Zig 项目迁移到 Rust,百万行代码不到两周完成,100% 测试通过,仅 19 个回归问题全部修复,成本约 16.5 万美元。文章介绍了六步迁移流程,强调以强 judge 和对抗 agent 验证测试断言,可复制的工厂流水线模板将语言级重构门槛降至小团队可行。