一句话判断
值得阅读原文了解其工作流程和证明的可靠性。
核心信息
研究者Shouqiao Wang使用OpenAI的GPT-5.6 Sol Ultra在Codex环境中,在5天内提出了6个Erdős问题的证明方案,并公布了完整的研究过程。工作流程包括多次迭代:尝试、失败、诊断、新方法、证明草稿、对抗性审计、修复。
原始内容
相关动态
Ant Ling 发布 Ling-3.0-flash 混合推理 MoE 模型
Ant Ling 团队发布 Ling-3.0-flash 混合推理 MoE 模型,124B 总参数,每个 token 仅激活 5.1B 参数,在多数基准测试中匹敌或超越其 1T 参数的旗舰模型。
Ling-3.0-flash 免费提供
AntLingAGI 发布 Ling-3.0-flash(124B总参数/5.1B活跃参数),该混合推理MoE模型以1/8总参和1/12活跃参匹配或超越其1T旗舰模型,在Nous Portal免费提供一周。
京东开源 JoyAI-VL-Interaction 实时视频交互模型
京东开源了 8B 参数的 JoyAI-VL-Interaction 模型,专为实时视觉驱动交互设计。在 26 个视频理解基准上平均得分 57.53,超过 Qwen3-VL-8B-Instruct 3.37 分。模型每秒处理直播视频并决定是否发言或保持沉默,交互时序通过时间对齐数据和强化学习学习,无需外部检测器。开源内容包括训练配方、数据和...
Atomic Agent 开源本地智能体发布
Atomic 发布开源本地智能体 Atomic Agent,基于 llama.cpp 运行 Qwen、Gemma、Llama 模型,通过 ARIA 快照操作浏览器、编辑文件、执行 shell 命令,具备持久化跨会话记忆,采用稳定前缀缓存降低成本及 TurboQuant 将 KV 缓存压缩 6.4 倍,在 GAIA Level 1 基准上以...
Harness Handbook论文提升编码代理规划胜率
Harness Handbook论文提出使用静态分析和LLM辅助的BGPD流程,构建从运行时行为到源码位置的映射,在60个修改请求上规划胜率从28.3%提升至38.3%和从26.7%提升至45.6%,规划器token使用下降12.7%和8.6%,文件级和符号级F1在24个对比中全面优于GPT-5.5和Opus 4.8参考计划,定位失败减少...