Signal Brief

研究者用GPT-5.6解决6个Erdős问题

研究者Shouqiao Wang使用OpenAI的GPT-5.6 Sol Ultra在Codex环境中,在5天内提出了6个Erdős问题的证明方案,并公布了完整的研究过程。工作流程包括多次迭代:尝试、失败、诊断、新方法、证明草稿、对抗性审计、修复。

twitter关注列表 Chubby♨️ (@kimmonismus) 发布 2026-07-23 收录 2026-07-23 观察

一句话判断

值得阅读原文了解其工作流程和证明的可靠性。

核心信息

研究者Shouqiao Wang使用OpenAI的GPT-5.6 Sol Ultra在Codex环境中,在5天内提出了6个Erdős问题的证明方案,并公布了完整的研究过程。工作流程包括多次迭代:尝试、失败、诊断、新方法、证明草稿、对抗性审计、修复。

原始内容

wtf is happening: A researcher says he used GPT-5.6 Sol Ultra in Codex to produce proposed solutions to six (!) Erdős problems, and published the full research trail. He says GPT-5.6 Sol Ultra in Codex produced proposed proofs for six Erdős problems. His prompts explicitly reject special cases, circular reductions and unsupported lemmas. They preserve multiple incompatible approaches and use independent agents to attack every candidate proof. Codex then continues without further interaction: "attempt -> failure -> diagnosis -> new approach -> proof draft -> adversarial audit -> repair." science is accelerating at unprecedented speed. > **引用原帖 Shouqiao Wang (@Qiaoqiao2001):** > I solved 6 open Erdős problems in 5 days, using @OpenAI GPT-5.6 Sol. > I have a math background, but the Codex workflow I used does not require deep mathematical knowledge. > Here’s exactly how I approached it, including my prompts 🧵 > https://x.com/Qiaoqiao2001/status/2080003441821163958

相关动态

03

京东开源 JoyAI-VL-Interaction 实时视频交互模型

京东开源了 8B 参数的 JoyAI-VL-Interaction 模型,专为实时视觉驱动交互设计。在 26 个视频理解基准上平均得分 57.53,超过 Qwen3-VL-8B-Instruct 3.37 分。模型每秒处理直播视频并决定是否发言或保持沉默,交互时序通过时间对齐数据和强化学习学习,无需外部检测器。开源内容包括训练配方、数据和...

twitter关注列表2026-07-23#模型发布#技术突破#开源
观察
04

Atomic Agent 开源本地智能体发布

Atomic 发布开源本地智能体 Atomic Agent,基于 llama.cpp 运行 Qwen、Gemma、Llama 模型,通过 ARIA 快照操作浏览器、编辑文件、执行 shell 命令,具备持久化跨会话记忆,采用稳定前缀缓存降低成本及 TurboQuant 将 KV 缓存压缩 6.4 倍,在 GAIA Level 1 基准上以...

twitter关注列表2026-07-23#开源#产品发布#技术突破
观察
05

Harness Handbook论文提升编码代理规划胜率

Harness Handbook论文提出使用静态分析和LLM辅助的BGPD流程,构建从运行时行为到源码位置的映射,在60个修改请求上规划胜率从28.3%提升至38.3%和从26.7%提升至45.6%,规划器token使用下降12.7%和8.6%,文件级和符号级F1在24个对比中全面优于GPT-5.5和Opus 4.8参考计划,定位失败减少...

twitter关注列表2026-07-23#研究#技术
观察