发生了什么
一篇论文展示了一个7B规模的强化学习模型能够指挥GPT‑5、Claude Sonnet 4和Gemini 2.5 Pro等顶级大模型完成自然语言子任务,并在GPQA Diamond、LiveCodeBench、AIME25等基准上超过单一模型,平均每题仅调用三次大模型。
为什么值得关注
该工作证明了端到端学习指挥大模型的可行性,揭示了未来AI系统的高效协同与自动化设计方向。
信息来源
以下内容来自公开来源,可打开原文继续核验。
一篇论文展示了一个7B规模的强化学习模型能够指挥GPT‑5、Claude Sonne
一篇论文展示了一个7B规模的强化学习模型能够指挥GPT‑5、Claude Sonnet 4和Gemini 2.5 Pro等顶级大模型完成自然语言子任务,并在GPQA Diamond、LiveCodeBench、AIME25等基准上超过单一模型,平均每题仅调用三次大模型。
打开原始来源 ↗