← 返回精选动态
精选动态

一篇论文展示了一个7B规模的强化学习模型能够指挥GPT‑5、Claude Sonne

一篇论文展示了一个7B规模的强化学习模型能够指挥GPT‑5、Claude Sonnet 4和Gemini 2.5 Pro等顶级大模型完成自然语言子任务,并在GPQA Diamond、LiveCodeBench、AIME25等基准上超过单一模型,平均每题仅调用三次大模型。

更新于 2026年05月11日 19:38 1 条公开来源

发生了什么

一篇论文展示了一个7B规模的强化学习模型能够指挥GPT‑5、Claude Sonnet 4和Gemini 2.5 Pro等顶级大模型完成自然语言子任务,并在GPQA Diamond、LiveCodeBench、AIME25等基准上超过单一模型,平均每题仅调用三次大模型。

为什么值得关注

该工作证明了端到端学习指挥大模型的可行性,揭示了未来AI系统的高效协同与自动化设计方向。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

一篇论文展示了一个7B规模的强化学习模型能够指挥GPT‑5、Claude Sonne

twitter关注列表 2026年05月11日 19:07

一篇论文展示了一个7B规模的强化学习模型能够指挥GPT‑5、Claude Sonnet 4和Gemini 2.5 Pro等顶级大模型完成自然语言子任务,并在GPQA Diamond、LiveCodeBench、AIME25等基准上超过单一模型,平均每题仅调用三次大模型。

打开原始来源 ↗
← 返回精选动态