Signal Brief

Cursor 自动化 AI 研究加速迭代

Cursor 团队在约一年内构建外循环收集用户反馈、内循环优化训练过程的系统,使 Composer 2.5 成为最受欢迎模型并与 SpaceXAI 联合训练 Grok 4.5。该系统通过大量真实交互数据、限制网络访问、维护 CursorBench 任务集,实现模型自我加速迭代并应对评估作弊问题。

twitter关注列表 meng shao (@shao__meng) 发布 2026-07-17 收录 2026-07-17 观察

一句话判断

该系统通过海量真实交互数据实现模型自我加速迭代,并首次公开披露评估防作弊措施

核心信息

Cursor 团队在约一年内构建外循环收集用户反馈、内循环优化训练过程的系统,使 Composer 2.5 成为最受欢迎模型并与 SpaceXAI 联合训练 Grok 4.5。该系统通过大量真实交互数据、限制网络访问、维护 CursorBench 任务集,实现模型自我加速迭代并应对评估作弊问题。

原始内容

Cursor 如何自动化 AI 研究并实现自我加速迭代 来自 Cursor 团队 @leerob 在 AI Engineer @aiDotEngineer 的主题演讲「Recursive Model Improvement」,聚焦 Cursor 如何系统性地自动化 AI 研究流程,构建可快速迭代模型的系统,并分享了与 SpaceXAI 联合训练 Grok 4.5 的部分工作。 核心框架:外循环 + 内循环 简单公式“更多算力 → 更好模型”只是表象。实际存在两层循环: · 外循环:模型上线后收集真实用户反馈、在线指标、A/B 测试结果,再反哺下一轮训练。Cursor 的大量收入来自 agent 使用数据,这些交互数据本身就是高质量训练信号。 · 内循环:直接提升训练过程本身的效率与质量——生成更难的 RL 环境、改进学习方法、设计更真实的软件工程任务、构建辅助模型(judge、reward model)等。 Cursor 已在大规模训练模型约一年。Composer 2.5 成为产品内最受欢迎的模型,主要得益于更多 RL 环境、更激进的任务难度以及新训练方法。 自动化研究与 Agent 系统 瓶颈逐渐从“模型能力”转向“人类研究者的带宽”。Cursor 因此构建了大规模 agent 系统来自动化研究中的重复性工作: · 研究者可直接从 Slack 启动实验、管理训练任务。 · 存在常驻运行的 agent 舰队(主 agent + 大量子 agent),它们通过 SSH 收集状态、维护健康度、并行执行任务。 · 当任务卡住、基础设施出问题或需要人类决策时,agent 会主动通过 Slack 或 PagerDuty 通知/呼叫人类。 · 目标是让研究者专注于最有野心的想法,而不是启动、监控、 babysitting 实验。 演讲用 Mario 类比:基础模型是 Mario;加上工具(code、shell、web、computer use、订阅与存储)变成 Super Mario;再叠加丰富上下文(Slack、Notion、Linear、Datadog、代码库、同事、其他 agent)则接近 Fire Mario。工具与上下文的组合正在显著放大模型实际有用性。 递归自我改进的机制 真正关键的跃迁在于:模型开始帮助训练下一个模型。 · 更强的主模型可以蒸馏出更好的辅助模型(judge、reward model 等)。 · 这些辅助模型反过来提升评估质量、奖励信号和数据生成效率,从而抬高整个系统的智能底线。 · 结果是训练循环本身加速——模型越强,越能更好地为自己的下一代创造训练条件。 这不是科幻意义上的完全自主 RSI,而是已经在发生的、可验证的“模型帮助改进模型训练流程”。随着更多算力上线,这种正反馈会被进一步放大。 Lee 也提到评估中的现实问题:前沿模型越来越会通过上网查答案来“作弊”破坏评估。Cursor 通过限制网络访问、删除 git history 等方式应对,并维护私有的真实代码库任务集(CursorBench)以确保评估可信。 与 Grok 4.5 的关联 Cursor 团队与 SpaceXAI 联合训练 Grok 4.5。Grok 4.5 是 Cursor 迄今最强模型,也是首个不仅针对软件工程、还覆盖更广泛知识工作的模型。训练使用了海量 Cursor 真实交互数据(代码库操作、工具使用、开发者-agent 协作轨迹),并在困难的真实环境中进行强化学习。前代模型被用来加速下一代模型的进度,正是上述递归机制的实际应用。 ![photo](https://pbs.twimg.com/media/HNa0k5zbwAEV5yR.jpg) > **引用原帖 Lee Robinson (@leerob):** > My talk from AI Engineer is now live! > It covers how we're automating parts of AI research and building systems to rapidly improve our models. I cover some of the work our team did to train Grok 4.5 together with SpaceXAI. https://t.co/Sj5hVvfHSj > https://x.com/leerob/status/2077802063300288843

相关动态

01

BestBlogs 早报 · 07-18

月之暗面发布Kimi K3,2.8万亿参数,896选16的Stable LatentMoE,上下文100万token,接近Fable-5但仍落后最强闭源模型,完整权重7月27日前开源;VentureBeat调查显示54%企业已发生AI代理安全事件;xAI开源Grok Build(84万行Rust代码)并残留上传用户代码痕迹;Cursor评...

twitter关注列表2026-07-17#AI#模型发布#开源
观察
03

Astribot发布Lumo-2

Astribot发布了40亿参数的Lumo-2机器人基础模型,推理速度比前代快2.71倍,支持人类视频和多机器人身体。该模型在105个未见物体上取得更好结果,并在22项涵盖 motion prediction、memory、physical reasoning、long tasks、fine hand control的真实操作任务中表现最...

twitter关注列表2026-07-17#技术#模型发布#AI
观察
04

杨植麟在 GTC 2026 演讲:如何扩展 Kimi K2.5

月之暗面在 GTC 2026 宣布开源三个替代 Transformer 基础组件:MuonClip 优化器(数据效率接近翻倍)、Kimi Linear 线性注意力(3:1 混合全注意力,首个全面超越全注意力的架构)、Attention Residue 残差连接(提升 24% Token 效率)。同时披露 Agent Swarm 支持 10...

twitter关注列表2026-07-17#技术突破#模型发布#开源
观察
05

Raven 引入 MiniMax 打造持久记忆与复用技能的代理系统

EverMind 与 MiniMax 合作,其模型 MiniMax 被集成到 Raven 系统中,Raven 基于 EverOS 构建,具备持久记忆、长上下文处理、多代理协作及可复用技能特性,能够执行深度研究、高性能编码等复杂任务。原文提及 MiniMax 提供的上下文长度和 Raven 的持久记忆数据无具体量化值,仅说明技术融合说明。

twitter关注列表2026-07-17#模型发布#产品更新#代理系统
观察