Signal Brief

ISO: RLVR原生优化栈

Hanqing Zhu团队提出ISO,一个RLVR-native优化栈,包含ISO-Merger(无需数据、回滚或OPD即可合并RL专家)和ISO-Optimizer(作为AdamW/Muon的即插即用包装,在Qwen3-8B-Base上匹配AdamW精度,步骤减少约2.7倍)。

twitter关注列表 马东锡 NLP (@dongxi_nlp) 发布 2026-07-24 收录 2026-07-24 观察

一句话判断

ISO-Optimizer在减少训练步骤方面有显著效果,值得关注其具体实现和可复现性。

核心信息

Hanqing Zhu团队提出ISO,一个RLVR-native优化栈,包含ISO-Merger(无需数据、回滚或OPD即可合并RL专家)和ISO-Optimizer(作为AdamW/Muon的即插即用包装,在Qwen3-8B-Base上匹配AdamW精度,步骤减少约2.7倍)。

原始内容

ISO: An RLVR-Native Optimization Stack > **引用原帖 Hanqing Zhu (@zhu_hanqing666):** > People keep asking me: what's different about optimization in RL? > Seemingly nothing — the pre-training stack just works (Adam, even SGD 👀 @saagnikkk). > Bringing some answers from my last work (sorry for the delay — been cooking 🚀). > We introduce ISO: Isospectral Optimization: an RLVR-native optimization stack. > Built on one simple observation, spectral inheritance: RLVR can reuse the base model's spectrum and acquire new behavior purely through the singular frames. > 🧩 Offline: ISO-Merger — consolidates RL experts into one model with no data, no rollouts, no OPD. Checkpoints only. > ⚙️ Online: ISO-Optimizer — a drop-in wrapper on AdamW / Muon that matches AdamW's accuracy with ~2.7× fewer steps on Qwen3-8B-Base. > 📄 https://t.co/ty1FrAveA5 > 🌐 https://t.co/xzXf6V8ukO > 🧵👇 > https://x.com/zhu_hanqing666/status/2080020648135680215

相关动态

02

When Do Multi-Agent Systems Help? An Information Bottleneck Perspective

该论文通过信息瓶颈视角,在5个基准测试、3种模型大小、18个测试中,比较了单agent、单agent遵循任务拆分、多agent系统的性能。发现多agent系统在信息传递紧凑完整时有效,尤其对弱模型,但当后续步骤需要精确早期细节时优势减弱或逆转。

twitter关注列表2026-07-24#AI#技术#分析
观察
03

AI代码库知识图谱方法分享

Mark Ajzenstadt 分享一个团队通过先构建知识图谱再使用AI的方法,在3.5个月内完成FedEx供应商平台重建,AI生成90%代码,合并122个PR,计算成本200美元/月。

twitter关注列表2026-07-23#技术#分析#AI
观察
05

The Stack v3 发布:最大的开放代码数据集

BigCode 社区发布 The Stack v3,这是迄今最大的开放代码数据集,包含 114 TB 原始数据、15.9 TB 处理后数据、约 5T 去重 tokens,涵盖 770 种编程语言和 2.24 亿仓库,完全开放且无限制许可。相比 2024 年的 v2(68 TB raw / 550B tokens / 618 种语言),v3...

twitter关注列表2026-07-23#技术#开源#模型
观察