一句话判断
首个在 GDPval 上以大幅成本优势击败 Claude Code 与 Codex 的多智能体系统,值得关注其架构细节与复现可能性。
核心信息
Offloop 4 人团队公布其多智能体 harness 在 GDPval 基准上以 84.9 分、单任务成本 $1.65 超越 Claude Code(Opus 4.8 得 82.4 分、$14.38) 与 Codex(GPT 5.6 Sol 得 83.3 分、$5.20),并声称在 GDP.pdf(44 分) 与 JobBench(67.2 分) 亦达 SOTA,GDPval 覆盖 44 个职业、9 大行业、对应约 $2.4 万亿美元美国知识工作薪资。
原始内容
相关动态
PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning
PRO-LONG方法通过保留所有过去动作的搜索日志,使编码代理在长期任务中更可靠。在ARC-AGI-3的25个隐藏规则游戏中,该方法将基础代理性能平均提升18个百分点,同时使用4.2到5.8倍更少的计费令牌。
Kimi K3 max vs. GPT-5.6 Sol max 软件工程基准对比
togethercompute 团队 @zainhas 在 DeepSWE 基准上对比了 Kimi K3 max 和 GPT-5.6 Sol max。pass@1: GPT 72.7%, Kimi 68.5%;pass@2: GPT 81.0%, Kimi 82.0%;pass@4: GPT 85.8%, Kimi 89.4%。Kimi ...
SANA-Video 2.0 发布
Enze Xie 团队发布 SANA-Video 2.0,采用混合线性-softmax 注意力、块注意力残差和 Sol-Engine 加速,统一 5B 和 14B 模型,在 16 节点 H100 上训练 5B 模型,VBench 总分 84.30,单 H100 生成 720p/5s 仅需 13.06s,速度比 Wan 2.2-A14B 快...
APEC 发布联合声明支持开源模型
APEC的21个成员国(包括美国和中国)发布联合声明,支持开源模型和开源项目,并鼓励APEC成员与开源社区合作。
Ant Ling 发布 Ling-3.0-flash 模型
Ant Ling 发布 Ling-3.0-flash 混合推理 MoE 模型,124B 参数,仅 5.1B 活跃参数,采用 KDA+MLA 混合注意力机制,支持 256K 上下文。以 1/8 总参数量和 1/12 活跃参数量,在多数基准上匹配或超越其 1T 旗舰模型。SGLang 正与其团队合作提供 day-0 支持。