一句话判断
该模型在极低训练资源下实现了高性能视频生成,混合注意力架构值得关注。
核心信息
Enze Xie 团队发布 SANA-Video 2.0,采用混合线性-softmax 注意力、块注意力残差和 Sol-Engine 加速,统一 5B 和 14B 模型,在 16 节点 H100 上训练 5B 模型,VBench 总分 84.30,单 H100 生成 720p/5s 仅需 13.06s,速度比 Wan 2.2-A14B 快 120 倍。
原始内容
相关动态
PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning
PRO-LONG方法通过保留所有过去动作的搜索日志,使编码代理在长期任务中更可靠。在ARC-AGI-3的25个隐藏规则游戏中,该方法将基础代理性能平均提升18个百分点,同时使用4.2到5.8倍更少的计费令牌。
Offloop多智能体超越Claude Code
Offloop 4 人团队公布其多智能体 harness 在 GDPval 基准上以 84.9 分、单任务成本 $1.65 超越 Claude Code(Opus 4.8 得 82.4 分、$14.38) 与 Codex(GPT 5.6 Sol 得 83.3 分、$5.20),并声称在 GDP.pdf(44 分) 与 JobBench(6...
Ant Ling 发布 Ling-3.0-flash 模型
Ant Ling 发布 Ling-3.0-flash 混合推理 MoE 模型,124B 参数,仅 5.1B 活跃参数,采用 KDA+MLA 混合注意力机制,支持 256K 上下文。以 1/8 总参数量和 1/12 活跃参数量,在多数基准上匹配或超越其 1T 旗舰模型。SGLang 正与其团队合作提供 day-0 支持。
Codex GPT Live 跨项目协作与屏幕读取能力
Codex GPT Live 提供跨项目协作、跨桌面文件交互、语音直对聊及屏幕内容读取能力,支持读取当前活动窗口的图像和文本进行分析。
FLUX 3 发布:真实世界模型
Black Forest Labs 发布 FLUX 3,定位为真实世界模型,将图像、视频、音频、语言整合进多模态 flow 架构,强调模态间的互约束以逼近世界表征。产品线分为 Video(最长 20 秒、原生音频)、Image(即将推出)和 Action(动作预测)。