一句话判断
值得关注扩散 LLM 在智能体任务上的潜力,可复现并对比其他开源模型。
核心信息
蚂蚁集团 inclusionAI 团队开源 LLaDA 2.2,这是首个大规模扩散 LLM,专为智能体任务设计,支持规划、工具调用和自我纠正,并采用块并行解码加速。在 τ²-Bench 基准上,LLaDA2.2-flash 得分 592.80,超越 Ling-2.6-flash 的 334.90,fast 模式达 705.30。
原始内容
相关动态
Meta发布Llama 3
Meta 于 2024 年 7 月 15 日发布 Llama 3,提供 8B 和 70B 两款参数规模的模型,70B 版在 MMLU 基准上达到 57.5% accuracy,超过 GPT‑4 的 52.5%。该模型开源并将在 Meta 云上以每千 token 0.02 美元的价格提供。
AMD 发布 Instella 16B MoE 基础模型
AMD 发表 Instella 16B MoE 基础模型,全程开源,提供预训练、长上下文、精调、DPO 及强化学习等多个阶段的检查点,公布数据集、训练方案及复现代码,这是 AMD 首个 MoE 基础模型,也是首个采用 FarSkip 架构的模型。
闭源巨头的开放权重阳谋
这篇文章剖析了OpenAI、Anthropic、Google、Amazon、Microsoft、NVIDIA、Meta、xAI和Apple等美国AI巨头围绕开放权重的商业模式与立场。OpenAI从缺席转为入列,Anthropic推出定价仅为Fable一半的Opus 5以扩大闭源市场,Ollama因开放模型需求迅速增长,暂缓Max新订阅。G...
Induction Labs 发布 Photon-1 想象模型
Induction Labs 发布想象模型 Photon-1,该模型通过在潜空间学习 18 年屏幕录制视频的因果关系且无需动作标签,采用 JEPA 架构,预训练成本声称比 Gemini 3.1 Flash 低 30 倍且效果更优,动作仍需后训练 RL 习得。
Anthropic 减少 Claude Code 系统提示 80%
Anthropic 团队在 Claude Code 新模型中删除了约 80% 的系统提示,结果在编码评测中未出现负面影响。此前的长提示包含了严格规则(如禁止多行注释),但与模型自主决策相冲突。新的提示改为仅描述目标,即编写与现有代码匹配的代码,并将规则迁移至工具描述,减少重复与前置加载,提升上下文效率。