一句话判断
获取 AMD 首次 MoE 模型的完整训练流程及 FarSkip 架构细节,提供多阶段检查点和复现代码
核心信息
AMD 发表 Instella 16B MoE 基础模型,全程开源,提供预训练、长上下文、精调、DPO 及强化学习等多个阶段的检查点,公布数据集、训练方案及复现代码,这是 AMD 首个 MoE 基础模型,也是首个采用 FarSkip 架构的模型。
原始内容
相关动态
黄仁勋一天内敲定韩国9500亿美元AI供应链合作
黄仁勋在一天内会见韩国总统李在明、三星李在镕、SK海力士崔泰源,签下总额约9500亿美元的五年合作协议,核心锁定HBM内存供应,SK海力士签署长期供应及共同开发协议,三星与博通达成2000亿美元MOU覆盖至2030年,涵盖2nm代工及先进封装。同时,黄仁勋在X平台发布联署25家公司的公开信,支持开放模型,强调开放模型对美国AI领导力的重要...
闭源巨头的开放权重阳谋
这篇文章剖析了OpenAI、Anthropic、Google、Amazon、Microsoft、NVIDIA、Meta、xAI和Apple等美国AI巨头围绕开放权重的商业模式与立场。OpenAI从缺席转为入列,Anthropic推出定价仅为Fable一半的Opus 5以扩大闭源市场,Ollama因开放模型需求迅速增长,暂缓Max新订阅。G...
Anthropic谈Claude Code上下文规则精简
Anthropic在发布Fable 5和Opus 5后,精简了Claude Code约80%的系统提示词,且编程评测无损失。他们总结了6条上下文管理趋势:从给规则到让模型运用判断力;从具体示例到设计接口;从全部前置上下文到渐进式披露;避免重复;从手动记录到自动记忆;从简单规则到丰富引用。
Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems
论文提出Agentic Context Management框架,通过5部分(architecting, ingesting, scoping, anticipating, compacting with consolidation)管理AI agent上下文,其系统Maximem Synap在LongMemEval取得92%准确率,在L...
Induction Labs 发布 Photon-1 想象模型
Induction Labs 发布想象模型 Photon-1,该模型通过在潜空间学习 18 年屏幕录制视频的因果关系且无需动作标签,采用 JEPA 架构,预训练成本声称比 Gemini 3.1 Flash 低 30 倍且效果更优,动作仍需后训练 RL 习得。