一句话判断
需关注基准测试方法论修正及训练策略调整可能性,同时留意人性化交互优化方向
核心信息
用户分析发现,Anthropic Opus 5 在基准测试中表现超出 Fable 5 并引发基准值有效性质疑。根据 Kun Chen 的观察,尽管 Opus 5 在多项指标上胜过 Fable 5,但实际应用场景中两者效能差异显著。研究指出公司在 5 系列模型训练策略上发生变化,将 Mythos 作为先导模型后通过蒸馏生成 Sonnet 和 Opus,但此策略可能导致生成效能未达预期。同时指出人性化交互体验下降,用户更偏好 Grok 和 Kimi 的使用体验。
原始内容
相关动态
NVIDIA 研究:AdamW 在大批量训练中存在规模上限
NVIDIA 研究发现,AdamW 在批量大小达到 1 亿 token 时训练稳定性下降,而 SOAP 和 Muon 保持稳定。团队通过每步 QR 正交化和改进预处理策略消除了 SOAP 在大批量下的 loss spikes,并在多十亿参数模型上训练数万亿 token 后,SOAP 和 Muon 一致优于 AdamW。
布雷德用Opus 5制作4K 120fps《暗黑行动》视频
Brad Wardell uses Opus 5 with Clairvoyance and Matt Shumer's prompt to create a Claude of Duty video, capturing at 120fps 4K resolution in a single shot.
Kimi K3: 2.8万亿参数开源模型发布
Kimi.ai 发布 Kimi K3 模型,拥有 2.8 万亿参数、100 万上下文、原生多模态能力。采用 Kimi Delta Attention 技术,在百万 token 上下文中实现高达 6.3 倍解码加速;Attention Residuals 以低于 2% 的额外成本带来约 25% 的训练效率提升。模型已上线官网、Kimi Wo...
From Memory to Skills: Evidence-Grounded Co-Evolution Governance for Long-Horizon LLM Agents
论文指出大多数代理记忆系统只保存事件并在上下文召回,导致重复推理错误。作者提出MSCE方法,将经验组织为声明性事实、诱导程序化策略和基础步骤轨迹,仅将重复模式提升为可调用的过程(如pip安装失败时运行规则),每个策略需具备触发条件、边界、正向收益估计和证据支持。
Claude Code 系统提示精简经验分享
Claude Code 的最新模型移除了约 80% 的系统提示,凸显了编写轻量级提示及技能文档的重要经验。