Kimi K3 开源模型开启新技术范式
通义千问团队发布 Kimi K3 模型,参数规模达到 2.8T,上下文窗口达 100 万 token,实现原生多模态能力。通过 Delta Attention 优化耗时减少 6.3 倍,Attention Residual 机制在不到 2% 额外成本下实现训练效率提升约 25%,专为长期 horizons agent 和自演化 workf...
围绕 技术报告 的精选动态、来源摘要和重要性判断。
通义千问团队发布 Kimi K3 模型,参数规模达到 2.8T,上下文窗口达 100 万 token,实现原生多模态能力。通过 Delta Attention 优化耗时减少 6.3 倍,Attention Residual 机制在不到 2% 额外成本下实现训练效率提升约 25%,专为长期 horizons agent 和自演化 workf...
Microsoft 及合作者提出 OAT,一种轻量级归因器,仅在成功轨迹上训练,利用神经控制微分方程建模成功动态,将故障归因转化为成功模式的一类学习,无需标注错误步骤或失败数据。
Google DeepMind 发布 Gemma 4 技术报告,模型家族参数从 2.3B 到 31B,涵盖密集和 MoE 架构。12B 模型采用无编码器设计,2.3B 有效参数模型匹配 Gemma 3 27B 性能。31B 模型在 Arena Text 排名 43,支持思考模式,AIME 2026 达 89.2%,GPQA Diamond...
Artificial Analysis 发布六项新的行业能力基准,覆盖金融、法律、医疗、策略与运营、工程和经济六个领域。基准结果显示,Claude Fable 5(搭配 Opus 4.8 回落)在全部八项指数中排名第一,Claude Opus 4.8(最大版)在六项指数中位列第二,GPT-5.5(xhigh)在两项指数中位列第二。在开源模...
Sakana AI 发布 Fugu 技术报告,介绍一种多模型编排系统,包含 Regular(快速路由)和 Ultra(动态工作流)两个版本。核心创新在于通过轻量层学习用户请求,动态选择最适合的专家模型或构建协作流程,区别于简单的投票或固定规则方法。
DAIR.AI转述一篇论文,分析了来自21家提供商的67个模型,证明任何路由、投票、级联或混合代理策略的准确率上限为1减去beta(所有候选模型都答错的查询比例)。论文指出,常用去相关假设不能保证改进空间,实际共失败高度集中在答案格式而非主题,建议在采用组合策略前先测量beta。
OpenAI 发布 GPT-5.6 预览系统卡,包含 Sol、Terra、Luna 三个版本。Sol 在网络安全和生物/化学领域被列为高风险,内部网络挑战集准确率 96.7%,外部测试发现真实零日漏洞。生物评估中 3/4 高风险阈值项目通过,病毒学故障排除得分 55.5% 远超专家 31% 基准。Sol 定价 $5/1M 输入、$30/1...