一句话判断
该结果展示了通过KV-cache复用和工具调用压缩等运行时优化而非模型微调提升性能的方法,值得关注开源Agent工具的进步。
核心信息
Atomic Agent在GAIA Level 1基准测试中以69.8%正确率超越Hermes的58.5%,速度快1.6倍(3h12m vs 5h10m),使用相同4-bit Qwen-3.6-35B模型和Apple M4 Max硬件,开源MIT许可。
原始内容
相关动态
Claude Opus 5 在 AA-Briefcase 基准上领先 Fable 5,成本更低
Artificial Analysis 发布评测,Claude Opus 5 在 AA-Briefcase 基准上以 1720 Elo 领先,比 Claude Fable 5 高 146 点,成本降低 20% 至 $17.79 每任务,但推理时间更长,max 设置平均 36.2 分钟。
Opus 5 性能大幅提升
在发布仅两个月内,Opus 5模型在ARC-AGI 3基准上从Opus 4.8的低于5%提升至超过30%,并在Artificial Analysis基准上以比Fable 5低26%的成本提供相当智能。
OpenCode爆炸增长数据
Y Combinator 在播客中披露,OpenCode(开源替代 Claude Code 和 Codex 的 AI 编码工具)自年初起增长至 460 万周活用户、1300 万月活用户,年化收入约 4000 万美元,处理了 7 万亿 tokens,CEO Jay V 谈到 Anthropic 争议和 20 倍增长驱动因素。
Grok 4.5 在发票处理测试中击败竞品
Ramp 测试了 Grok 4.5 等模型在 150k 张真实发票上的表现,Grok 4.5 获得最高完美提取率,击败了 Gemini Flash 3.6、GPT 5.6 Terra 和 Sonnet 5。
vLLM 发布 AFD 插件实现 MoE 推理优化
vLLM 发布实验性插件 vLLM AFD Plugin,实现 Attention-FFN Disaggregation (AFD),将 MoE 模型的注意力路径与专家路径分离为独立服务,支持独立扩缩,兼容 NVIDIA GPU 和 Ascend NPU。