一句话判断
Claude Opus 5 的 ARC-AGI 3 得分是次优模型三倍,但网络安全落后,值得对比其他模型。
核心信息
Anthropic 发布 Claude Opus 5 旗舰模型,Frontier-Bench 得分超前代两倍,ARC-AGI 3 是次优模型三倍,但网络安全能力落后。Moonshot 开源 Kimi K3 开放权重模型;火山引擎开源 SearchCLI Agent 搜索技术;AMD 发布 MI455X 等硬件。
原始内容
相关动态
Meta 发布 Llama 3 8B
Meta 发布 Llama 3 8B 与 70B 两款模型,参数量分别为 8B 和 70B。 在 MMLU 基准上,8B 版本比 Llama 2 提升 5%,70B 版本提升 3%。
Sakana AI 发布 Fugu 模型
Sakana AI 发布新模型 Fugu,参数量为 1B,在 MMLU 基准上达到 75% 准确率,比同规模模型高出 5 个百分点。该模型采用高效训练技术,但未开源。
Stripe拟百亿美元收购OpenRouter
OpenRouter刚刚以13亿美元估值融资1.13亿美元,WSJ报道Stripe正谈判以约100亿美元收购OpenRouter,此举将支付与AI模型分发结合,使Stripe获得使用数据和定价影响力。
Opus 5 性能大幅提升
在发布仅两个月内,Opus 5模型在ARC-AGI 3基准上从Opus 4.8的低于5%提升至超过30%,并在Artificial Analysis基准上以比Fable 5低26%的成本提供相当智能。
OpenCode爆炸增长数据
Y Combinator 在播客中披露,OpenCode(开源替代 Claude Code 和 Codex 的 AI 编码工具)自年初起增长至 460 万周活用户、1300 万月活用户,年化收入约 4000 万美元,处理了 7 万亿 tokens,CEO Jay V 谈到 Anthropic 争议和 20 倍增长驱动因素。