一句话判断
对比公开信息,Opus 5 在无先验问题求解上实现了三倍于次优的提升,值得深入关注其技术细节。
核心信息
Opus 5 在 ARC-AGI-3 基准上取得 30% 的得分,刷新该基准的 SOTA,且得分是次优模型的三倍。
原始内容
相关动态
Gemini 3.6 Flash 多智能体系统实时迭代游戏设计
Google AI Developers展示了基于 Gemini 3.5 Flash-Lite 和 3.6 Flash 的多智能体系统,实时迭代可玩游戏设计,利用 Flash-Lite 进行设计、构建和验证拼图挑战,基于玩家实时行为平衡速度与推理。
OPUS 5超越Fable 5
Chubby♨️发布OPUS 5模型对比,声称在大多数评估中超越Fable 5。核心数据为评估结果比较,但未具体披露参数量、版本号或具体分数
Claude Opus 5登顶ARC-AGI-3
ARC Prize 公布 Anthropic 的 Claude Opus 5 在 ARC-AGI-3 基准上达到 30.2% 的新 SOTA,远超前最高分 7.8%(由 GPT-5.6 Sol (Max) 创造),并展现出解决之前未击败环境的新颖行为。
Anthropic 发布 Claude Opus 5:接近前沿智能,成本仅为 Fable 5 一半
Anthropic 发布 Claude Opus 5,在多个基准测试中接近或超越 Fable 5,但成本仅为一半:CursorBench 差 0.5% 成本减半,OSWorld 超越且成本低三分之二,ARC-AGI 3 得分是次优模型的 3 倍,Frontier-Bench 性能是 Opus 4.8 的两倍多。定价与 Opus 4.8 相...
中国AI芯片自给提速:进口依赖降至60%以下
据WSJ报道,中国AI芯片进口依赖从2021年的90%降至2025年的60%以下,摩根士丹利预计2030年降至25%。华为的Ascend芯片已可替代部分Nvidia任务,但其最强芯片算力仅为Nvidia最佳芯片的四分之一,且仍依赖外国设备。