一句话判断
该模型创新性地结合缓存路由来降低推理成本,值得在编码agent场景中验证复现。
核心信息
Dari团队开源了用于编码agent的自动路由模型,在Terminal-Bench 2.1上达到79.8%准确率,总推理成本仅$76,相比Frontier setup成本降低70%,性能与Fable相当。该小型微调模型会根据缓存决策动态选择模型,仅在必要时调用昂贵模型。
原始内容
相关动态
OpenClaw 创始人开放 oracle 专用开发工具
OpenAI 工程师、OpenClaw 创始人公开 oracle 开发工具,该工具原本用于访问 ChatGPT Pro,用户授权给 Codex 构建技能后可正常调用。技术细节未公开,需根据源代码自行理解。
Gemini 3.6 Flash 多智能体系统实时迭代游戏设计
Google AI Developers展示了基于 Gemini 3.5 Flash-Lite 和 3.6 Flash 的多智能体系统,实时迭代可玩游戏设计,利用 Flash-Lite 进行设计、构建和验证拼图挑战,基于玩家实时行为平衡速度与推理。
Opus 5 发布:价格减半性能领先
Anthropic 发布 Claude Opus 5,定价 $5/$25 每百万 token(与 Opus 4.8 相同),仅为 Fable 5 的一半,但在绝大多数基准测试中击败了 Fable 5。它支持五种努力设置,默认启用推理,并在编码、操作计算机等经济价值高的任务上表现更强,具有自主验证和恢复能力。
Cursor宣布Claude Opus 5上线
Cursor平台上线Claude Opus 5模型,在CursorBench基准测试中得分66.7,与Fable 5的66.5分持平,但价格仅为后者一半(输入5美元、输出25美元每百万token),且支持零数据保留,而Fable 5仍保留数据30天。
Claude 发布 Opus 5 模型
Claude 官方发布 Opus 5 模型,称其 thoughtful and proactive,接近 Fable 5 的前沿智能,价格仅为后者一半。