一句话判断
首次披露 Opus 5 在提示注入防御上的具体成功率数据及多层防御组合效果,值得阅读系统卡片了解细节。
核心信息
Claude 团队称 Opus 5 在编码、数据分析、设计、生物学、知识工作等评测中表现优异,同时强调该模型是迄今为止最不易被提示注入的模型,在结合模型对齐、提示注入探针和 Claude Code 中的 Auto Mode 后,提示注入攻击成功率降至约 0%。
原始内容
相关动态
Cursor宣布Claude Opus 5上线
Cursor平台上线Claude Opus 5模型,在CursorBench基准测试中得分66.7,与Fable 5的66.5分持平,但价格仅为后者一半(输入5美元、输出25美元每百万token),且支持零数据保留,而Fable 5仍保留数据30天。
Claude 发布 Opus 5 模型
Claude 官方发布 Opus 5 模型,称其 thoughtful and proactive,接近 Fable 5 的前沿智能,价格仅为后者一半。
Introducing Claude Opus 5
Anthropic 发布 Claude Opus 5,其智能接近 Fable 5,但价格仅为后者的一半。
Anthropic 发布 Claude Opus 5:接近前沿智能,成本仅为 Fable 5 一半
Anthropic 发布 Claude Opus 5,在多个基准测试中接近或超越 Fable 5,但成本仅为一半:CursorBench 差 0.5% 成本减半,OSWorld 超越且成本低三分之二,ARC-AGI 3 得分是次优模型的 3 倍,Frontier-Bench 性能是 Opus 4.8 的两倍多。定价与 Opus 4.8 相...
Dari 开源路由模型
Dari团队开源了用于编码agent的自动路由模型,在Terminal-Bench 2.1上达到79.8%准确率,总推理成本仅$76,相比Frontier setup成本降低70%,性能与Fable相当。该小型微调模型会根据缓存决策动态选择模型,仅在必要时调用昂贵模型。