← 返回精选动态
精选动态

Constitutional Classifiers: Defending against universal jailbreaks

Anthropic 发表 Constitutional Classifiers++(约1% 额外计算成本)

更新于 2026年05月21日 14:55 2 条公开来源

发生了什么

Anthropic 发表 Constitutional Classifiers++(约1% 额外计算成本)

为什么值得关注

这篇值得看原文的重点在于其两阶段 exchange classifier 设计,以及它在成本、拒答率和攻击成功率上的量化改进,适合关注模型安全防护方案的人参考。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

Next-generation Constitutional Classifiers

Anthropic-research 2026年01月10日 01:17

Anthropic 发布了新论文《Next-generation Constitutional Classifiers: More efficient protection against universal jailbreaks》,介绍用于防御 jailbreak 的第二代 Constitutional Classifiers++。相比第一代系统将 jailbreak 成功率从 86% 降到 4.4%、计算成本增加 23.7%、无害问题拒答率上升 0.38%,新系统采用两阶段 ensemble 架构:先用低成本 probe 观察 Claude 的内部激活,再把可疑交互交给更强的 classifier,同时改为同时检查对话输入和输出。Anthropic 表示,新系统把额外计算成本降到约 1%,成功攻击率是其测试过的最低水平,且尚未发现 universal jailbreak;在 GPQA Diamond 上,部分 jailbreak 方法会把模型表现从 74% 降到最低 32%。

打开原始来源 ↗
02

Constitutional Classifiers: Defending agai

Anthropic-research 2025年02月03日 20:35

Anthropic Safeguards Research Team 发表论文《Constitutional Classifiers: Defending against universal jailbreaks》,提出一套基于输入/输出分类器的防越狱系统,用合成数据训练后可拦截大多数 jailbreak,同时尽量减少误拒和计算开销。人工红队测试中,183 名参与者在两个月内累计投入估计超过 3,000 小时,针对 10 个“禁用”查询攻击 Claude 3.5 Sonnet(June 2024)原型系统,最高奖励为 15,000 美元,但未发现单次可让模型对全部 10 个问题都作答的 universal jailbreak。自动化评测中,Anthropic 生成了 10,000 个 jailbreak prompts,Claude 3.5 Sonnet(October 2024)在无防护时 jailbreak success rate 为 86%,加入 Constitutional Classifiers 后降至 4.4%;同时,生产流量上的拒答率并未显著上升,计算成本仅中度增加,最新版本将误拒率额外增加控制在 0.38%。

打开原始来源 ↗
← 返回精选动态