发生了什么
论文 分析 LLM对抗性前缀自我报告(10模型, 4基准, 27.3%错误率)
为什么值得关注
该研究揭示了LLM自我报告安全检查的不可靠性,值得阅读原文以了解具体测试方法和模型表现。
信息来源
以下内容来自公开来源,可打开原文继续核验。
01
LLM无法可靠自我报告对抗性前缀
一篇论文在10个开源模型和4个安全基准上发现,LLM无法可靠识别自己的输出是否被对抗性前缀攻击,平均27.3%的被攻击输出被模型误认为是自身意图,模型的安全自检能力薄弱。
打开原始来源 ↗