发生了什么
OpenAI 发表 好行为泛化研究(RL 训练)
为什么值得关注
与已知的涌现失调(坏行为泛化)相反,OpenAI 证明好行为同样可通过 RL 泛化,且对抗攻击下更稳定,值得阅读原文了解实验设计。
信息来源
以下内容来自公开来源,可打开原文继续核验。
01
好行为泛化研究
OpenAI 通过 RL 训练模型在健康等特定领域展现诚实、认知谦逊等好行为,发现该行为泛化到 44 个未见评测领域,显著降低了欺骗、谄媚等不良输出,且模型在对抗性攻击下更稳健。
打开原始来源 ↗