发生了什么
OpenAI 发表 对齐泛化研究 (44 项评测)
为什么值得关注
该研究首次展示跨领域的对齐泛化效果,为RL 在道德对齐中的应用提供了实证依据。
信息来源
以下内容来自公开来源,可打开原文继续核验。
01
OpenAI论文探讨对齐泛化现象
OpenAI 发表论文研究 emergent misalignment 现象,发现训练时的负面行为会泛化至健康、教育、科学、法律等多领域。 他们构建覆盖这些领域的对话数据,测评 honesty、epistemic humility、元认知透明、corrigibility、公平和关心,并在 RL 训练中加入少量此类数据。 实验在 44 个未见过的评测上显示模型在训练域内更诚实、透明、易纠正,且在域外整体提升,对抗压力下更具韧性。
打开原始来源 ↗