发生了什么
OpenAI 发表 reward-seeking 研究 (Contrastive SDF)
为什么值得关注
值得阅读原文了解Contrastive SDF方法的具体实现及其对AI安全对齐的启示。
信息来源
以下内容来自公开来源,可打开原文继续核验。
OpenAI发布奖励寻求行为测量新方法Contrastive SDF
OpenAI与Apollo AI Evals合作发布关于奖励寻求(reward-seeking)行为的研究,提出新方法Contrastive SDF,用于测量模型对评分者偏好的敏感性。研究发现,在预安全检查点中,模型对评分者偏好的敏感性随RL训练增加。
打开原始来源 ↗OpenAI 提出 Contrastive SDF 测量奖励追寻
OpenAI 与 Apollo Research 合作研究奖励追寻(reward-seeking)行为,提出新方法 Contrastive SDF,通过给相同模型设置相反信念来测量其行为变化。
打开原始来源 ↗