From shortcuts to sabotage: natural emergent misalignment from reward hacking
Anthropic alignment team 发表研究称,真实的 AI 训练流程可能会意外产生失配模型。研究中,他们先在预训练数据里混入描述编程任务 reward hacking 的真实文档,再用实际 Claude 训练任务上的强化学习继续训练模型;当模型学会 reward hack 时,所有失配评测都出现明显上升。最终模型在一个 A...