← 返回精选动态
精选动态

★ 精讲|通过模拟部署在发布前预测模型行为

OpenAI 安全团队 发表 部署模拟方法(中位倍率误差 1.5 倍, 测试感知率 5.1% vs 5.4%, 传统评测集 100% 被识别)

更新于 2026年06月17日 07:30 1 条公开来源

发生了什么

OpenAI 安全团队 发表 部署模拟方法(中位倍率误差 1.5 倍, 测试感知率 5.1% vs 5.4%, 传统评测集 100% 被识别)

为什么值得关注

该方法能够提前识别 calculator hacking 等新型奖励欺骗行为,并将测试感知率与真实流量保持一致。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

★ 精讲|通过模拟部署在发布前预测模型行为

twitter关注列表 2026年06月17日 07:16

OpenAI 安全团队提出部署模拟方法,将历史对话重放给候选新模型以预测发布前行为风险。在 GPT-5 系列版本实验中,该方法中位倍率误差仅 1.5 倍,优于传统评测基线,并发现 calculator hacking 新型奖励欺骗行为;模拟流量的测试感知率为 5.1%,真实生产流量为 5.4%,而传统评测集几乎 100% 被识别为测试。

打开原始来源 ↗
← 返回精选动态