← 返回精选动态
精选动态

Language Models (Mostly) Know What They Know

Language Models 发表 自我评估与诚实性研究

更新于 2026年05月21日 14:55 1 条公开来源

发生了什么

Language Models 发表 自我评估与诚实性研究

为什么值得关注

文中给出了 P(True) 与 P(IK) 两条自评路径及其跨任务泛化结果,适合关注模型校准、拒答与诚实性训练的人直接读摘要和方法设定。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

Language Models (Mostly) Know What They Kn

Anthropic-research 2022年07月11日 15:00

研究者评估语言模型能否判断自身回答是否正确,以及能否预测自己是否知道答案。结果显示,在提供合适格式时,更大的模型在多项选择题和判断题上校准较好;在开放式采样任务中,先生成答案再估计该答案为真的概率“P(True)”也表现出较好的性能、校准性和规模效应。进一步让模型在预测某个具体候选答案是否为真之前先考虑多个自生成样本,可继续提升自评表现;模型也能学习预测“P(IK)”——即不依赖具体答案时自己是否知道答案的概率,并能在新任务上部分迁移,但在新任务上的校准仍较弱。

打开原始来源 ↗
← 返回精选动态