← 返回精选动态
精选动态

LLM-as-a-Judge 可靠性审计

研究人员 分析 LLM-as-a-Judge

更新于 2026年06月23日 05:44 1 条公开来源

发生了什么

研究人员 分析 LLM-as-a-Judge

为什么值得关注

揭示了高重复性与高偏见可共存的“一致性悖论”,建议在构建评估系统时使用 Cohen's kappa 以修正由于随机性导致的一致性高估。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

LLM-as-a-Judge 可靠性审计

twitter关注列表 2026年06月22日 22:23

研究人员对 9 家供应商的 21 个 LLM-as-a-Judge 模型在 MT-Bench、JudgeBench 和 RewardBench 上约 541,000 次评判进行了可靠性审计。研究发现使用 Cohen's kappa 指标替代精确匹配 (exact-match) 会使 MT-Bench 的一致性得分降低 33-41 分,且模型排名最高波动 14 位。此外,研究指出存在一致性悖论,即测试-重测可靠性高于 0.95 的模型仍可能携带超过 0.10 的严重位置偏见。

打开原始来源 ↗
← 返回精选动态