发生了什么
研究人员 分析 LLM-as-a-Judge
为什么值得关注
揭示了高重复性与高偏见可共存的“一致性悖论”,建议在构建评估系统时使用 Cohen's kappa 以修正由于随机性导致的一致性高估。
信息来源
以下内容来自公开来源,可打开原文继续核验。
LLM-as-a-Judge 可靠性审计
研究人员对 9 家供应商的 21 个 LLM-as-a-Judge 模型在 MT-Bench、JudgeBench 和 RewardBench 上约 541,000 次评判进行了可靠性审计。研究发现使用 Cohen's kappa 指标替代精确匹配 (exact-match) 会使 MT-Bench 的一致性得分降低 33-41 分,且模型排名最高波动 14 位。此外,研究指出存在一致性悖论,即测试-重测可靠性高于 0.95 的模型仍可能携带超过 0.10 的严重位置偏见。
打开原始来源 ↗