发生了什么
Arena 公布 事实评分(200 万 主张)
为什么值得关注
事实评分显著重新排列了模型排名,尤其是 GPT‑5.5 上升 13 名
信息来源
以下内容来自公开来源,可打开原文继续核验。
01
Arena 增加事实评分
Arena 在其排行榜中加入了基于真实用户对话的事实核查评分,对模型的可靠性进行衡量。他们从超过 200 万条模型在真实对话中提出的可验证主张中抽样验证,覆盖约 13 万文本竞赛和 4 万搜索竞赛。启用事实权重后,GPT‑5.5 在文本竞赛中上升 13 名,Muse Spark 下降 13 名,Claude Fable 5 略降,而在搜索竞赛中 GPT‑5.5-search 登顶,Gemini grounding 跌至第 13 名。
打开原始来源 ↗