发生了什么
Rapidata 发布 SVG Benchmark(30个LLM,135万+人类响应)
为什么值得关注
该基准测试聚焦LLM生成SVG的能力,采用大规模人工评分,为多模态生成评估提供新参考。
信息来源
以下内容来自公开来源,可打开原文继续核验。
01
SVG生成基准测试发布
Rapidata 在 ModelScope 发布 SVG 基准测试,比较 30 个前沿 LLM 的静态 SVG 生成能力。人工评估包含 188,754 次对比、500 个提示和 1,355,161 条人类响应。Claude Fable 5 Thinking 以 1232.9 ELO 排名第一。
打开原始来源 ↗