← 返回精选动态
精选动态

Chronicles-OCR 基准测试

腾讯HY实验室 发表 Chronicles-OCR(2800张图像 7类文字 28个模型)

更新于 2026年05月27日 21:43 2 条公开来源

发生了什么

腾讯HY实验室 发表 Chronicles-OCR(2800张图像 7类文字 28个模型)

为什么值得关注

建议重点看原文的任务定义与评测细节,这组结果首次把古文字识别中“看见载体而非识别文字”的失败模式量化出来,且对 reasoning 机制在感知任务中的副作用有直接证据。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

Chronicles-OCR 基准测试

twitter关注列表 2026年05月27日 20:38

腾讯HY实验室联合4家机构发布古文字识别基准 Chronicles-OCR,用于评测 AI 对跨越3000年中国古文字的识别能力。该基准包含2800张专家标注图像,覆盖甲骨文、金文、篆书、隶书、楷书、行书、草书7类。28个前沿多模态模型在任务上表现不佳:最强的 VLLM 在甲骨文识别上准确率仅14%,端到端检测的最高 H-mean 只有16.5%,GPT-5 和 Gemini 2.5 Pro 接近0;开启 reasoning 模式后,多数模型表现反而更差。

打开原始来源 ↗
02

古文字识别基准

twitter关注列表 2026年05月27日 14:46

腾讯 HY 联合 4 家机构发布古汉字基准 Chronicles-OCR,用 2,800 张专家标注图像、覆盖 7 种书体(oracle bone、bronze、seal、clerical、regular、running、cursive),测试了 28 个前沿模型,时间跨度覆盖中国文字 3,000 年。结果显示,最佳 VLLM 在 oracle bone script recognition 上仅 14%;端到端检测在古文字上大幅失效,最佳 H-mean 只有 16.5,GPT-5 和 Gemini 2.5 Pro 近乎为 0。研究还发现,thinking mode 会在几乎所有模型上进一步恶化表现,古文字分类 96.7% 的高分更多来自识别龟甲和青铜器等载体,而不是字符本身。

打开原始来源 ↗
← 返回精选动态