发生了什么
腾讯HY实验室 发表 Chronicles-OCR(2800张图像 7类文字 28个模型)
为什么值得关注
建议重点看原文的任务定义与评测细节,这组结果首次把古文字识别中“看见载体而非识别文字”的失败模式量化出来,且对 reasoning 机制在感知任务中的副作用有直接证据。
信息来源
以下内容来自公开来源,可打开原文继续核验。
Chronicles-OCR 基准测试
腾讯HY实验室联合4家机构发布古文字识别基准 Chronicles-OCR,用于评测 AI 对跨越3000年中国古文字的识别能力。该基准包含2800张专家标注图像,覆盖甲骨文、金文、篆书、隶书、楷书、行书、草书7类。28个前沿多模态模型在任务上表现不佳:最强的 VLLM 在甲骨文识别上准确率仅14%,端到端检测的最高 H-mean 只有16.5%,GPT-5 和 Gemini 2.5 Pro 接近0;开启 reasoning 模式后,多数模型表现反而更差。
打开原始来源 ↗古文字识别基准
腾讯 HY 联合 4 家机构发布古汉字基准 Chronicles-OCR,用 2,800 张专家标注图像、覆盖 7 种书体(oracle bone、bronze、seal、clerical、regular、running、cursive),测试了 28 个前沿模型,时间跨度覆盖中国文字 3,000 年。结果显示,最佳 VLLM 在 oracle bone script recognition 上仅 14%;端到端检测在古文字上大幅失效,最佳 H-mean 只有 16.5,GPT-5 和 Gemini 2.5 Pro 近乎为 0。研究还发现,thinking mode 会在几乎所有模型上进一步恶化表现,古文字分类 96.7% 的高分更多来自识别龟甲和青铜器等载体,而不是字符本身。
打开原始来源 ↗