发生了什么
Baidu 开源 Unlimited OCR(3B总参数,500M激活)
为什么值得关注
首次提出 Reference Sliding Window Attention,使 OCR 模型在保持常量 KV 缓存的同时能够一次处理 40+ 页长文档。
信息来源
以下内容来自公开来源,可打开原文继续核验。
百度开源Unlimited OCR
百度宣布开源 Unlimited OCR 模型,该模型具有 30 亿总参数、仅激活 5 亿参数。在 OmniDocBench v1.5 和 v1.6 基准上实现新的端到端 SOTA,并采用 Reference Sliding Window Attention (R-SWA) 机制,保持常量 KV 缓存,使其能够在一次前向传递中转录 40+ 页文档而不丢失上下文。相较于之前的 SOTA,Unlimited OCR 在同一基准上取得了更高的得分。
打开原始来源 ↗