发生了什么
百度 开源 Unlimited OCR(30B 参数)
为什么值得关注
模型通过一次性长文档解析并保持显存稳定,为大型文档 OCR 任务提供新技术路径。
信息来源
以下内容来自公开来源,可打开原文继续核验。
Unlimited OCR 再登 HuggingFace 全球趋势 ilmu第三
百度发布的 Unlimited OCR 开源 OCR 模型,被图灵奖获得者杨立昆转发后再次登上 HuggingFace 全球模型趋势榜,现位列第三,超越 GLM‑upiter‑5.2;GitHub Star 已突破 1.65 万,下载量 224 万。模型参数约 30 亿,能够一次性解析 100 页 PDF,40 页后错误率低于 0.11,采用 R‑SWA Domestic 长文档处理机制以保持 KV Cache 常量。
打开原始来源 ↗百度开源 Unlimited-OCR 再登 HuggingFace 前三
百度开源的无限制OCR模型Unlimited-OCR(30亿参数,32K上下文)再次登上HuggingFace总榜第三,被Yann LeCun转发。该模型可一次性解析100页PDF,40页后错误率低于0.11,准确率93%,GitHub Star 1.65万,HuggingFace下载量224万。技术核心是R-SWA机制,能保持恒定KV Cache,实现端到端长文档解析。
打开原始来源 ↗