Signal Brief

Unlimited OCR 再登 HuggingFace 全球趋势 ilmu第三

百度发布的 Unlimited OCR 开源 OCR 模型,被图灵奖获得者杨立昆转发后再次登上 HuggingFace 全球模型趋势榜,现位列第三,超越 GLM‑upiter‑5.2;GitHub Star 已突破 1.65 万,下载量 224 万。模型参数约 30 亿,能够一次性解析 100 页 ...

twitter关注列表 Berryxia.AI (@berryxia) 发布 2026-07-22 收录 2026-07-22 值得跟进

一句话判断

模型通过一次性长文档解析并保持显存稳定,为大型文档 OCR 任务提供新技术路径。

核心信息

百度发布的 Unlimited OCR 开源 OCR 模型,被图灵奖获得者杨立昆转发后再次登上 HuggingFace 全球模型趋势榜,现位列第三,超越 GLM‑upiter‑5.2;GitHub Star 已突破 1.65 万,下载量 224 万。模型参数约 30 亿,能够一次性解析 100 页 PDF,40 页后错误率低于 0.11,采用 R‑SWA Domestic 长文档处理机制以保持 KV Cache 常量。

原始内容

兄弟们,这几天真的是国产模型的高光时刻啊,又有模型海外刷屏! Yann LeCun 转发,Unlimited-OCR 开源模型再次登上 HuggingFace 总榜🔥 Unlimited OCR 模型又火了! 之前还分享过它家出品的几个OCR的新模型,这个模型因为我没有本地部署的资源,因此还没有实测,结果这个模型在海外又出圈了! 近日,图灵奖获得者、AI 科学家杨立昆(Yann LeCun)转发推荐百度开源的 Unlimited OCR,该项目再次登上 HuggingFace 全球模型总趋势榜,目前位列第三,再次超过 GLM-5.2。 截至目前,Unlimited OCR 的 GitHub Star 已突破 1.65万,HuggingFace 下载量达到 224万,热度仍在持续攀升。 要知道,上个月发布时它就已经疯过一轮:发布次日登顶 GitHub Daily Trending 总榜、Python 榜,5 天 Star 破万,横扫 GitHub、HuggingFace 四大榜单第一。 如今时隔一月再次冲入全球趋势榜前三,Unlimited OCR 正在从一次出圈走向持续增长,成为近期全球开发者社区关注度最高的开源 AI 项目之一。 海外开发者直接炸了👇 🔹知名播客主持人 Mario Nawfal:30 亿参数,一次性解析整本 100 页 PDF,无需分页、无上下文丢失。40 页之后错误率低于 0.11,而其他所有 OCR 工具到这个阶段已经无法正常工作了。 🔹GrowthSchool 创始人 Vaibhav Sisinty:传统 OCR 逐页切割,跨页表格断裂、阅读顺序丢失。Unlimited-OCR 一次性处理整个文档,32K 上下文,文本、公式、表格、阅读顺序全部跨页保留,完全免费本地运行。 🔹网友 Superman:中国开源了一个「花生大小」的 OCR,只有 30 亿参数,本地运行,免费,永久。大多数人还不知道它的存在。 🔹网友 Macro Bombastic:这正是能彻底摧毁 SaaS 敲诈的办法,免费、本地化、准确率 93%,简直太棒了。 持续刷屏的背后是长程解析的技术突破 过去 OCR 处理长文档只能「逐页解析+结果拼接」,输出越长 KV Cache 越膨胀,推理越慢显存越贵。 Unlimited OCR 提出的 R-SWA 机制借鉴人类抄书的方式:始终盯着原文,只保留最近生成的「工作记忆」。 数十页文档一次连续解析,KV Cache 恒定规模,效率和显存成本两个都要,为端到端长文档解析提供了新的技术方案。 免费、开源、本地跑,感兴趣的快去试试👇🏻 GitHub:https://t.co/YRrqO7CTq0 ![photo](https://pbs.twimg.com/media/HN0FruBagAA9EqJ.jpg)

相关动态

01

dots-note-3.0获IMO满分金牌

小红书dots团队的大模型dots-note-3.0在第67届IMO中获得42分满分,超过金牌线13分,成为全球首个在IMO官方评卷中斩获满分的大模型,也是中国首个IMO金牌大模型。此前Gemini Deep Think曾获35分。该模型采用智能体化推理系统和加强归纳法,并计划近期开源。

twitter关注列表2026-07-22#模型#技术突破#AI模型
值得跟进
02

百度开源Unlimited-OCR模型

百度开源 Unlimited-OCR 模型,30亿参数但推理时仅5亿激活,支持一次性处理40页文档,32K上下文窗口,准确率93%(比基线高6%),错误率低于0.11,输出结构化Markdown,免费本地运行,对比亚马逊Textract等商用方案每页收费。

twitter关注列表2026-07-20#模型发布#开源#技术突破
观察
05

SWE-Pruner Pro: The Coder LLM Already Knows What to Prune

SWE-Pruner Pro团队提出一种利用编码模型内部表示来剪枝无关工具输出行的方法,无需额外剪枝模型。在2个开源模型和4个多轮基准上,节省最多39%的token,同时在一个编码基准上提升3.8%,一个长上下文测试提升2.2点。训练使用22609条标记工具响应。

twitter关注列表2026-07-22#技术突破#模型#研究
观察