Signal Brief

百度开源 Unlimited-OCR 再登 HuggingFace 前三

百度开源的无限制OCR模型Unlimited-OCR(30亿参数,32K上下文)再次登上HuggingFace总榜第三,被Yann LeCun转发。该模型可一次性解析100页PDF,40页后错误率低于0.11,准确率93%,GitHub Star 1.65万,HuggingFace下载量224万。技...

twitter关注列表 Berryxia.AI (@berryxia) 发布 2026-07-22 收录 2026-07-22 观察

一句话判断

相比传统逐页拼接OCR,Unlimited-OCR通过R-SWA机制实现长文档一次解析,KV Cache恒定,是值得关注的技术突破。

核心信息

百度开源的无限制OCR模型Unlimited-OCR(30亿参数,32K上下文)再次登上HuggingFace总榜第三,被Yann LeCun转发。该模型可一次性解析100页PDF,40页后错误率低于0.11,准确率93%,GitHub Star 1.65万,HuggingFace下载量224万。技术核心是R-SWA机制,能保持恒定KV Cache,实现端到端长文档解析。

原始内容

为什么OCR仍然是AI信息处理的第一步? 人类先有身体再有文字,而 AI 反过来,文字能力先成熟。 OCR 的价值就是把物理世界的文档、图像转成电子文字,后面才能接信息抽取、RAG、知识问答、Agent 等。 在硬地骇客播客这期早就说了这个观点,现在看来的确AI时代并不能脱离这个事实啊! https://video.twimg.com/amplify_video/2079938304687099905/vid/avc1/1080x1920/VSXMNW0v3aPB8OwN.mp4?tag=29 > **引用原帖 Berryxia.AI (@berryxia):** > 兄弟们,这几天真的是国产模型的高光时刻啊,又有模型海外刷屏! > Yann LeCun 转发,Unlimited-OCR 开源模型再次登上 HuggingFace 总榜🔥 > Unlimited OCR 模型又火了! > 之前还分享过它家出品的几个OCR的新模型,这个模型因为我没有本地部署的资源,因此还没有实测,结果这个模型在海外又出圈了! > 近日,图灵奖获得者、AI 科学家杨立昆(Yann LeCun)转发推荐百度开源的 Unlimited OCR,该项目再次登上 HuggingFace 全球模型总趋势榜,目前位列第三,再次超过 GLM-5.2。 > 截至目前,Unlimited OCR 的 GitHub Star 已突破 1.65万,HuggingFace 下载量达到 224万,热度仍在持续攀升。 > 要知道,上个月发布时它就已经疯过一轮:发布次日登顶 GitHub Daily Trending 总榜、Python 榜,5 天 Star 破万,横扫 GitHub、HuggingFace 四大榜单第一。 > 如今时隔一月再次冲入全球趋势榜前三,Unlimited OCR 正在从一次出圈走向持续增长,成为近期全球开发者社区关注度最高的开源 AI 项目之一。 > 海外开发者直接炸了👇 > 🔹知名播客主持人 Mario Nawfal:30 亿参数,一次性解析整本 100 页 PDF,无需分页、无上下文丢失。40 页之后错误率低于 0.11,而其他所有 OCR 工具到这个阶段已经无法正常工作了。 > 🔹GrowthSchool 创始人 Vaibhav Sisinty:传统 OCR 逐页切割,跨页表格断裂、阅读顺序丢失。Unlimited-OCR 一次性处理整个文档,32K 上下文,文本、公式、表格、阅读顺序全部跨页保留,完全免费本地运行。 > 🔹网友 Superman:中国开源了一个「花生大小」的 OCR,只有 30 亿参数,本地运行,免费,永久。大多数人还不知道它的存在。 > 🔹网友 Macro Bombastic:这正是能彻底摧毁 SaaS 敲诈的办法,免费、本地化、准确率 93%,简直太棒了。 > 持续刷屏的背后是长程解析的技术突破 > 过去 OCR 处理长文档只能「逐页解析+结果拼接」,输出越长 KV Cache 越膨胀,推理越慢显存越贵。 > Unlimited OCR 提出的 R-SWA 机制借鉴人类抄书的方式:始终盯着原文,只保留最近生成的「工作记忆」。 > 数十页文档一次连续解析,KV Cache 恒定规模,效率和显存成本两个都要,为端到端长文档解析提供了新的技术方案。 > 免费、开源、本地跑,感兴趣的快去试试👇🏻 > GitHub:https://t.co/YRrqO7CTq0 > https://x.com/berryxia/status/2079841995649163623

相关动态

01

AI 推翻 30 年图论猜想

GPT 5.6 Pro 反驳了 Dinitz-Garg-Goemans 猜想(开放约 30 年),通过简单提示词(如“做个突破”)发现反例:分数流成本 58 时,不可分割流成本至少 60。

twitter关注列表2026-07-22#技术突破#AI模型#研究
观察
04

Cosmos 3 Super模型发布

NVIDIA AI 发布了 4 步 Cosmos 3 Super 模型,生成图像和视频速度比原版快 25 倍,在 Artificial Analysis 基准中图像到视频(无音频)排名第一,文本到图像排名第二,模型已在 Hugging Face 开源。

twitter关注列表2026-07-22#模型发布#技术更新#AI
观察
05

Qwen-Image-3.0 发布

Alibaba Qwen 团队发布了第三代图像生成基座模型 Qwen-Image-3.0。该模型支持高达 4.5k tokens 的长提示词,可实现复杂的布局生成(如报纸、分镜脚本、3x3 信息图),具备 10px 级别清晰的文本渲染能力,并支持 12 种语言和 100 多种艺术风格。

twitter关注列表2026-07-22#模型发布#技术更新#产品发布
观察