一句话判断
相比传统逐页拼接OCR,Unlimited-OCR通过R-SWA机制实现长文档一次解析,KV Cache恒定,是值得关注的技术突破。
核心信息
百度开源的无限制OCR模型Unlimited-OCR(30亿参数,32K上下文)再次登上HuggingFace总榜第三,被Yann LeCun转发。该模型可一次性解析100页PDF,40页后错误率低于0.11,准确率93%,GitHub Star 1.65万,HuggingFace下载量224万。技术核心是R-SWA机制,能保持恒定KV Cache,实现端到端长文档解析。
原始内容
相关动态
AI 推翻 30 年图论猜想
GPT 5.6 Pro 反驳了 Dinitz-Garg-Goemans 猜想(开放约 30 年),通过简单提示词(如“做个突破”)发现反例:分数流成本 58 时,不可分割流成本至少 60。
AI发现Dinitz-Garg-Goemans猜想反例
GPT-5.6 Pro 发现了图论中开放约30年的 Dinitz-Garg-Goemans 猜想的一个反例,该反例显示存在分数流成本58且任何不可分流量成本至少60的图。
NVIDIA 开源模型获 IMO 金牌
NVIDIA AI 对 Nemotron 3 Ultra 进行 IMO 2026 问题测试,得分 30/42,超过金牌线 29 分,首次实现开源模型在 IMO 获金牌水平。
Cosmos 3 Super模型发布
NVIDIA AI 发布了 4 步 Cosmos 3 Super 模型,生成图像和视频速度比原版快 25 倍,在 Artificial Analysis 基准中图像到视频(无音频)排名第一,文本到图像排名第二,模型已在 Hugging Face 开源。
Qwen-Image-3.0 发布
Alibaba Qwen 团队发布了第三代图像生成基座模型 Qwen-Image-3.0。该模型支持高达 4.5k tokens 的长提示词,可实现复杂的布局生成(如报纸、分镜脚本、3x3 信息图),具备 10px 级别清晰的文本渲染能力,并支持 12 种语言和 100 多种艺术风格。