一句话判断
该模型在IMO中首次以满分超越人类金牌线,其加强归纳法提供了新推理思路,值得关注开源版本。
核心信息
小红书dots团队的大模型dots-note-3.0在第67届IMO中获得42分满分,超过金牌线13分,成为全球首个在IMO官方评卷中斩获满分的大模型,也是中国首个IMO金牌大模型。此前Gemini Deep Think曾获35分。该模型采用智能体化推理系统和加强归纳法,并计划近期开源。
原始内容
相关动态
AutoLab: Can Frontier Models Solve Long-Horizon Auto Research and Engineering Tasks?
研究人员提出了 AutoLab 基准测试,包含 36 项涉及系统加速、谜题、模型开发及 CUDA kernel 工作的任务,旨在评估模型在长时程自动研究中的表现。通过对 17 个主流模型的测试发现,成功的关键不在于初始想法的质量,而在于模型的持续测试与反馈迭代能力;其中 Claude Opus 4.6 在该基准测试中表现最佳,原因在于其能...
Kimi K3 30分钟构建VR伴侣
Kimi团队展示Kimi K3模型在收到一个3D模型和一条提示后,于30分钟内自主构建了一个VR伴侣,该伴侣能够听、回应、改变表情并在场景间移动,期间K3独立发现并部署了本地ASR和TTS连接LLM,并构建了VR场景。
Tencent Hy3 Agent Arena排名#25
Arena.ai评测显示,腾讯Hy3模型在Agent Arena中排名第25位(开放权重模型第5位),在Frontend Code Arena中排名第16位(开放模型第2位)。Hy3在工具使用(bash错误恢复,+2.6%)方面表现强劲,但在可操纵性(用户推回时调整能力)方面较弱,得分为-7.1%。
百度开源Unlimited-OCR模型
百度开源 Unlimited-OCR 模型,30亿参数但推理时仅5亿激活,支持一次性处理40页文档,32K上下文窗口,准确率93%(比基线高6%),错误率低于0.11,输出结构化Markdown,免费本地运行,对比亚马逊Textract等商用方案每页收费。
Unlimited OCR 再登 HuggingFace 全球趋势 ilmu第三
百度发布的 Unlimited OCR 开源 OCR 模型,被图灵奖获得者杨立昆转发后再次登上 HuggingFace 全球模型趋势榜,现位列第三,超越 GLM‑upiter‑5.2;GitHub Star 已突破 1.65 万,下载量 224 万。模型参数约 30 亿,能够一次性解析 100 页 PDF,40 页后错误率低于 0.11,...