Chronicles-OCR 基准测试
腾讯HY实验室联合4家机构发布古文字识别基准 Chronicles-OCR,用于评测 AI 对跨越3000年中国古文字的识别能力。该基准包含2800张专家标注图像,覆盖甲骨文、金文、篆书、隶书、楷书、行书、草书7类。28个前沿多模态模型在任务上表现不佳:最强的 VLLM 在甲骨文识别上准确率仅14%,端到端检测的最高 H-mean 只有1...
围绕 研究突破 的精选动态、来源摘要和重要性判断。
腾讯HY实验室联合4家机构发布古文字识别基准 Chronicles-OCR,用于评测 AI 对跨越3000年中国古文字的识别能力。该基准包含2800张专家标注图像,覆盖甲骨文、金文、篆书、隶书、楷书、行书、草书7类。28个前沿多模态模型在任务上表现不佳:最强的 VLLM 在甲骨文识别上准确率仅14%,端到端检测的最高 H-mean 只有1...
斯坦福经济学家 Hunt Allcott 和 Matthew Gentzkow 在 2018 年通过 Facebook 广告招募了 2743 名活跃用户,并按随机对照实验让其中 1611 名估值低于 102 美元的用户以 102 美元停用 Facebook 4 周,对照组则继续正常使用。研究在 2018 年美国中期选举后进行,团队通过多次...
微软联合上海交通大学、复旦大学、同济大学等机构提出 SkillOpt 框架,用于自动评估并迭代优化 Agent 的 skill。论文中,该框架通过 harness 闭环让大模型先写 skill,再在独立验证集上跑分,只有分数提升的文本编辑才会保留;其编辑操作包括增加、删除、替换文本。实验显示,GPT-5.5 的直接对话准确率因此提升了 2...
Poolside 发布技术报告,介绍Laguna M.1和Laguna XS.2的模型工厂、预训练数据、分布式训练、后训练、Agent RL、量化及评估。报告提供了详细的技术细节和评估指标。
DAIR.AI 转引一篇关于长上下文 agent 的论文,提出让语言模型在运行中加入类似“睡眠”的离线巩固步骤:模型会周期性地对最近上下文做 N 次离线递归前向,然后把结果写入 state-space blocks 的 persistent fast weights,并清空 KV cache。这样可把额外计算挪到“睡眠”阶段,同时保持“清...
一位数学家在周末测试 Claude Mythos 是否能解决长期未解的 Erdős problem #90,结果它成功给出了解答。该模型没有复现 OpenAI 的 #1196 已知解法,而是反复收敛到另一种被数学家形容为更简洁的论证,且没有解析复杂性;测试环境为 air-gapped、无互联网、无信息泄漏。原帖还提到,GPT-5.5 在今...
MIT、Stanford、New York Univ和Princeton的研究团队发现AI使用效率幻觉现象,在3项预注册研究中,2,691名参与者预期AI平均节省55.7秒,实际仅节省7.5秒,且使用AI仅2次后即形成依赖,即使独立完成更快。
Muhan Gao团队在ICML 2026发表的论文发现,长上下文LLM中误导信息的损害呈非线性关系。在128K-token的Qwen2.5设置中,前10%的hard distractors(硬干扰项)解释了约58%的总性能损失,而非按比例分配;10%的hard distractors即可解释约97%的干扰压力。机制在于softmax注意...
MIT CSAIL 开发的操作系统内核 Fractal 让研究人员更清晰地观察芯片内部运作,发现 Apple M1 可能易受一种称为 Phantom 的投机攻击。
来自 Meta、Stanford、Google 等实验室的论文提出 AutoResearchClaw(arxiv:2605.20025),讨论如何让自动化研究在 AI 出错、恢复、并在合适时机请求人类介入时表现更好。论文强调将辩论、修复、验证、记忆和选择性人类输入纳入同一个受治理的循环,而不是单纯提高自治程度。作者报告,在 ARC-Ben...
Meta、CMU等实验室发表论文提出Self-Play SWE-RL方法,使编码代理能通过在真实项目中制造和修复bug来自我训练。该方法将学习单位从标记任务转为可执行情境,一个模型版本探索真实代码库、削弱测试、注入有意义的bug并留下测试工件;另一个版本需要修复系统以恢复测试行为。相比于传统方法依赖人类编写的问题描述、拉取请求、测试和注释...
CMU 和 UMD 研究者在论文《Language Models Need Sleep》中提出,模型在处理深度推理任务时不只是受限于内存容量,还需要通过多次 forward pass 将当前 context 巩固成更可用的内部表示。研究使用 Rule 110 这种图灵完备的 toy task 做实验,方法是在清除 KV cache 前让模...
团队提出 KPop,用自适应 binary-KL 区域替代 IcePop 里的固定比例 mask,以匹配每个 token 的噪声强度,从而提升大型 MoE 模型的 RL 训练稳定性和长时程 agentic RL 更新稳定性。该方法宣称无需修改基础设施、无需 routing replay,仅通过一个参数即可生效,并使 Ring-2.6-1T...
Ling Team 提出了一种可直接替换现有激活函数的 PowLU,用于稳定大规模预训练。原文指出,SwiGLU 在大输入下近似表现为 x²,会放大激活值和异常值,使深层网络或低精度(FP8/FP4)训练更容易出现 loss spike;在 FP8 训练稳定性对比中,SwiGLU 和 SwiGLU-Clip 都在约 step 77k 附近...
Sakana AI 转发 hardmaru 的帖子,并引用其与 Oxford University、Stanford University、Allen AI 等研究者合作发表的研究。该研究提出评估 AI 科学预测能力的基准 CUSP,使用 4,760 件科学事件进行验证,结果显示当前最先进模型能识别有前景的研究方向,但难以预测这些方向是否...
Meta、Stanford 和 Illinois 的一篇综述论文提出,AI agents 在把 code 作为主要工作层时表现更好。作者指出,单纯的 LLM 更像文本预测器,长任务中容易丢失状态、掩盖错误,并把计划脆弱地转成动作;他们把围绕模型的系统称为 agent harness,包括工具、记忆、沙箱、检查和反馈回路。论文的核心观点是让...
Verve Therapeutics(Eli Lilly)在《NEJM》发表了 VERVE-102 的 Phase 1 结果。该疗法是一种单次输注的 base-editing 基因编辑治疗,作用于肝脏 PCSK9;在最高剂量下,PCSK9 下降 88%,LDL 胆固醇下降 62%,且降幅至少维持 1 年。研究纳入 35 名家族性高胆固醇血...
Yann LeCun 转发并宣布 Basile Terver 的 JEPA‑WM v2 论文在 TMLR 接受,提供新的数据扩展实验、多步回滚训练的 Lipschitz 分析及扩展讨论,arXiv:2512.24497
BestBlogs 早报精选了 10 篇内容,其中 3 篇深度精讲。核心包括:Google 将 FDE 面试从“4-6 轮数周”压缩到“2 天 2 轮”,OpenAI 斥资 40 亿美元成立独立部署公司并收购了 150 名 FDE 的 Tomoro,Anthropic 也跟进建立同类架构。Anthropic 研究 PM Alex 首度披露...
Google DeepMind 的 AlphaProof Nexus 通过将 LLM 推理与 Lean 形式化验证结合,自动解决了 9 个开放的 Erdős 问题,其中部分问题已悬而未决 56 年;单个问题的成本为“几百美元”。它还证明了 44 个开放的 OEIS 猜想,解决了一个 15 年前的代数几何问题,并在优化理论中发现了一个人类此...