Signal Feed

#研究突破 主题信号第 4 页

围绕 研究突破 的精选动态、来源摘要和重要性判断。

动态列表

01

Chronicles-OCR 基准测试

腾讯HY实验室联合4家机构发布古文字识别基准 Chronicles-OCR,用于评测 AI 对跨越3000年中国古文字的识别能力。该基准包含2800张专家标注图像,覆盖甲骨文、金文、篆书、隶书、楷书、行书、草书7类。28个前沿多模态模型在任务上表现不佳:最强的 VLLM 在甲骨文识别上准确率仅14%,端到端检测的最高 H-mean 只有1...

twitter关注列表2026年05月27日 20:38#基准测试#多模态#研究突破
值得跟进
02

Facebook停用实验

斯坦福经济学家 Hunt Allcott 和 Matthew Gentzkow 在 2018 年通过 Facebook 广告招募了 2743 名活跃用户,并按随机对照实验让其中 1611 名估值低于 102 美元的用户以 102 美元停用 Facebook 4 周,对照组则继续正常使用。研究在 2018 年美国中期选举后进行,团队通过多次...

twitter关注列表2026年05月27日 09:34#行业动态#研究突破#AI产业
观察
03

SkillOpt 让 skill 也能“训练”

微软联合上海交通大学、复旦大学、同济大学等机构提出 SkillOpt 框架,用于自动评估并迭代优化 Agent 的 skill。论文中,该框架通过 harness 闭环让大模型先写 skill,再在独立验证集上跑分,只有分数提升的文本编辑才会保留;其编辑操作包括增加、删除、替换文本。实验显示,GPT-5.5 的直接对话准确率因此提升了 2...

twitter关注列表2026年05月27日 07:01#智能体#研究突破#技术
观察
04

Poolside 报告发布

Poolside 发布技术报告,介绍Laguna M.1和Laguna XS.2的模型工厂、预训练数据、分布式训练、后训练、Agent RL、量化及评估。报告提供了详细的技术细节和评估指标。

twitter关注列表2026年05月27日 01:22#模型发布#研究突破
观察
05

Language models need "sleep"

DAIR.AI 转引一篇关于长上下文 agent 的论文,提出让语言模型在运行中加入类似“睡眠”的离线巩固步骤:模型会周期性地对最近上下文做 N 次离线递归前向,然后把结果写入 state-space blocks 的 persistent fast weights,并清空 KV cache。这样可把额外计算挪到“睡眠”阶段,同时保持“清...

twitter关注列表2026年05月27日 04:08#智能体#研究突破#基础设施
观察
06

Claude Mythos 解决 Erdős #90

一位数学家在周末测试 Claude Mythos 是否能解决长期未解的 Erdős problem #90,结果它成功给出了解答。该模型没有复现 OpenAI 的 #1196 已知解法,而是反复收敛到另一种被数学家形容为更简洁的论证,且没有解析复杂性;测试环境为 air-gapped、无互联网、无信息泄漏。原帖还提到,GPT-5.5 在今...

twitter关注列表2026年05月27日 00:31#研究突破#大模型#行业动态
观察
07

效率增益幻觉:人们低估AI使用率并高估其在简单任务上的收益

MIT、Stanford、New York Univ和Princeton的研究团队发现AI使用效率幻觉现象,在3项预注册研究中,2,691名参与者预期AI平均节省55.7秒,实际仅节省7.5秒,且使用AI仅2次后即形成依赖,即使独立完成更快。

twitter关注列表2026年05月27日 00:48#研究突破#AI模型
观察
08

The First Drop of Ink: Nonlinear Impact of

Muhan Gao团队在ICML 2026发表的论文发现,长上下文LLM中误导信息的损害呈非线性关系。在128K-token的Qwen2.5设置中,前10%的hard distractors(硬干扰项)解释了约58%的总性能损失,而非按比例分配;10%的hard distractors即可解释约97%的干扰压力。机制在于softmax注意...

twitter关注列表2026年05月27日 01:22#研究突破#大模型#基准测试
观察
09

MIT CSAIL 发现 Apple M1 易受 Phantom 攻击

MIT CSAIL 开发的操作系统内核 Fractal 让研究人员更清晰地观察芯片内部运作,发现 Apple M1 可能易受一种称为 Phantom 的投机攻击。

twitter关注列表2026年05月27日 00:01#安全#研究突破
观察
10

AutoResearchClaw

来自 Meta、Stanford、Google 等实验室的论文提出 AutoResearchClaw(arxiv:2605.20025),讨论如何让自动化研究在 AI 出错、恢复、并在合适时机请求人类介入时表现更好。论文强调将辩论、修复、验证、记忆和选择性人类输入纳入同一个受治理的循环,而不是单纯提高自治程度。作者报告,在 ARC-Ben...

twitter关注列表2026年05月26日 22:24#研究突破#智能体#AI模型
观察
11

Toward Training Superintelligent Software

Meta、CMU等实验室发表论文提出Self-Play SWE-RL方法,使编码代理能通过在真实项目中制造和修复bug来自我训练。该方法将学习单位从标记任务转为可执行情境,一个模型版本探索真实代码库、削弱测试、注入有意义的bug并留下测试工件;另一个版本需要修复系统以恢复测试行为。相比于传统方法依赖人类编写的问题描述、拉取请求、测试和注释...

twitter关注列表2026年05月26日 22:40#研究突破#智能体#开发者工具
观察
12

Language Models Need Sleep

CMU 和 UMD 研究者在论文《Language Models Need Sleep》中提出,模型在处理深度推理任务时不只是受限于内存容量,还需要通过多次 forward pass 将当前 context 巩固成更可用的内部表示。研究使用 Rule 110 这种图灵完备的 toy task 做实验,方法是在清除 KV cache 前让模...

twitter关注列表2026年05月26日 23:14#研究突破#大模型#基础设施
值得跟进
13

KPop 提升 MoE RL 稳定性

团队提出 KPop,用自适应 binary-KL 区域替代 IcePop 里的固定比例 mask,以匹配每个 token 的噪声强度,从而提升大型 MoE 模型的 RL 训练稳定性和长时程 agentic RL 更新稳定性。该方法宣称无需修改基础设施、无需 routing replay,仅通过一个参数即可生效,并使 Ring-2.6-1T...

twitter关注列表2026年05月26日 23:14#研究突破#智能体#大模型
观察
14

PowLU

Ling Team 提出了一种可直接替换现有激活函数的 PowLU,用于稳定大规模预训练。原文指出,SwiGLU 在大输入下近似表现为 x²,会放大激活值和异常值,使深层网络或低精度(FP8/FP4)训练更容易出现 loss spike;在 FP8 训练稳定性对比中,SwiGLU 和 SwiGLU-Clip 都在约 step 77k 附近...

twitter关注列表2026年05月26日 22:01#研究突破#大模型#AI模型
观察
15

科学进步可否预测

Sakana AI 转发 hardmaru 的帖子,并引用其与 Oxford University、Stanford University、Allen AI 等研究者合作发表的研究。该研究提出评估 AI 科学预测能力的基准 CUSP,使用 4,760 件科学事件进行验证,结果显示当前最先进模型能识别有前景的研究方向,但难以预测这些方向是否...

twitter关注列表2026年05月26日 15:08#研究突破#基准测试#AI模型
观察
16

Code as Agent Harness

Meta、Stanford 和 Illinois 的一篇综述论文提出,AI agents 在把 code 作为主要工作层时表现更好。作者指出,单纯的 LLM 更像文本预测器,长任务中容易丢失状态、掩盖错误,并把计划脆弱地转成动作;他们把围绕模型的系统称为 agent harness,包括工具、记忆、沙箱、检查和反馈回路。论文的核心观点是让...

twitter关注列表2026年05月26日 04:33#智能体#开发者工具#研究突破
观察
17

单次输注降 LDL

Verve Therapeutics(Eli Lilly)在《NEJM》发表了 VERVE-102 的 Phase 1 结果。该疗法是一种单次输注的 base-editing 基因编辑治疗,作用于肝脏 PCSK9;在最高剂量下,PCSK9 下降 88%,LDL 胆固醇下降 62%,且降幅至少维持 1 年。研究纳入 35 名家族性高胆固醇血...

twitter关注列表2026年05月26日 05:21#研究突破#行业动态#AI产业
观察
18

📢 Accepted to TMLR, with reproducibility c

Yann LeCun 转发并宣布 Basile Terver 的 JEPA‑WM v2 论文在 TMLR 接受,提供新的数据扩展实验、多步回滚训练的 Lipschitz 分析及扩展讨论,arXiv:2512.24497

twitter关注列表2026年05月25日 21:37#模型发布#研究突破
观察
19

BestBlogs 早报 05-26

BestBlogs 早报精选了 10 篇内容,其中 3 篇深度精讲。核心包括:Google 将 FDE 面试从“4-6 轮数周”压缩到“2 天 2 轮”,OpenAI 斥资 40 亿美元成立独立部署公司并收购了 150 名 FDE 的 Tomoro,Anthropic 也跟进建立同类架构。Anthropic 研究 PM Alex 首度披露...

twitter关注列表2026年05月25日 08:43#行业动态#模型发布#研究突破
值得跟进
20

AlphaProof Nexus 解 9 个 Erdős 问题

Google DeepMind 的 AlphaProof Nexus 通过将 LLM 推理与 Lean 形式化验证结合,自动解决了 9 个开放的 Erdős 问题,其中部分问题已悬而未决 56 年;单个问题的成本为“几百美元”。它还证明了 44 个开放的 OEIS 猜想,解决了一个 15 年前的代数几何问题,并在优化理论中发现了一个人类此...

twitter关注列表2026年05月25日 06:17#研究突破#模型发布#智能体
值得跟进