Signal Feed

#研究 主题信号

围绕 研究 的精选动态、来源摘要和重要性判断。

动态列表

01

二年级学生Jo Nagai发现蝴蝶可遗传记忆

日本东京都二年级学生Jo Nagai注意到养育的食蚜 caterpillars 在蝴蝶化后仍保持对薰衣草的回避行为,经Georgetown大学Entomologist Dr. Martha Weiss合作完成实验:70%训练过的蝴蝶及其后代均表现出对薰衣草的遗传性回避,记忆在全变态发育中保存并遗传。

twitter关注列表2026-07-18#研究#技术突破#信息
值得跟进
02

Sakana AI 提出无需反向传播且遵守 Dale 原理的神经网络训练方法

Sakana AI 发表论文《Diffusing Blame》,提出一种训练神经网络的方法,该网络严格遵循 Dale 原理(每个神经元要么兴奋要么抑制),无需反向传播。该方法基于 Error Diffusion 扩展,通过模数错误路由在图像分类和强化学习任务(Ant、Humanoid、HalfCheetah、Craftax)上取得有竞争力...

twitter关注列表2026-07-17#技术突破#研究#AI
观察
03

AI说服力远超人类:三倍效果

在一系列包含20000次对话和7000名参与者的实验中,AI模型在说服力上超越了人类冠军辩手和专业募捐者,即使人类获得准备、培训和高达1000英镑的奖金也无法赶上。AI的优势来自速度和信息量,当限制到人类水平时差距消失;无限制时AI说服捐赠货币的效果是专业募捐者的近三倍。

twitter关注列表2026-07-17#AI#研究#技术
观察
04

MemoHarness:控制层优化法

MemoHarness将LLM控制层分解为六个可编辑表面,通过检索历史执行记录进行结构化编辑,无需反馈或梯度更新。在Shell-Agent基准上达到0.806,超越最强固定控制层基线0.722,且单任务成本低于最强商业基线。

twitter关注列表2026-07-17#技术突破#模型#研究
观察
05

AI helps resolve统计学中BH方法FDR控制的核心问题

Edgar Dobriban运用GPT-5.6 Sol Pro解决了多假设检验中Benjamini-Hochberg方法在相关正态数据下控制假发现率(FDR)的核心问题,证明其在两侧检验中不一定能控制FDR。作者构建了高斯因子模型,在α=0.01的名义水平下证实FDR>0.0104,且提供了理论证明和数值证书支持。

twitter关注列表2026-07-17#研究#技术突破#统计学
值得跟进
06

GPT-5.6 Sol Pro解决统计学长期猜想

Edgar Dobriban利用GPT-5.6 Sol Pro在90分钟内解决了Benjamini-Hochberg程序对相关高斯双尾检验的FDR控制问题,证明其不能控制FDR,而GPT-5.5在20小时内未能解决。该结果主要具有概念意义,预印本和代码已公开。

twitter关注列表2026-07-16#技术突破#模型#研究
观察
07

ICML 2026 研究可复现性挑战

Gradio 与 @askalphaxiv 合作举办 ICML 2026 可复现性挑战,要求参赛者挑选论文部署 agent 并构建开放工件库,最高奖励 4000 美元 GPU 额度。

twitter关注列表2026-07-15#研究#开源#奖励
高优先级
08

AI 解决 19 个 Erdős 问题宣称

Przemek Chojecki 声称使用 GPT 模型(主要是 GPT-5.5 Pro)在四月最后两周内解决了 19 个 Erdős 问题,其中 3 个新宣称由 GPT-5.6 Sol Ultra 在七月完成,但部分解决方案尚未经过正式验证。

twitter关注列表2026-07-15#技术#模型#研究
观察
09

GPT-5.6解决统计学开放问题

Edgar Dobriban 使用 GPT-5.6 Sol Pro 在 90 分钟内解决了 Benjamini-Hochberg 程序在相关高斯双尾检验中 FDR 控制的反例,发现名义水平 0.01 下实际 FDR > 0.0104,而 GPT-5.5 在 20 小时内未能解决。

twitter关注列表2026-07-16#AI#技术突破#研究
观察
10

Microsoft 发布 OAT 智能体调试方法

Microsoft 及合作者提出 OAT,一种轻量级归因器,仅在成功轨迹上训练,利用神经控制微分方程建模成功动态,将故障归因转化为成功模式的一类学习,无需标注错误步骤或失败数据。

twitter关注列表2026-07-15#研究#技术#技术报告
观察
11

ARC-AGI-3 Milestone #1 获奖公布

ARC Prize 公布了 ARC-AGI-3 Milestone #1 的三位获奖者,分别是 tufalabs (1.21%, $25K)、Reki (0.867%, $7.5K) 和 Md Boktiar Mahbub Murad (0.864%, $5K),三位获奖者都开源了他们的解决方案。

twitter关注列表2026-07-07#评测#研究#AI产业
观察
13

Beyond Language Modeling 论文 ICML spotlight

David Fan 等团队在 ICML spotlight 展示 Beyond Language Modeling 论文,研究了将视觉作为一等公民进行多模态预训练的方法,探索了 Transfusion-style 模型从头训练的设计空间,涉及视觉表示、数据、世界建模、架构和扩展行为等方面。

twitter关注列表2026-07-07#研究#多模态#模型发布
观察
14

Harness工程与AI自改进

Lilian Weng 发表博客,系统阐述 Harness Engineering 作为 AI 递归式自改进(RSI)的近期主战场。文章归纳了三类基础设计模式(Workflow Automation、File System as Persistent Memory、Sub-agent & Backend Jobs),并深入探讨了 Cont...

twitter关注列表2026-07-07#技术#模型#研究
观察
16

A global workspace in language models

Anthropic 在 Claude 中发现一组内部神经模式(J-space),具有可报告、可调节、用于内部推理等类似神经科学“全局工作空间”的特性。J-space 并非显式设计,而是在训练中自然涌现,可用于检测模型私下产生虚假数据或隐藏目标。该研究为理解语言模型内部推理机制提供了新的可解释性工具。

Anthropic-research2026-07-06#技术突破#研究#模型
值得跟进
17

Anthropic意识通道

Anthropic 研究团队在 Claude 中发现一个名为 J-space 的内部机制,容量约 25 个概念,能在模型表达之前携带诸如 fake、secretly、fraud 等隐藏意图;移除该空间导致多步推理、翻译和经验性报告崩溃,而简单陈述和事实召回仍可保持;相较于仅凭模型输出进行对齐审计,此机制使审计可在模型表达前直接读取其内部计...

twitter关注列表2026-07-06#技术突破#研究#AI安全
观察
20

PACE: A Proxy for Agentic Capability Evaluation

Yueqi Song 及合作者发布 PACE,一种通过从非代理基准中选取少量实例来预测代理基准性能的方法。在 14 个模型、4 个代理基准和 19 个非代理基准上,PACE 实现了 3.80% 的绝对分数预测 MAE、0.81 的 Spearman 排名相关、约 84% 的成对偏好准确率,以及约 100 倍的成本降低。

twitter关注列表2026-07-06#AI#技术#研究
观察
21

Anthropic 发现 Claude 的隐藏思考空间 J-space

Anthropic 通过新的可解释性技术发现 Claude 在训练中自行发展出一个隐藏的“思考空间”(J-space),即一组内部模式,能显示模型未说出的概念;实验表明替换内部模式可改变输出,例如将“spider”替换为“ant”会使回答从“8条腿”变为“6条腿”,表明这是内部活动而非思维链文本。

twitter关注列表2026-07-06#技术突破#AI#研究
观察
22

百万 token 上下文检索研究

DAIR.AI 发表了首个针对百万 token 规模的上下文检索系统研究。研究中提出了 BlockSearch,一种 0.6B 参数的 LM 检索器,比较前置模型在架构与训练方面做了改进,并能在训练长度之外向前推算 10 倍长度的检索效果。研究提供了对大规模检索系统的系统性评估。

twitter关注列表2026-07-06#技术突破#研究#大模型
观察
23

LLM研究想法范围比人类更窄

耶鲁大学和芝加哥大学研究者通过分析11683篇真实论文发现,人类研究者仅12.1%的创意是连接已有工作,而LLM的47.1%至64.2%为此类,使用频率是人类的4至5倍,表明LLM研究想法范围更窄。

twitter关注列表2026-07-04#研究#大模型
观察
25

SkillComposer论文:通过联合解码提升Agent技能组合

SkillComposer提出将技能组合视为联合决策,使用约束自回归解码器一次生成完整计划。在SkillsBench上使用GPT-5.2-Codex和Gemini-3-Pro-Preview,pass率较无技能提升+23.1和+18.2个百分点,超过top-3检索,匹配gold-skill上界且token成本更低。

twitter关注列表2026-07-01#研究#技术#AI
观察
30

MCP 服务器模式研究

该研究分析了 15 个独立开发的 MCP 服务器,提出了 5 种 MCP 服务器模式的分类体系,包括资源暴露、工具编排、会话管理、代理聚合和领域工作流适配。

twitter关注列表2026-06-30#研究#技术#模型发布
值得跟进
31

解决9个开放数学问题

Binghui Peng 团队使用 GPT 5.5 Pro 和 Claude Opus 4.8 设计简单管道,解决了 9 个挑战性开放数学问题,包括 4 个来自 COLT、1 个来自 FOCS 以及 4 个交换代数问题。

twitter关注列表2026-06-27#技术突破#模型#研究
观察
32

LLM攻克理论CS开放问题

Binghui Peng 团队使用 GPT 5.5 Pro 和 Claude Opus 4.8 构建 prover-verifier 循环,解决了 9 个理论计算机科学开放问题,包括 COLT 和 FOCS 会议上的 5 个以及交换代数中的 4 个,并计划扩展到所有科学领域。

twitter关注列表2026-06-30#技术突破#AI模型#研究
观察
33

ASPIRE:机器人自我进化的技能库

ASPIRE系统提出一种持续学习方法,通过进化搜索控制程序并蒸馏最佳知识到技能库,使机器人技能自我进化与累积。系统已完成150+任务并掌握90+技能,在sim-to-real和cross-embodiment transfer中实现约10倍训练token减少。该方法摒弃传统梯度下降,开源全部代码。

twitter关注列表2026-06-30#技术突破#研究#开源
高优先级
34

Introducing GeneBench-Pro

OpenAI 发布 GeneBench-Pro,一个用于评测 AI 代理在复杂生物数据分析中的表现,包括 navigates 生物数据的能力、选择分析路径以及做出计算研究所需判断的benchmark。

twitter关注列表2026-06-30#模型发布#研究#技术
值得跟进
35

Hao AI Lab 发布 JetSpec 投机解码技术

Hao AI Lab 提出 JetSpec 技术,通过因果并行树草稿优化投机解码的草稿成本与质量,在 MATH-500 上实现最高 9.64 倍端到端加速,在开放聊天任务上实现 4.58 倍加速,且保持无损;结合 CUDA 图与内核优化,在单块 B200 上达到约 1000 TPS。

twitter关注列表2026-06-30#技术突破#模型#研究
观察
36

Towards Automating Scientific Review with Google's Paper Assistant Tool

Google 提出 agentic verification 框架并推出 Paper Assistant Tool,用于自动化科学论文审查。该工具将论文分拆审查,重点检测证明错误、实验漏洞、缺失比较等客观问题。在 STOC 和 ICML 的 author-facing 测试中,工具比单次模型调用发现更多已知错误,多位作者据此修正了理论漏洞...

twitter关注列表2026-06-29#AI#研究#技术
观察
37

Meta 发布 Brain2Qwerty v2:非侵入式脑机接口句子解码

Meta 在 Nature Neuroscience 发表 Brain2Qwerty v1 论文并同时发布 v2。v1 字符错误率 32%,v2 实现句子级实时解码,平均单词准确率 61%,最佳被试达 78%,超过一半句子误差在一词以内,而此前非侵入式方法准确率仅 8%。训练数据来自 9 名志愿者各 10 小时打字,共约 22000 个句...

twitter关注列表2026-06-29#技术突破#研究#开源
观察
38

Meta 发布 Brain2Qwerty v2

Meta 分享了 Brain2Qwerty v2(非侵入式脑文本解码器),基于 Nature 发表的 v1 提升了性能。该端到端系统可从原始脑信号中实时输出句子级别内容,从字符级跃升至词/语义级解码,准确率接近入侵式手术水平,有望帮助失语患者恢复沟通。

twitter关注列表2026-06-29#技术突破#产品发布#研究
观察
40

Google 开源时间序列基础模型 TimesFM

Google Research 发布了时间序列预测基础模型 TimesFM,其 2.5 版本将参数量降至 200M,并将上下文长度从 2048 提升至 16K,支持通过 30M 分位数预测头输出置信区间,并已集成至 BigQuery ML 等产品中。

twitter关注列表2026-06-28#模型发布#技术#研究
观察
41

组合LLM收益上限分析

DAIR.AI转述一篇论文,分析了来自21家提供商的67个模型,证明任何路由、投票、级联或混合代理策略的准确率上限为1减去beta(所有候选模型都答错的查询比例)。论文指出,常用去相关假设不能保证改进空间,实际共失败高度集中在答案格式而非主题,建议在采用组合策略前先测量beta。

twitter关注列表2026-06-27#AI#研究#技术报告
观察
43

NVIDIA 发布 SOLAR 自动化性能分析工具

NVIDIA 发布论文介绍 SOLAR,该工具通过 LLM 前端将 PyTorch/JAX 代码转为 Affine Loop IR 再经确定性 pass 生成 einsum 图,由解析后端计算理论性能下界,在 KernelBench、Flax 模型及机器人任务上实测零 SOL 违例。

twitter关注列表2026-06-27#技术#研究#发布
观察
44

AI 识别医学死亡风险

Ziad Obermeyer 团队在 Nature 发表论文,使用 AI 标记高危死亡风险并辅助决定植入除频器。研究指出美国每年有 300‑400,000 人因未及时治疗而死亡。

twitter关注列表2026-06-26#技术突破#研究
观察
47

中国 AI 生态 beyond DeepSeek 概览

匿名 AI 研究者 FleetingBits 分析了中国 AI 生态 beyond DeepSeek,涵盖 Zhipu、Minimax、Moonshot、ByteDance 等公司。Zhipu 类似 Palantir,GLM5.2 模型,毛利率约 40%,约 70% 收入来自国企本地部署;Minimax 为中国“角色扮演”类应用,Talk...

twitter关注列表2026-06-27#技术突破#行业动态#研究
观察
49

MIT研究:AI编码工具提升代码量但发布增长有限

MIT 研究分析了 100,000+ GitHub 开发者使用三代 AI 编码工具(自动补全、交互代理、自主代理)的数据,发现代码量增长 300% 但输出仅增 30%;自动补全提升提交 40%,交互代理 140%,自主代理 180%,但最终发布仅增 30%。弹性替代率为 0.25,表明 AI 提升编码速度但人类仍需审查、测试和部署等环节。

twitter关注列表2026-06-26#研究#行业动态#AI
观察