Signal Feed

#研究突破 主题信号第 10 页

围绕 研究突破 的精选动态、来源摘要和重要性判断。

动态列表

01

Automated Alignment Researchers: Using large language models to scale scalable oversight

Anthropic 发布研究,探讨用大语言模型自动扩展对齐研究能力,并以 weak-to-strong supervision 作为 scalable oversight 的代理任务。研究中使用 9 个 Claude Opus 4.6 实例,配备 sandbox、共享论坛、代码存储和远程评分服务器,让它们自主提出、测试和分析对齐方法。以 ...

Anthropic-research2026年04月14日 21:01#研究突破#AI安全#模型发布
值得跟进
02

What 81,000 people told us about the economics of AI

Anthropic 基于对 81,000 名 Claude 用户的调查,分析了人们对 AI 经济影响的看法,并将这些看法与 Claude 的实际使用暴露度进行对照。结果显示,在 AI 暴露度更高的岗位中,受访者对 AI 驱动的失业替代更担忧;每增加 10 个百分点的暴露度,感知到的岗位威胁上升 1.3 个百分点,暴露度最高 25% 的人提...

Anthropic-research2026年04月22日 22:12#行业动态#研究突破#大模型
观察
03

Evaluating Claude’s bioinformatics research capabilities with BioMysteryBench

Anthropic 的研究团队成员 Brianna 介绍了 BioMysteryBench 这一生物信息学基准,用来评估 Claude 在真实世界生物数据集上的分析能力。文章称,他们观察到 Claude 在生物学科研能力上跨代提升明显,当前模型表现已与人类专家相当,最新一代模型还解出了一个人类专家小组未能解决的多道问题,并且有时采用了与人...

Anthropic-research2026年04月30日 04:26#研究突破#模型发布#基准测试
观察
04

Natural Language Autoencoders: Turning Claude’s thoughts into text

Anthropic 介绍了 Natural Language Autoencoders(NLA),一种把 Claude 的 activation 直接转换为可读自然语言文本的方法,并用“activation verbalizer(AV)→ text explanation → activation reconstructor(AR)”的循...

Anthropic-research2026年05月08日 05:21#研究突破#AI安全#开发者工具
观察
05

Teaching Claude why

Anthropic 发表文章,复盘其针对 Claude 的 alignment training 更新,并以 agentic misalignment 作为案例。文中指出,自 Claude Haiku 4.5 起,每个 Claude 模型在 agentic misalignment 评测中都拿到满分;此前模型在该评测中曾最高有 96% 的...

Anthropic-research2026年05月08日 20:18#研究突破#模型发布#AI安全
观察
06

Our First Proof submissions

OpenAI 使用内部模型完成了 First Proof 项目的全部 10 道研究级数学证明题,并于 2026 年 2 月 14 日 0:00 PT 公开了 10 份 proof attempts 及附录中的 prompt patterns 和示例。根据专家反馈,OpenAI 认为其中第 4、5、6、9、10 题的证明尝试“很有可能正确”...

OpanAI-Research2026年02月20日 22:30#研究突破#大模型#AI模型
值得跟进
07

Why we no longer evaluate SWE-bench Verified

OpenAI 表示,自 2024 年 8 月发布 SWE-bench Verified 以来,该基准已被行业广泛用于衡量模型在自主软件工程任务上的进展,但其最近 6 个月的成绩只从 74.9% 提升到 80.9%。OpenAI 进一步分析了一个 27.6% 的子集,发现至少 59.4% 的审计题目存在测试用例或题目描述问题,导致功能正确的...

OpanAI-Research2026年02月23日 19:00#基准测试#研究突破#行业动态
值得跟进
08

Reasoning models struggle to control their chains of thought, and that’s good

OpenAI 研究了推理模型是否能控制其 chain of thought(CoT)以降低监控可见性,结论是当前前沿推理模型总体都很难可靠地控制 CoT。团队构建了开源评测集 CoT-Control,包含超过 13,000 个任务,基于 GPQA、MMLU-Pro、HLE、BFCL 和 SWE-Bench Verified 等基准组合生成...

OpanAI-Research2026年03月05日 18:00#研究突破#AI安全#模型发布
值得跟进
09

Improving instruction hierarchy in frontier LLMs

OpenAI 介绍了用于训练前沿 LLM 指令层级的新数据集 IH-Challenge,并基于该方法训练出内部模型 GPT-5 Mini-R。该方法要求模型在 System > developer > user > tool 的优先级下正确处理冲突指令,目标是提升安全可控性与抗 prompt-injection 能力,同时避免“过度拒答”...

OpanAI-Research2026年03月10日 19:00#研究突破#模型发布#AI安全
观察
10

An OpenAI model has disproved a central co

OpenAI 表示,其一个内部通用推理模型在平面 unit distance problem 上推翻了长期以来关于“square grid”构造近似最优的猜想,并给出了一个使 unit-distance pairs 数量达到多项式改进的无限构造族。该证明已由一组外部数学家核查,OpenAI 还发布了证明正文、外部数学家写的 compani...

OpanAI-Research2026年05月20日 08:00#研究突破#大模型#行业动态
高优先级
11

SAM 3 开源仓库

Meta Superintelligence Labs 开源了 SAM 3 仓库,用于图像和视频中的 promptable segmentation,支持用文本或点、框、mask 等视觉提示进行检测、分割和跟踪。相比 SAM 2,SAM 3 增加了对开放词汇概念的穷尽式分割能力;其新 SA-CO 基准包含 27 万个独特概念,宣称达到人类...

twitter关注列表2026年05月21日 13:38#模型发布#开源#研究突破
观察
12

OpenAI 计划发布通用 LLM

OpenAI 通过 Noam Brown 透露,正在分享一个内部通用大模型在平面单位距离问题上取得突破。该模型并非专门针对数学或该题训练,也不是 scaffold;OpenAI 表示没有把它在开放问题上推到极限,而是希望尽快发布,让更多人自行使用。原帖还提到,距离“不到 1 年前”前沿 AI 模型还处于 IMO 金牌水平,而这次进展被描述...

twitter关注列表2026年05月21日 05:20#模型发布#研究突破#大模型
值得跟进
13

MeMo: Memory as a Model

DAIR.AI 转发并介绍了论文《MeMo: Memory as a Model》(arXiv:2605.15156,2026年5月14日提交)。论文提出用一个独立训练的 memory model 为任意 LLM 增强记忆能力,在保持 LLM 参数不变的情况下存储、检索并融合新事实。作者称该方法可避免 catastrophic forge...

twitter关注列表2026年05月21日 03:30#研究突破#大模型#开发者工具
观察
14

A Methodology for Selecting and Composing

Vasundra Srinivasan 在 arXiv 发布论文《A Methodology for Selecting and Composing Runtime Architecture Patterns for Production LLM Agents》,提出将生产级 LLM agent 中随机模型输出与确定性软件系统之间的边界定...

twitter关注列表2026年05月21日 02:00#智能体#研究突破#开发者工具
值得跟进
15

Grok 税改分析

Emad (@EMostaque) 引用 Grok 对一张美国联邦税改信息图的分析,称把美国下半数家庭的联邦税降为 0,可能帮助数百万人、对税收影响很小,并让经济增加超过 1000 亿美元。Grok 给出的共享对话进一步称,最新 IRS 和 Tax Foundation 数据显示,美国底部 50% 纳税人(AGI 约低于 5 万至 5.4...

twitter关注列表2026年05月21日 01:37#行业动态#研究突破
观察
16

Terminal-Bench Science

Terminal-Bench Science 发布了一个面向自然科学真实计算工作流的 AI agents 基准,目标是评估模型在科学研究中的工具使用与任务执行能力。项目面向 life sciences、physical sciences、earth sciences,并同时开放 mathematical sciences 等领域的任务贡献...

twitter关注列表2026年05月21日 01:47#基准测试#智能体#研究突破
值得跟进
17

Query-Aware Context Compression for Better

Perplexity 发布并产品化了 query-aware context compression,用于更快、更干净、准确度更高的搜索。其系统可将 context tokens 最多压缩 70%,同时提升答案质量;在 SimpleQA 上达到 50x 压缩比,并保持 frontier-level performance。Perplexi...

twitter关注列表2026年05月21日 01:26#开发者工具#研究突破#产品更新
值得跟进
18

ESI-Bench

由 Yining Hong、Jiageng Liu、Han Yin、Manling Li、Leonidas Guibas、Li Fei-Fei、Jiajun Wu、Yejin Choi 等人提出的 ESI-BENCH,旨在衡量 embodied spatial intelligence 中的 perception-action loop。...

twitter关注列表2026年05月20日 23:59#基准测试#研究突破#智能体
观察
19

Anti-Self-Distillation for Reasoning RL vi

研究团队提出 Anti-Self-Distillation(AntiSD),用于 reasoning RL 中的 self-distillation。作者用 pointwise mutual information 分析发现,带有 verified solution 等 privileged context 的 teacher 会对结构性...

twitter关注列表2026年05月20日 23:51#研究突破#大模型#基准测试
观察
20

Widening the conversation on frontier AI

Anthropic 于 2026年5月19日发布文章,称其正在与来自 15+ 个宗教和跨文化群体的学者、神职人员、哲学家、伦理学者及公民思想者开展对话,讨论 frontier AI 的“品格形成”问题。Anthropic 表示,Claude 的后续训练会强化或抑制某些行为,因此模型行为不只是代码问题;其关注点包括在压力、冲突、诱惑和社会影...

twitter关注列表2026年05月20日 15:05#行业动态#研究突破#AI安全
观察