LLMs and Biorisk
Anthropic 发文讨论 LLMs 与生物风险,指出 Claude Opus 4 发布时已启用 AI Safety Level 3(ASL-3)防护,用于限制模型协助化学、生物、放射和核(CBRN)武器开发相关任务。文章称,Benchling 正在用 Claude 帮研究人员整理数据、提问和更快生成洞见,Biomni 正在用 Clau...
围绕 研究突破 的精选动态、来源摘要和重要性判断。
Anthropic 发文讨论 LLMs 与生物风险,指出 Claude Opus 4 发布时已启用 AI Safety Level 3(ASL-3)防护,用于限制模型协助化学、生物、放射和核(CBRN)武器开发相关任务。文章称,Benchling 正在用 Claude 帮研究人员整理数据、提问和更快生成洞见,Biomni 正在用 Clau...
Anthropic 发布研究 Project Fetch,邀请 8 名 Anthropic 研究员和工程师(都没有机器人领域经验)随机分成两组:4 人可用 Claude,4 人不可用,要求操作四足机器人完成“捡回沙滩球”的任务。结果显示,Claude 组平均完成任务更快,速度约为无 Claude 组的一半,且只有 Claude 组在让机器...
Anthropic 及其 MATS/Anthropic Fellows 项目团队发布 SCONE-bench,这是首个按“模拟被盗资金总美元价值”评估智能体利用智能合约漏洞能力的基准。该基准包含 405 个在 2020 至 2025 年间真实被利用过的合约,覆盖 3 条 Ethereum 兼容链;团队在其中对截至知识截止日期之后才被攻破的...
Anthropic 与 Pacific Northwest National Laboratory(PNNL)合作,探索用 Claude 支持关键基础设施网络防御。PNNL 在一个高保真水处理厂仿真环境中,用 Claude 进行对手模拟与攻击重构,估计把原本需要数周的工作缩短到 3 小时;该实验使用的是 2025 年夏季的 Claude ...
Anthropic、MATS 和 Northeastern University 的 Muhammad Maaz、Liam DeVoe、Zac Hatfield-Dodds、Nicholas Carlini 发布了一项在 2025 年 NeurIPS Deep Learning for Code Workshop 展示的工作,构建了一个基...
Anthropic 在与 Carnegie Mellon University 的 CyLab 和 Incalmo 合作的现实化 cyber ranges 上评估 AI 模型的网络攻防能力。结果显示,Claude Sonnet 4.5 已能在 9 个网络中的少数网络上,不依赖此前几代模型所需的自定义 cyber toolkit,而是仅用 ...
Anthropic 团队发布了对 Claude 生成 CVE-2026-2796 利用链的逆向分析,称 Claude Opus 4.6 在与 Mozilla 的合作中,2 周内发现了 Firefox 的 22 个漏洞,并在一个专门削弱浏览器安全特性的测试环境里,为 CVE-2026-2796 写出了可运行的 exploit。该尝试给了模型...
Anthropic 在发布 Claude Mythos Preview 后,公布了其在网络安全任务上的内部评估结果,并启动 Project Glasswing,目标是用 Mythos Preview 帮助加固关键软件、应对网络攻击者。Anthropic 说,该模型能在所有主流操作系统和主流浏览器中识别并利用零日漏洞,甚至可对 Mozill...
Anthropic 发表文章,系统解释如何为 AI agents 设计评测(evals)。文中区分了单轮评测与多轮评测,并给出 task、trial、grader、transcript、outcome、evaluation harness、agent harness、evaluation suite 等定义;同时指出 agent 评测更复...
一篇关于 agentic coding 评测基础设施噪声的分析指出,SWE-bench 和 Terminal-Bench 这类基准的分数差距常只有几个百分点,但底层资源配置本身就能造成超过这一幅度的变化。作者团队在 Google Kubernetes Engine 上运行 Terminal-Bench 2.0 时发现,严格执行任务资源规格...
Anthropic 团队发表论文《Predictability and Surprise in Large Generative Models》,讨论大规模生成式模型的一个矛盾特性:训练损失在广泛数据分布上可预测,符合 scaling laws,但具体能力、输入和输出却具有不可预测性。论文以 GPT-3、Megatron-Turing N...
Anthropic 团队研究了大模型训练中的重复数据影响,训练了一组大部分数据唯一、少量数据被重复多次的模型,系统分析重复数据对性能和机制的作用。结果发现明显的“双重下降”现象:在训练中途,重复数据会让测试损失上升;例如,一个 800M 参数模型只要把 0.1% 的数据重复 100 次,性能就可能退化到相当于 400M 参数模型的水平,即...
研究者评估语言模型能否判断自身回答是否正确,以及能否预测自己是否知道答案。结果显示,在提供合适格式时,更大的模型在多项选择题和判断题上校准较好;在开放式采样任务中,先生成答案再估计该答案为真的概率“P(True)”也表现出较好的性能、校准性和规模效应。进一步让模型在预测某个具体候选答案是否为真之前先考虑多个自生成样本,可继续提升自评表现;...
Anthropic 研究了对语言模型进行 red teaming 以发现、衡量并降低有害输出的方法,比较了 4 种模型类型:普通 LM、经过 helpful/honest/harmless 提示的 LM、使用 rejection sampling 的模型,以及通过 RLHF 训练的 helpful/harmless 模型。研究覆盖 3 个...
论文使用在合成数据上训练的简化 ReLU 网络研究“superposition”现象,即模型表示的特征数量超过其维度的情况。作者指出,在特征稀疏时,superposition 允许模型实现比线性模型更高的压缩,但代价是会引入需要通过非线性过滤来处理的“interference”。
作者讨论了 large language models 的 scalable oversight 问题,即如何监督可能在多数任务能力上超过人类的系统,并提出一种可用于实证研究的实验设计:选择“人类专家能做、普通人和当前通用 AI 系统都做不好”的任务。论文用两个问答任务 MMLU 和 time-limited QuALITY 做了概念验证...
Anthropic 提出 Constitutional AI,用一组规则或原则替代人工标注有害输出,训练一个“无害但不回避”的 AI assistant。方法分为监督学习和强化学习两阶段:监督阶段先从初始模型采样,生成自我批评与修订,再用修订后的回答微调原模型;强化学习阶段先从微调模型采样,用模型比较两条样本优劣,再训练偏好模型并以此作为...
研究团队提出用 language models 自动生成评测集来发现模型行为,而不是依赖耗时的众包或现成数据源。团队测试了从让模型直接写 yes/no 问题,到构造多阶段生成与过滤的复杂 Winogender schemas 等方法,共生成 154 个数据集;众包工人认为这些样例相关性很高,且标签一致率达到 90%–100%,有时甚至高于...
研究团队考察了大语言模型在输出 Chain-of-Thought(CoT)推理时,这些“逐步推理”是否忠实反映了模型真实的决策过程。研究通过干预 CoT 内容(例如加入错误或改写措辞)观察模型预测变化,发现不同任务中模型对 CoT 的依赖程度差异很大:有时强烈依赖 CoT,有时主要忽略它。研究还指出,CoT 带来的性能提升似乎并不只是来自...
研究者使用 Eigenvalue-corrected Kronecker-Factored Approximate Curvature(EK-FAC)近似,将 influence functions 扩展到最多 520 亿参数的 LLM。实验显示,EK-FAC 在影响函数估计准确率上与传统方法相近,但 IHVP 计算速度快了几个数量级;同...