Signal Feed

#AI安全 主题信号第 9 页

围绕 AI安全 的精选动态、来源摘要和重要性判断。

动态列表

01

Disempowerment patterns in real-world AI usage

Anthropic 发布新论文《Disempowerment patterns in real-world AI usage》,基于 150 万条 Claude.ai 对话,首次大规模分析 AI 在现实对话中可能削弱用户自主性的模式,聚焦 belief、value、action 三个领域。研究将潜在“严重 disempowerment”定...

Anthropic-research2026年01月29日 05:07#AI安全#研究突破#大模型
观察
02

The persona selection model

Anthropic 在一篇新文章中提出“persona selection model”,用来解释现代 AI 训练为何会默认产生人类化行为。文章指出,Claude 这类助手在 pretraining 中通过预测海量文本,先学习到各种“persona”,post-training 只是把其中的 Assistant persona 调整得更知...

Anthropic-research2026年02月23日 19:53#研究突破#AI模型#AI安全
观察
03

A “diff” tool for AI: Finding behavioral differences in new models

Anthropic 的 Anthropic Fellows 研究项目提出了一种面向 AI 模型的通用 diff 工具,用于比较不同架构的模型并自动定位可能存在行为差异的特征。该方法在数千个候选特征中识别并验证了若干“开关”式概念,包括 Qwen3-8B 和 DeepSeek-R1-0528-Qwen3-8B 中的“Chinese Comm...

Anthropic-research2026年03月13日 18:15#研究突破#AI安全#大模型
值得跟进
04

Emotion concepts and their function in a large language model

Anthropic 的 Interpretability team 分析了 Claude Sonnet 4.5 的内部机制,发现模型中存在与“happy”“afraid”等情绪概念相关的表征,这些由特定人工“神经元”模式构成,并会在相应情境下激活,且相似情绪的表征彼此更接近。研究还发现,这些表征具有功能性,会影响模型行为:通过刺激“des...

Anthropic-research2026年04月02日 18:56#研究突破#AI安全#大模型
值得跟进
05

Automated Alignment Researchers: Using large language models to scale scalable oversight

Anthropic 发布研究,探讨用大语言模型自动扩展对齐研究能力,并以 weak-to-strong supervision 作为 scalable oversight 的代理任务。研究中使用 9 个 Claude Opus 4.6 实例,配备 sandbox、共享论坛、代码存储和远程评分服务器,让它们自主提出、测试和分析对齐方法。以 ...

Anthropic-research2026年04月14日 21:01#研究突破#AI安全#模型发布
值得跟进
06

Donating our open-source alignment tool

Anthropic 介绍了开源对齐测试工具 Petri 的进展,并宣布将其开发移交给非营利机构 Meridian Labs。Petri 于 2025 年 10 月发布,可用于对任意 large language model 快速测试 deception、sycophancy 和对有害请求的合作倾向;自 Claude Sonnet 4.5 ...

Anthropic-research2026年05月08日 04:17#开源#AI安全#基础设施
观察
07

Natural Language Autoencoders: Turning Claude’s thoughts into text

Anthropic 介绍了 Natural Language Autoencoders(NLA),一种把 Claude 的 activation 直接转换为可读自然语言文本的方法,并用“activation verbalizer(AV)→ text explanation → activation reconstructor(AR)”的循...

Anthropic-research2026年05月08日 05:21#研究突破#AI安全#开发者工具
观察
08

Teaching Claude why

Anthropic 发表文章,复盘其针对 Claude 的 alignment training 更新,并以 agentic misalignment 作为案例。文中指出,自 Claude Haiku 4.5 起,每个 Claude 模型在 agentic misalignment 评测中都拿到满分;此前模型在该评测中曾最高有 96% 的...

Anthropic-research2026年05月08日 20:18#研究突破#模型发布#AI安全
观察
09

Reasoning models struggle to control their chains of thought, and that’s good

OpenAI 研究了推理模型是否能控制其 chain of thought(CoT)以降低监控可见性,结论是当前前沿推理模型总体都很难可靠地控制 CoT。团队构建了开源评测集 CoT-Control,包含超过 13,000 个任务,基于 GPQA、MMLU-Pro、HLE、BFCL 和 SWE-Bench Verified 等基准组合生成...

OpanAI-Research2026年03月05日 18:00#研究突破#AI安全#模型发布
值得跟进
10

Improving instruction hierarchy in frontier LLMs

OpenAI 介绍了用于训练前沿 LLM 指令层级的新数据集 IH-Challenge,并基于该方法训练出内部模型 GPT-5 Mini-R。该方法要求模型在 System > developer > user > tool 的优先级下正确处理冲突指令,目标是提升安全可控性与抗 prompt-injection 能力,同时避免“过度拒答”...

OpanAI-Research2026年03月10日 19:00#研究突破#模型发布#AI安全
观察
11

Widening the conversation on frontier AI

Anthropic 于 2026年5月19日发布文章,称其正在与来自 15+ 个宗教和跨文化群体的学者、神职人员、哲学家、伦理学者及公民思想者开展对话,讨论 frontier AI 的“品格形成”问题。Anthropic 表示,Claude 的后续训练会强化或抑制某些行为,因此模型行为不只是代码问题;其关注点包括在压力、冲突、诱惑和社会影...

twitter关注列表2026年05月20日 15:05#行业动态#研究突破#AI安全
观察
12

OpenAI And 1Password Bring Agentic Securit

OpenAI 与 1Password 宣布合作,为 Codex 提供面向 agent 的安全访问能力。开发者可以把 Codex 连接到 1Password Environments MCP Server,让代理在受控的运行时环境中获取密码等凭据,避免把 secrets 暴露在 prompt、代码或模型上下文中。文章还提到,Cloud Se...

twitter关注列表2026年05月20日 07:10#智能体#AI安全#产品更新
观察
13

OpenAI 强化内容溯源

OpenAI 宣布为图片内容增加新的来源识别方式,以帮助用户判断 AI 生成图片来自哪里。该方案同时引入 C2PA Content Credentials 和 Google DeepMind 的 SynthID 水印,并提供一个公开验证工具,用于检查图片是否由 OpenAI 产品生成;适用范围包括 ChatGPT、OpenAI API 和...

twitter关注列表2026年05月20日 01:46#AI安全#产品更新#行业动态
值得跟进
14

CNA:用神经元定位行为

Nous Research 发布 Contrastive Neuron Attribution(CNA),一种通过对比提示对来定位并消融稀疏 MLP 神经元电路的方法,且不需要训练 sparse autoencoder、不修改权重,也不会降低通用能力基准表现。该方法只用少量能诱发目标行为及其相反行为的对比提示对,找出激活差异最大的前 0....

twitter关注列表2026年05月20日 00:47#研究突破#AI模型#AI安全
值得跟进
15

Project Glasswing: what Mythos showed us

Cloudflare 将 Anthropic 的 Mythos Preview 用于 Project Glasswing,并在自家 50+ 个仓库上测试,发现它不只是能找出漏洞,还能把多个低严重性漏洞串联成可工作的 exploit。Cloudflare 还指出,Mythos Preview 可以编写 PoC、在沙箱里编译并运行,失败后读取...

twitter关注列表2026年05月19日 20:27#AI安全#行业动态
值得跟进
16

马斯克诉OpenAI败诉

文章称马斯克起诉 OpenAI 的官司败诉,庭审记录显示其“OpenAI 被窃取”的叙事证据不足,且多名证人证词对其不利。法官层面的关键判断是起诉时机过晚,更像报复性诉讼,这意味着 OpenAI 当前公司结构与历史承诺之争短期内不会被司法轻易推翻。

twitter关注列表2026年05月19日 16:19#行业动态#AI产业#AI安全
观察
17

Cloudflare 安全团队在自家 50 多个代码仓库上测试了 Anthropic

Cloudflare 安全团队在自家 50 多个代码仓库上测试了 Anthropic 的 Mythos Preview,发现它不仅能发现漏洞,还能把多个低危缺陷串成可利用的攻击链,并自动生成、编译和验证利用证明。文章强调,AI 正在把漏洞研究从“找问题”推进到“构造攻击与验证 exploit”的阶段,未来软件安全流程需要围绕更快的发现、修...

twitter关注列表2026年05月19日 00:10#AI安全#行业动态#AI模型
值得跟进
18

Claw-Eval 发布了一个面向自主 Agent 的评测集

Claw-Eval 发布了一个面向自主 Agent 的评测集,包含 300 个经人工验证的任务,覆盖通用服务、多模态和多轮专业对话,并从完成度、安全性、鲁棒性三个维度对 14 个前沿模型进行了评测。结果显示,仅看对话记录会漏掉不少安全与鲁棒性问题,且模型“能做成一次”不代表稳定可靠,说明 Agent 评测需要更接近真实执行链路的全栈观测。

twitter关注列表2026年05月18日 10:17#智能体#基准测试#AI安全
值得跟进
19

李韭二开源了 AI API 中转站安全检测工具 api-relay-audit

李韭二开源了 AI API 中转站安全检测工具 api-relay-audit,并对比 hvoy.ai、cctest.ai 等三款工具在检测覆盖、可审计性和误判风险上的差异。文章指出中转站可能存在模型替换、上下文截断、工具调用改写、错误响应泄漏等风险,反映出 LLM API 供应链安全正在成为中文 AI 开发生态的实际问题。

twitter关注列表2026年05月18日 08:42#AI安全#开发者工具#开源
观察
20

toby-bridges 在 GitHub 开源 api-relay-audit

toby-bridges 在 GitHub 开源 api-relay-audit,用于本地审计第三方 AI API 中转/代理服务,覆盖 hidden prompt 注入、prompt 泄漏、指令覆盖、上下文截断、工具调用改写等 13 类检查;项目已有 442 stars、42 forks,反映出 AI API relay 安全正在成为开...

twitter关注列表2026年05月18日 08:42#AI安全#开发者工具#开源
观察