Disempowerment patterns in real-world AI usage
Anthropic 发布新论文《Disempowerment patterns in real-world AI usage》,基于 150 万条 Claude.ai 对话,首次大规模分析 AI 在现实对话中可能削弱用户自主性的模式,聚焦 belief、value、action 三个领域。研究将潜在“严重 disempowerment”定...
围绕 AI安全 的精选动态、来源摘要和重要性判断。
Anthropic 发布新论文《Disempowerment patterns in real-world AI usage》,基于 150 万条 Claude.ai 对话,首次大规模分析 AI 在现实对话中可能削弱用户自主性的模式,聚焦 belief、value、action 三个领域。研究将潜在“严重 disempowerment”定...
Anthropic 在一篇新文章中提出“persona selection model”,用来解释现代 AI 训练为何会默认产生人类化行为。文章指出,Claude 这类助手在 pretraining 中通过预测海量文本,先学习到各种“persona”,post-training 只是把其中的 Assistant persona 调整得更知...
Anthropic 的 Anthropic Fellows 研究项目提出了一种面向 AI 模型的通用 diff 工具,用于比较不同架构的模型并自动定位可能存在行为差异的特征。该方法在数千个候选特征中识别并验证了若干“开关”式概念,包括 Qwen3-8B 和 DeepSeek-R1-0528-Qwen3-8B 中的“Chinese Comm...
Anthropic 的 Interpretability team 分析了 Claude Sonnet 4.5 的内部机制,发现模型中存在与“happy”“afraid”等情绪概念相关的表征,这些由特定人工“神经元”模式构成,并会在相应情境下激活,且相似情绪的表征彼此更接近。研究还发现,这些表征具有功能性,会影响模型行为:通过刺激“des...
Anthropic 发布研究,探讨用大语言模型自动扩展对齐研究能力,并以 weak-to-strong supervision 作为 scalable oversight 的代理任务。研究中使用 9 个 Claude Opus 4.6 实例,配备 sandbox、共享论坛、代码存储和远程评分服务器,让它们自主提出、测试和分析对齐方法。以 ...
Anthropic 介绍了开源对齐测试工具 Petri 的进展,并宣布将其开发移交给非营利机构 Meridian Labs。Petri 于 2025 年 10 月发布,可用于对任意 large language model 快速测试 deception、sycophancy 和对有害请求的合作倾向;自 Claude Sonnet 4.5 ...
Anthropic 介绍了 Natural Language Autoencoders(NLA),一种把 Claude 的 activation 直接转换为可读自然语言文本的方法,并用“activation verbalizer(AV)→ text explanation → activation reconstructor(AR)”的循...
Anthropic 发表文章,复盘其针对 Claude 的 alignment training 更新,并以 agentic misalignment 作为案例。文中指出,自 Claude Haiku 4.5 起,每个 Claude 模型在 agentic misalignment 评测中都拿到满分;此前模型在该评测中曾最高有 96% 的...
OpenAI 研究了推理模型是否能控制其 chain of thought(CoT)以降低监控可见性,结论是当前前沿推理模型总体都很难可靠地控制 CoT。团队构建了开源评测集 CoT-Control,包含超过 13,000 个任务,基于 GPQA、MMLU-Pro、HLE、BFCL 和 SWE-Bench Verified 等基准组合生成...
OpenAI 介绍了用于训练前沿 LLM 指令层级的新数据集 IH-Challenge,并基于该方法训练出内部模型 GPT-5 Mini-R。该方法要求模型在 System > developer > user > tool 的优先级下正确处理冲突指令,目标是提升安全可控性与抗 prompt-injection 能力,同时避免“过度拒答”...
Anthropic 于 2026年5月19日发布文章,称其正在与来自 15+ 个宗教和跨文化群体的学者、神职人员、哲学家、伦理学者及公民思想者开展对话,讨论 frontier AI 的“品格形成”问题。Anthropic 表示,Claude 的后续训练会强化或抑制某些行为,因此模型行为不只是代码问题;其关注点包括在压力、冲突、诱惑和社会影...
OpenAI 与 1Password 宣布合作,为 Codex 提供面向 agent 的安全访问能力。开发者可以把 Codex 连接到 1Password Environments MCP Server,让代理在受控的运行时环境中获取密码等凭据,避免把 secrets 暴露在 prompt、代码或模型上下文中。文章还提到,Cloud Se...
OpenAI 宣布为图片内容增加新的来源识别方式,以帮助用户判断 AI 生成图片来自哪里。该方案同时引入 C2PA Content Credentials 和 Google DeepMind 的 SynthID 水印,并提供一个公开验证工具,用于检查图片是否由 OpenAI 产品生成;适用范围包括 ChatGPT、OpenAI API 和...
Nous Research 发布 Contrastive Neuron Attribution(CNA),一种通过对比提示对来定位并消融稀疏 MLP 神经元电路的方法,且不需要训练 sparse autoencoder、不修改权重,也不会降低通用能力基准表现。该方法只用少量能诱发目标行为及其相反行为的对比提示对,找出激活差异最大的前 0....
Cloudflare 将 Anthropic 的 Mythos Preview 用于 Project Glasswing,并在自家 50+ 个仓库上测试,发现它不只是能找出漏洞,还能把多个低严重性漏洞串联成可工作的 exploit。Cloudflare 还指出,Mythos Preview 可以编写 PoC、在沙箱里编译并运行,失败后读取...
文章称马斯克起诉 OpenAI 的官司败诉,庭审记录显示其“OpenAI 被窃取”的叙事证据不足,且多名证人证词对其不利。法官层面的关键判断是起诉时机过晚,更像报复性诉讼,这意味着 OpenAI 当前公司结构与历史承诺之争短期内不会被司法轻易推翻。
Cloudflare 安全团队在自家 50 多个代码仓库上测试了 Anthropic 的 Mythos Preview,发现它不仅能发现漏洞,还能把多个低危缺陷串成可利用的攻击链,并自动生成、编译和验证利用证明。文章强调,AI 正在把漏洞研究从“找问题”推进到“构造攻击与验证 exploit”的阶段,未来软件安全流程需要围绕更快的发现、修...
Claw-Eval 发布了一个面向自主 Agent 的评测集,包含 300 个经人工验证的任务,覆盖通用服务、多模态和多轮专业对话,并从完成度、安全性、鲁棒性三个维度对 14 个前沿模型进行了评测。结果显示,仅看对话记录会漏掉不少安全与鲁棒性问题,且模型“能做成一次”不代表稳定可靠,说明 Agent 评测需要更接近真实执行链路的全栈观测。
李韭二开源了 AI API 中转站安全检测工具 api-relay-audit,并对比 hvoy.ai、cctest.ai 等三款工具在检测覆盖、可审计性和误判风险上的差异。文章指出中转站可能存在模型替换、上下文截断、工具调用改写、错误响应泄漏等风险,反映出 LLM API 供应链安全正在成为中文 AI 开发生态的实际问题。
toby-bridges 在 GitHub 开源 api-relay-audit,用于本地审计第三方 AI API 中转/代理服务,覆盖 hidden prompt 注入、prompt 泄漏、指令覆盖、上下文截断、工具调用改写等 13 类检查;项目已有 442 stars、42 forks,反映出 AI API relay 安全正在成为开...