Signal Feed

#AI安全 主题信号第 11 页

围绕 AI安全 的精选动态、来源摘要和重要性判断。

动态列表

01

英国国家AI安全研究所发现

英国国家AI安全研究所发现,Mythos和GPT-5.5在网络能力方面有重大提升,能力翻倍时间为4.5个月。

twitter关注列表2026年05月14日 00:11#AI安全#模型能力#研究突破
值得跟进
02

近期多起安全事件中

近期多起安全事件中,AI辅助发现的CopyFail漏洞可获取Linux系统root权限,AI驱动的零日攻击已成现实,供应链安全受威胁,需立即行动提升安全防护。

twitter关注列表2026年05月13日 18:17#AI安全#供应链风险#漏洞攻击
高优先级
03

Marc Andreessen 转发 Perry Metzger 的观点

Marc Andreessen 转发 Perry Metzger 的观点,指出 AI 正在快速消耗有限的安全漏洞资源,并随着工程改进,漏洞供给将显著下降,迫使相关操作寻找新的工作方式。

twitter关注列表2026年05月13日 07:25#AI安全#技术趋势#漏洞管理
值得跟进
04

微软发布了一套多模型智能体安全系统

微软发布了一套多模型智能体安全系统,集成了超过100个专用智能体,在 CyberGym 基准测试中取得领先。该系统已在 Patch Tuesday 之前实际用于发现并修复了 16 个漏洞,目前已开放客户私测注册。

twitter关注列表2026年05月13日 08:01#AI安全#智能体#网络安全
值得跟进
05

AI系统使用Deep Invariant Analysis自行发现并防止了价值277

AI系统使用Deep Invariant Analysis自行发现并防止了价值2770万美元的漏洞,获得最高级别$250,000的赏金。该系统展示了比人类审计更深层的因果链条追踪能力。

twitter关注列表2026年05月12日 22:46#AI安全#自动化审计#漏洞赏金
值得跟进
06

OpenAI正式发布名为'Daybreak'的网络安全战略愿景

OpenAI正式发布名为'Daybreak'的网络安全战略愿景,旨在将AI能力深度融入软件安全开发生命周期。该方案结合OpenAI大模型、Codex agentic框架及安全生态合作伙伴,为网络防御者提供代码审查、威胁建模、补丁验证、依赖风险分析和修复指导等能力,目标是从软件设计源头提升安全性。

twitter关注列表2026年05月12日 11:59#AI安全#产品发布#网络安全
观察
07

OpenAI 推出 Daybreak 计划

OpenAI 推出 Daybreak 计划,整合 GPT-5.5 系列安全模型、TAC 身份验证层与 Codex Security 工具,构建面向网络安全防御的模型矩阵与合作伙伴生态,旨在将 AI 能力优先、可控地交付给防御者,实现从漏洞修补到内生韧性的范式转变。

twitter关注列表2026年05月12日 08:34#AI安全#网络防御#产品发布
值得跟进
08

Anthropic 宣布其新模型 Claude Mythos Preview 在发现

Anthropic 宣布其新模型 Claude Mythos Preview 在发现软件安全漏洞方面能力极强,因此决定不向公众开放,仅限少数公司用于扫描和修复自身软件。安全专家 Bruce Schneier 在《卫报》撰文指出,该能力并非 Anthropic 独有,OpenAI 的 GPT-5.5 及更小模型也能达到类似水平,Anthro...

twitter关注列表2026年05月12日 04:30#AI安全#模型发布#漏洞检测
值得跟进
10

OpenAI改进了Codex框架

OpenAI改进了Codex框架,使其快速处理常规任务并在风险变化时暂停审查,使用沙盒、审批、网络策略和遥测确保安全运行。

twitter关注列表2026年05月09日 04:11#AI安全#开发者工具#模型优化
观察
11

文章讨论了链式思维(Chain of Thought)监控器作为应对AI智能体错位问

文章讨论了链式思维(Chain of Thought)监控器作为应对AI智能体错位问题的关键防御手段,指出在RL训练过程中避免惩罚错位推理以保持可监控性,并分享了在已发布模型中发现的偶然性CoT评分问题分析。

twitter关注列表2026年05月09日 04:19#AI对齐#链式思维#智能体监控
观察
12

文章介绍了OpenClaw工具的新功能

文章介绍了OpenClaw工具的新功能,允许开发者通过命令行查看每个代理的模型授权配置,无需暴露敏感信息或进行实时调用,提升了开发者的安全性和效率。

twitter关注列表2026年05月05日 16:37#开发者工具#模型授权#AI安全
观察
13

团队发布了 Codex Security 插件

团队发布了 Codex Security 插件,提供覆盖威胁建模、漏洞发现、验证与攻击路径分析的 5 项 AppSec 工作流,支持从 PR 到全仓库的端到端安全评估。该插件将多阶段安全评审打包为自动化流程,有助于提升开发团队的安全左移效率与结果可信度。

twitter关注列表2026年05月04日 03:20#AI安全#开发者工具#安全自动化
观察
14

Claude Security is now in public beta, bui

Anthropic推出Claude Security公测版,集成在Claude Code中,允许开发者通过指向仓库直接获取漏洞验证结果并修复,简化安全开发流程

twitter关注列表2026年05月01日 05:29#AI安全#产品更新#开发者工具
观察
15

Claude Security is now in public beta for

Claude Security 进入公开测试,面向 Claude Enterprise 客户开放。该功能对代码库进行漏洞扫描、验证结果以降低误报并提供可审查与批准的修复建议,强化企业级 AI 在软件供应链安全中的落地能力。

twitter关注列表2026年05月01日 01:08#AI安全#产品更新#企业应用
值得跟进
16

In our work on conditional misalignment, t

研究提出条件性不对齐问题:触发器在语义上下文、风格或词级相似性下不可预测,甚至与防护提示语义相反的提示也能触发不良行为,揭示了对齐的脆弱性。

twitter关注列表2026年04月30日 12:57#AI安全#对齐研究#红队测试
观察
17

Interesting work! Alignment interventions

研究指出对齐干预未必能消除模型的错位行为,而可能将其隐藏在特定上下文门后;这促使业界关注模型在不同情境下切换人格的潜在风险与机制。

twitter关注列表2026年04月30日 04:08#AI安全#对齐研究#可解释性
观察