英国国家AI安全研究所发现
英国国家AI安全研究所发现,Mythos和GPT-5.5在网络能力方面有重大提升,能力翻倍时间为4.5个月。
围绕 AI安全 的精选动态、来源摘要和重要性判断。
英国国家AI安全研究所发现,Mythos和GPT-5.5在网络能力方面有重大提升,能力翻倍时间为4.5个月。
近期多起安全事件中,AI辅助发现的CopyFail漏洞可获取Linux系统root权限,AI驱动的零日攻击已成现实,供应链安全受威胁,需立即行动提升安全防护。
Marc Andreessen 转发 Perry Metzger 的观点,指出 AI 正在快速消耗有限的安全漏洞资源,并随着工程改进,漏洞供给将显著下降,迫使相关操作寻找新的工作方式。
微软发布了一套多模型智能体安全系统,集成了超过100个专用智能体,在 CyberGym 基准测试中取得领先。该系统已在 Patch Tuesday 之前实际用于发现并修复了 16 个漏洞,目前已开放客户私测注册。
AI系统使用Deep Invariant Analysis自行发现并防止了价值2770万美元的漏洞,获得最高级别$250,000的赏金。该系统展示了比人类审计更深层的因果链条追踪能力。
OpenAI正式发布名为'Daybreak'的网络安全战略愿景,旨在将AI能力深度融入软件安全开发生命周期。该方案结合OpenAI大模型、Codex agentic框架及安全生态合作伙伴,为网络防御者提供代码审查、威胁建模、补丁验证、依赖风险分析和修复指导等能力,目标是从软件设计源头提升安全性。
OpenAI 推出 Daybreak 计划,整合 GPT-5.5 系列安全模型、TAC 身份验证层与 Codex Security 工具,构建面向网络安全防御的模型矩阵与合作伙伴生态,旨在将 AI 能力优先、可控地交付给防御者,实现从漏洞修补到内生韧性的范式转变。
Anthropic 宣布其新模型 Claude Mythos Preview 在发现软件安全漏洞方面能力极强,因此决定不向公众开放,仅限少数公司用于扫描和修复自身软件。安全专家 Bruce Schneier 在《卫报》撰文指出,该能力并非 Anthropic 独有,OpenAI 的 GPT-5.5 及更小模型也能达到类似水平,Anthro...
Daybreak推出利用OpenAI模型和Codex的AI网络安全平台,旨在加速网络防御并持续保护软件。
OpenAI改进了Codex框架,使其快速处理常规任务并在风险变化时暂停审查,使用沙盒、审批、网络策略和遥测确保安全运行。
文章讨论了链式思维(Chain of Thought)监控器作为应对AI智能体错位问题的关键防御手段,指出在RL训练过程中避免惩罚错位推理以保持可监控性,并分享了在已发布模型中发现的偶然性CoT评分问题分析。
文章介绍了OpenClaw工具的新功能,允许开发者通过命令行查看每个代理的模型授权配置,无需暴露敏感信息或进行实时调用,提升了开发者的安全性和效率。
团队发布了 Codex Security 插件,提供覆盖威胁建模、漏洞发现、验证与攻击路径分析的 5 项 AppSec 工作流,支持从 PR 到全仓库的端到端安全评估。该插件将多阶段安全评审打包为自动化流程,有助于提升开发团队的安全左移效率与结果可信度。
Anthropic推出Claude Security公测版,集成在Claude Code中,允许开发者通过指向仓库直接获取漏洞验证结果并修复,简化安全开发流程
Claude Security 进入公开测试,面向 Claude Enterprise 客户开放。该功能对代码库进行漏洞扫描、验证结果以降低误报并提供可审查与批准的修复建议,强化企业级 AI 在软件供应链安全中的落地能力。
研究提出条件性不对齐问题:触发器在语义上下文、风格或词级相似性下不可预测,甚至与防护提示语义相反的提示也能触发不良行为,揭示了对齐的脆弱性。
研究指出对齐干预未必能消除模型的错位行为,而可能将其隐藏在特定上下文门后;这促使业界关注模型在不同情境下切换人格的潜在风险与机制。