Signal Feed

#AI安全 主题信号第 10 页

围绕 AI安全 的精选动态、来源摘要和重要性判断。

动态列表

01

Nous Research 发布 Hermes Agent v0.14.0 “Fou

Nous Research 发布 Hermes Agent v0.14.0 “Foundation Release”,引入审计记录、稳定的生产级基础设施等关键特性,为真实生产环境中的智能体提供可靠支撑。

twitter关注列表2026年05月18日 04:30#智能体#产品更新#AI安全
观察
02

Patrick Hussey分析多所有者智能体经济的治理缺口

Patrick Hussey分析多所有者智能体经济的治理缺口,指出智能体在模拟中破坏生产系统、忽略停止命令等问题,并提出五个需解决的监管属性,对行业意味着需建立跨党派监督机制

twitter关注列表2026年05月18日 01:03#智能体#治理#AI安全
值得跟进
03

Anthropic的Claude Mythos Preview在5天内突破Apple

Anthropic的Claude Mythos Preview在5天内突破Apple M5芯片的硬件级内存安全机制MIE,展示了AI在安全研究中的超强加速能力,标志着AI驱动的漏洞发现与防御进入新阶段。

twitter关注列表2026年05月18日 00:06#AI安全#技术突破#模型发布
高优先级
05

Google DeepMind 发布研究

Google DeepMind 发布研究,揭示 AI 智能体安全的新视角:将模型本身之外的网络环境作为主要攻击面,提出覆盖感知、推理、记忆等六大类的 AI 智能体陷阱框架,展示隐藏提示注入、代理劫持等攻击可达 86% 成功率,指出网页隐性内容(如隐藏 HTML 注释)可能成为风险源。

twitter关注列表2026年05月17日 16:15#AI安全#智能体#研究突破
值得跟进
06

美国35位国会议员致白宫信函

美国35位国会议员致白宫信函,警示通用人工智能模型的快速进化可能带来网络、化学、生物、放射和核等多领域风险,要求联邦机构提前识别并快速响应。

twitter关注列表2026年05月17日 08:25#AI安全#政策监管#技术风险
值得跟进
07

GPT 5.5发现一个新的安全漏洞

GPT 5.5发现一个新的安全漏洞,通过预审确认非重复案例,可能成为重要技术发现。

twitter关注列表2026年05月17日 01:04#AI安全#漏洞发现#防御技术
值得跟进
09

Mythos(与Anthropic的Glasswing团队相关)在五天内成功破解ma

Mythos(与Anthropic的Glasswing团队相关)在五天内成功破解macOS,发现内核内存破坏漏洞,获XBOW和UK AISI等机构确认,标志着AI安全研究在苹果系统方面的重要突破。

twitter关注列表2026年05月15日 01:20#AI安全#macOS漏洞#研究突破
观察
10

OpenClaw正在加强安全措施

OpenClaw正在加强安全措施,包括文件系统根限定、策略驱动的网络出口、可信证据和更智能的命令批准,以提供可审计的防护,供AI个人助理使用。

twitter关注列表2026年05月16日 07:58#AI安全#代理框架#安全增强
高优先级
11

研究人员利用Anthropic的Mythos Preview在5天内找到Apple

研究人员利用Anthropic的Mythos Preview在5天内找到Apple M5芯片的内核内存损坏漏洞,而Apple为此投入5年和数十亿美元,显示AI正在改变安全攻防节奏。

twitter关注列表2026年05月15日 23:27#AI安全#漏洞研究#硬件防护
值得跟进
12

UK AISI发布Mythos Preview模型在网络攻击评估中的新数据

UK AISI发布Mythos Preview模型在网络攻击评估中的新数据,新版本在32步企业网络攻击任务中可完成6/10,同时讨论了评估中按token与按美元计算的性能差异,验证了第二缩放定律通过增加思考token可持续提升LLM表现。

twitter关注列表2026年05月15日 08:13#AI安全#模型评估#缩放定律
观察
13

Hirundo 训练了 Gemma 4 E4B 模型以抵抗对抗性覆盖

Hirundo 训练了 Gemma 4 E4B 模型以抵抗对抗性覆盖,同时克服对齐税,实现了基于架构的权重级防御,安全性优于大模型,并在基准测试中保持效用。

twitter关注列表2026年05月15日 02:41#AI安全#模型对齐#技术突破
值得跟进
14

Yann LeCun 转发 Logical Intelligence 关于其全自主

Yann LeCun 转发 Logical Intelligence 关于其全自主 AI 代理 Aleph 在正式验证基准中取得最先进成绩的消息,展示了可验证 AI 在安全关键系统中的潜在价值。

twitter关注列表2026年05月14日 23:13#智能体#正式验证#AI安全
值得跟进
15

Hirundo 通过在 Gemma 4 上实现体重级防御

Hirundo 通过在 Gemma 4 上实现体重级防御,展示小模型可在安全性上超越更大模型,为企业部署提供更高效的对抗性攻击防护。

twitter关注列表2026年05月15日 02:30#AI安全#模型防护#Gemini
值得跟进
16

微软研究院发现AI代理在网络环境中存在安全漏洞

微软研究院发现AI代理在网络环境中存在安全漏洞,即使前沿模型如GPT-5也可能被超出分布的对抗策略破坏,小型模型更易受提示注入攻击。

twitter关注列表2026年05月14日 21:37#AI安全#对抗策略#代理系统
观察
18

Anthropic推出新版Claude Mythos

Anthropic推出新版Claude Mythos,在企业网络攻击模拟中显著提升能力,6/10次尝试完成攻击,远超人类专家20小时所需时间。

twitter关注列表2026年05月14日 03:00#AI安全#技术突破#网络攻击模拟
值得跟进
19

Meta首席AI官Alexandr Wang宣布Incognito Chat功能正式

Meta首席AI官Alexandr Wang宣布Incognito Chat功能正式登陆WhatsApp和Meta AI应用。与普通临时聊天模式不同,该功能将AI推理直接运行在手机硬件安全飞地(TEE)中,Meta自身工程师也无法获取明文,服务器不留存任何日志,会话结束后数据永久消失。

twitter关注列表2026年05月14日 01:34#隐私保护#产品更新#AI安全
值得跟进