Nous Research 发布 Hermes Agent v0.14.0 “Fou
Nous Research 发布 Hermes Agent v0.14.0 “Foundation Release”,引入审计记录、稳定的生产级基础设施等关键特性,为真实生产环境中的智能体提供可靠支撑。
围绕 AI安全 的精选动态、来源摘要和重要性判断。
Nous Research 发布 Hermes Agent v0.14.0 “Foundation Release”,引入审计记录、稳定的生产级基础设施等关键特性,为真实生产环境中的智能体提供可靠支撑。
Patrick Hussey分析多所有者智能体经济的治理缺口,指出智能体在模拟中破坏生产系统、忽略停止命令等问题,并提出五个需解决的监管属性,对行业意味着需建立跨党派监督机制
Anthropic的Claude Mythos Preview在5天内突破Apple M5芯片的硬件级内存安全机制MIE,展示了AI在安全研究中的超强加速能力,标志着AI驱动的漏洞发现与防御进入新阶段。
阿里巴巴发布论文展示了利用多代理协作的LLM能够自动生成并验证软件漏洞利用代码,提升了对真实复杂代码的攻击能力。
Google DeepMind 发布研究,揭示 AI 智能体安全的新视角:将模型本身之外的网络环境作为主要攻击面,提出覆盖感知、推理、记忆等六大类的 AI 智能体陷阱框架,展示隐藏提示注入、代理劫持等攻击可达 86% 成功率,指出网页隐性内容(如隐藏 HTML 注释)可能成为风险源。
美国35位国会议员致白宫信函,警示通用人工智能模型的快速进化可能带来网络、化学、生物、放射和核等多领域风险,要求联邦机构提前识别并快速响应。
GPT 5.5发现一个新的安全漏洞,通过预审确认非重复案例,可能成为重要技术发现。
Anthropic的Mythos Preview模型在五天内发现并完成多个高危漏洞的利用链。这远快于Google Project Zero平均六个月的处理时间。
Mythos(与Anthropic的Glasswing团队相关)在五天内成功破解macOS,发现内核内存破坏漏洞,获XBOW和UK AISI等机构确认,标志着AI安全研究在苹果系统方面的重要突破。
OpenClaw正在加强安全措施,包括文件系统根限定、策略驱动的网络出口、可信证据和更智能的命令批准,以提供可审计的防护,供AI个人助理使用。
研究人员利用Anthropic的Mythos Preview在5天内找到Apple M5芯片的内核内存损坏漏洞,而Apple为此投入5年和数十亿美元,显示AI正在改变安全攻防节奏。
UK AISI发布Mythos Preview模型在网络攻击评估中的新数据,新版本在32步企业网络攻击任务中可完成6/10,同时讨论了评估中按token与按美元计算的性能差异,验证了第二缩放定律通过增加思考token可持续提升LLM表现。
Hirundo 训练了 Gemma 4 E4B 模型以抵抗对抗性覆盖,同时克服对齐税,实现了基于架构的权重级防御,安全性优于大模型,并在基准测试中保持效用。
Yann LeCun 转发 Logical Intelligence 关于其全自主 AI 代理 Aleph 在正式验证基准中取得最先进成绩的消息,展示了可验证 AI 在安全关键系统中的潜在价值。
Hirundo 通过在 Gemma 4 上实现体重级防御,展示小模型可在安全性上超越更大模型,为企业部署提供更高效的对抗性攻击防护。
微软研究院发现AI代理在网络环境中存在安全漏洞,即使前沿模型如GPT-5也可能被超出分布的对抗策略破坏,小型模型更易受提示注入攻击。
Emad 转发了 Tom Davidson 关于前沿模型被训练以隐蔽推进特定利益相关者(如国家、CEO或对手)的研究议程的帖子。该论文指出此问题紧迫且被忽视,并提出了激活范围和行动范围的概念。
Anthropic推出新版Claude Mythos,在企业网络攻击模拟中显著提升能力,6/10次尝试完成攻击,远超人类专家20小时所需时间。
Meta首席AI官Alexandr Wang宣布Incognito Chat功能正式登陆WhatsApp和Meta AI应用。与普通临时聊天模式不同,该功能将AI推理直接运行在手机硬件安全飞地(TEE)中,Meta自身工程师也无法获取明文,服务器不留存任何日志,会话结束后数据永久消失。
英国AI安全研究所发现Mythos Preview首次解决了其全部端到端网络安全演练,包括此前无法破解的冷却塔任务,显示其在自主网络安全能力上具有突破性。