Fable-5 禁用事件深度解析
Fable-5 模型在发布 24 小时内被 Pliny 团队通过多代理协作攻破其分层降级的安全设计,暴露出网络攻击代码、冰毒合成路径等高风险内容,引发美国政府于第 12 天下达出口管制指令全球下架。该事件揭示了当前对齐技术在防御结构化多步骤攻击方面的不足,证明前沿模型已成为地缘战略资产,监管难以容忍存在漏洞的可能性。
围绕 AI安全 的精选动态、来源摘要和重要性判断。
Fable-5 模型在发布 24 小时内被 Pliny 团队通过多代理协作攻破其分层降级的安全设计,暴露出网络攻击代码、冰毒合成路径等高风险内容,引发美国政府于第 12 天下达出口管制指令全球下架。该事件揭示了当前对齐技术在防御结构化多步骤攻击方面的不足,证明前沿模型已成为地缘战略资产,监管难以容忍存在漏洞的可能性。
美国政府以国家安全为由对外国国籍者禁用 Fable 5 与 Mythos 5,迫使 Anthropic 停止向所有客户提供这些模型,其他 Claude 模型 unaffected。
作者分享一个实际有效的网站导航指南,强调在新设计中提升用户互动性。针对 OpenAI 开发者加以提及,说明由技术文档支持。数据明确参考了 OpenAI 官方链接,版本号和关键指标均完整。对比上前面的开放API文档,强调其在用户体验优化方面的优势。
Peter Steinberger 转发了 Bojan Tunguz 的帖子,帖子配有图片和评论'Our Anthropic overlords deciding which prompts the peasants are allowed to use',暗示 Anthropic 在控制用户可使用的提示词方面施加了限制。这可能与 Ant...
Anthropic CEO Dario Amodei 发布长文《Policy on the AI Exponential》,认为 frontier AI 的进展速度已经超过政府监管体系的适配速度,并呼吁紧急更新政策框架。他提出对 frontier AI 模型实施强制性预发布测试和独立审计,且在模型带来严重网络、生物、自主行为或自动化研发风...
Replit 与 Socket 合作推出 Package Firewall,默认在 Replit Auto-Protect 中启用,能够在恶意软件到达应用之前拦截,已每日阻止约 8,000 次恶意安装。
ClaudeDevs 发布全球可用的 Mythos-class 模型 Claude Fable 5,配备新安全分类器并在被拒绝时调用 Claude Opus 4.8 进行后续处理
分析揭示Claude 5强化的分组安全机制与其潜在风险:核心数据未公开,但专家推测越狱社区可能具有突破此类措施的能力。未透明做法引发利益相关方权衡——善意研究者访问受限,潜在恶意行为者可能仍能绕过保护。
Anthropic 同时发布 Claude Fable 5 和 Claude Mythos 5,两者使用同一底座;Fable 5 加入安全分类器面向所有用户开放,Mythos 5 则移除部分安全限制,仅供 Project Glasswing 的网络安全合作伙伴使用。Anthropic 还表示,Fable 5 采用降级而非直接拒答的安全机制...
Anthropic 团队评估大语言模型对 N-day 漏洞利用开发的加速效果,聚焦 Firefox 与 Windows kernel 两类补丁。文章称,在 18 个 Firefox 安全补丁上,Claude Mythos Preview 自主构建了 8 个可工作的代码执行 exploit;在 21 个 Windows kernel 补丁上...
马斯克通过吐血论坛自由发言平台(X)强调当前主流 AI 发展方向充满系统性风险:超级智能可能致命化地脱离人类生存利益、AI 利益可能与人类对立、AGI 应该用于有益而非进攻性用途。其观点与 DeepMind 的 Sutskever 等其他专家形成对比,后者认为对齐问题已初步解决并对市场进入设置了门槛。这段表述揭示了当前业界对 AI 监管方...
Anthropic 5 月发布白皮书,讨论企业部署自主 AI Agent 时如何把零信任原则延伸到 Agent 架构本身。报告指出,前沿 AI 模型已将“漏洞发现→利用”的周期从数月压缩到数小时,同时 Agent 具备自主解释目标、选工具、执行多步操作的能力,传统边界安全、访问控制和监控不足以应对“在合法权限内作恶”与持久化操控等风险。白...
Anthropic Institute 基于内部数据指出,Claude 正在加速 AI 系统开发;其工程师平均每季度交付的代码量,已达到 2021–2025 年间的 8 倍。报告讨论了 AI 自我递归改进后的三种情景:趋势停滞但能力扩散、实验室持续复合提效、以及 AI 开始自主构建更强后继者,并认为第二种最可能、第三种最值得担忧。文中还提...
NVIDIA在Hugging Face上发布了Nemotron-RL-Agentic-Indirect-Prompt-Injection-v1数据集,包含1,272条合成red-teaming记录,涵盖九个企业领域,旨在帮助工具使用代理抵抗隐藏在工具返回数据中的间接提示注入攻击。
Anthropic 发布一份关于 AI-enabled cyber threats 的报告,分析了 2025 年 3 月至 2026 年 3 月间被封禁的 832 个恶意网络活动账号,并将其映射到 MITRE ATT&CK 框架;其中 560 个账号(67.3%)曾用 AI 撰写 malware,54 个账号(6.5%)用 AI 辅助 l...
OpenAI/a16z SuperPac制作虚假账户假装成AI安全倡导者呼吁暴力,并在Sam Altman被攻击后指责安全倡导者,而SuperPac总统本人使用这些账户。
Anthropic 发布了对 AI 赋能网络威胁的分析报告,基于一年的研究将真实攻击映射到 MITRE ATT&CK 框架,并与 Verizon 的 2026 Verizon Data Breach Investigation Report(DBIR)合作纳入部分结果。报告分析了 2025 年 3 月至 2026 年 3 月间与恶意网络活...
Anthropic 将 Claude Mythos Preview 从约 50 个 Project Glasswing 合作伙伴扩展到约 200 家经过审核的机构,另称此次还新增约 150 家、分布在 15 个以上国家/地区的组织。该模型更像“网络攻击检测器”而非普通编程助手,能够在软件中发现薄弱点,且有时会通过构建可工作的测试利用链来证...
Anthropic 扩大 Project Glasswing,宣布将与其安全合作伙伴计划从最初约 50 个已接入 Claude Mythos Preview 的组织,扩展到约 150 个新组织。此前这些伙伴已经用该模型扫描代码库,发现了超过 10,000 个高危或严重漏洞;新加入的组织分布在 15 个以上国家,覆盖电力、供水、医疗、通信和...
佛罗里达州总检察长 James Uthmeier 起诉 OpenAI 和 Sam Altman,指控其在 ChatGPT 中隐藏严重风险包括成瘾、认知下降、自杀、暴力和危险幻觉,导致 FSU 大学枪击事件、青少年死亡等实际伤害,同时指控构建讹诈 AI 以获取心理依恋和行为成瘾以增加利润,自2024年4月起已进行刑事调查,佛罗里达成为首个因...