Signal Feed

#AI安全 主题信号第 5 页

围绕 AI安全 的精选动态、来源摘要和重要性判断。

动态列表

01

Fable-5 禁用事件深度解析

Fable-5 模型在发布 24 小时内被 Pliny 团队通过多代理协作攻破其分层降级的安全设计,暴露出网络攻击代码、冰毒合成路径等高风险内容,引发美国政府于第 12 天下达出口管制指令全球下架。该事件揭示了当前对齐技术在防御结构化多步骤攻击方面的不足,证明前沿模型已成为地缘战略资产,监管难以容忍存在漏洞的可能性。

twitter关注列表2026年06月13日 13:25#政策#模型发布#AI安全
值得跟进
02

美国限制 Fable 5 与 Mythos 5

美国政府以国家安全为由对外国国籍者禁用 Fable 5 与 Mythos 5,迫使 Anthropic 停止向所有客户提供这些模型,其他 Claude 模型 unaffected。

twitter关注列表2026年06月13日 10:31#政策#AI安全#行业动态
值得跟进
03

powerful & cool way to navigate a website

作者分享一个实际有效的网站导航指南,强调在新设计中提升用户互动性。针对 OpenAI 开发者加以提及,说明由技术文档支持。数据明确参考了 OpenAI 官方链接,版本号和关键指标均完整。对比上前面的开放API文档,强调其在用户体验优化方面的优势。

twitter关注列表2026年06月13日 03:19#AI#技术发布#产品更新
值得跟进
04

Anthropic 提示限制讨论

Peter Steinberger 转发了 Bojan Tunguz 的帖子,帖子配有图片和评论'Our Anthropic overlords deciding which prompts the peasants are allowed to use',暗示 Anthropic 在控制用户可使用的提示词方面施加了限制。这可能与 Ant...

twitter关注列表2026年06月10日 22:27#AI#技术#AI安全
观察
05

Policy on the AI Exponential

Anthropic CEO Dario Amodei 发布长文《Policy on the AI Exponential》,认为 frontier AI 的进展速度已经超过政府监管体系的适配速度,并呼吁紧急更新政策框架。他提出对 frontier AI 模型实施强制性预发布测试和独立审计,且在模型带来严重网络、生物、自主行为或自动化研发风...

twitter关注列表2026年06月11日 04:17#AI安全#行业动态#分析
值得跟进
06

Replit 推出 Package Firewall

Replit 与 Socket 合作推出 Package Firewall,默认在 Replit Auto-Protect 中启用,能够在恶意软件到达应用之前拦截,已每日阻止约 8,000 次恶意安装。

twitter关注列表2026年06月11日 00:43#产品更新#AI安全
观察
07

ClaudeFable 5 首发

ClaudeDevs 发布全球可用的 Mythos-class 模型 Claude Fable 5,配备新安全分类器并在被拒绝时调用 Claude Opus 4.8 进行后续处理

twitter关注列表2026年06月10日 03:24#模型发布#AI安全#技术
观察
08

Claude 5 分组安全措施引发社区担忧

分析揭示Claude 5强化的分组安全机制与其潜在风险:核心数据未公开,但专家推测越狱社区可能具有突破此类措施的能力。未透明做法引发利益相关方权衡——善意研究者访问受限,潜在恶意行为者可能仍能绕过保护。

twitter关注列表2026年06月10日 02:02#AI安全#大模型#分析
值得跟进
09

Anthropic 发布 Claude Fable 5

Anthropic 同时发布 Claude Fable 5 和 Claude Mythos 5,两者使用同一底座;Fable 5 加入安全分类器面向所有用户开放,Mythos 5 则移除部分安全限制,仅供 Project Glasswing 的网络安全合作伙伴使用。Anthropic 还表示,Fable 5 采用降级而非直接拒答的安全机制...

twitter关注列表2026年06月10日 01:22#模型发布#产品更新#AI安全
值得跟进
10

Measuring LLMs' Impact on N-day Exploits

Anthropic 团队评估大语言模型对 N-day 漏洞利用开发的加速效果,聚焦 Firefox 与 Windows kernel 两类补丁。文章称,在 18 个 Firefox 安全补丁上,Claude Mythos Preview 自主构建了 8 个可工作的代码执行 exploit;在 21 个 Windows kernel 补丁上...

Anthropic-red2026年06月08日 08:00#研究#技术报告#AI安全
值得跟进
11

Elon Musk 批评 AI 行业出现「脱离人类共同目标」的风险

马斯克通过吐血论坛自由发言平台(X)强调当前主流 AI 发展方向充满系统性风险:超级智能可能致命化地脱离人类生存利益、AI 利益可能与人类对立、AGI 应该用于有益而非进攻性用途。其观点与 DeepMind 的 Sutskever 等其他专家形成对比,后者认为对齐问题已初步解决并对市场进入设置了门槛。这段表述揭示了当前业界对 AI 监管方...

twitter关注列表2026年06月08日 04:55#AI安全#超级智能#人机共生
值得跟进
12

面向 AI Agent 的零信任安全

Anthropic 5 月发布白皮书,讨论企业部署自主 AI Agent 时如何把零信任原则延伸到 Agent 架构本身。报告指出,前沿 AI 模型已将“漏洞发现→利用”的周期从数月压缩到数小时,同时 Agent 具备自主解释目标、选工具、执行多步操作的能力,传统边界安全、访问控制和监控不足以应对“在合法权限内作恶”与持久化操控等风险。白...

twitter关注列表2026年06月06日 20:19#行业动态#技术#AI安全
观察
13

Anthropic 讨论递归自我改进

Anthropic Institute 基于内部数据指出,Claude 正在加速 AI 系统开发;其工程师平均每季度交付的代码量,已达到 2021–2025 年间的 8 倍。报告讨论了 AI 自我递归改进后的三种情景:趋势停滞但能力扩散、实验室持续复合提效、以及 AI 开始自主构建更强后继者,并认为第二种最可能、第三种最值得担忧。文中还提...

twitter关注列表2026年06月05日 12:09#研究#分析#AI安全
观察
14

NVIDIA发布Agentic安全数据集

NVIDIA在Hugging Face上发布了Nemotron-RL-Agentic-Indirect-Prompt-Injection-v1数据集,包含1,272条合成red-teaming记录,涵盖九个企业领域,旨在帮助工具使用代理抵抗隐藏在工具返回数据中的间接提示注入攻击。

twitter关注列表2026年06月04日 23:14#AI安全#模型发布#技术
值得跟进
15

What we learned mapping a year’s worth of AI-enabled cyber threats

Anthropic 发布一份关于 AI-enabled cyber threats 的报告,分析了 2025 年 3 月至 2026 年 3 月间被封禁的 832 个恶意网络活动账号,并将其映射到 MITRE ATT&CK 框架;其中 560 个账号(67.3%)曾用 AI 撰写 malware,54 个账号(6.5%)用 AI 辅助 l...

Anthropic-research2026年06月03日 18:55#分析#AI安全#行业动态
值得跟进
16

OpenAI/a16z SuperPac造假抹黑安全倡导者

OpenAI/a16z SuperPac制作虚假账户假装成AI安全倡导者呼吁暴力,并在Sam Altman被攻击后指责安全倡导者,而SuperPac总统本人使用这些账户。

twitter关注列表2026年06月04日 03:27#AI安全#行业动态
值得跟进
17

Mapping AI-enabled cyber threats: Insights from the LLM ATT&CK Navigator

Anthropic 发布了对 AI 赋能网络威胁的分析报告,基于一年的研究将真实攻击映射到 MITRE ATT&CK 框架,并与 Verizon 的 2026 Verizon Data Breach Investigation Report(DBIR)合作纳入部分结果。报告分析了 2025 年 3 月至 2026 年 3 月间与恶意网络活...

Anthropic-red2026年06月03日 08:00#AI安全#研究#分析
值得跟进
18

Anthropic 扩大 Claude Mythos Preview

Anthropic 将 Claude Mythos Preview 从约 50 个 Project Glasswing 合作伙伴扩展到约 200 家经过审核的机构,另称此次还新增约 150 家、分布在 15 个以上国家/地区的组织。该模型更像“网络攻击检测器”而非普通编程助手,能够在软件中发现薄弱点,且有时会通过构建可工作的测试利用链来证...

twitter关注列表2026年06月02日 22:01#行业动态#技术#AI安全
值得跟进
19

Expanding Project Glasswing

Anthropic 扩大 Project Glasswing,宣布将与其安全合作伙伴计划从最初约 50 个已接入 Claude Mythos Preview 的组织,扩展到约 150 个新组织。此前这些伙伴已经用该模型扫描代码库,发现了超过 10,000 个高危或严重漏洞;新加入的组织分布在 15 个以上国家,覆盖电力、供水、医疗、通信和...

Anthropic-news2026年06月02日 08:00#AI安全#产品更新#行业动态
观察
20

佛罗里达州起诉 OpenAI 和 Sam Altman

佛罗里达州总检察长 James Uthmeier 起诉 OpenAI 和 Sam Altman,指控其在 ChatGPT 中隐藏严重风险包括成瘾、认知下降、自杀、暴力和危险幻觉,导致 FSU 大学枪击事件、青少年死亡等实际伤害,同时指控构建讹诈 AI 以获取心理依恋和行为成瘾以增加利润,自2024年4月起已进行刑事调查,佛罗里达成为首个因...

twitter关注列表2026年06月02日 00:21#行业动态#AI安全#政策
值得跟进