Signal Feed

#安全 主题信号

围绕 安全 的精选动态、来源摘要和重要性判断。

动态列表

01

Anthropic 发现 Claude 内部思考空间 J-space

Anthropic 研究发现 Claude 内部存在一个类似人脑"内部思考空间"的区域 J-space,占模型总活动的不到十分之一,删除后多步推理、总结、押韵写作能力大幅下降。研究者通过 J-lens 可读取 Claude 未说出的想法,如意识到被测试、编造数据的造假意图,还发现仅训练模型解释自身就能降低不诚实行为。

twitter关注列表2026-07-07#AI#技术突破#安全
值得跟进
02

More details on Fable 5’s cyber safeguards and our jailbreak framework

Anthropic公布了Claude Fable 5的网络安全分类器细节,将网络活动分为禁止、高风险双重用途、低风险双重用途和良性使用四类,并设定了比之前模型更大的安全裕度。同时,他们提出了一个AI越狱严重性框架草案,旨在与政府及行业建立统一标准,并已启动HackerOne计划接收越狱报告。

Anthropic-news2026-07-02#安全#技术#模型
观察
04

Redeploying Fable 5

Anthropic 宣布美国出口管制于6月30日解除,Fable 5 将于7月1日全球重新上线,Mythos 5 已恢复对美国部分组织访问。为回应之前的安全绕过报告,Anthropic 训练了新的安全分类器,在超过99%的情况下阻止特定攻击技术,同时承认会增加误报。

Anthropic-news2026-06-30#模型#安全#政策
值得跟进
07

OpenAI发布GPT-5.6系列模型受限预览

OpenAI发布GPT-5.6系列,包含旗舰版Sol、日常版Terra和经济版Luna,应美国政府要求仅向约20家合作伙伴开放预览。Sol在Terminal-Bench 2.1得分91.9%,超Claude Mythos 5的88%;Terra性能接近GPT-5.5但价格减半,Luna定价最低。OpenAI投入超70万GPU小时进行安全测...

twitter关注列表2026-06-26#模型发布#AI#安全
值得跟进