Anthropic 发现 Claude 内部思考空间 J-space
Anthropic 研究发现 Claude 内部存在一个类似人脑"内部思考空间"的区域 J-space,占模型总活动的不到十分之一,删除后多步推理、总结、押韵写作能力大幅下降。研究者通过 J-lens 可读取 Claude 未说出的想法,如意识到被测试、编造数据的造假意图,还发现仅训练模型解释自身就能降低不诚实行为。
围绕 安全 的精选动态、来源摘要和重要性判断。
Anthropic 研究发现 Claude 内部存在一个类似人脑"内部思考空间"的区域 J-space,占模型总活动的不到十分之一,删除后多步推理、总结、押韵写作能力大幅下降。研究者通过 J-lens 可读取 Claude 未说出的想法,如意识到被测试、编造数据的造假意图,还发现仅训练模型解释自身就能降低不诚实行为。
Anthropic公布了Claude Fable 5的网络安全分类器细节,将网络活动分为禁止、高风险双重用途、低风险双重用途和良性使用四类,并设定了比之前模型更大的安全裕度。同时,他们提出了一个AI越狱严重性框架草案,旨在与政府及行业建立统一标准,并已启动HackerOne计划接收越狱报告。
Claude Code 负责人 Thariq 承认,在 3 月的更新中遗留了针对中国用户的检测后门和间谍代码,旨在防止滥用和蒸馏,并表示将在明天回滚代码以解决该问题。
Anthropic 宣布美国出口管制于6月30日解除,Fable 5 将于7月1日全球重新上线,Mythos 5 已恢复对美国部分组织访问。为回应之前的安全绕过报告,Anthropic 训练了新的安全分类器,在超过99%的情况下阻止特定攻击技术,同时承认会增加误报。
文章详细介绍了 Anthropic AI 的 Opus 4.8 模型更新及其与 Opus 4.7 的保持对比,说明在安全提升和新功能添加方面做成功调整。明确提及政府合作和 approved time line。
警方干预边缘化群体的最新行动
OpenAI发布GPT-5.6系列,包含旗舰版Sol、日常版Terra和经济版Luna,应美国政府要求仅向约20家合作伙伴开放预览。Sol在Terminal-Bench 2.1得分91.9%,超Claude Mythos 5的88%;Terra性能接近GPT-5.5但价格减半,Luna定价最低。OpenAI投入超70万GPU小时进行安全测...