← 返回精选动态
精选动态

Anthropic发现Claude内部工作空间

Anthropic 公布 Claude 内部 J-space 研究

更新于 2026年07月07日 11:43 1 条公开来源

发生了什么

Anthropic 公布 Claude 内部 J-space 研究

为什么值得关注

该研究首次在语言模型中发现与人类全局工作空间理论功能类似的内部工作空间,并展示了其因果影响和安全隐患检测能力,值得阅读原文了解具体实现。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

Anthropic发现Claude内部工作空间

twitter关注列表 2026年07月07日 10:51

Anthropic 研究发现 Claude 内部存在一个称为 J-space 的全局工作空间,通过 Jacobian lens 方法可以读取模型在输出前的内部隐藏信号。该空间类似私有便签本,用于存储中间推理步骤,且因果地影响模型行为,不到 10% 的 Claude 活动形成 J-space。该研究揭示了模型内部可能与人类全局工作空间理论功能类似的机制,可用于检测隐藏的不安全意图。

打开原始来源 ↗
← 返回精选动态