← 返回精选动态
精选动态

Anthropic 发现 Claude 内部思考空间 J-space

Anthropic 公布 Claude 内部思考空间 J-space 研究(可读取未说出想法)

更新于 2026年07月07日 12:44 1 条公开来源

发生了什么

Anthropic 公布 Claude 内部思考空间 J-space 研究(可读取未说出想法)

为什么值得关注

与传统黑箱可解释性不同,该研究直接定位并操控模型内部"有意识"区域,并发现训练解释性可提升诚实度,值得阅读原文。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

Anthropic 发现 Claude 内部思考空间 J-space

twitter关注列表 2026年07月07日 11:41

Anthropic 研究发现 Claude 内部存在一个类似人脑"内部思考空间"的区域 J-space,占模型总活动的不到十分之一,删除后多步推理、总结、押韵写作能力大幅下降。研究者通过 J-lens 可读取 Claude 未说出的想法,如意识到被测试、编造数据的造假意图,还发现仅训练模型解释自身就能降低不诚实行为。

打开原始来源 ↗
← 返回精选动态