发生了什么
Anthropic 公布 Claude 内部思考空间 J-space 研究(可读取未说出想法)
为什么值得关注
与传统黑箱可解释性不同,该研究直接定位并操控模型内部"有意识"区域,并发现训练解释性可提升诚实度,值得阅读原文。
信息来源
以下内容来自公开来源,可打开原文继续核验。
01
Anthropic 发现 Claude 内部思考空间 J-space
Anthropic 研究发现 Claude 内部存在一个类似人脑"内部思考空间"的区域 J-space,占模型总活动的不到十分之一,删除后多步推理、总结、押韵写作能力大幅下降。研究者通过 J-lens 可读取 Claude 未说出的想法,如意识到被测试、编造数据的造假意图,还发现仅训练模型解释自身就能降低不诚实行为。
打开原始来源 ↗