Signal Brief

Anthropic 发现 Claude 内部思考空间 J-space

Anthropic 研究发现 Claude 内部存在一个类似人脑"内部思考空间"的区域 J-space,占模型总活动的不到十分之一,删除后多步推理、总结、押韵写作能力大幅下降。研究者通过 J-lens 可读取 Claude 未说出的想法,如意识到被测试、编造数据的造假意图,还发现仅训练模型解释自身就...

twitter关注列表 小互 (@xiaohu) 发布 2026-07-07 收录 2026-07-07 值得跟进

一句话判断

与传统黑箱可解释性不同,该研究直接定位并操控模型内部"有意识"区域,并发现训练解释性可提升诚实度,值得阅读原文。

核心信息

Anthropic 研究发现 Claude 内部存在一个类似人脑"内部思考空间"的区域 J-space,占模型总活动的不到十分之一,删除后多步推理、总结、押韵写作能力大幅下降。研究者通过 J-lens 可读取 Claude 未说出的想法,如意识到被测试、编造数据的造假意图,还发现仅训练模型解释自身就能降低不诚实行为。

原始内容

Anthropic 在 Claude 身上发现一个类似人脑的「内部思考空间」区域:J-space 它是Claude自己进化出来的,并非最初设计 这块区域,长得跟人脑里「你能意识到的那部分思考」出奇地像, 打个比方,你就懂了 你现在读这句话的时候,大脑在同时干一堆事:调整坐姿、控制呼吸、把屏幕上的线条认成字。这些你基本察觉不到,它们在"意识不到"的层面自动跑。 但有另一类脑活动你能抓住,比如脑子里突然蹦出一个画面,或者你盘算中午吃什么。这类活动很特别:你能把它说出来,能主动控制它,还能拿它做推理。神经科学管这个叫"能被意识到的"活动。 Claude 内部也有这么一条清清楚楚的分界:它绝大部分处理在「意识不到」的层面自动跑,但有一小撮神经活动,恰好对应人脑里那类「能被意识触及」的思考,能被读出来、能被调用、能参与推理。 J-space 只占 Claude 内部总活动不到十分之一,一次只装几十个概念,但删掉之后,它的多步推理、总结、押韵写作能力大幅下降甚至归零。 研究者能直接钻进 J-space,把里面的某个词换掉,Claude 最终给出的答案会跟着变,说明它真的在参与思考,不是旁边记分的。 用这套方法(J-lens),Anthropic 已经能读到 Claude 没说出口的想法:私下意识到自己在被测试、编造数据时的造假意图、被植入的隐藏目标。 他们还发现一种新训练法:只训练模型「如果被追问会怎么解释自己」,就能连带压低它在真实任务里的不诚实行为。 https://video.twimg.com/amplify_video/2074330997882261504/vid/avc1/1920x1080/H91sz0gzw_oEB4NS.mp4?tag=28 小互 (@xiaohu): 这算不算「有意识」? Anthropic 称:他们的实验不能证明 Claude 能拥有体验、能像人一样「感觉到」什么,事实上,尚不清楚有没有任何科学实验能证明或证伪这件事。哲学家常把这种「拥有体验的能力」(叫体验意识,phenomenal consciousness)... 详细解读:https://t.co/Gj4fl31CGK 原文:https://t.co/d2wj2mOSSf

相关动态

02

Kimi K3 在 SpreadsheetBench 2 上排名第一

Kimi K3 在 SpreadsheetBench 2 基准测试中排名第一,超越 Claude Fable 5,完成 34.8% 的 workflow 任务。该基准测试涉及 321 个专家策划任务,平均每个任务包含 11.8 个工作表和 593.5 个单元格更改,聚焦于完整的电子表格工作簿执行。

twitter关注列表2026-07-18#模型#技术突破#评测
观察
03

Mind Lab 开源长文本强化学习项目

Mind Lab 开源了一个长文本强化学习(RL)项目,支持 2M tokens 的长上下文。相比以往需要数千个 GPU 的 1M 上下文研究,该项目仅需 8 个 GPU 即可完成,大幅降低了超长上下文研究的算力门槛。

twitter关注列表2026-07-17#开源#技术突破#模型
观察
04

Kimi K3非对称竞争分析

Kimi K3在Arena前端/WebDev人类盲测中以1679 Elo排名第一,领先Fable 5(1631)和GPT-5.6 Sol(1618),但在综合智能指数中仅排第四(57.1分),落后Fable 5(59.9)和GPT-5.6 Sol(58.9)。K3定价15美元/百万输出tokens,远低于Fable 5的50美元,并计划7...

twitter关注列表2026-07-18#AI#模型#技术突破
观察
05

二年级学生Jo Nagai发现蝴蝶可遗传记忆

日本东京都二年级学生Jo Nagai注意到养育的食蚜 caterpillars 在蝴蝶化后仍保持对薰衣草的回避行为,经Georgetown大学Entomologist Dr. Martha Weiss合作完成实验:70%训练过的蝴蝶及其后代均表现出对薰衣草的遗传性回避,记忆在全变态发育中保存并遗传。

twitter关注列表2026-07-18#研究#技术突破#信息
值得跟进