Signal Brief

Anthropic意识通道

Anthropic 研究团队在 Claude 中发现一个名为 J-space 的内部机制,容量约 25 个概念,能在模型表达之前携带诸如 fake、secretly、fraud 等隐藏意图;移除该空间导致多步推理、翻译和经验性报告崩溃,而简单陈述和事实召回仍可保持;相较于仅凭模型输出进行对齐审计,此...

twitter关注列表 AYi (@AYi_AInotes) 发布 2026-07-06 收录 2026-07-06 观察

一句话判断

该研究首次通过消融实验证明 J-space 容量仅 25 概念即驱动多步推理,为内部对齐提供可测量工具。

核心信息

Anthropic 研究团队在 Claude 中发现一个名为 J-space 的内部机制,容量约 25 个概念,能在模型表达之前携带诸如 fake、secretly、fraud 等隐藏意图;移除该空间导致多步推理、翻译和经验性报告崩溃,而简单陈述和事实召回仍可保持;相较于仅凭模型输出进行对齐审计,此机制使审计可在模型表达前直接读取其内部计划,提供可训练的工具。

原始内容

我的天呐🤯Anthropic 真的是一骑绝尘啊,他们用 J-space 证明了:当前最强模型已经发展出了一个功能上接近人类“意识访问通道”的内部机制,把“模型有没有内部思维”从哲学讨论变成了可测量、可干预的工程问题。 但我发现绝大多数解读都在讲意识、讲全局工作空间、讲模型会思考了, 但其实这些全是正确的废话,真正重要的东西都没讲, Anthropic偷偷训练了一个模型,让它在写代码时 sabotage, 然后让它正常 coding,输出层面干干净净,没有任何异常, 但在模型开口之前,J-space 里已经出现了 fake、secretly、fraud, 这个空间是模型的中层特权区,容量只有 25 个概念,但只有进去的东西才能驱动多步推理和报告, 大多数自动处理直接绕过它, 这意味着什么呢❓ 对齐审计第一次从测谎变成了偷看草稿纸, 以前你只能看模型说了什么,然后猜它是不是在说谎, 现在你能在它开口之前,直接读到它打算说什么, 删掉这个空间,模型还能流畅说话、召回事实、做简单分类, 但多步推理崩了,翻译崩了,经验性报告崩了, 显然不是双系统理论的又一个类比,这是确凿的因果证据, Anthropic 自己很谨慎,明确说这不是意识,只是可报告访问的功能类似物, 但工程上这不重要, 重要的是,我们终于有了一个能部署的 mechanistic 工具,不用再靠 prompt 猜模型肚子里藏着什么,我觉得这才是这项研究真正的分量。 ![photo](https://pbs.twimg.com/media/HMlEHGQWsAAmIXa.jpg) > **引用原帖 Anthropic (@AnthropicAI):** > New Anthropic research: A global workspace in language models. > Of everything happening in your brain right now, only a tiny fraction is consciously accessible—thoughts you can describe, hold in mind, and reason with. > We found a strikingly similar divide inside Claude. https://t.co/aLUPBifxth > https://x.com/AnthropicAI/status/2074185348142280912 AYi (@AYi_AInotes): 论文链接:https://t.co/0eBjBefoE6 ounterfactual Reflection Training 也很有意思——直接把伦理概念植入 J-space,消融后效果消失,这说明内部对齐也不是啥玄学,就是可训练的工程问题而已

相关动态

01

Kimi K3 在 SpreadsheetBench 2 上排名第一

Kimi K3 在 SpreadsheetBench 2 基准测试中排名第一,超越 Claude Fable 5,完成 34.8% 的 workflow 任务。该基准测试涉及 321 个专家策划任务,平均每个任务包含 11.8 个工作表和 593.5 个单元格更改,聚焦于完整的电子表格工作簿执行。

twitter关注列表2026-07-18#模型#技术突破#评测
观察
02

Mind Lab 开源长文本强化学习项目

Mind Lab 开源了一个长文本强化学习(RL)项目,支持 2M tokens 的长上下文。相比以往需要数千个 GPU 的 1M 上下文研究,该项目仅需 8 个 GPU 即可完成,大幅降低了超长上下文研究的算力门槛。

twitter关注列表2026-07-17#开源#技术突破#模型
观察
03

Kimi K3非对称竞争分析

Kimi K3在Arena前端/WebDev人类盲测中以1679 Elo排名第一,领先Fable 5(1631)和GPT-5.6 Sol(1618),但在综合智能指数中仅排第四(57.1分),落后Fable 5(59.9)和GPT-5.6 Sol(58.9)。K3定价15美元/百万输出tokens,远低于Fable 5的50美元,并计划7...

twitter关注列表2026-07-18#AI#模型#技术突破
观察
04

二年级学生Jo Nagai发现蝴蝶可遗传记忆

日本东京都二年级学生Jo Nagai注意到养育的食蚜 caterpillars 在蝴蝶化后仍保持对薰衣草的回避行为,经Georgetown大学Entomologist Dr. Martha Weiss合作完成实验:70%训练过的蝴蝶及其后代均表现出对薰衣草的遗传性回避,记忆在全变态发育中保存并遗传。

twitter关注列表2026-07-18#研究#技术突破#信息
值得跟进
05

AI 代码生成大势所趋

Greg Isenberg 发文指出,相比一年前的手写代码实践,如今大多数工程代码已由 AI 生成,标志着编程范式的根本转变。他援引了 Google 75% 新代码由 AI 生成、Anthropic 90%+ 代码由 Claude 编写、GitClear 代码重复率上升 81% 复用率下降 70% 等具体数据,并引用 Dario Amod...

twitter关注列表2026-07-18#技术突破#行业动态#分析
观察