← 返回精选动态
精选动态

A global workspace in language models

Anthropic 发表 语言模型全局工作空间研究

更新于 2026年07月07日 10:11 1 条公开来源

发生了什么

Anthropic 发表 语言模型全局工作空间研究

为什么值得关注

该研究揭示了语言模型内部存在类似人类意识的全局工作空间,为可解释性提供了新方法,值得深入阅读原文和复现代码。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

A global workspace in language models

Anthropic-research 2026年07月06日 22:12

Anthropic 在 Claude 中发现一组内部神经模式(J-space),具有可报告、可调节、用于内部推理等类似神经科学“全局工作空间”的特性。J-space 并非显式设计,而是在训练中自然涌现,可用于检测模型私下产生虚假数据或隐藏目标。该研究为理解语言模型内部推理机制提供了新的可解释性工具。

打开原始来源 ↗
← 返回精选动态