← 返回精选动态
精选动态

Tracing the thoughts of a large language model

Anthropic 发表 Claude 3.5 Haiku 可解释性研究

更新于 2026年05月21日 14:55 1 条公开来源

发生了什么

Anthropic 发表 Claude 3.5 Haiku 可解释性研究

为什么值得关注

适合点开原文看方法细节与案例设计,尤其是多语言思维、长程规划和伪推理三个结论对后续可解释性与安全研究都有直接参考价值。

信息来源

以下内容来自公开来源,可打开原文继续核验。

01

Tracing the thoughts of a large language m

Anthropic-research 2025年03月27日 17:16

Anthropic 发布两篇新论文,继续推进其用于“观察”大模型内部机制的解释性方法:一篇把模型中的可解释概念连接成计算“电路”,另一篇用该方法深入分析 Claude 3.5 Haiku 的 10 类关键行为。论文显示,Claude 可能在多语言之间共享概念空间、会提前很多词规划诗句,并且在给出错误数学提示时会编造看似合理的推理。Anthropic 还指出,该方法目前只能捕捉 Claude 总计算的一小部分,理解一个短提示的电路仍需数小时人工分析。

打开原始来源 ↗
← 返回精选动态