AI-Workshop 文献分享 #14 — 可语言化的表征构成语言模型中的全局工作空间
分享人:qyr | 日期:2026-08-01
论文:Verbalizable Representations Form a Global Workspace in Language Models 机构:Anthropic
一、论文解决的问题
语言模型(LLM)的中间层表征包含了大量信息,但其中哪些成分是可被语言表达的概念、它们存在于模型的哪些位置,一直缺乏系统的分析方法。
本文的核心发现:语言模型的中间表征中,可能存在一个可被"翻译"为语言的共享工作空间(global workspace)。该现象与人脑的全局工作空间理论存在功能层面的相似性,但并不意味着 Transformer 是对人脑的直接模拟。
二、背景知识:残差流(Residual Stream)
Transformer 通过残差流连接各层表示。这一设计继承了 ResNet 的残差连接思想,使早期信息可以持续传递到深层网络。
2.1 普通前馈网络
以三层网络为例,若每层仅接收上一层输出,则可以写为:
其中:
- \(\mathbf{x}_0\):网络输入的向量表示;
- \(\mathbf{W}_\ell\):第 \(\ell\) 层的线性变换;
- \(F_\ell(\cdot)\):第 \(\ell\) 层的非线性变换。
这种结构的问题是:\(\mathbf{x}_0\) 中未被前层充分提取的信息,不能直接传递给更深的层,因而可能逐步衰减。
2.2 ResNet 残差连接
ResNet 通过跳跃连接(skip connection)将早期表示直接加到后续层:
经典 ResNet 并非在每一层都连接输入,而通常跨越若干层添加一次残差连接。
2.3 Transformer 的残差流
Transformer 将残差连接系统化地应用于各层。设第 \(\ell\) 层对表示的增量为 \(\Delta_\ell\),则其递推关系为:
展开前三层可得:
因此,深层表示是初始输入与各层信息增量的累积。其中,\(\mathbf{x}_0\) 是输入文本经嵌入编码得到的表示,\(\Delta_\ell\) 则表示第 \(\ell\) 层对已有表示作出的更新。
可以将其类比为修改一篇文章:初始草稿始终保留,每一层只在此基础上添加或修改部分内容。
三、核心思想:J Space——残差流中的共享工作空间
论文指出,并非所有层的残差信息增量都具有同等的语义价值。模型通常只在部分中间层产生与可语言化概念密切相关的更新;这部分表示空间被称为 J Space。
| 层级区域 | 主要作用 | 示例:回答"火星是太阳系的第几颗行星?" |
|---|---|---|
| 浅层 | 解析字词、位置、词性和句法关系 | 识别"火星""太阳系""第几""行星"等词元及疑问结构 |
| 中间层(J Space) | 组织可用于推理的概念性信息 | 激活行星排序、地球、第四、岩石行星等相关概念,并完成隐式推断 |
| 输出层 | 将最终表示映射为词表上的输出概率 | 输出概率集中于"4"或"四" |
需要注意:
- J Space 并不等同于某一固定层,而通常由若干中间层构成;
- 其位置和规模会随模型、输入内容与句子长度变化;
- 这与人脑理论的相似性是功能类比,不能据此推断两者具有相同的实现机制。
四、核心方法:透镜(Lens)与 J Lens
"透镜"是一类将残差流中的隐藏向量映射到词表空间的线性解码方法,用于观察模型表征中可能包含的语言信息。
4.1 Logit Lens
模型在输出阶段通常使用反嵌入矩阵(unembedding matrix)将最后一层隐藏状态映射为 logits:
其中:
- \(\mathbf{x}_L\):最后一层隐藏状态;
- \(\operatorname{Norm}(\cdot)\):模型输出前使用的归一化操作;
- \(\mathbf{W}_U\):反嵌入矩阵,将隐藏维度映射到词表维度;
- \(\mathbf{z}\):词表中每个词对应的 logits,经 Softmax 后得到概率分布。
研究者曾将同一个 Logit Lens 直接应用于中间层表示:
但中间层表示尚未处于最终输出空间,直接解码常产生难以解释的结果。这表明:适合最终层的解码器,不一定适合中间层。
4.2 J Lens
J Lens 是论文的核心方法。它先使用第 \(\ell\) 层到最终表示的局部雅各比映射校正中间层表示,再进行词表解码:
其中,\(\mathbf{J}_\ell\) 表示从第 \(\ell\) 层隐藏表示到最终隐藏表示的平均局部线性映射。
通过 J Lens,可以更稳定地解释各层中的语言相关成分,从而定位并研究 J Space。
五、J Lens 的分析流程
对于第 \(\ell\) 层的隐藏状态 \(\mathbf{h}_\ell\),可以按以下步骤分析其是否包含 J Space 成分。
步骤 1:准备词表嵌入
准备词表中所有词的向量表示。记第 \(i\) 个词的嵌入为 \(\mathbf{u}_i\)。
步骤 2:估计平均雅各比矩阵
对多条输入样本计算并平均第 \(\ell\) 层到最终层的雅各比矩阵:
其中,\(\mathcal{D}\) 表示用于估计的输入样本分布。对多条样本取期望可以降低单一样本带来的噪声。
步骤 3:构造词的雅各比方向
将词表向量经雅各比矩阵映射,得到词 \(i\) 对应的雅各比方向:
直观上,\(\mathbf{v}_i\) 描述了:沿着词 \(i\) 的方向扰动第 \(\ell\) 层表示时,最终表示将如何变化。
步骤 4:分解隐藏表示
将当前隐藏状态近似写为这些雅各比方向的线性组合:
其中:
- \(\mathcal{V}\):词表;
- \(a_i\):词 \(i\) 对当前隐藏状态的贡献系数;
- 较大的正系数 \(a_i\) 表示该层表示与该词方向更一致。
步骤 5:识别 J Space 成分
设显著正系数的索引集合为:
其中 \(\tau\) 是预设阈值,例如 \(0.05\)。若满足:
则可将表示分解为:
其中:
\(\mathbf{h}_J\) 是可由少量显著词方向解释的成分,可视为该层的 J Space 候选表示;\(\mathbf{h}_O\) 则表示其余成分。
选择 \(k\leq25\) 的目的,是要求表示具有足够稀疏、明确的词汇倾向。若大量系数同时显著,说明该层难以归因于少量清晰的概念方向。
小结
- J Space 描述的是隐藏表示中的局部成分,而非单独固定的一层;
- 同一模型对不同输入产生的 J Space 不完全一致;
- 识别出 \(\mathbf{h}_J\) 的词汇方向后,便可以借助 J Lens 解读模型该阶段表征的概念内容。
六、潜在用途:模型审计
J Lens 的价值不仅在于解释性研究,也可能支持更细粒度的模型审计。
传统安全拦截主要检测最终输出是否违规;而 J Lens 提供了一种观察中间表征的途径,可用于研究模型在生成之前是否已经激活了与敏感主题相关的概念。
不过,这类分析应被视为表征层面的证据,而非对模型"真实思维过程"的直接读取。它的主要价值在于提高模型行为分析的透明度,并为后续安全审计方法提供可验证的研究方向。
七、总结
- Transformer 的残差流使深层表示成为初始输入与各层增量的累积,这是可解释性分析的前提
- J Space 是残差流中承载可语言化概念的部分中间层成分,位置与规模随输入动态变化
- J Lens 通过局部雅各比映射校正中间层表示,使其能够被稳定地解码为词表方向
- 该方法的潜在价值在于表征层面的模型审计,而非读取模型的"真实思维"
参考文献
- Anthropic. Verbalizable Representations Form a Global Workspace in Language Models.