AI-Workshop 文献分享 2026-08-01 21:30

AI-Workshop 文献分享 #14 — 可语言化的表征构成语言模型中的全局工作空间

分享 Anthropic 论文:语言模型中间表征中存在可被"翻译"为语言的共享工作空间(J Space)。从残差流讲起,介绍 J Lens 方法如何定位并解读可语言化成分,及其在模型审计中的潜在用途。

AI-Workshop 文献分享 可解释性 表征分析 全局工作空间

AI-Workshop 文献分享 #14 — 可语言化的表征构成语言模型中的全局工作空间

分享人:qyr | 日期:2026-08-01

论文:Verbalizable Representations Form a Global Workspace in Language Models 机构:Anthropic


一、论文解决的问题

语言模型(LLM)的中间层表征包含了大量信息,但其中哪些成分是可被语言表达的概念、它们存在于模型的哪些位置,一直缺乏系统的分析方法。

本文的核心发现:语言模型的中间表征中,可能存在一个可被"翻译"为语言的共享工作空间global workspace)。该现象与人脑的全局工作空间理论存在功能层面的相似性,但并不意味着 Transformer 是对人脑的直接模拟。


二、背景知识:残差流(Residual Stream)

Transformer 通过残差流连接各层表示。这一设计继承了 ResNet 的残差连接思想,使早期信息可以持续传递到深层网络。

2.1 普通前馈网络

以三层网络为例,若每层仅接收上一层输出,则可以写为:

\[ \begin{aligned} \mathbf{x}_1 &= F_1(\mathbf{W}_1\mathbf{x}_0), \\ \mathbf{x}_2 &= F_2(\mathbf{W}_2\mathbf{x}_1), \\ \mathbf{x}_3 &= F_3(\mathbf{W}_3\mathbf{x}_2). \end{aligned} \]

其中:

  • \(\mathbf{x}_0\):网络输入的向量表示;
  • \(\mathbf{W}_\ell\):第 \(\ell\) 层的线性变换;
  • \(F_\ell(\cdot)\):第 \(\ell\) 层的非线性变换。

这种结构的问题是:\(\mathbf{x}_0\) 中未被前层充分提取的信息,不能直接传递给更深的层,因而可能逐步衰减。

2.2 ResNet 残差连接

ResNet 通过跳跃连接(skip connection)将早期表示直接加到后续层:

\[ \begin{aligned} \mathbf{x}_1 &= F_1(\mathbf{W}_1\mathbf{x}_0), \\ \mathbf{x}_2 &= F_2(\mathbf{W}_2\mathbf{x}_1), \\ \mathbf{x}_3 &= F_3(\mathbf{W}_3\mathbf{x}_2) + \mathbf{x}_0. \end{aligned} \]

经典 ResNet 并非在每一层都连接输入,而通常跨越若干层添加一次残差连接。

2.3 Transformer 的残差流

Transformer 将残差连接系统化地应用于各层。设第 \(\ell\) 层对表示的增量为 \(\Delta_\ell\),则其递推关系为:

\[ \mathbf{x}_{\ell+1} = \mathbf{x}_\ell + \Delta_\ell, \qquad \Delta_\ell = F_\ell(\mathbf{W}_\ell\mathbf{x}_\ell). \]

展开前三层可得:

\[ \begin{aligned} \mathbf{x}_1 &= \mathbf{x}_0 + \Delta_0, \\ \mathbf{x}_2 &= \mathbf{x}_0 + \Delta_0 + \Delta_1, \\ \mathbf{x}_3 &= \mathbf{x}_0 + \Delta_0 + \Delta_1 + \Delta_2. \end{aligned} \]

因此,深层表示是初始输入与各层信息增量的累积。其中,\(\mathbf{x}_0\) 是输入文本经嵌入编码得到的表示,\(\Delta_\ell\) 则表示第 \(\ell\) 层对已有表示作出的更新。

可以将其类比为修改一篇文章:初始草稿始终保留,每一层只在此基础上添加或修改部分内容。


三、核心思想:J Space——残差流中的共享工作空间

论文指出,并非所有层的残差信息增量都具有同等的语义价值。模型通常只在部分中间层产生与可语言化概念密切相关的更新;这部分表示空间被称为 J Space

层级区域 主要作用 示例:回答"火星是太阳系的第几颗行星?"
浅层 解析字词、位置、词性和句法关系 识别"火星""太阳系""第几""行星"等词元及疑问结构
中间层(J Space) 组织可用于推理的概念性信息 激活行星排序、地球、第四、岩石行星等相关概念,并完成隐式推断
输出层 将最终表示映射为词表上的输出概率 输出概率集中于"4"或"四"

需要注意:

  • J Space 并不等同于某一固定层,而通常由若干中间层构成;
  • 其位置和规模会随模型、输入内容与句子长度变化;
  • 这与人脑理论的相似性是功能类比,不能据此推断两者具有相同的实现机制。

四、核心方法:透镜(Lens)与 J Lens

"透镜"是一类将残差流中的隐藏向量映射到词表空间的线性解码方法,用于观察模型表征中可能包含的语言信息。

4.1 Logit Lens

模型在输出阶段通常使用反嵌入矩阵(unembedding matrix)将最后一层隐藏状态映射为 logits:

\[ \mathbf{z} = \operatorname{LogitLens}(\mathbf{x}_L) = \mathbf{W}_U\,\operatorname{Norm}(\mathbf{x}_L). \]

其中:

  • \(\mathbf{x}_L\):最后一层隐藏状态;
  • \(\operatorname{Norm}(\cdot)\):模型输出前使用的归一化操作;
  • \(\mathbf{W}_U\):反嵌入矩阵,将隐藏维度映射到词表维度;
  • \(\mathbf{z}\):词表中每个词对应的 logits,经 Softmax 后得到概率分布。

研究者曾将同一个 Logit Lens 直接应用于中间层表示:

\[ \mathbf{z}_\ell = \mathbf{W}_U\,\operatorname{Norm}(\mathbf{x}_\ell). \]

但中间层表示尚未处于最终输出空间,直接解码常产生难以解释的结果。这表明:适合最终层的解码器,不一定适合中间层。

4.2 J Lens

J Lens 是论文的核心方法。它先使用第 \(\ell\) 层到最终表示的局部雅各比映射校正中间层表示,再进行词表解码:

\[ \mathbf{z}^{(J)}_\ell = \operatorname{JLens}(\mathbf{x}_\ell) = \mathbf{W}_U\,\operatorname{Norm}(\mathbf{J}_\ell\mathbf{x}_\ell). \]

其中,\(\mathbf{J}_\ell\) 表示从第 \(\ell\) 层隐藏表示到最终隐藏表示的平均局部线性映射。

通过 J Lens,可以更稳定地解释各层中的语言相关成分,从而定位并研究 J Space。


五、J Lens 的分析流程

对于第 \(\ell\) 层的隐藏状态 \(\mathbf{h}_\ell\),可以按以下步骤分析其是否包含 J Space 成分。

步骤 1:准备词表嵌入

准备词表中所有词的向量表示。记第 \(i\) 个词的嵌入为 \(\mathbf{u}_i\)

步骤 2:估计平均雅各比矩阵

对多条输入样本计算并平均第 \(\ell\) 层到最终层的雅各比矩阵:

\[ \mathbf{J}_\ell = \mathbb{E}_{\mathbf{x}\sim\mathcal{D}} \left[ \frac{\partial \mathbf{h}_{\mathrm{final}}} {\partial \mathbf{h}_\ell} \right]. \]

其中,\(\mathcal{D}\) 表示用于估计的输入样本分布。对多条样本取期望可以降低单一样本带来的噪声。

步骤 3:构造词的雅各比方向

将词表向量经雅各比矩阵映射,得到词 \(i\) 对应的雅各比方向:

\[ \mathbf{v}_i = \mathbf{J}_\ell\mathbf{u}_i. \]

直观上,\(\mathbf{v}_i\) 描述了:沿着词 \(i\) 的方向扰动第 \(\ell\) 层表示时,最终表示将如何变化。

步骤 4:分解隐藏表示

将当前隐藏状态近似写为这些雅各比方向的线性组合:

\[ \mathbf{h}_\ell \approx \sum_{i=1}^{|\mathcal{V}|} a_i\mathbf{v}_i, \]

其中:

  • \(\mathcal{V}\):词表;
  • \(a_i\):词 \(i\) 对当前隐藏状态的贡献系数;
  • 较大的正系数 \(a_i\) 表示该层表示与该词方向更一致。

步骤 5:识别 J Space 成分

设显著正系数的索引集合为:

\[ \mathcal{I}_+ = \{i \mid a_i > \tau\}, \]

其中 \(\tau\) 是预设阈值,例如 \(0.05\)。若满足:

\[ |\mathcal{I}_+| \leq k, \qquad k = 25, \]

则可将表示分解为:

\[ \mathbf{h}_\ell = \mathbf{h}_{J} + \mathbf{h}_{O}, \]

其中:

\[ \mathbf{h}_{J} = \sum_{i\in\mathcal{I}_+} a_i\mathbf{v}_i. \]

\(\mathbf{h}_J\) 是可由少量显著词方向解释的成分,可视为该层的 J Space 候选表示;\(\mathbf{h}_O\) 则表示其余成分。

选择 \(k\leq25\) 的目的,是要求表示具有足够稀疏、明确的词汇倾向。若大量系数同时显著,说明该层难以归因于少量清晰的概念方向。

小结

  • J Space 描述的是隐藏表示中的局部成分,而非单独固定的一层;
  • 同一模型对不同输入产生的 J Space 不完全一致;
  • 识别出 \(\mathbf{h}_J\) 的词汇方向后,便可以借助 J Lens 解读模型该阶段表征的概念内容。

六、潜在用途:模型审计

J Lens 的价值不仅在于解释性研究,也可能支持更细粒度的模型审计。

传统安全拦截主要检测最终输出是否违规;而 J Lens 提供了一种观察中间表征的途径,可用于研究模型在生成之前是否已经激活了与敏感主题相关的概念。

不过,这类分析应被视为表征层面的证据,而非对模型"真实思维过程"的直接读取。它的主要价值在于提高模型行为分析的透明度,并为后续安全审计方法提供可验证的研究方向。


七、总结

  1. Transformer 的残差流使深层表示成为初始输入与各层增量的累积,这是可解释性分析的前提
  2. J Space 是残差流中承载可语言化概念的部分中间层成分,位置与规模随输入动态变化
  3. J Lens 通过局部雅各比映射校正中间层表示,使其能够被稳定地解码为词表方向
  4. 该方法的潜在价值在于表征层面的模型审计,而非读取模型的"真实思维"

参考文献

  1. Anthropic. Verbalizable Representations Form a Global Workspace in Language Models.