非线性语义表示与线性语言模型
语言模型需要同时解决两个不同层次的表示问题:语义本身往往是多峰、连续且依赖上下文的;序列计算又必须在有限时间和有限状态中持续写入历史。研究关注如何用非线性函数表达语义结构,以及如何用线性时间递推实现选择、遗忘和上下文更新。
关键词 非线性表示 · 语义场 · 多义性 · 状态空间模型 · 线性注意力 · Delta Rule
两种不同意义上的“线性”
词向量中的线性,指语义被表示为向量空间中的点,并通过向量加法完成组合;线性语言模型中的线性,则通常指计算量随序列长度 按 增长,而不是说模型只能表达线性函数。Mamba 和 DeltaNet 都包含输入依赖的门控、投影和非线性网络,只是把跨时间的信息传递压缩为固定大小的递归状态。
这两个问题具有共同的结构张力。静态向量便于相加,却难以直接表示一个词的多个连续语义模式;有限状态递推便于长序列计算,却必须决定哪些内容写入、哪些内容覆盖、哪些内容长期保留。前者研究 语义空间的几何容量,后者研究 时间状态的记忆容量。把二者连接起来,可以更清楚地讨论模型如何在有限表示中保存多义性和长程依赖。
FIRE:从语义点到语义场
在 NeurIPS 2022 论文 FIRE 中,我们不再把一个词表示为单个向量,而是表示为位置测度与连续非线性函数的二元组
给出词在 维语义空间中的一个或多个位置, 则描述该词在整个空间产生的语义强度。两个词的相似性不是固定点之间的欧氏距离,而是彼此函数在对方位置上的响应:
多义性由 的多个位置以及 的多峰结构共同表达;组合性则保留为函数和测度的线性叠加。因而,“bank”的金融义和河岸义可以形成不同峰,而“river”与“financial”的函数叠加仍能产生与 “bank” 相近的场。这种表示没有要求先把离散词义划分为固定类别,而是允许语义在连续空间中形成多个吸引区域。
FIRE 用多层 planar transformation 的 Jacobian 构造每个词的非线性函数,在二维场中即可形成可视化的多峰结构。按相同参数量比较时,它在词相似度和句子相似度任务上与向量方法相当;在基于 WordNet 的词义数量预测中,场的几何聚类比 Word2Vec、Gaussian mixture 和 BERT contextual embedding 更清楚地区分单义词与多义词。结果说明,上下文化向量能够在给定语境中消歧,但并不自动等价于对词本身多峰语义结构的显式表示。
从二次注意力到有限状态递推
标准 self-attention 需要显式比较位置对,训练计算量和注意力矩阵随长度近似为 ;自回归推理还需要保存随上下文增长的 KV cache。线性时间模型把历史压缩为状态 ,并通过递推更新:
如果 、 和 由当前输入决定,这个系统对序列的整体映射仍然高度非线性。效率来自时间维度上不再展开完整位置对,而不是牺牲所有内容依赖。真正的难点随之改变:全注意力可以回看显式保存的 token,固定状态模型则必须在线决定如何压缩历史,状态容量和更新规则直接限制可检索信息。
Mamba:选择性传播与状态空间对偶
Mamba 将结构化状态空间模型的参数变为输入的函数,使模型能够根据当前 token 选择传播或遗忘信息。选择性步长控制不同状态分量的时间尺度,输入和输出投影决定什么内容写入状态、什么内容从状态读取。它保留了递归推理的线性复杂度,同时用硬件感知的 parallel scan 缓解训练阶段难以并行的问题。
Mamba-2 进一步通过 structured state space duality,把选择性 SSM 与一类半可分结构矩阵上的 attention 联系起来。这个对偶关系的重要性不只是加速,而是提供了统一语言:attention 可以理解为显式的 token-to-token 交互,SSM 可以理解为同一结构的递归压缩。由此可以比较两类模型在状态秩、时间衰减和内容选择上的表达边界,而不是只比较吞吐率。
Mamba 的选择机制仍面临有限状态问题。需要长期保留的多个语义模式可能在同一状态子空间中干涉;快速遗忘有利于局部适应,却可能破坏跨段检索。研究重点因而包括状态中的有效维数、不同时间尺度的谱结构,以及选择门接近饱和时是否出现记忆突变和临界遗忘。
DeltaNet:以预测误差更新记忆
线性注意力通常维护一个 fast-weight 矩阵 ,通过外积把 key-value 对累加到状态。单纯加法会不断叠加相似 key,导致覆盖和干扰。DeltaNet 将更新改写为 delta rule:
括号中的 是当前状态对 key 的预测误差。只有状态尚未正确存储的部分才被写入;相同 key 再次出现时,新 value 可以定向修正旧关联,而不是继续无界累加。DeltaNet 通过 Householder 矩阵乘积的紧凑表示实现序列维度上的并行训练,使这一更具表达力的更新能够扩展到十亿参数语言模型。
Gated DeltaNet 将衰减门与 delta update 结合:门控负责快速清除不再相关的全局记忆,delta rule 负责对特定关联进行精确覆盖。后续 Kimi Delta Attention 又将门控细化到更丰富的状态转移。这个发展脉络表明,线性时间模型的核心竞争不只是选择哪一种 kernel,而是如何在固定状态中实现 写入、擦除、覆盖和读取 四种操作。
研究问题与应用
下一步研究关注非线性语义结构与线性递推记忆之间的对应关系。一个多义概念在状态中需要多少独立模式;有限秩 fast weight 能否保存函数式、而非单点式的语义;选择门与 delta update 如何改变状态空间的吸引子和可达维数;这些问题可以通过谱分析、相关维数和受控记忆任务建立可测量的判据。
应用上,这一方向面向长上下文语言模型、低 KV-cache 推理和持续运行的智能体。目标不是假设线性时间架构必然替代 Transformer,而是确定它在何种状态容量和更新机制下能够保留复杂语义,以及何时需要局部或全局 attention 作为外部可寻址记忆。
相关论文
Xin Du and Kumiko Tanaka-Ishii. FIRE: Semantic Field of Words Represented as Nonlinear Functions — 论文介绍. NeurIPS 2022. Paper · Code