Xin Du · 杜鑫
菜单

大模型与复杂性

大模型通过局部的 next-token 预测产生推理、叙事和规划等长程结构。研究从概率轨迹的几何出发,定义模型所感知的跨尺度复杂性,并追踪这种结构在自然语言、预训练、幻觉和生成退化中如何形成或消失。

关键词 相关维度 · 统计流形 · 多重分形 · 长程记忆 · 相变

模型诱导的统计流形

文本是离散符号序列,没有适用于动力系统分析的天然欧氏坐标。直接对 token 编号使用欧氏距离没有语义,而外部词向量又会把所选表示模型的偏差引入测量。语言模型为每个位置给出条件分布 p(x<t)p(\,\cdot\mid x_{<t}),因此一段文本可以表示为概率单纯形上的轨迹;状态间距离由模型对未来符号的预测差异决定,而不是由任意坐标决定。

我们在这一统计流形上以 Fisher-Rao 几何定义局部距离,并统计轨迹在不同尺度上的邻域复现率。这样既保留离散序列的概率结构,又能使用动力系统中的分形工具讨论长程组织。技术难点包括:高维概率单纯形上的距离估计、有限文本造成的边界偏差、幂律标度区间的稳定选择,以及不同词表、架构与量化精度下的可比性。

若相关积分满足 C(r)rD2C(r)\propto r^{D_2},则指数 D2D_2 给出相关维度。它不是词汇丰富度的替代量,而是模型概率轨迹中动态活跃自由度的估计。实际计算需要处理高维邻域统计的有限样本偏差、稳定标度区间的选择,以及模型架构、词表和量化方式带来的可比性问题。

C(r)rD2,D2=dlogC(r)dlogr.C(r)\propto r^{D_2}, \qquad D_2=\frac{\mathrm{d}\log C(r)}{\mathrm{d}\log r}.

自然语言的分形结构

Physical Review Research 2024 论文 中,我们在统计流形上重构 Grassberger-Procaccia 方法。自然语言不是由单一尺度控制:局部斜率随观察尺度变化,形成多重分形;但在较大的尺度上,不同语言、体裁和模型估计得到的相关维度收敛到约 6.5。这个数值小于简单离散随机序列的维度、高于 Barabási-Albert 过程,说明语言处在完全随机与低维网络生长之间的复杂性区间。

多种自然语言的相关维度结果
图 1. 不同自然语言在大尺度上表现出接近的相关维度。

对照实验进一步定位了自相似性的来源。打乱词序后,平均相关维度上升至约 13.0;随机化语言模型权重同样破坏稳定结构。变化并非仅由词频产生,而与长程次序及模型能否恢复这种次序有关。论文还把同一方法用于离散音乐编码:古典、金属与摇滚呈现不同维度,且都显著低于白噪声。这说明框架测量的是概率离散序列的跨尺度组织,而不局限于书面语言。

这些结果提供了语言宏观复杂性的几何基线。关键不只是得到一个维度数值,而是建立从离散符号到统计流形、再到长程复现结构的完整定义,使语言、音乐及其他真实序列可以在同一概率几何框架下比较。

语言相关积分的标度区间
图 2. 相关积分的幂律区间及其局部斜率;稳定区间用于估计全局相关维度。

从语言分形到模型诊断

NeurIPS 2025 论文 将同一思想直接应用于自回归模型的 next-token log-probability 轨迹。动机来自 perplexity 的局限:局部预测损失可以持续下降,但模型仍会产生事实幻觉、重复、不连贯或内容贫乏。相关维度衡量模型在处理完整序列时动用了多少长程结构,因此与局部准确率提供互补信息。

预训练轨迹呈现清晰的三阶段变化。第一阶段,模型学习 bigram 级短程结构,相关维度快速下降;第二阶段,模型开始捕获长程依赖,维度重新上升;第三阶段,随着上下文压缩与泛化改善,维度缓慢下降。值得注意的是,perplexity 在整个过程中仍单调降低。Pythia-14M 和 160M 等较小模型没有稳定进入第三阶段,训练后期维度反而突升至约 8,同时上下文重复任务的准确率明显下降。这使相关维度能够显露局部损失曲线中不可见的泛化失稳。

相关维度揭示预训练的三个阶段
图 3. 相关维度随预训练推进形成“短程结构学习—长程依赖形成—上下文压缩与泛化”的三阶段轨迹。

相关维度也区分不同类型的生成失稳。在受控数据中,正常文本的平均维度为 5.04;重复、不连贯和内容贫乏分别下降至 3.80、3.96 和 4.51,且变化方向一致,而 perplexity 在不同退化类型上可能升高也可能降低。在知识密集文本中,能够正确调用事实的模型维持较高维轨迹,只模仿答案格式而产生人名幻觉的模型则出现明显降维;该实验中相关维度低于 5.0 的模型都产生了幻觉。

在随机长文本压力测试中,稳健模型能维持或增加轨迹维度,易退化模型则在续写过程中突然降维;这一测量与 HelloEval 的 Spearman 相关系数达到 0.952。实现通过 GPU kernel fusion 与词表约简获得超过十倍加速,不增加标准推理之外的显存;指标跨 Transformer 与 Mamba 有效,对低至 4-bit 的量化变化低于 3%。这些性质使跨模型和在线测量成为可能。

相变与模型能力形成

训练阶段切换和生成维度突降提示模型内部有效自由度发生重组:短程规则、长程依赖与上下文压缩并不是同一条平滑学习曲线上的简单增量。然而,经验分期并不自动构成严格相变。需要进一步把相关维度或其变化率定义为候选序参量,测量 checkpoint 邻域中的 susceptibility、临界减速和涨落增强,并通过模型规模与数据量的有限尺度标度区分连续过渡、突变和平滑 crossover。

这一研究路线把“能力何时形成”转化为可检验问题:复杂性变化是否先于特定能力出现,维度突变是否对应记忆调用或内部表示重组,以及这些变化能否用于训练监测和 checkpoint 选择。

应用与相关论文

相关维度可以作为困惑度之外的结构性指标,用于预训练监测、checkpoint 选择、长文本质量评估、在线退化预警和知识调用分析。它反映模型所感知的轨迹结构,并不单独判定事实真伪或语义质量;实际应用需要与任务指标、事实核验和局部概率指标共同使用。

Xin Du and Kumiko Tanaka-Ishii. Correlation Dimension of Auto-Regressive Large Language Models — 论文介绍. NeurIPS 2025. arXiv

Xin Du and Kumiko Tanaka-Ishii. Correlation Dimension of Natural Language in a Statistical Manifold — 论文介绍. Physical Review Research, 2024. Journal