压缩即智能:从信息论理解 LLM¶
为什么"压缩 = 智能"是理解 LLM 的最深层框架¶
LLM 训练的 cross-entropy loss 在数学上恰好等于数据的压缩率。这不是隐喻——是 Shannon 信息论的精确等式。由此出发,Scaling Law 的幂律形式、幻觉的不可避免性、训练的两阶段动态,全都能从第一性原理推导出来。
三篇子文档¶
如果 LLM 是压缩器,它压得多好?¶
Chinchilla 70B 把 Wikipedia 压缩到原大小的 8.3%(gzip 只能 32.3%)。更惊人的是这个纯文本模型压缩图片比 PNG 好、压缩音频比 FLAC 好——证明它学到的是超越文本的通用统计规律。
详见 论文精读:Language Modeling Is Compression (ICLR 2024) — 含 5 张原论文图表
为什么 Loss 恰好是幂律?不是别的函数形式?¶
因为数据中"知识"的分布服从 Zipf 定律——用 Pitman-Yor 过程建模。从这个分布出发,可以数学推导出 \(L \propto N^{-\alpha}\) 的幂律形式,而且指数 \(\alpha\) 直接由 Zipf 参数决定。同一个框架还解释了:为什么高频知识先学会、低频知识后学会、模型太小必然幻觉。
详见 论文精读:Understanding LLM via Compression (NeurIPS 2025 Spotlight) — 含原图 + 完整推导链
训练为什么分"记忆"和"理解"两个阶段?¶
信息瓶颈理论说:先拟合(记住一切),再压缩(忘掉无关细节)。Grokking 现象是这个过程的极端表现——训练 loss 到 0 很久之后测试 accuracy 才突然提升。从压缩视角:Phase 1 是逐样本记忆(无压缩),Phase 2 是发现规律(真正压缩)。Weight decay 是驱动这个转变的关键力量。
详见 延伸:Grokking、信息瓶颈与不可约 Loss