跳转至

论文精读:Language Modeling Is Compression (ICLR 2024)

Delétang et al. Language Modeling Is Compression. ICLR 2024. 论文链接


一、一句话总结

LLM 的预测能力可以直接转化为数据压缩能力。Chinchilla 70B 把 enwik9 压缩到原大小的 8.3%(gzip 只能 32.3%)。更惊人的是,这个纯文本模型压缩 ImageNet 图片也比 PNG 好,压缩 LibriSpeech 音频也比 FLAC 好——证明 LLM 学到了超越文本的通用模式。


二、核心定理:预测 = 压缩

2.1 算术编码桥梁

如果你有一个完美的概率预测器 \(P(x_t|x_{<t})\),就能用算术编码把数据压缩到 信息论极限。 算术编码的工作方式:

  1. 维护一个 \([0, 1)\) 的区间

  2. 每看到一个新 token,按预测概率缩小区间

  3. 预测越准(概率越高)→ 区间缩小越少 → 需要的 bits 越少

编码 \(x_t\) 需要 \(-\log_2 P(x_t|x_{<t})\) bits。这恰好是 cross-entropy loss

2.2 反过来也成立

任何压缩器也是预测器!gzip 隐式地对数据做了概率建模(LZ77 的滑动窗口 = 一种简单的 \(n\)-gram 模型)。所以可以把 gzip 当成一个(很弱的)语言模型用。 这个对称性意味着:比较两个模型的"智能"程度 = 比较它们的压缩率


三、关键实验结果

3.1 文本压缩(enwik9)

enwik9 = Wikipedia 的前 \(10^9\) bytes,是压缩 benchmark 的标准数据集。 70B 模型比 gzip 好 4 倍。这意味着 LLM 对文本数据的"理解"深度远超传统算法。

3.2 跨模态压缩(最惊人的发现)

Chinchilla 70B 只在文本上训练,但压缩图片和音频也胜过领域专用算法。 为什么纯文本模型能压缩图片?因为 LLM 学到的不只是"英语语法",而是通用的统计规律——这些规律(低频成分、空间相关性、重复模式)在图片和音频中同样存在。

3.3 In-context 压缩

随着模型看到更多上下文(sequence 更长),压缩率持续提升。这就是 in-context learning 的压缩解释:模型在看到更多"例子"后,对后续数据的预测越来越准 → 压缩越来越好。


四、对 Scaling Laws 的启示

论文发现:

  1. 更大的模型 = 更好的压缩,呈幂律关系

  2. 最优模型大小取决于数据量——压缩 1GB 数据和压缩 1TB 数据的最优模型不同

  3. 这和 Chinchilla scaling law 完全一致——从压缩视角重新推导了 scaling law

这意味着 Scaling Law 不是经验巧合,而是信息论的必然结果


五、实践启示


六、追问


参考

  • [1] Delétang et al. Language Modeling Is Compression. ICLR 2024. 论文

  • [2] Hutter. The Hutter Prize. 网站

  • [3] Ranking LLMs by Compression. 2024. 论文

  • [4] Revisiting Data Compression with Language Modeling. 2025. 论文


原论文关键图表

Figure 1: 算术编码示例。展示如何将概率预测转化为二进制编码。预测概率越高→区间缩小越少→需要的bits越少。

Figure 2: 压缩率 vs 模型大小。更大的模型 = 更好的压缩。但存在 compute-optimal 拐点——和 Chinchilla scaling law 完全一致。

Figure 3: enwik9 上的 in-context 压缩率随上下文长度的变化。Chinchilla 70B 从 ~15% 降到 ~8%,而 gzip 固定在 32.3%。

Figure 4: ImageNet 图片的 in-context 压缩。纯文本模型也能压缩图片,而且随上下文增长持续改善。

Figure 5: LibriSpeech 音频的 in-context 压缩。Chinchilla 70B (16.4%) 胜过 FLAC (30.3%)。


上级 · A5.1 压缩即智能:信息论推导