论文精读:Language Modeling Is Compression (ICLR 2024)¶
Delétang et al. Language Modeling Is Compression. ICLR 2024. 论文链接
一、一句话总结¶
LLM 的预测能力可以直接转化为数据压缩能力。Chinchilla 70B 把 enwik9 压缩到原大小的 8.3%(gzip 只能 32.3%)。更惊人的是,这个纯文本模型压缩 ImageNet 图片也比 PNG 好,压缩 LibriSpeech 音频也比 FLAC 好——证明 LLM 学到了超越文本的通用模式。
二、核心定理:预测 = 压缩¶
2.1 算术编码桥梁¶
如果你有一个完美的概率预测器 \(P(x_t|x_{<t})\),就能用算术编码把数据压缩到 信息论极限。 算术编码的工作方式:
-
维护一个 \([0, 1)\) 的区间
-
每看到一个新 token,按预测概率缩小区间
-
预测越准(概率越高)→ 区间缩小越少 → 需要的 bits 越少
编码 \(x_t\) 需要 \(-\log_2 P(x_t|x_{<t})\) bits。这恰好是 cross-entropy loss。
2.2 反过来也成立¶
任何压缩器也是预测器!gzip 隐式地对数据做了概率建模(LZ77 的滑动窗口 = 一种简单的 \(n\)-gram 模型)。所以可以把 gzip 当成一个(很弱的)语言模型用。 这个对称性意味着:比较两个模型的"智能"程度 = 比较它们的压缩率。
三、关键实验结果¶
3.1 文本压缩(enwik9)¶
enwik9 = Wikipedia 的前 \(10^9\) bytes,是压缩 benchmark 的标准数据集。 70B 模型比 gzip 好 4 倍。这意味着 LLM 对文本数据的"理解"深度远超传统算法。
3.2 跨模态压缩(最惊人的发现)¶
Chinchilla 70B 只在文本上训练,但压缩图片和音频也胜过领域专用算法。 为什么纯文本模型能压缩图片?因为 LLM 学到的不只是"英语语法",而是通用的统计规律——这些规律(低频成分、空间相关性、重复模式)在图片和音频中同样存在。
3.3 In-context 压缩¶
随着模型看到更多上下文(sequence 更长),压缩率持续提升。这就是 in-context learning 的压缩解释:模型在看到更多"例子"后,对后续数据的预测越来越准 → 压缩越来越好。
四、对 Scaling Laws 的启示¶
论文发现:
-
更大的模型 = 更好的压缩,呈幂律关系
-
最优模型大小取决于数据量——压缩 1GB 数据和压缩 1TB 数据的最优模型不同
-
这和 Chinchilla scaling law 完全一致——从压缩视角重新推导了 scaling law
这意味着 Scaling Law 不是经验巧合,而是信息论的必然结果。
五、实践启示¶
六、追问¶
参考¶
-
[1] Delétang et al. Language Modeling Is Compression. ICLR 2024. 论文
-
[2] Hutter. The Hutter Prize. 网站
-
[3] Ranking LLMs by Compression. 2024. 论文
-
[4] Revisiting Data Compression with Language Modeling. 2025. 论文
原论文关键图表¶
Figure 1: 算术编码示例。展示如何将概率预测转化为二进制编码。预测概率越高→区间缩小越少→需要的bits越少。

Figure 2: 压缩率 vs 模型大小。更大的模型 = 更好的压缩。但存在 compute-optimal 拐点——和 Chinchilla scaling law 完全一致。

Figure 3: enwik9 上的 in-context 压缩率随上下文长度的变化。Chinchilla 70B 从 ~15% 降到 ~8%,而 gzip 固定在 32.3%。

Figure 4: ImageNet 图片的 in-context 压缩。纯文本模型也能压缩图片,而且随上下文增长持续改善。

Figure 5: LibriSpeech 音频的 in-context 压缩。Chinchilla 70B (16.4%) 胜过 FLAC (30.3%)。

↑ 上级 · A5.1 压缩即智能:信息论推导