互联网存档清单:CC / Wayback / 衍生语料¶
更新日期:2026-04-26
数字时效
本页 PB / token 量级数据截至 2024-2025 公开数据,2026 年内 CC 月度 snapshot 体量约略 +5% / 月。Frontier lab 在用的版本可能领先 1-3 个 snapshot —— 用前先查 https://commoncrawl.org/blog 或 https://huggingface.co/datasets/HuggingFaceFW/fineweb 确认最新。
预训练数据的"原始矿石"绝大部分来自两个公开存档(Common Crawl + Internet Archive),加上他们衍生出的几个高质量子集(FineWeb / DCLM / RedPajama)。本页是清单,工业实践中绝大多数团队的数据底层就是这一堆里挑组合。
一、Common Crawl¶
CC 是 LLM 预训练的事实基底。美国 501©(3) 非营利,2008 年起每月一个 snapshot,全部免费公开(AWS S3 Public Dataset)。
| 维度 | 数值 |
|---|---|
| 单 snapshot 大小 | ~3.0–3.5 B URLs,~300–400 TB 压缩(WARC) |
| 月度抓取频率 | 每月 1 次 |
| 历史累计(去重前) | ~13–15 PB 压缩(截至 2026 中估算) |
| 历史累计 unique URL(粗去重) | ~250 B |
| 语言分布 | 英语 ~43-46%,德/俄/日/西/法 各 4-6%,中文 ~5-6% |
| 访问 | s3://commoncrawl/(免费);data.commoncrawl.org HTTP;index.commoncrawl.org CDX 索引 |
| 文件格式 | WARC(完整响应:headers + body)/ WET(提取后的纯文本,不要用,质量差)/ WAT(metadata) |
关键工程教训:
- 永远不要直接用 WET —— 用 WARC 自己跑
trafilatura或resiliparse重提,质量差距非常大(详见 parser) - CC 抓取严守 robots.txt,所以 robots Disallow 的高质量站点(很多新闻、知识库)CC 完全没有
- CC 抓 HTTP 200 + HTML 为主,不抓 JS-rendered SPA、不抓登录后、不抓 PDF(虽然 PDF 在 WARC 里能见)
- 历史 snapshot 之间重复极高(同一 URL 每月可能重复抓 ≥80%),实际可用 unique 内容远小于累计大小
二、Internet Archive Wayback Machine¶
跟 CC 性质不同:Wayback 是记录历史的,单次站点访问可能保留多个时间点的快照。
| 维度 | 数值 |
|---|---|
| URL 总数 | ~916 B(2024 公开数字,2026 估计 1 T+) |
| 全 IA 总数据量 | ~99–145 PB(含视频 / 图片 / 软件 / 书 等所有类型) |
| Web 收藏部分 | 是 IA 的最大分支,但官方未给独立数字 |
| API | CDX server https://web.archive.org/cdx/search/cdx,免费,rate-limited(实测 ~1-10 req/s 稳定) |
| 批量下载 | 不公开 WARC 批量下载,只能 partnership 申请 |
用法:
- 覆盖率交叉验证 —— 拿你的爬虫 db 跟 Wayback CDX 对比同一域名的 URL 集合,算"漏抓率"(crawler §5.3)
- 历史版本回溯 —— 抓某站某时间点的旧版(CC 不能做,因为 CC 只有近 N 月的)
- 不适合做主预训练源 —— 因为没有批量下载,单 URL 速率上限太低
三、CC 衍生的"开源标准"语料¶
工业团队通常不直接吃 CC,而是从下面几个已经清洗过的 CC 子集起手,再加自家额外清洗:
3.1 FineWeb 系列(HuggingFace 2024-)¶
主线 LLM 预训练新事实标准。
| 数据集 | 体量 | 方法 | 链接 |
|---|---|---|---|
| FineWeb | 15 T tokens / 25.9 B docs(英语) | 113+ CC snapshots(2013-2025)→ trafilatura 提取 → 一系列 filter(C4/Gopher 风格)+ MinHash 去重 | HF card |
| FineWeb-Edu | 1.3 T tokens | FineWeb → 用 LLM 训的 Llama 3-Edu classifier 打分 → 筛 educational | HF card |
| FineWeb-2 | 1+ T tokens / 1810+ 语言 | FineWeb pipeline 的多语言扩展 | HF card |
为什么火:HF 团队(Loubna Ben Allal et al.)公开了完整 pipeline + ablation 实验(FineWeb 论文 arXiv:2406.17557),训练有素的 baseline 在同 token 下打败之前的 RedPajama / C4。
3.2 DCLM 系列(DataComp-LM, 2024)¶
学术联合体(Apple / UW / DeepMind 等)的 data benchmark 数据集。
| 数据集 | 体量 | 用途 |
|---|---|---|
| DCLM-Pool | 240 T tokens 原始 | 全 CC(轻清洗),用作 baseline pool 给研究者跑 ablation |
| DCLM-Baseline | 4 T tokens / 3 B docs / 7.2 TB | Pool → RefinedWeb 启发式 + Bloom 去重 + fastText 质量分类器(基于 OpenHermes / ELI5) |
paper 2406.11794。DCLM-Baseline 在 7B 规模上是公开 SOTA 数据集。
3.3 RedPajama 系列(Together AI)¶
| 数据集 | 体量 | 备注 |
|---|---|---|
| RedPajama V1 | 1.2 T tokens(CC 占 878 B) | LLaMA-1 数据复刻(CC + C4 + GitHub + arXiv + Wikipedia + StackExchange + Books) |
| RedPajama V2 | 30.4 T deduped / 50.6 T raw / 100 B+ docs | 84 CC snapshots → CCNet pipeline → perplexity 桶 + 30+ 质量信号 + minhash |
arXiv:2411.12372。V2 把"质量信号当 metadata 而非过滤"是关键创新 —— 用户自己选阈值,免去 CCNet 一刀切。
3.4 C4 / mC4(Google 2020,仍在用)¶
| 数据集 | 体量 | 备注 |
|---|---|---|
| C4-en | 305 GB / ~156 B tokens | T5 训练用,基于 2019.04 单 snapshot CC(注意单月) |
| mC4 | 9.7 TB / 108 语言 | 多语言版 |
注意:C4 单 snapshot,年份久,作 baseline 还行,作主训练数据已经过时了。
3.5 The Pile(EleutherAI 2020)¶
825 GiB / ~300 B tokens / 22 子源(PubMed Central / arXiv / Books3 / GitHub / HackerNews / EuroParl / ...)。Frontier 预训练已基本不用 —— 体量小、含版权敏感的 Books3 和 OpenSubtitles。仍然作为 eval / perplexity benchmark 的标准。
3.6 The Stack(BigCode)¶
代码语料的事实标准。
- The Stack v1(2022):3 TB,30 种语言
- The Stack v2(2024):67.5 TB raw / 32.1 TB dedup / ~900 B tokens / 658 种语言,基于 Software Heritage 2023-09-06 snapshot,only permissive license
3.7 其他¶
- Dolma(AI2 2024):3 T tokens 全开放配方
- OSCAR(INRIA):CC 衍生多语言,2019-2023 多次更新
- OpenWebText / OpenWebText2:复刻 GPT-2 训练数据,体量小(~40 GB)
四、"全网"vs CC 覆盖差距¶
业务方常问"我们离全网还差多少"。没有可靠确切数字,只能给区间:
| 指标 | 估算 |
|---|---|
| Google 索引规模 | 400-500 B pages(2024 估计) |
| 全可爬 web text | ~50-100 PB 压缩(不含 deep web / 非 HTML) |
| CC 单月覆盖 | ~3-5 B URL / 月 ≈ 全 web 的 < 5% / 月 |
| CC 累计 unique(去重后) | ~50-100 B URL ≈ 全 web 的 10-50% |
| CC 可用文本量 / Google 文本量 | ~20-30% |
为什么 CC 文本量远小于 URL 量比例:
- CC 严守 robots.txt → 错过 ~10-20% 高质量站
- CC 不抓 JS-rendered SPA → 现代 web 大量内容在 SPA 里
- CC 不抓登录后 / paywall
- CC HTML 提取后才是文本,原始 raw HTML 体量是文本的 ~10×
- CC 内重复极高,实际 unique 文本 < 看到的 ⅓
结论:靠 CC = 拿到全网的 ~20-30% 可用文本。要更多必须自爬(详见 crawler)+ 接私域 API(详见 private-domain)+ 买商业语料(详见 vendors)。
五、选型决策表¶
flowchart LR
Q{"团队规模 + 算力 + 时间预算"}
Q -- "学术 / 1-10 人 / 7B 以下" --> A[FineWeb-Edu / DCLM-Baseline]
Q -- "工业 / 30B-400B 训练" --> B[FineWeb + 自爬补充 + The Stack v2 + 数学/书]
Q -- "Frontier / >400B" --> C["全自研 pipeline:<br/>自爬 + CC + 私域 + 商业供应商<br/>+ DCLM-Pool 做 ablation 比较"]
classDef stage fill:#fff,stroke:#cc785c;
class Q,A,B,C stage
实操推荐:
- 学术 / 7B 以下:直接用 FineWeb-Edu(1.3T tokens,质量已筛过)+ The Stack v2 子集,跑通 baseline 即可
- 30B-400B:FineWeb + 自家清洗的额外 CC snapshot(补 FineWeb 之后的)+ The Stack v2 + 数学专用语料(OpenWebMath)+ 书籍(合规渠道)
- Frontier:必须自建。FineWeb / DCLM / RedPajama 只作 ablation 比较基线
六、引用数字 sanity-check¶
写文档时引用以上数字,至少做这一步:
# CC 最新 snapshot
curl https://data.commoncrawl.org/crawl-data/index.html | head -20
# FineWeb 最新版本和体量
# https://huggingface.co/datasets/HuggingFaceFW/fineweb 看 dataset card
# DCLM-Baseline
# https://huggingface.co/datasets/mlfoundations/dclm-baseline-1.0
参考链接¶
- Common Crawl 官网
- FineWeb 论文
- DCLM 论文
- RedPajama V2 论文
- The Stack v2 论文
- Common Crawl Index 查询
- Wayback CDX API 文档