跳转至

互联网存档清单:CC / Wayback / 衍生语料

更新日期:2026-04-26

数字时效

本页 PB / token 量级数据截至 2024-2025 公开数据,2026 年内 CC 月度 snapshot 体量约略 +5% / 月。Frontier lab 在用的版本可能领先 1-3 个 snapshot —— 用前先查 https://commoncrawl.org/bloghttps://huggingface.co/datasets/HuggingFaceFW/fineweb 确认最新。

预训练数据的"原始矿石"绝大部分来自两个公开存档(Common Crawl + Internet Archive),加上他们衍生出的几个高质量子集(FineWeb / DCLM / RedPajama)。本页是清单,工业实践中绝大多数团队的数据底层就是这一堆里挑组合


一、Common Crawl

CC 是 LLM 预训练的事实基底。美国 501©(3) 非营利,2008 年起每月一个 snapshot,全部免费公开(AWS S3 Public Dataset)。

维度 数值
单 snapshot 大小 ~3.0–3.5 B URLs,~300–400 TB 压缩(WARC)
月度抓取频率 每月 1 次
历史累计(去重前) ~13–15 PB 压缩(截至 2026 中估算)
历史累计 unique URL(粗去重) ~250 B
语言分布 英语 ~43-46%,德/俄/日/西/法 各 4-6%,中文 ~5-6%
访问 s3://commoncrawl/(免费);data.commoncrawl.org HTTP;index.commoncrawl.org CDX 索引
文件格式 WARC(完整响应:headers + body)/ WET(提取后的纯文本,不要用,质量差)/ WAT(metadata)

关键工程教训

  • 永远不要直接用 WET —— 用 WARC 自己跑 trafilaturaresiliparse 重提,质量差距非常大(详见 parser
  • CC 抓取严守 robots.txt,所以 robots Disallow 的高质量站点(很多新闻、知识库)CC 完全没有
  • CC 抓 HTTP 200 + HTML 为主,不抓 JS-rendered SPA不抓登录后不抓 PDF(虽然 PDF 在 WARC 里能见)
  • 历史 snapshot 之间重复极高(同一 URL 每月可能重复抓 ≥80%),实际可用 unique 内容远小于累计大小

二、Internet Archive Wayback Machine

跟 CC 性质不同:Wayback 是记录历史的,单次站点访问可能保留多个时间点的快照。

维度 数值
URL 总数 ~916 B(2024 公开数字,2026 估计 1 T+)
全 IA 总数据量 ~99–145 PB(含视频 / 图片 / 软件 / 书 等所有类型)
Web 收藏部分 是 IA 的最大分支,但官方未给独立数字
API CDX server https://web.archive.org/cdx/search/cdx,免费,rate-limited(实测 ~1-10 req/s 稳定)
批量下载 不公开 WARC 批量下载,只能 partnership 申请

用法

  • 覆盖率交叉验证 —— 拿你的爬虫 db 跟 Wayback CDX 对比同一域名的 URL 集合,算"漏抓率"(crawler §5.3)
  • 历史版本回溯 —— 抓某站某时间点的旧版(CC 不能做,因为 CC 只有近 N 月的)
  • 不适合做主预训练源 —— 因为没有批量下载,单 URL 速率上限太低

三、CC 衍生的"开源标准"语料

工业团队通常不直接吃 CC,而是从下面几个已经清洗过的 CC 子集起手,再加自家额外清洗:

3.1 FineWeb 系列(HuggingFace 2024-)

主线 LLM 预训练新事实标准

数据集 体量 方法 链接
FineWeb 15 T tokens / 25.9 B docs(英语) 113+ CC snapshots(2013-2025)→ trafilatura 提取 → 一系列 filter(C4/Gopher 风格)+ MinHash 去重 HF card
FineWeb-Edu 1.3 T tokens FineWeb → 用 LLM 训的 Llama 3-Edu classifier 打分 → 筛 educational HF card
FineWeb-2 1+ T tokens / 1810+ 语言 FineWeb pipeline 的多语言扩展 HF card

为什么火:HF 团队(Loubna Ben Allal et al.)公开了完整 pipeline + ablation 实验(FineWeb 论文 arXiv:2406.17557),训练有素的 baseline 在同 token 下打败之前的 RedPajama / C4。

3.2 DCLM 系列(DataComp-LM, 2024)

学术联合体(Apple / UW / DeepMind 等)的 data benchmark 数据集。

数据集 体量 用途
DCLM-Pool 240 T tokens 原始 全 CC(轻清洗),用作 baseline pool 给研究者跑 ablation
DCLM-Baseline 4 T tokens / 3 B docs / 7.2 TB Pool → RefinedWeb 启发式 + Bloom 去重 + fastText 质量分类器(基于 OpenHermes / ELI5)

paper 2406.11794DCLM-Baseline 在 7B 规模上是公开 SOTA 数据集。

3.3 RedPajama 系列(Together AI)

数据集 体量 备注
RedPajama V1 1.2 T tokens(CC 占 878 B) LLaMA-1 数据复刻(CC + C4 + GitHub + arXiv + Wikipedia + StackExchange + Books)
RedPajama V2 30.4 T deduped / 50.6 T raw / 100 B+ docs 84 CC snapshots → CCNet pipeline → perplexity 桶 + 30+ 质量信号 + minhash

arXiv:2411.12372。V2 把"质量信号当 metadata 而非过滤"是关键创新 —— 用户自己选阈值,免去 CCNet 一刀切。

3.4 C4 / mC4(Google 2020,仍在用)

数据集 体量 备注
C4-en 305 GB / ~156 B tokens T5 训练用,基于 2019.04 单 snapshot CC(注意单月)
mC4 9.7 TB / 108 语言 多语言版

注意:C4 单 snapshot,年份久,作 baseline 还行,作主训练数据已经过时了。

3.5 The Pile(EleutherAI 2020)

825 GiB / ~300 B tokens / 22 子源(PubMed Central / arXiv / Books3 / GitHub / HackerNews / EuroParl / ...)。Frontier 预训练已基本不用 —— 体量小、含版权敏感的 Books3 和 OpenSubtitles。仍然作为 eval / perplexity benchmark 的标准

3.6 The Stack(BigCode)

代码语料的事实标准。

  • The Stack v1(2022):3 TB,30 种语言
  • The Stack v2(2024):67.5 TB raw / 32.1 TB dedup / ~900 B tokens / 658 种语言,基于 Software Heritage 2023-09-06 snapshot,only permissive license

HF card

3.7 其他

  • Dolma(AI2 2024):3 T tokens 全开放配方
  • OSCAR(INRIA):CC 衍生多语言,2019-2023 多次更新
  • OpenWebText / OpenWebText2:复刻 GPT-2 训练数据,体量小(~40 GB)

四、"全网"vs CC 覆盖差距

业务方常问"我们离全网还差多少"。没有可靠确切数字,只能给区间:

指标 估算
Google 索引规模 400-500 B pages(2024 估计)
全可爬 web text ~50-100 PB 压缩(不含 deep web / 非 HTML)
CC 单月覆盖 ~3-5 B URL / 月 ≈ 全 web 的 < 5% / 月
CC 累计 unique(去重后) ~50-100 B URL ≈ 全 web 的 10-50%
CC 可用文本量 / Google 文本量 ~20-30%

为什么 CC 文本量远小于 URL 量比例:

  1. CC 严守 robots.txt → 错过 ~10-20% 高质量站
  2. CC 不抓 JS-rendered SPA → 现代 web 大量内容在 SPA 里
  3. CC 不抓登录后 / paywall
  4. CC HTML 提取后才是文本,原始 raw HTML 体量是文本的 ~10×
  5. CC 内重复极高,实际 unique 文本 < 看到的 ⅓

结论:靠 CC = 拿到全网的 ~20-30% 可用文本。要更多必须自爬(详见 crawler)+ 接私域 API(详见 private-domain)+ 买商业语料(详见 vendors)。


五、选型决策表

flowchart LR
    Q{"团队规模 + 算力 + 时间预算"}
    Q -- "学术 / 1-10 人 / 7B 以下" --> A[FineWeb-Edu / DCLM-Baseline]
    Q -- "工业 / 30B-400B 训练" --> B[FineWeb + 自爬补充 + The Stack v2 + 数学/书]
    Q -- "Frontier / >400B" --> C["全自研 pipeline:<br/>自爬 + CC + 私域 + 商业供应商<br/>+ DCLM-Pool 做 ablation 比较"]

    classDef stage fill:#fff,stroke:#cc785c;
    class Q,A,B,C stage

实操推荐

  • 学术 / 7B 以下:直接用 FineWeb-Edu(1.3T tokens,质量已筛过)+ The Stack v2 子集,跑通 baseline 即可
  • 30B-400B:FineWeb + 自家清洗的额外 CC snapshot(补 FineWeb 之后的)+ The Stack v2 + 数学专用语料(OpenWebMath)+ 书籍(合规渠道)
  • Frontier:必须自建。FineWeb / DCLM / RedPajama 只作 ablation 比较基线

六、引用数字 sanity-check

写文档时引用以上数字,至少做这一步

# CC 最新 snapshot
curl https://data.commoncrawl.org/crawl-data/index.html | head -20

# FineWeb 最新版本和体量
# https://huggingface.co/datasets/HuggingFaceFW/fineweb 看 dataset card

# DCLM-Baseline
# https://huggingface.co/datasets/mlfoundations/dclm-baseline-1.0

参考链接


上级 · B1. 预训练数据 Pipeline:爬取→清洗→去重→过滤→配比