跳转至

B. 数据工程

预训练数据决定模型能力上限。本章覆盖原始爬取 → 清洗 → 去重 → 配比的完整 pipeline,tokenizer 的设计与训练,多模态数据组织,合成数据的方法论与边界(model collapse),以及数据质量评估指标与 loss 斜率的关系。

章节


上级 · 大语言模型/多模态大模型 LLM/MLLM