B. 数据工程¶
预训练数据决定模型能力上限。本章覆盖原始爬取 → 清洗 → 去重 → 配比的完整 pipeline,tokenizer 的设计与训练,多模态数据组织,合成数据的方法论与边界(model collapse),以及数据质量评估指标与 loss 斜率的关系。
章节¶
- B1. 预训练数据 Pipeline:爬取→清洗→去重→过滤→配比
- B2. Tokenizer 设计与训练:BPE、多语言、多模态 Token
- B3. 多模态数据工程:图片/视频数据组织与处理
- B4. 合成数据:方法论、Scaling 边界、Model Collapse
- B5. 数据质量评估:指标、工具、与 Loss 斜率的关系
↑ 上级 · 大语言模型/多模态大模型 LLM/MLLM