跳转至

J. 推理行为与失败模式

预训练 / 后训练 / 对齐讲完了模型怎么得到能力。本章讲推理时模型怎么用这些能力:长 context 检索、思考量级控制、不同思考模式(CoT / ReAct / interleave)、以及最大失败模式 —— 幻觉

四个核心问题:

  1. 长 context:当前 1M context 模型真的能用吗?benchmark 怎么测?数据怎么造?—— J1 长 context
  2. Thinking effort 控制:怎么让模型 adaptive 决定思考多少?low/high 等级开关怎么实现?数据怎么构造?—— J2 思考量级控制
  3. Reasoning modes:CoT、ReAct、Interleaved Thinking、ToT 之间是什么关系?什么情况用哪个?—— J3 推理模式对比
  4. 幻觉:thinking 增加是否减少幻觉?从架构、推理、数据三个层面怎么降幻觉?—— J4 幻觉与减少策略

这四个话题贯穿 E. 后训练 + G. 推理 + I. 评测 三章,但单独抽出来讨论更聚焦"推理行为"这一个层面。


上级 · 大语言模型/多模态大模型 LLM/MLLM