整体来看,Pre-training、Mid-training、Post-training、RL这几个阶段之间的界限,确实已经越来越模糊了
训练重心正在后移
GPT-3时代,模型能力主要取决于预训练。训练的核心,是把网页、维基百科和书籍中的人类知识尽可能压缩进参数。后训练更多负责调整行为,让模型更会对话、更能遵循指令。
O1之后,强化学习的重要性明显上升。素材提到,一些企业投入预训练和后训练的算力已经大致相当。这意味着模型在预训练结束时不再定型,后训练开始直接塑造最终能力。
我认为,这不是简单增加一道训练工序,而是整个训练目标发生了变化。
基础模型成为能力的底座
基础模型并没有消失,只是角色变了。
过去希望它尽可能掌握完整知识和任务能力。现在更重要的是提前准备好代码语法、API、函数调用、Git和文件系统等原子能力,再让模型进入复杂环境,通过强化学习把这些能力组合起来。
一个Coding Agent不必在预训练结束时就能独立完成十小时的软件工程任务。但它必须先具备完成这类任务所需的基本零件。
因此,基础模型越来越像Reasoning和Agent的能力底座,而不是最终产品。
数据从广泛收集转向目标设计
训练目标改变,数据结构也会随之改变。
素材称,GPT-3的训练数据中,网页和维基百科约占85%;在一些新模型里,这一比例已降到约15%,代码反而成为占比最高的数据来源。
这里真正重要的不是比例本身,而是数据选择开始有明确目的。模型公司已经知道未来需要Coding、Reasoning、长程任务和Agent能力,就会在预训练阶段主动准备相应数据。
问答、对话、工具调用和接近真实任务的数据,也因此更早进入训练过程。预训练不再只是学习知识,还要为未来的行动能力打基础。
合成数据的重要性也由此上升。一段普通代码可以被重新组织成查找Bug、修改代码、调用工具和连续完成任务的样本。数据生产开始从“有什么就学什么”,转向“需要什么能力,就设计什么数据”。
中训练承担分布过渡
预训练与后训练面对的数据差异越来越大。
前者可能以网页、书籍和代码为主,后者则大量出现推理轨迹、Agent交互、多轮工具调用和长上下文任务。如果直接切换,模型需要突然适应完全不同的数据分布。
MoE模型对此尤其敏感。预训练形成的专家分工,可能因为数据分布骤变而出现负载失衡。
Mid-training的价值,就是在正式后训练前完成过渡:让模型提前适应长上下文、推理数据、Agent数据和未来真实任务的分布,减少训练阶段之间的断裂。
训练正在形成两个大范式
从这个角度看,预训练、中训练、后训练和强化学习已经很难被理解为几段彼此独立的流水线。
更简洁的划分,是监督学习负责建立知识、表征和基础能力,强化学习负责让模型进入环境,通过探索、试错和反馈,把已有能力组合成复杂行为。
这也解释了为什么算力、数据和训练方法会同时变化。强化学习的权重上升,不会让预训练失去价值,反而会重新定义预训练应该准备什么。
我更愿意把基础模型看成一个起点:它不必预先完成所有复杂任务,但必须为后续学习留下足够扎实、可组合的能力结构。模型竞争的焦点,也将从谁压缩了更多知识,转向谁能更有效地准备、组合并释放这些能力。