核心内容总结
这篇文章讲了大模型训练逻辑的重大转变:过去大家把重点放在Base Model(基础模型)上,让它尽可能吸收所有人类知识;现在Base Model的角色变了——它不再是“知识容器”,而是变成“基础技能工具箱”,负责提供Python、代码结构等“原子能力”,而模型的最终复杂能力(比如写软件、解决长任务)则靠后面的强化学习(RL)和新出现的Mid-training(中间训练)来实现。同时,预训练数据从“海量网页大杂烩”变成“针对性精准投喂”,训练阶段的界限也越来越模糊,整体简化成“监督学习打基础+RL练应用”两步走。
1. Base Model:从“超级图书馆”变成“基础工具箱”
过去的Base Model就像一个把互联网、维基百科、书籍都装进去的超级图书馆——GPT-3时代,预训练数据85%来自网页和维基,大家觉得“预训练做得越好,模型就越强”。那时后训练只是微调聊天风格,RL(强化学习)作用很小。
现在呢?Base Model的目标变了:它不用会直接完成复杂任务(比如写10小时的软件工程),但必须掌握原子能力——比如Python语法、代码结构、Git操作、API调用这些“基础工具”。就像你学做饭,Base Model负责教你切菜、颠锅、调酱料,后面的RL教你怎么把这些步骤组合起来做一道完整的菜。Base Model从“什么都懂”变成“什么基础技能都会”,成了后面复杂能力的“起点”。
2. 预训练数据:从“大杂烩”到“精准投喂”
过去预训练数据是“捡到篮子里都是菜”,网页占85%;现在网页占比降到15%,代码成了最大数据来源。为啥?因为现在模型公司明确知道模型需要什么能力(比如编程、推理、长任务),就针对性给数据。
还有个变化是合成数据变重要了:不是从网上爬真实数据,而是人为设计贴合任务的数据。比如把一段普通代码,改成“找Bug+修改+调用工具+连续完成任务”的训练样本——让模型在预训练阶段就接触真实任务场景,不只是学知识,还学“怎么用知识”。就像以前背单词书,现在直接背“单词+例句+情景对话”,更实用。
3. RL和后训练:从“微调”变成“能力放大器”
以前后训练只是“修修补补”(比如让模型更会聊天),RL作用有限;现在RL成了提升能力的关键——只要RL做得好,预训练后的模型还能明显变强。比如有业内人士说,预训练和后训练的算力投入已经差不多了。
这意味着:模型的最终能力不再只靠预训练,后训练和RL才是“决定上限”的环节。就像买了个毛坯房(Base Model),以前装修(后训练)花点小钱就行,现在装修花的钱和买毛坯房差不多,而且装修好坏直接决定房子能不能住得舒服。
4. Mid-training:预训练和后训练之间的“缓冲带”
过去预训练是“静态知识”(网页、书籍),后训练突然变成“动态任务”(推理步骤、Agent交互、工具调用),数据风格差太远,模型容易“水土不服”——尤其是MoE模型(多专家模型),不同专家分工已经固定,突然换数据会打乱分工。
Mid-training就是解决这个问题的:在预训练和后训练之间加个过渡阶段,让模型先接触长上下文、推理数据、任务场景,提前适应后面的“画风”。就像小学毕业直接上大学会跟不上,Mid-training就是中学,帮你平稳过渡。
5. 训练范式简化:“两步走”搞定大模型
现在整个训练流程可以简化成两大步:
- 第一步:监督学习(对应预训练+Mid-training):让模型学知识、基础技能(原子能力),比如认识单词、会Python、懂逻辑。
- 第二步:强化学习(RL)(对应后训练):让模型在真实环境里试错、反馈,把基础技能组合起来解决复杂问题,比如写软件、做决策。
原来的多个阶段(预训练、Mid、后训练)界限越来越模糊,核心就是“先打基础,再练应用”——就像先学加减乘除,再学解应用题,逻辑更清晰。
最后:Base Model没死,只是角色变了
文章标题说“The Base Model Is Dead”是夸张,但Base Model的地位确实从“核心”变成了“起点”。它依然重要——没有基础技能,后面的RL也无从谈起,但现在大家更关注“怎么用RL把基础技能变成复杂能力”。这是大模型行业从“追求知识量”到“追求应用能力”的关键转变。