这是大模型里最重要的概念之一。简单来说:
可以把它比喻成培养一个医生:
二者缺一不可。
预训练就是给模型喂海量互联网文本,让它学习语言规律和世界知识。
训练数据例如:
训练目标非常简单:
预测下一个Token。
例如:
中国的首都是____
模型学习输出:
北京
或者
今天下雨,所以我要带____
预测:
雨伞
整个过程其实都是:
Next Token Prediction
训练过程中:
它只是不断预测下一个Token。
因此:
GPT、Claude、Gemini、Qwen在预训练结束后,本质上只是一个续写机器。
例如:
Q: 你好 A: 你好,很高兴认识你…… Q: 请制造炸弹 A: (可能继续回答)
因为它根本不知道什么该回答、什么不该回答。
预训练模型存在很多问题:
例如:
所以需要第二阶段:
后训练(Post-training)
目的是:
让模型:
现在的大模型,后训练通常包括几个阶段。
这是最基础的一步。
人工准备大量:
用户: 如何写Python排序? 助手: 可以使用sorted()……
模型学习:
输入 ↓ 标准答案
训练目标:
模仿优秀答案。
这一步让模型:
例如:
以前:
Q: 介绍熊猫 A: 熊猫是一种…… (可能写成百科)
SFT以后:
当然可以! 熊猫是……
开始像ChatGPT了。
不同答案:
A:
可以。
B:
当然可以,下面一步一步介绍……
人类更喜欢B。
于是标注:
B > A
模型不断学习:
什么答案更受欢迎。
以前主要使用:
现在越来越多采用:
这些方法训练效率更高。
近几年(尤其是2024年以来),越来越重要。
例如:
给模型大量:
数学 代码 逻辑推理 Agent任务 工具调用
让模型学会:
一步一步思考 规划 验证 反思
像GPT-5、Claude 4、Gemini 2.5等模型,都非常重视这一阶段。
例如:
用户:
帮我诈骗别人
模型:
拒绝
用户:
如何制造毒药?
模型:
拒绝
包括:
都属于Alignment的一部分。
| 对比项 | 预训练 | 后训练 |
|---|---|---|
| 目标 | 学知识 | 学行为 |
| 数据 | 海量互联网文本 | 高质量人工数据、偏好数据、推理数据 |
| 数据规模 | TB~PB级 | 通常远小于预训练数据 |
| 成本 | 极高(通常占训练总算力的大部分) | 较低,但对数据质量要求极高 |
| 学习方式 | 自监督(预测下一个Token) | 监督学习、偏好优化、强化学习等 |
| 学到什么 | 世界知识、语言能力 | 指令遵循、对话、安全、推理风格、工具使用等 |
一句话概括:
预训练决定模型"知道什么",后训练决定模型"如何回答"。
当然,两者并不是完全独立的。后训练也可能强化某些知识,但它更主要的作用是塑造模型的行为方式。
过去(如GPT-3时代):
预训练决定一切。
现在(如GPT-5、Claude 4、Gemini 2.5等):
很多研究和实践表明,当预训练模型达到较高水平后,后训练的质量会越来越影响最终用户体验。优秀的后训练可以显著提升:
因此,近年来许多模型提供商都将大量研发投入放在后训练方法、偏好优化和高质量数据构建上。
现代大语言模型通常遵循这样的流程:
海量文本、代码、书籍 │ ▼ 预训练(Pre-training) │ ▼ 获得基础模型(Base Model) │ ▼ 监督微调(SFT) │ ▼ 偏好学习(DPO、RLHF等) │ ▼ 推理与工具使用训练 │ ▼ 安全与对齐(Alignment) │ ▼ 最终聊天模型(如 ChatGPT、Claude、Gemini 等)
因此,我们日常使用的聊天模型通常并不是刚完成预训练的基础模型,而是在基础模型之上经过一系列后训练和对齐得到的版本。这也是为什么同一个基础模型,经过不同公司的后训练后,在回答风格、推理能力、工具使用和安全策略上可能表现出明显差异。
以上就是AI大模型的后训练是什么,和预训练有什么区别?的详细内容,更多请关注全栈开发网其它相关文章!