素材
- 《大模型应用开发极简入门》1.2 节和【内部:以前的完整笔记】。
- OpenAI 关于 GPT-1、GPT-2、GPT-3、InstructGPT、GPT-4、GPT-4o、GPT-5、GPT-5.5 和 GPT-5.6 的官方资料。
- OpenAI o1 与 DeepSeek-R1 的官方发布资料和技术报告。
先说结论
GPT-1 到 GPT-5.6,我只需要记住一条主线:
先让模型通过预测下一个 Token 学会语言,再让它学会完成任务、听人的指令、处理声音和图片,最后进一步学会推理、使用工具并完成更长的真实工作。
Token:模型读写文字时使用的小块,可以是一个字、一个词或词的一部分。
InstructGPT:经过专门训练、更会遵循人类指令的 GPT-3,不是 GPT-3 到 GPT-4 之间的新一代基础模型。
这不是四条不同路线,而是同一条 GPT 路线逐步长大:
G:Generative,逐个生成 Token。P:Pre-trained,先预训练。T:Transformer,用 Transformer 处理上下文。
Transformer:一种特别擅长处理上下文关系的神经网络架构。
用“上学”理解整个过程
把模型想成一个学生:
预训练:- 先读完整个图书馆,反复做“下一个 Token 是什么”的填空题。
- 你可以理解为“完形填空”
监督微调 SFT(Supervised Fine-Tuning):- 老师给出“问题 → 理想回答”,教它怎样完成任务。
人类反馈强化学习 RLHF(Reinforcement Learning from Human Feedback):- 老师比较多个回答哪个好,教它更符合人的偏好。
提示词:- 学生毕业后,我今天交给它的具体任务。
基础模型:只完成了大规模预训练、很会续写,很会做完形填空,但不一定听指令的模型。
助手模型:基础模型经过后训练,更会按人的要求回答。
最重要的区别是:
预训练、微调和 RLHF 会修改模型参数;提示词不会。
四个词必须分清
监督学习
监督学习就是:人提前给出正确答案。
“页面终于不卡了。” -> 正面
“支付按钮点了没有反应。” -> 负面- 模型看着这些
人工标签调整参数 - GPT 出现以前,很多自然语言任务都要单独准备
一套标注数据,再训练一个专用模型
预训练(也叫做“无监督预训练”)
预训练就是:先不管具体业务,让模型从大量通用文本中学习语言。
GPT 使用的练习题是预测下一个 Token:
原文:出门下雨记得带伞
题目:出门下雨记得带____
答案:伞整个过程只有四步:
- 原文是“出门下雨记得带伞”。
- 训练程序暂时遮住“伞”,让模型猜下一个 Token。
- 模型猜成“雨衣”,再和原文中的“伞”比较。
- 猜错后调整参数。海量文本反复这样训练,模型逐渐学会语言规律。
图里为了好懂只画了一道题。实际上一句话可以连续产生多道题:
出门 -> 下雨
出门下雨 -> 记得
出门下雨记得 -> 带
出门下雨记得带 -> 伞这里的“猜错”只表示没有猜中原文实际出现的下一个 Token。 “雨衣”在生活中同样合理,只是它不是这条训练样本的答案。
关键不是“没有答案”,而是答案就在原文里,不需要人另外标注。
GPT-1 和 GPT-2 当时常把它叫无监督预训练。今天更常叫自监督预训练,这个名字更准确。
微调和后训练
微调就是拿预训练模型,用更小、更具体的数据继续训练。
GPT-1 的典型路线是:
① 通用预训练模型 + 情感标注数据 -> 情感分类模型
② 通用预训练模型 + 问答标注数据 -> 问答模型后来的后训练范围更大。它用 SFT、RLHF 等方法,让模型更会理解指令、按要求回答、符合人的偏好和安全边界。
SFT是Supervised Fine-Tuning的缩写,中文是监督微调:- 人写出一批理想问答,模型照着模仿。它就是预训练之后进行的监督学习。
RLHF是Reinforcement Learning from Human Feedback的缩写,中文是基于人类反馈的强化学习:- 模型先生成多个回答,人不必重写答案,只要比较哪个更好。
- 系统把这些选择变成奖励信号,再继续调整模型。
最短记忆:
SFT 是“照着示范学”,RLHF 是“根据人的评价改”。
它们都是后训练方法,都会修改模型参数。这里知道作用就够了,不需要学习奖励模型和强化学习公式。
提示词和上下文学习
提示词不是训练。它不修改参数,只影响当前这次生成。
红色 -> red
蓝色 -> blue
绿色 ->模型根据上下文生成 green。这叫上下文学习:
- 不给例子,只说任务:零样本。
- 给一个例子:单样本。
- 给少量例子:少样本。
零样本:这里的“样本”是提示词里的示范。零样本就是只说任务、不给示范,模型直接回答。
下面是一个零样本案例:
任务:判断下面这句话是正面还是负面。
句子:这家店的面很好吃。
回答:正面提示词只告诉模型任务,没有先给它看“什么叫正面、什么叫负面”的例子。模型直接用预训练和后训练获得的能力回答,这就是零样本能力。
如果先加一个示范,就不再是零样本:
示范:等了一个小时还没上菜。 -> 负面
任务:这家店的面很好吃。 ->我必须避免两个误解:
零样本不是模型从来没见过类似文字。它已经做过大规模预训练。零样本也不是零提示词。至少还要告诉模型现在要完成什么任务。
谈 GPT-2 时,零样本更强调“没有为下游任务单独训练”;谈 GPT-3 的提示词时,更常强调“当前提示词里没有示范”。共同点都是:直接调用模型已有的通用能力完成任务。
GPT-3 没有消灭微调。它只是证明:很多任务可以先用提示词解决,不必每次都修改模型参数。
GPT-1 到 GPT-5.6,分别改变了什么
GPT-1:先通识教育,再专项训练
GPT-1 跑通了:
大量文本预训练 → 少量任务数据监督微调。
模型不再为每个自然语言任务都从零开始。
GPT-2:规模变大,开始出现零样本能力
GPT-2 仍然只练预测下一个 Token,但数据更多、模型更大。它没有为翻译、问答、摘要分别训练,也开始能做一点这些任务。
GPT-3:把任务和例子放进提示词
GPT-3 进一步扩大规模,重点展示了零样本、单样本和少样本学习。
它能从当前上下文看懂任务,不一定要先为这个任务微调。但它本质上仍是强大的续写模型,不天然等于可靠的聊天助手。
InstructGPT:从“会续写”到“会听指令”
Instruct就是“指令”。InstructGPT 可以理解为:经过指令后训练、更加愿意按人的要求做事的 GPT。
它不是 GPT-3 和 GPT-4 之间漏掉的新一代基础模型,而是 OpenAI 在 GPT-3 上验证的一条关键后训练路线。
为什么需要它?GPT-3 预训练时只练了一件事:预测下一个 Token。因此用户写“请把这段话总结成一句”,基础模型可能继续续写类似文本,不一定真的执行总结任务。
InstructGPT 的训练分成三步:
- 人写出“指令 → 理想回答”,让模型通过 SFT 模仿。
- 模型生成多个候选回答,人给它们排序。
- 系统从排序中学习人的偏好,再通过 RLHF 调整模型。
所以 InstructGPT 的重点不是补充更多世界知识,而是教模型:已有能力应该怎样按照人的指令使用。
ChatGPT 沿用了相近的 SFT 和 RLHF 思路,并专门针对连续对话训练。它不是简单给 InstructGPT 加了一个聊天界面。
GPT-4:能力更强,并进入多模态
多模态:一个模型可以处理文字、图片等不同类型的信息。
GPT-4 仍然分成两段:
- 预训练主要获得能力。
- 后训练主要调整行为。
它还能同时接收文字和图片。对我最直接的意义是:模型不仅能读提示词,还能看页面截图、图表和文档图片。
GPT-4 的完整内部架构没有公开,不猜参数量和实现细节。
以下 GPT-4o、o1、DeepSeek-R1、GPT-5、GPT-5.5 和 GPT-5.6 的公开信息截至 2026-07-28。
GPT-4o:一个模型同时听、看、说
o是omni的缩写,可以理解为“全能、全模态”。
GPT-4o 在 2024 年发布。以前的语音对话像接力:
声音 -> 语音转文字 -> GPT 处理文字 -> 文字转语音GPT-4o 改成用同一个神经网络端到端处理文字、声音和图像。它不只“看见转写后的文字”,还可以直接利用语气、背景声音和画面信息。
对我最直接的意义是:模型从一个文字聊天框,变成了可以实时听我说话、看页面和理解图片的多模态助手。
o1 和 DeepSeek-R1:推理模型成为新的分界线
推理模型:不像普通聊天模型那样马上回答,而是先多花一些计算和 Token 尝试、检查、纠错,再给最终答案。
OpenAI 在 2024 年发布 o1,明确把“回答前花更多时间思考”做成一个新模型系列。它在数学、科学和编码等复杂问题上更强。
DeepSeek 在 2025 年发布 R1。它不是第一个推理模型,但它把这条路线真正推向行业主流:
- 用大规模强化学习增强推理能力。
- 官方称数学、代码和推理能力可以对标 OpenAI o1。
- 开放模型权重、技术报告和蒸馏模型,允许其他人研究、部署和继续训练。
开放权重:把训练好的模型参数文件公开,其他人可以下载、部署和继续研究。
蒸馏:让较小模型学习大模型的回答和推理方式,尽量用更低成本获得相近能力。
真正的分界不是模型突然“会思考”了,而是能力增长多了一条新路线:
以前:扩大预训练、增加参数
后来:再用强化学习训练推理,并在回答时投入更多计算这叫推理时扩展:同一个模型在回答难题时多花一些计算,通常能得到更好的结果。
推理时扩展:像考试时允许多给几分钟验算;不是重新上课,而是在答题现场投入更多时间。
这也有代价:推理越久,通常越慢、Token 越多、成本越高。简单提取、翻译和闲聊不一定需要推理模型。
GPT-5:从一个模型变成会自动分配思考时间的系统
GPT-5 在 2025 年发布。OpenAI 把它描述成一个统一系统:
- 简单问题交给快速模型。
- 困难问题交给更深的推理模型。
- 路由器根据任务难度、工具需求和我的要求选择路线。
路由器 Router:像医院分诊台,先判断问题难度,再把任务交给合适的模型处理。
GPT-5 的关键不只是“回答更聪明”,而是可以决定什么时候快速回答、什么时候多花时间推理。它在编码、工具调用、指令遵循和复杂任务上进一步增强。
GPT-5.5:更会操作工具,把工作继续做下去
GPT-5.5 在 2026 年发布,重点转向真实工作:Agent 编码、电脑操作、资料研究、数据分析,以及创建文档和表格。
Agentic:不只回答应该怎么做,还会规划步骤、调用工具、检查结果并继续执行。
它更像一个能接住模糊任务的执行者:我不必规定每一步,它可以自己规划、跨工具工作、检查结果,并尽量把事情做完。
GPT-5.6:更强的 Agent,并开始明确分能力档位
GPT-5.6 在 2026 年发布,重点是用更少的 Token 和成本完成更长、更复杂的工作,并加强编码、电脑操作、设计、知识工作和多工具协作。
它分成三个能力档位:
Sol:旗舰模型,解决最难的问题。Terra:能力和成本更均衡,适合日常工作。Luna:最快、最便宜,适合大量简单任务。
Sol / Terra / Luna:可以把它们理解成同一代汽车的高配、均衡版和经济版,不是三个连续的新世代。
OpenAI 对这套命名的解释是:5.6表示模型世代,Sol、Terra、Luna 表示可以分别演进的能力档位。
模型发展重点已经从“生成一段更好的文字”,走向“调用工具、操作软件、协调多个步骤,交付一个完整结果”。
模型参数到底是什么
一个参数就是模型训练后保存的一个内部数值,也叫权重。训练会改变这些数值,普通提示词不会。
早期 GPT 公布过参数量:
- GPT-1:约
117M,也就是1.17 亿个参数。 - GPT-2:最大版本
1.5B,也就是15 亿个参数。 - GPT-3:最大版本
175B,也就是1750 亿个参数。
M / B:M 表示百万,B 表示十亿。
参数量表示模型的学习容量,不是知识条数,也不等于最终能力。1750 亿参数,不代表记住了 1750 亿条知识。
一个直接证据是:在 OpenAI 的人类偏好测试中,13 亿参数的 InstructGPT 比 1750 亿参数的 GPT-3 更受欢迎。训练方法和数据质量,有时比单纯增加参数更重要。
从 GPT-4 开始,OpenAI 没有公布精确参数量。因此不记录网上传言,比较新模型时直接看真实任务效果、速度和成本。
我只记住这五句话
- GPT 的基础训练目标一直是预测下一个 Token。
- GPT-1 到 GPT-3 的主线是
预训练、扩大规模和上下文学习。 - InstructGPT 和 ChatGPT 通过
后训练,让会续写的模型变得更会听指令。 - GPT-4 和 GPT-4o 把能力扩展到图片、声音等模态。
- o1 和 DeepSeek-R1 把推理时投入更多计算变成新主线,GPT-5 到 GPT-5.6 再把推理、工具、电脑操作和 Agent 组合起来。
我暂时不需要知道
- GPT-4 以后网上流传、但 OpenAI 没有公布的参数量。
- 优化器、损失函数、Q、K、V 的数学细节。
- RLHF 的具体算法。
- GPT-4 以后没有公开的完整内部结构。
这些内容不能帮助我讲清主线时,先不学。
一分钟怎么讲清楚
GPT-1 到 GPT-5.6 的主线,是让模型先学会语言,再学会听人说话,最后学会使用工具完成真实工作。
GPT-1 建立了“先通用预训练,再按任务监督微调”的路线。GPT-2 把模型和数据做大,开始出现零样本能力。GPT-3 证明可以把任务和少量例子放进提示词,不修改参数也能完成很多新任务。
但 GPT-3 基础模型主要是续写模型。InstructGPT 和 ChatGPT 通过监督微调和人类反馈,让它更会遵循指令。GPT-4 支持文字和图片,GPT-4o 再把文字、声音和图像放进同一个端到端模型。
接着出现了推理模型这条分界线。OpenAI o1 让模型在回答前花更多时间尝试和纠错;DeepSeek-R1 再通过大规模强化学习、开放权重和蒸馏模型,让这条路线进入行业主流。
GPT-5 把快速回答和深入推理组合成统一系统。GPT-5.5 更会调用工具和操作电脑,GPT-5.6 进一步加强长任务、Agent 和运行效率,并用 Sol、Terra、Luna 区分能力档位。
早期 GPT-1、GPT-2、GPT-3 的参数量分别约为 1.17 亿、15 亿和 1750 亿。GPT-4 之后 OpenAI 没有公开精确参数量,而且新产品已经可能包含多个模型、路由器和工具系统,所以不能再只用参数量判断能力。
考考你
GPT-1 到 GPT-5.6 的发展主线是什么?
GPT-1 到 GPT-3 主要解决怎样从海量文字获得通用能力,InstructGPT 和 ChatGPT 让模型更会听指令,GPT-4 和 GPT-4o 扩展到多模态,o1 和 DeepSeek-R1 开启推理模型主线,GPT-5 到 GPT-5.6 再把推理、工具、电脑操作和 Agent 组合起来。
SFT 和 RLHF 分别是什么,有什么区别?
SFT 是 Supervised Fine-Tuning,让模型模仿人写的理想回答;RLHF 是 Reinforcement Learning from Human Feedback,让模型根据人对多个回答的排序继续改进。最短记忆是:SFT 照着示范学,RLHF 根据评价改。
什么是零样本能力?
当前提示词只说明任务、不给示范,模型仍然可以直接回答,就是零样本能力。零样本不是模型没有预训练知识,也不是没有提示词。
模型参数是什么,为什么不能只看参数量?
参数是模型训练后保存的内部数值。参数越多通常表示学习容量越大,但能力还取决于训练数据、后训练、推理时间和工具系统;而且 GPT-4 之后 OpenAI 没有公布精确参数量。
为什么推理模型是 GPT-4o 到 GPT-5 之间的重要分界线?
因为模型能力不再只靠扩大预训练和参数量,也可以通过强化学习训练推理,并在回答时投入更多计算来尝试、检查和纠错。o1 公开展示了这条路线,DeepSeek-R1 用开放权重和蒸馏模型把它推向行业主流,GPT-5 再用路由器把快速回答和深入推理组合成统一系统。
o1 已经出现,为什么 DeepSeek-R1 仍然是重要节点?
o1 较早公开展示了推理模型路线;DeepSeek-R1 再通过开放权重、技术报告和蒸馏模型,降低了研究、部署和继续训练的门槛。它的重要性不是“第一个”,而是把推理模型推向更开放、更普及的行业阶段。
为什么不应该让所有任务都使用推理模型?
推理模型会花更多时间和 Token 尝试、检查和纠错,因此通常更慢、更贵。复杂数学、代码和多步决策值得使用;简单提取、改写、翻译和闲聊,直接回答通常更合适。
GPT-5 为什么需要路由器?
因为不同问题需要的思考成本不同。路由器像分诊台:简单任务交给快速模型,复杂任务交给推理模型,在回答质量、速度和成本之间做选择。
参考
- 《大模型应用开发极简入门:基于 GPT-4 和 ChatGPT(第 2 版)》1.2 节,以及【内部:以前的完整笔记】。
- OpenAI:GPT-1、GPT-2、GPT-3。
- OpenAI:InstructGPT、GPT-4 技术报告、GPT-4o。
- 推理模型:OpenAI o1、DeepSeek-R1 官方发布、DeepSeek-R1 技术报告。
- OpenAI:GPT-5、GPT-5.5、GPT-5.6;当前型号信息截至 2026-07-28。