331. AgentX:GPT-1 到 GPT-5.6,我最少需要知道什么?

2026.07.28

·fdeagentx

素材

  • 《大模型应用开发极简入门》1.2 节和【内部:以前的完整笔记】。
  • OpenAI 关于 GPT-1、GPT-2、GPT-3、InstructGPT、GPT-4、GPT-4o、GPT-5、GPT-5.5 和 GPT-5.6 的官方资料。
  • OpenAI o1 与 DeepSeek-R1 的官方发布资料和技术报告。

先说结论

GPT-1 到 GPT-5.6,我只需要记住一条主线:

先让模型通过预测下一个 Token 学会语言,再让它学会完成任务、听人的指令、处理声音和图片,最后进一步学会推理、使用工具并完成更长的真实工作。

Token:模型读写文字时使用的小块,可以是一个字、一个词或词的一部分。

331. AgentX:GPT-1 到 GPT-5.6,我最少需要知道什么? 图表 1

InstructGPT:经过专门训练、更会遵循人类指令的 GPT-3,不是 GPT-3 到 GPT-4 之间的新一代基础模型。

这不是四条不同路线,而是同一条 GPT 路线逐步长大:

  • G:Generative,逐个生成 Token。
  • P:Pre-trained,先预训练。
  • T:Transformer,用 Transformer 处理上下文。

Transformer:一种特别擅长处理上下文关系的神经网络架构

用“上学”理解整个过程

把模型想成一个学生:

  • 预训练
    • 先读完整个图书馆,反复做“下一个 Token 是什么”的填空题。
    • 你可以理解为“完形填空”
  • 监督微调 SFT(Supervised Fine-Tuning)
    • 老师给出“问题 → 理想回答”,教它怎样完成任务。
  • 人类反馈强化学习 RLHF(Reinforcement Learning from Human Feedback)
    • 老师比较多个回答哪个好,教它更符合人的偏好。
  • 提示词
    • 学生毕业后,我今天交给它的具体任务。

基础模型:只完成了大规模预训练、很会续写,很会做完形填空,但不一定听指令的模型。

助手模型:基础模型经过后训练,更会按人的要求回答。

331. AgentX:GPT-1 到 GPT-5.6,我最少需要知道什么? 图表 2

最重要的区别是:

预训练、微调和 RLHF 会修改模型参数;提示词不会。

四个词必须分清

监督学习

监督学习就是:人提前给出正确答案。

text
“页面终于不卡了。”        ->  正面
“支付按钮点了没有反应。”   ->  负面
  • 模型看着这些人工标签调整参数
  • GPT 出现以前,很多自然语言任务都要单独准备一套标注数据,再训练一个专用模型

预训练(也叫做“无监督预训练”)

预训练就是:先不管具体业务,让模型从大量通用文本中学习语言。

GPT 使用的练习题是预测下一个 Token:

text
原文:出门下雨记得带伞
题目:出门下雨记得带____
答案:伞

331. AgentX:GPT-1 到 GPT-5.6,我最少需要知道什么? 图表 3

整个过程只有四步:

  • 原文是“出门下雨记得带伞”。
  • 训练程序暂时遮住“伞”,让模型猜下一个 Token。
  • 模型猜成“雨衣”,再和原文中的“伞”比较。
  • 猜错后调整参数。海量文本反复这样训练,模型逐渐学会语言规律。

图里为了好懂只画了一道题。实际上一句话可以连续产生多道题

text
出门             -> 下雨
出门下雨          -> 记得
出门下雨记得       -> 带
出门下雨记得带     -> 伞

这里的“猜错”只表示没有猜中原文实际出现的下一个 Token。 “雨衣”在生活中同样合理,只是它不是这条训练样本的答案。

关键不是“没有答案”,而是答案就在原文里,不需要人另外标注

GPT-1 和 GPT-2 当时常把它叫无监督预训练。今天更常叫自监督预训练,这个名字更准确。

微调和后训练

微调就是拿预训练模型,用更小、更具体的数据继续训练

GPT-1 的典型路线是:

text
① 通用预训练模型 + 情感标注数据 -> 情感分类模型
② 通用预训练模型 + 问答标注数据 -> 问答模型

后来的后训练范围更大。它用 SFT、RLHF 等方法,让模型更会理解指令、按要求回答、符合人的偏好和安全边界。

  • SFTSupervised Fine-Tuning 的缩写,中文是监督微调
    • 人写出一批理想问答,模型照着模仿。它就是预训练之后进行的监督学习。
  • RLHFReinforcement Learning from Human Feedback 的缩写,中文是基于人类反馈的强化学习
    • 模型先生成多个回答,人不必重写答案,只要比较哪个更好。
    • 系统把这些选择变成奖励信号,再继续调整模型。

331. AgentX:GPT-1 到 GPT-5.6,我最少需要知道什么? 图表 4

最短记忆:

SFT 是“照着示范学”,RLHF 是“根据人的评价改”。

它们都是后训练方法,都会修改模型参数。这里知道作用就够了,不需要学习奖励模型和强化学习公式。

提示词和上下文学习

提示词不是训练。它不修改参数,只影响当前这次生成

text
红色 -> red
蓝色 -> blue
绿色 ->

模型根据上下文生成 green。这叫上下文学习

  • 不给例子,只说任务:零样本。
  • 给一个例子:单样本。
  • 给少量例子:少样本。

零样本:这里的“样本”是提示词里的示范。零样本就是只说任务、不给示范,模型直接回答。

下面是一个零样本案例:

text
任务:判断下面这句话是正面还是负面。
句子:这家店的面很好吃。
回答:正面

提示词只告诉模型任务,没有先给它看“什么叫正面、什么叫负面”的例子。模型直接用预训练和后训练获得的能力回答,这就是零样本能力

如果先加一个示范,就不再是零样本:

text
示范:等了一个小时还没上菜。 -> 负面
任务:这家店的面很好吃。     ->

331. AgentX:GPT-1 到 GPT-5.6,我最少需要知道什么? 图表 5

我必须避免两个误解:

  • 零样本不是模型从来没见过类似文字。它已经做过大规模预训练。
  • 零样本也不是零提示词。至少还要告诉模型现在要完成什么任务。

谈 GPT-2 时,零样本更强调“没有为下游任务单独训练”;谈 GPT-3 的提示词时,更常强调“当前提示词里没有示范”。共同点都是:直接调用模型已有的通用能力完成任务。

GPT-3 没有消灭微调。它只是证明:很多任务可以先用提示词解决,不必每次都修改模型参数。

GPT-1 到 GPT-5.6,分别改变了什么

GPT-1:先通识教育,再专项训练

GPT-1 跑通了:

大量文本预训练 → 少量任务数据监督微调。

模型不再为每个自然语言任务都从零开始。

GPT-2:规模变大,开始出现零样本能力

GPT-2 仍然只练预测下一个 Token,但数据更多、模型更大。它没有为翻译、问答、摘要分别训练,也开始能做一点这些任务。

GPT-3:把任务和例子放进提示词

GPT-3 进一步扩大规模,重点展示了零样本、单样本和少样本学习

它能从当前上下文看懂任务,不一定要先为这个任务微调。但它本质上仍是强大的续写模型,不天然等于可靠的聊天助手。

InstructGPT:从“会续写”到“会听指令”

Instruct就是“指令”。InstructGPT 可以理解为:经过指令后训练、更加愿意按人的要求做事的 GPT。

它不是 GPT-3 和 GPT-4 之间漏掉的新一代基础模型,而是 OpenAI 在 GPT-3 上验证的一条关键后训练路线。

为什么需要它?GPT-3 预训练时只练了一件事:预测下一个 Token。因此用户写“请把这段话总结成一句”,基础模型可能继续续写类似文本,不一定真的执行总结任务。

InstructGPT 的训练分成三步:

  • 人写出“指令 → 理想回答”,让模型通过 SFT 模仿。
  • 模型生成多个候选回答,人给它们排序。
  • 系统从排序中学习人的偏好,再通过 RLHF 调整模型。

331. AgentX:GPT-1 到 GPT-5.6,我最少需要知道什么? 图表 6

所以 InstructGPT 的重点不是补充更多世界知识,而是教模型:已有能力应该怎样按照人的指令使用。

ChatGPT 沿用了相近的 SFT 和 RLHF 思路,并专门针对连续对话训练。它不是简单给 InstructGPT 加了一个聊天界面。

GPT-4:能力更强,并进入多模态

多模态:一个模型可以处理文字、图片等不同类型的信息。

GPT-4 仍然分成两段:

  • 预训练主要获得能力。
  • 后训练主要调整行为。

它还能同时接收文字和图片。对我最直接的意义是:模型不仅能读提示词,还能看页面截图、图表和文档图片。

GPT-4 的完整内部架构没有公开,不猜参数量和实现细节。

以下 GPT-4o、o1、DeepSeek-R1、GPT-5、GPT-5.5 和 GPT-5.6 的公开信息截至 2026-07-28。

GPT-4o:一个模型同时听、看、说

oomni 的缩写,可以理解为“全能、全模态”。

GPT-4o 在 2024 年发布。以前的语音对话像接力:

text
声音 -> 语音转文字 -> GPT 处理文字 -> 文字转语音

GPT-4o 改成用同一个神经网络端到端处理文字、声音和图像。它不只“看见转写后的文字”,还可以直接利用语气、背景声音和画面信息。

对我最直接的意义是:模型从一个文字聊天框,变成了可以实时听我说话、看页面和理解图片的多模态助手。

o1 和 DeepSeek-R1:推理模型成为新的分界线

推理模型:不像普通聊天模型那样马上回答,而是先多花一些计算和 Token 尝试、检查、纠错,再给最终答案。

331. AgentX:GPT-1 到 GPT-5.6,我最少需要知道什么? 图表 7

OpenAI 在 2024 年发布 o1,明确把“回答前花更多时间思考”做成一个新模型系列。它在数学、科学和编码等复杂问题上更强。

DeepSeek 在 2025 年发布 R1。它不是第一个推理模型,但它把这条路线真正推向行业主流:

  • 用大规模强化学习增强推理能力。
  • 官方称数学、代码和推理能力可以对标 OpenAI o1。
  • 开放模型权重、技术报告和蒸馏模型,允许其他人研究、部署和继续训练。

开放权重:把训练好的模型参数文件公开,其他人可以下载、部署和继续研究。

蒸馏:让较小模型学习大模型的回答和推理方式,尽量用更低成本获得相近能力。

真正的分界不是模型突然“会思考”了,而是能力增长多了一条新路线:

text
以前:扩大预训练、增加参数
后来:再用强化学习训练推理,并在回答时投入更多计算

这叫推理时扩展:同一个模型在回答难题时多花一些计算,通常能得到更好的结果。

推理时扩展:像考试时允许多给几分钟验算;不是重新上课,而是在答题现场投入更多时间。

这也有代价:推理越久,通常越慢、Token 越多、成本越高。简单提取、翻译和闲聊不一定需要推理模型。

GPT-5:从一个模型变成会自动分配思考时间的系统

GPT-5 在 2025 年发布。OpenAI 把它描述成一个统一系统:

  • 简单问题交给快速模型。
  • 困难问题交给更深的推理模型。
  • 路由器根据任务难度、工具需求和我的要求选择路线。

路由器 Router:像医院分诊台,先判断问题难度,再把任务交给合适的模型处理。

GPT-5 的关键不只是“回答更聪明”,而是可以决定什么时候快速回答、什么时候多花时间推理。它在编码、工具调用、指令遵循和复杂任务上进一步增强。

GPT-5.5:更会操作工具,把工作继续做下去

GPT-5.5 在 2026 年发布,重点转向真实工作:Agent 编码、电脑操作、资料研究、数据分析,以及创建文档和表格。

Agentic:不只回答应该怎么做,还会规划步骤、调用工具、检查结果并继续执行。

它更像一个能接住模糊任务的执行者:我不必规定每一步,它可以自己规划、跨工具工作、检查结果,并尽量把事情做完。

GPT-5.6:更强的 Agent,并开始明确分能力档位

GPT-5.6 在 2026 年发布,重点是用更少的 Token 和成本完成更长、更复杂的工作,并加强编码、电脑操作、设计、知识工作和多工具协作。

它分成三个能力档位:

  • Sol:旗舰模型,解决最难的问题。
  • Terra:能力和成本更均衡,适合日常工作。
  • Luna:最快、最便宜,适合大量简单任务。

Sol / Terra / Luna:可以把它们理解成同一代汽车的高配、均衡版和经济版,不是三个连续的新世代。

OpenAI 对这套命名的解释是:5.6表示模型世代,Sol、Terra、Luna 表示可以分别演进的能力档位。

模型发展重点已经从“生成一段更好的文字”,走向“调用工具、操作软件、协调多个步骤,交付一个完整结果”。

模型参数到底是什么

一个参数就是模型训练后保存的一个内部数值,也叫权重。训练会改变这些数值,普通提示词不会。

331. AgentX:GPT-1 到 GPT-5.6,我最少需要知道什么? 图表 8

早期 GPT 公布过参数量:

  • GPT-1:约 117M,也就是 1.17 亿个参数。
  • GPT-2:最大版本 1.5B,也就是 15 亿个参数。
  • GPT-3:最大版本 175B,也就是 1750 亿个参数。

M / B:M 表示百万,B 表示十亿。

参数量表示模型的学习容量,不是知识条数,也不等于最终能力。1750 亿参数,不代表记住了 1750 亿条知识。

一个直接证据是:在 OpenAI 的人类偏好测试中,13 亿参数的 InstructGPT 比 1750 亿参数的 GPT-3 更受欢迎。训练方法和数据质量,有时比单纯增加参数更重要。

从 GPT-4 开始,OpenAI 没有公布精确参数量。因此不记录网上传言,比较新模型时直接看真实任务效果、速度和成本。

我只记住这五句话

331. AgentX:GPT-1 到 GPT-5.6,我最少需要知道什么? 图表 9

  • GPT 的基础训练目标一直是预测下一个 Token。
  • GPT-1 到 GPT-3 的主线是预训练、扩大规模和上下文学习。
  • InstructGPT 和 ChatGPT 通过后训练,让会续写的模型变得更会听指令。
  • GPT-4 和 GPT-4o 把能力扩展到图片、声音等模态。
  • o1 和 DeepSeek-R1 把推理时投入更多计算变成新主线,GPT-5 到 GPT-5.6 再把推理、工具、电脑操作和 Agent 组合起来。

我暂时不需要知道

  • GPT-4 以后网上流传、但 OpenAI 没有公布的参数量。
  • 优化器、损失函数、Q、K、V 的数学细节。
  • RLHF 的具体算法。
  • GPT-4 以后没有公开的完整内部结构。

这些内容不能帮助我讲清主线时,先不学。

一分钟怎么讲清楚

GPT-1 到 GPT-5.6 的主线,是让模型先学会语言,再学会听人说话,最后学会使用工具完成真实工作。

GPT-1 建立了“先通用预训练,再按任务监督微调”的路线。GPT-2 把模型和数据做大,开始出现零样本能力。GPT-3 证明可以把任务和少量例子放进提示词,不修改参数也能完成很多新任务。

但 GPT-3 基础模型主要是续写模型。InstructGPT 和 ChatGPT 通过监督微调和人类反馈,让它更会遵循指令。GPT-4 支持文字和图片,GPT-4o 再把文字、声音和图像放进同一个端到端模型。

接着出现了推理模型这条分界线。OpenAI o1 让模型在回答前花更多时间尝试和纠错;DeepSeek-R1 再通过大规模强化学习、开放权重和蒸馏模型,让这条路线进入行业主流。

GPT-5 把快速回答和深入推理组合成统一系统。GPT-5.5 更会调用工具和操作电脑,GPT-5.6 进一步加强长任务、Agent 和运行效率,并用 Sol、Terra、Luna 区分能力档位。

早期 GPT-1、GPT-2、GPT-3 的参数量分别约为 1.17 亿、15 亿和 1750 亿。GPT-4 之后 OpenAI 没有公开精确参数量,而且新产品已经可能包含多个模型、路由器和工具系统,所以不能再只用参数量判断能力。

考考你

GPT-1 到 GPT-5.6 的发展主线是什么?

GPT-1 到 GPT-3 主要解决怎样从海量文字获得通用能力,InstructGPT 和 ChatGPT 让模型更会听指令,GPT-4 和 GPT-4o 扩展到多模态,o1 和 DeepSeek-R1 开启推理模型主线,GPT-5 到 GPT-5.6 再把推理、工具、电脑操作和 Agent 组合起来。

SFT 和 RLHF 分别是什么,有什么区别?

SFT 是 Supervised Fine-Tuning,让模型模仿人写的理想回答;RLHF 是 Reinforcement Learning from Human Feedback,让模型根据人对多个回答的排序继续改进。最短记忆是:SFT 照着示范学,RLHF 根据评价改。

什么是零样本能力?

当前提示词只说明任务、不给示范,模型仍然可以直接回答,就是零样本能力。零样本不是模型没有预训练知识,也不是没有提示词。

模型参数是什么,为什么不能只看参数量?

参数是模型训练后保存的内部数值。参数越多通常表示学习容量越大,但能力还取决于训练数据、后训练、推理时间和工具系统;而且 GPT-4 之后 OpenAI 没有公布精确参数量。

为什么推理模型是 GPT-4o 到 GPT-5 之间的重要分界线?

因为模型能力不再只靠扩大预训练和参数量,也可以通过强化学习训练推理,并在回答时投入更多计算来尝试、检查和纠错。o1 公开展示了这条路线,DeepSeek-R1 用开放权重和蒸馏模型把它推向行业主流,GPT-5 再用路由器把快速回答和深入推理组合成统一系统。

o1 已经出现,为什么 DeepSeek-R1 仍然是重要节点?

o1 较早公开展示了推理模型路线;DeepSeek-R1 再通过开放权重、技术报告和蒸馏模型,降低了研究、部署和继续训练的门槛。它的重要性不是“第一个”,而是把推理模型推向更开放、更普及的行业阶段。

为什么不应该让所有任务都使用推理模型?

推理模型会花更多时间和 Token 尝试、检查和纠错,因此通常更慢、更贵。复杂数学、代码和多步决策值得使用;简单提取、改写、翻译和闲聊,直接回答通常更合适。

GPT-5 为什么需要路由器?

因为不同问题需要的思考成本不同。路由器像分诊台:简单任务交给快速模型,复杂任务交给推理模型,在回答质量、速度和成本之间做选择。

参考

上一篇:GPT 只有 Decoder,为什么翻译也挺好? 下一篇:DeepSeek API,我最少需要知道什么?