← 返回 AI 基础 首页 / 算法与AI / AI 基础 / GPT 系列
AI 基础 · GPT 系列演进

从 1.17 亿到 o3:GPT 家族是怎么一路变强的

GPT 不是一夜之间变聪明的。它像一个学生:先读书识字(GPT-1)、再博览群书练写作(GPT-2/3)、然后学规矩会聊天(ChatGPT)、接着学会看图听声(GPT-4o)、最后学会"先想再答"(o1/o3)。这一课串起这条进化线,你就明白每个版本到底新在哪。

① 时间线:GPT 版本一路加码

版本参数规模年份里程碑
GPT-11.17 亿(117M)2018验证"先预训练、再微调"可行
GPT-215 亿(1.5B)2019证明模型变大就能写连贯文章
GPT-31750 亿(175B)2020少样本学习(few-shot)惊艳全场
GPT-3.5 / ChatGPT未公开2022.11SFT+RLHF 后会聊天,全球爆火
GPT-4未公开( MoE 传闻)2023更强推理、可看图,专业考试接近人类
GPT-4o未公开2024原生多模态:图、文、语音实时对话
o1 / o3未公开2024–2025推理模型:先内部"思考"再答题
关键趋势参数从 117M 冲到 175B 用了四年;之后 OpenAI 不再公布参数,转而比"会不会聊天、会不会看图、会不会推理"——比拼的重点从"大"转向"好用、聪明"。

② GPT-1/2/3:规模 scaling 的胜利

核心思路就一句话:把模型做大、把数据堆多

代主打发现局限
GPT-1Transformer 解码器 + 预训练后微调下游任务小,只能做特定任务
GPT-2不微调也能 zero-shot 写文章,震惊业界仍偶尔跑题、事实错误
GPT-3175B + 提示里给几个例子就能做新任务(few-shot)贵、胡说八道、不会对话

这三代证明了 Scaling Law(缩放定律):只要参数、数据、算力一起涨,模型能力就可预测地变强。

③ ChatGPT 的爆发:InstructGPT + RLHF + System Prompt

GPT-3 已经很能写,但它不会好好对话——你问"怎么报税",它可能写一篇关于税收历史的散文。把它变成 ChatGPT 的是三件关键技术:

技术作用大白话
InstructGPT用指令数据微调,让模型学会"听指令做事"从"写文章的"变成"听指挥的助手"
RLHF人类偏好反馈对齐教它回答得像人喜欢的样子
System Prompt对话开头给模型设定角色和规则"你是一个乐于助人的助手"这句隐藏指令
System Prompt 长什么样
用户看不见,但模型每轮都读
You are ChatGPT, a large language model trained by OpenAI. Answer as helpfully as possible…… 它决定了语气、边界、安全策略。你在产品里"自定义人设",本质就是在改这一行。

④ GPT-4 与 GPT-4o:从文字到多模态

版本新增能力意义
GPT-4接受图片输入;推理和专业考试大幅提升能看图表、看截图做题;不再只是文字模型
GPT-4o原生图文音多模态,语音对话接近真人延迟能听、能看、能说,实时跟你语音聊天
"o"是什么意思o = omni(全能),指一个模型同时处理文本、图像、音频,而不是几个模型拼起来。这是多模态统一架构的方向。

⑤ o1 / o3:会"思考"的推理模型

普通 GPT 是"想到哪答到哪"。o1/o3 不一样:它在给你最终答案之前,先在内部默默写一大段"思考过程"(思维链 Chain-of-Thought),像学生考试先打草稿再写答案。

对比普通 GPT-4o1 / o3 推理模型
回答方式直接输出答案先内部推理(长 CoT),再给结论
训练重点预测下一个词 + 对齐用强化学习(RL)专门奖励"推理正确"
擅长日常问答、写作数学、编程、复杂逻辑题
代价快、便宜慢、贵(思考要烧更多算力)
别误解o 系列不是"更博学",而是"更会一步步推理"。它在常识闲聊上未必比 GPT-4o 强,遇到难题才显出差距。所以官方建议:普通问题用普通模型,烧脑题才上 o 系列。

⑥ 三个例子:体会代际差别

例 1 · GPT-3 vs ChatGPT
问:"给我讲个笑话。"
GPT-3 可能继续写"笑话是一种叙事体裁,分为冷笑话、热笑话……";ChatGPT 直接给你一个真笑话。差别就在 SFT + RLHF 把它从"续写机器"调成了"助手"。
例 2 · GPT-4o 的多模态
你拍一张写满公式的白板照片发给它。
它能看懂图里的公式,告诉你哪一步算错了——这是 GPT-3 时代做不到的,因为它只能吃文字。
例 3 · o1 解数学题
一道多步几何证明题。
普通模型可能一上来就猜答案;o1 会先在草稿里列已知条件、推中间结论、试错几次,最后才输出证明——正确率明显更高。
防坑提示 ① 参数大小 ≠ 版本新旧。GPT-4/o 系列从不公布参数,别拿"多少 B"去比谁更强。
② o 系列不是万能,闲聊和简单任务用它反而慢又贵,按需选用。
③ System Prompt 是产品能力的一部分——你看到的"人设"很多是系统提示词写出来的,不是模型本性。

⑦ 折叠自测(点开看答案)

基础1. GPT-1 到 GPT-3 参数规模大致是怎么演进的?

GPT-1 约 1.17 亿(117M)→ GPT-2 约 15 亿(1.5B)→ GPT-3 约 1750 亿(175B),靠"堆参数+堆数据"持续变强。

中档2. ChatGPT 能好好聊天,主要靠哪三件事?

InstructGPT(指令微调,学会听指挥)、RLHF(人类偏好对齐)、System Prompt(设定角色与规则)。

拔高3. o1/o3 和普通 GPT-4 最大的区别是什么?为什么更慢更贵?

它会先在内部做长链推理(思维链),靠强化学习专门奖励正确推理;因为要生成并思考一大堆中间过程,token 消耗大,所以更慢更贵,但在数学/编程/逻辑题上更强。

⑧ 费曼三问:讲给自己听

问 1:GPT-3 已经很强,为什么还要做 ChatGPT?
因为它只会续写、不会按人类方式对话;SFT+RLHF+System Prompt 把它调成了听话的助手,才真正好用。
问 2:GPT-4o 的"o"代表什么飞跃?
omni 全能——一个模型原生处理文本、图像、音频,能实时看图听声语音对话。
问 3:o 系列适合什么时候用?
数学、编程、复杂逻辑这种需要多步推理的难题;简单闲聊用它反而慢又贵。
口述全链路
"GPT 从 117M 一路堆到 175B,靠的是数据和参数一起涨。"
"ChatGPT 爆发靠的是 InstructGPT + RLHF + System Prompt,把续写机器调成了助手。"
"GPT-4o 多模态能看能听能说,o1/o3 则先内部推理再答题,专攻烧脑难题。"

⑨ 能力定位速查:不同任务选哪个

你要干的事推荐用原因
日常聊天、写邮件、头脑风暴GPT-4o 类快、便宜、综合够用
看图、读截图、图表分析GPT-4o 类多模态原生支持图片输入
数学证明、编程竞赛、复杂逻辑o1/o3 类推理模型先思考再答,正确率高
简单问答、分类、抽取小模型/旧版没必要为简单任务花大钱
省钱心法不是越新越强就越该用。把难题派给 o 系列,日常活派给便宜模型,总成本能差好几倍。

⑩ 关键名词速查

名词大白话
Zero-shot不给例子,直接让它做新任务
Few-shot提示里给几个示范例子,它照着做
In-context Learning不更新权重,光靠提示里的上下文就学会新任务(GPT-3 的杀手锏)
Chain-of-Thought让它把推理步骤一步步写出来再下结论,o 系列把这个内化了
多模态一个模型同时处理图、文、音,而非各管各

⑪ 常见误区辨析

误区 1:参数越大就越聪明GPT-4/o 从不公布参数,能力来自架构、数据、对齐的综合,不是单纯堆参数。
误区 2:ChatGPT 背后就是 GPT-3ChatGPT 是 GPT-3.5 经 SFT+RLHF 对齐后的产品形态,和原始 GPT-3 不是一回事。
误区 3:o1 什么都比 GPT-4o 强o 系列强在推理难题,闲聊、创意、速度上未必占优,反而更慢更贵。
误区 4:模型"记住"了训练数据它学的是统计规律,不是数据库;被问到没见过的事实时会一本正经地编(幻觉)。

⑫ 分层练习(点开解析)

基础GPT-1 的参数大概是多少?
约 1.17 亿(117M),是 Transformer 解码器路线的早期验证。
基础ChatGPT 是哪个版本对齐后的产物?
GPT-3.5 经 SFT + RLHF 对齐后的对话产品,2022 年底发布。
中档few-shot 是什么意思?
在提示里给几个示范例子,模型照样子完成新任务,无需更新权重(in-context learning)。
中档GPT-4 相比 GPT-3.5 关键新增了什么?
更强的推理,以及接受图片输入的多模态能力,专业考试成绩大幅提升。
中档System Prompt 起什么作用?
对话开头给模型设定角色、语气和边界,影响每一轮回答,用户通常看不见。
拔高o 系列为什么在数学/编程上更强?
它先用强化学习训练长链推理能力,答题前先内部打草稿、多步推导,再输出结论。
拔高为什么说"参数大小不再是比拼重点"?
GPT-4 之后 OpenAI 不再公布参数,转而比多模态、推理、可用性;单纯堆规模的边际收益下降。

⑬ 三句记忆口诀

① GPT-1 到 GPT-3:参数 117M → 175B,靠规模 scaling 变强。
② ChatGPT = GPT-3.5 + InstructGPT + RLHF + System Prompt。
③ GPT-4o 多模态能看听,o1/o3 先思考再答、专攻推理。
想要选
日常聊天写作GPT-4o 类
看图读表多模态
烧脑数学编程o 系列

📌 知识链路

前置知识(先学) · 上一章 · 训练全流程:GPT 每一代都在这套流程上加料。
本节位置 用一条真实演进线,把"结构 + 训练 + 对齐"串成看得见的产品史。
下一步(学完去) · 下一章 · RAG 进阶:通用模型再强,也得配上你自己的资料才好用。
← 上一章 · 训练全流程 AI 基础