AI 基础 · GPT 系列演进
从 1.17 亿到 o3:GPT 家族是怎么一路变强的
GPT 不是一夜之间变聪明的。它像一个学生:先读书识字(GPT-1)、再博览群书练写作(GPT-2/3)、然后学规矩会聊天(ChatGPT)、接着学会看图听声(GPT-4o)、最后学会"先想再答"(o1/o3)。这一课串起这条进化线,你就明白每个版本到底新在哪。
① 时间线:GPT 版本一路加码
| 版本 | 参数规模 | 年份 | 里程碑 |
| GPT-1 | 1.17 亿(117M) | 2018 | 验证"先预训练、再微调"可行 |
| GPT-2 | 15 亿(1.5B) | 2019 | 证明模型变大就能写连贯文章 |
| GPT-3 | 1750 亿(175B) | 2020 | 少样本学习(few-shot)惊艳全场 |
| GPT-3.5 / ChatGPT | 未公开 | 2022.11 | SFT+RLHF 后会聊天,全球爆火 |
| GPT-4 | 未公开( MoE 传闻) | 2023 | 更强推理、可看图,专业考试接近人类 |
| GPT-4o | 未公开 | 2024 | 原生多模态:图、文、语音实时对话 |
| o1 / o3 | 未公开 | 2024–2025 | 推理模型:先内部"思考"再答题 |
关键趋势参数从 117M 冲到 175B 用了四年;之后 OpenAI 不再公布参数,转而比"会不会聊天、会不会看图、会不会推理"——比拼的重点从"大"转向"好用、聪明"。
② GPT-1/2/3:规模 scaling 的胜利
核心思路就一句话:把模型做大、把数据堆多
| 代 | 主打发现 | 局限 |
| GPT-1 | Transformer 解码器 + 预训练后微调下游任务 | 小,只能做特定任务 |
| GPT-2 | 不微调也能 zero-shot 写文章,震惊业界 | 仍偶尔跑题、事实错误 |
| GPT-3 | 175B + 提示里给几个例子就能做新任务(few-shot) | 贵、胡说八道、不会对话 |
这三代证明了 Scaling Law(缩放定律):只要参数、数据、算力一起涨,模型能力就可预测地变强。
③ ChatGPT 的爆发:InstructGPT + RLHF + System Prompt
GPT-3 已经很能写,但它不会好好对话——你问"怎么报税",它可能写一篇关于税收历史的散文。把它变成 ChatGPT 的是三件关键技术:
| 技术 | 作用 | 大白话 |
| InstructGPT | 用指令数据微调,让模型学会"听指令做事" | 从"写文章的"变成"听指挥的助手" |
| RLHF | 人类偏好反馈对齐 | 教它回答得像人喜欢的样子 |
| System Prompt | 对话开头给模型设定角色和规则 | "你是一个乐于助人的助手"这句隐藏指令 |
System Prompt 长什么样
用户看不见,但模型每轮都读
You are ChatGPT, a large language model trained by OpenAI. Answer as helpfully as possible…… 它决定了语气、边界、安全策略。你在产品里"自定义人设",本质就是在改这一行。
④ GPT-4 与 GPT-4o:从文字到多模态
| 版本 | 新增能力 | 意义 |
| GPT-4 | 接受图片输入;推理和专业考试大幅提升 | 能看图表、看截图做题;不再只是文字模型 |
| GPT-4o | 原生图文音多模态,语音对话接近真人延迟 | 能听、能看、能说,实时跟你语音聊天 |
"o"是什么意思o = omni(全能),指一个模型同时处理文本、图像、音频,而不是几个模型拼起来。这是多模态统一架构的方向。
⑤ o1 / o3:会"思考"的推理模型
普通 GPT 是"想到哪答到哪"。o1/o3 不一样:它在给你最终答案之前,先在内部默默写一大段"思考过程"(思维链 Chain-of-Thought),像学生考试先打草稿再写答案。
| 对比 | 普通 GPT-4 | o1 / o3 推理模型 |
| 回答方式 | 直接输出答案 | 先内部推理(长 CoT),再给结论 |
| 训练重点 | 预测下一个词 + 对齐 | 用强化学习(RL)专门奖励"推理正确" |
| 擅长 | 日常问答、写作 | 数学、编程、复杂逻辑题 |
| 代价 | 快、便宜 | 慢、贵(思考要烧更多算力) |
别误解o 系列不是"更博学",而是"更会一步步推理"。它在常识闲聊上未必比 GPT-4o 强,遇到难题才显出差距。所以官方建议:普通问题用普通模型,烧脑题才上 o 系列。
⑥ 三个例子:体会代际差别
例 1 · GPT-3 vs ChatGPT
问:"给我讲个笑话。"
GPT-3 可能继续写"笑话是一种叙事体裁,分为冷笑话、热笑话……";ChatGPT 直接给你一个真笑话。差别就在 SFT + RLHF 把它从"续写机器"调成了"助手"。
例 2 · GPT-4o 的多模态
你拍一张写满公式的白板照片发给它。
它能看懂图里的公式,告诉你哪一步算错了——这是 GPT-3 时代做不到的,因为它只能吃文字。
例 3 · o1 解数学题
一道多步几何证明题。
普通模型可能一上来就猜答案;o1 会先在草稿里列已知条件、推中间结论、试错几次,最后才输出证明——正确率明显更高。
防坑提示
① 参数大小 ≠ 版本新旧。GPT-4/o 系列从不公布参数,别拿"多少 B"去比谁更强。
② o 系列不是万能,闲聊和简单任务用它反而慢又贵,按需选用。
③ System Prompt 是产品能力的一部分——你看到的"人设"很多是系统提示词写出来的,不是模型本性。
⑦ 折叠自测(点开看答案)
基础1. GPT-1 到 GPT-3 参数规模大致是怎么演进的?
GPT-1 约 1.17 亿(117M)→ GPT-2 约 15 亿(1.5B)→ GPT-3 约 1750 亿(175B),靠"堆参数+堆数据"持续变强。
中档2. ChatGPT 能好好聊天,主要靠哪三件事?
InstructGPT(指令微调,学会听指挥)、RLHF(人类偏好对齐)、System Prompt(设定角色与规则)。
拔高3. o1/o3 和普通 GPT-4 最大的区别是什么?为什么更慢更贵?
它会先在内部做长链推理(思维链),靠强化学习专门奖励正确推理;因为要生成并思考一大堆中间过程,token 消耗大,所以更慢更贵,但在数学/编程/逻辑题上更强。
⑧ 费曼三问:讲给自己听
问 1:GPT-3 已经很强,为什么还要做 ChatGPT?
因为它只会续写、不会按人类方式对话;SFT+RLHF+System Prompt 把它调成了听话的助手,才真正好用。
问 2:GPT-4o 的"o"代表什么飞跃?
omni 全能——一个模型原生处理文本、图像、音频,能实时看图听声语音对话。
问 3:o 系列适合什么时候用?
数学、编程、复杂逻辑这种需要多步推理的难题;简单闲聊用它反而慢又贵。
口述全链路
"GPT 从 117M 一路堆到 175B,靠的是数据和参数一起涨。"
"ChatGPT 爆发靠的是 InstructGPT + RLHF + System Prompt,把续写机器调成了助手。"
"GPT-4o 多模态能看能听能说,o1/o3 则先内部推理再答题,专攻烧脑难题。"
⑨ 能力定位速查:不同任务选哪个
| 你要干的事 | 推荐用 | 原因 |
| 日常聊天、写邮件、头脑风暴 | GPT-4o 类 | 快、便宜、综合够用 |
| 看图、读截图、图表分析 | GPT-4o 类多模态 | 原生支持图片输入 |
| 数学证明、编程竞赛、复杂逻辑 | o1/o3 类推理模型 | 先思考再答,正确率高 |
| 简单问答、分类、抽取 | 小模型/旧版 | 没必要为简单任务花大钱 |
省钱心法不是越新越强就越该用。把难题派给 o 系列,日常活派给便宜模型,总成本能差好几倍。
⑩ 关键名词速查
| 名词 | 大白话 |
| Zero-shot | 不给例子,直接让它做新任务 |
| Few-shot | 提示里给几个示范例子,它照着做 |
| In-context Learning | 不更新权重,光靠提示里的上下文就学会新任务(GPT-3 的杀手锏) |
| Chain-of-Thought | 让它把推理步骤一步步写出来再下结论,o 系列把这个内化了 |
| 多模态 | 一个模型同时处理图、文、音,而非各管各 |
⑪ 常见误区辨析
误区 1:参数越大就越聪明GPT-4/o 从不公布参数,能力来自架构、数据、对齐的综合,不是单纯堆参数。
误区 2:ChatGPT 背后就是 GPT-3ChatGPT 是 GPT-3.5 经 SFT+RLHF 对齐后的产品形态,和原始 GPT-3 不是一回事。
误区 3:o1 什么都比 GPT-4o 强o 系列强在推理难题,闲聊、创意、速度上未必占优,反而更慢更贵。
误区 4:模型"记住"了训练数据它学的是统计规律,不是数据库;被问到没见过的事实时会一本正经地编(幻觉)。
⑫ 分层练习(点开解析)
基础GPT-1 的参数大概是多少?
约 1.17 亿(117M),是 Transformer 解码器路线的早期验证。
基础ChatGPT 是哪个版本对齐后的产物?
GPT-3.5 经 SFT + RLHF 对齐后的对话产品,2022 年底发布。
中档few-shot 是什么意思?
在提示里给几个示范例子,模型照样子完成新任务,无需更新权重(in-context learning)。
中档GPT-4 相比 GPT-3.5 关键新增了什么?
更强的推理,以及接受图片输入的多模态能力,专业考试成绩大幅提升。
中档System Prompt 起什么作用?
对话开头给模型设定角色、语气和边界,影响每一轮回答,用户通常看不见。
拔高o 系列为什么在数学/编程上更强?
它先用强化学习训练长链推理能力,答题前先内部打草稿、多步推导,再输出结论。
拔高为什么说"参数大小不再是比拼重点"?
GPT-4 之后 OpenAI 不再公布参数,转而比多模态、推理、可用性;单纯堆规模的边际收益下降。
⑬ 三句记忆口诀
① GPT-1 到 GPT-3:参数 117M → 175B,靠规模 scaling 变强。
② ChatGPT = GPT-3.5 + InstructGPT + RLHF + System Prompt。
③ GPT-4o 多模态能看听,o1/o3 先思考再答、专攻推理。
| 想要 | 选 |
| 日常聊天写作 | GPT-4o 类 |
| 看图读表 | 多模态 |
| 烧脑数学编程 | o 系列 |
📌 知识链路
本节位置
用一条真实演进线,把"结构 + 训练 + 对齐"串成看得见的产品史。