AI 基础入门 · 第2课
模型类型:判别式、生成式与 Encoder/Decoder 全家桶
同样叫"AI 模型",BERT 和 GPT 可不是一回事——一个是"阅读理解学霸",一个是"写作达人"。这一课带你从四个不同的分类维度把模型切开看:按"会不会创造"分判别/生成,按"专不专用"分专用/通用,按"处理什么信号"分文本/多模态/代码,按"内部结构"分 Encoder/Decoder,最后再聊聊开源闭源那点事。学完你再听到"BERT 是 Encoder-only""GPT 是 Decoder-only",心里就有一张清晰的对照表。
① 小白第一课怎么学(4 步走,约 55 分钟)
这一课信息密度大,但别怕——它就是给"模型"这只大象做一次解剖,按四个维度切四刀。
1建立直觉(10 分钟)
读③:判别式是"裁判",生成式是"作家"。
2理清四个分类维度(20 分钟)
读④:判别/生成、专用/通用、模态、结构,四条线别串。
3死磕 Encoder/Decoder 对比表(15 分钟)
读⑤:BERT vs GPT vs T5,三兄弟各管一摊。
4刷题自测(10 分钟)
做⑦⑩,错题回⑥看易错点。
本课小目标学完你要能:① 说清判别式和生成式的本质区别;② 记住 BERT/GPT/T5 分别属于哪种结构、适合干什么;③ 说出开源和闭源模型各自的优劣。
② 一图看懂:模型分类树
读法:分类不是"非此即彼",而是同一个模型可以同时落进好几个格子。比如 GPT-4o:它是生成式、是通用基础模型、是多模态、是 Decoder-only、是闭源。五个维度各打一个标签,拼出它的完整画像。
③ 本质直觉:判别式是"裁判",生成式是"作家"
先想一个生活场景:给你一万张猫和狗的照片,每张标好"猫"或"狗"。你要训练一个模型做两件不同的事——
判别式模型(Discriminative):它学的是"猫和狗的边界在哪"。你给它一张新照片,它说:"80% 是猫,20% 是狗。"它学的是条件概率 P(类别 | 图片)——给定这张图,它属于哪类?它像一个裁判,只判分,不创作。垃圾邮件识别、人脸识别、情感分析都是这一类。
生成式模型(Generative):它学的是"猫长什么样、狗长什么样"的整体规律。你跟它说"画一只猫",它能凭空捏出一张从来没存在过的猫图。它学的是数据本身的分布 P(图片)——世界上的猫大概长什么样?它像一个作家,读完万卷书之后能自己写新故事。ChatGPT、文生图 Sora、语音克隆都是这一类。
一句话记住区别:判别式学"边界"做判断,输出一个类别或分数;生成式学"分布"做创造,输出一个全新的样本。
别被"生成式 AI"这个词带偏不是只有画图、聊天才叫生成式——早期的 GAN 生成人脸、VAE 生成手写数字、语音合成模型,都是生成式。判别式也没消失:今天你手机解锁的人脸识别、邮箱里的垃圾邮件过滤,大量还是判别式模型在干活。
④ 完整体系:四个分类维度逐项拆开
维度一:专用模型 vs 通用基础模型
| 专用模型(Task-specific) | 通用基础模型(Foundation Model) |
| 训练目标 | 只做一件事,比如判垃圾邮件 | 在海量数据上预训练,什么都学一点 |
| 数据量 | 几万到几十万条标注样本 | 万亿 token 级别的无标注文本/图片 |
| 代表 | BERT 微调版、ResNet 图像分类 | GPT、Claude、Gemini、Llama、DeepSeek |
| 优点 | 小、快、便宜、单任务准 | 一个模型干所有事,还能举一反三 |
| 缺点 | 换任务就得重训 | 大、贵、推理慢 |
BERT 是哪一种?BERT 本身是"通用预训练模型",但它的设计初衷是"理解后被微调到具体任务"(比如客服意图识别),所以工业界一提 BERT 往往指它微调后的专用版本。GPT 则是"预训练完直接通用对话",不再微调也能干活。这是两者最实际的差别。
维度二:按处理的模态分
| 类型 | 吃什么 | 吐什么 | 代表 |
| 纯文本模型 | 文字 | 文字 | 早期 GPT-3、LLaMA 文本版 |
| 代码模型 | 文字+代码 | 代码 | CodeLlama、DeepSeek-Coder |
| 语音模型 | 音频波形 | 文字 或 语音 | Whisper(转写)、Suno(唱歌) |
| 图像模型 | 文字 或 图片 | 图片 | Stable Diffusion、Midjourney |
| 多模态模型 | 文字+图+音+视频 | 文字/图/音 | GPT-4o、Gemini、Claude 3.5 |
维度三:按开源闭源分
| 开源模型(Llama、DeepSeek、Qwen) | 闭源模型(GPT、Claude、Gemini API) |
| 权重 | 公开下载,可本地跑 | 只给 API 调用,拿不到参数文件 |
| 定制 | 能微调、能改结构、能私有化部署 | 只能在提示词里玩花样 |
| 成本 | 自己出 GPU,一次部署长期用 | 按 token 计费,调用多了很贵 |
| 能力 | 顶级开源追平闭源,但仍有差距 | 通常是当前最强 |
| 数据隐私 | 数据不出内网,适合金融医疗 | 数据要发到厂商服务器 |
⑤ 重头戏:Encoder / Decoder / Encoder-Decoder 三兄弟
这是面试和考试最爱考的一块。Transformer 出来之后,大家发现它可以拆成"只编不解""只解不编""又编又解"三种用法,三种用法长出了三类模型。
| Encoder-only | Decoder-only | Encoder-Decoder |
| 别名 | 理解型 | 生成型 | 转换型 |
| 代表模型 | BERT、RoBERTa | GPT 全家族、Llama、Qwen、DeepSeek | T5、BART |
| 怎么工作 | 双向看完整句话,理解每个词的意思 | 从左到右,一个词一个词往外蹦 | 先读懂输入,再逐词生成输出 |
| 训练任务 | 完形填空(遮住一个词让它猜) | 预测下一个词 | 把输入改写成另一种形式 |
| 擅长 | 分类、情感分析、实体识别、阅读理解 | 聊天、写作、写代码、开放式生成 | 机器翻译、摘要、问答 |
| 不擅长 | 自己写文章(它只会填空) | 精确分类(它在瞎猜下一个词) | 开放式闲聊(它偏"翻译腔") |
| 类比 | 语文考试做阅读理解的学霸 | 坐在你对面陪你聊天的作家 | 坐在翻译箱里的同传译员 |
为什么聊天机器人清一色是 Decoder-only?
你让 AI 写一段文章,它得一个字一个字往外蹦。
Decoder-only 天生就是"逐词预测下一个",跟写文章的过程一模一样。Encoder-only 训练时能看到完整句子,没法做"只看前面写后面"的自回归生成。所以 ChatGPT、Claude、Llama 全是 Decoder-only。
那为什么翻译要 Encoder-Decoder?
把 "I love you" 翻译成 "我爱你"。
翻译需要先把英文整句读明白(Encoder 的活),再从中文第一个字开始往外蹦(Decoder 的活)。两段式最自然。T5 就是干这个的,后来 BART 用它做摘要。
BERT 今天还能干什么?
BERT 不是过气了吗?
在"理解类"小任务上它又小又快又便宜:客服意图分类、简历筛选、搜索召回、广告点击率预估,工业界到处还是 BERT 的身影。它只是不跟 GPT 抢饭碗而已。
一张表记死理解找 BERT(Encoder),聊天找 GPT(Decoder),翻译摘要找 T5(Encoder-Decoder)。
⑥ 高频错误诊断(5 条)
错误 1:以为"模型大小"就是"模型类型"7B、70B 是参数规模,不是类型。一个 7B 的 Llama 是 Decoder-only,一个 70B 的 BERT 变体也是 Encoder-only。大小和结构是两码事。
错误 2:把 BERT 当成"写文章的模型"BERT 是 Encoder-only,训练目标是完形填空,它没有"逐词生成"的能力。让 BERT 写文章属于赶鸭子上架。
错误 3:以为开源模型一定不如闭源2024 年后 DeepSeek-R1、Llama 4、Qwen3 在很多榜单上追平甚至超过闭源模型。开源的劣势主要在"多模态整合"和"产品化打磨",不是智力。
错误 4:觉得多模态模型就是"多个模型拼起来"早期是拼,但 GPT-4o、Gemini 1.5 这种是原生多模态——图像和文字在同一个注意力网络里被联合训练,不是简单拼接。
错误 5:把"生成式"等同于"大模型"生成式模型小的有 GAN 生成手写数字(几百万参数),大的有 GPT-4o(万亿参数)。大模型是生成式的一种,但生成式不限于大模型。
⑦ 考点真题演练(4 题)
考点分布
| 考法 | 出题形式 | 应对 |
| 判别 vs 生成 | 给任务选模型类型 | 判分类→判别,创作→生成 |
| 三兄弟结构 | 问 GPT/BERT/T5 各是哪种 | 记代表模型 |
| 开源闭源 | 问哪个权重公开 | Llama/DeepSeek/Qwen |
| 模态分类 | 问 Whisper 属于哪类 | 语音模型 |
真题基础1. 你要训练一个模型识别"这封邮件是不是垃圾邮件",它最可能是哪一类?
真题中档2. GPT 系列、Llama、DeepSeek 在 Transformer 结构上属于哪一种?
真题中档3. 下面哪个模型属于"开源"、权重可以下载到本地?
真题拔高4. 做"中英文机器翻译"任务,历史上最经典的架构选择是?
⑧ 必背知识点卡
判别式:学边界、做判断、输出类别 垃圾邮件/人脸识别
生成式:学分布、做创造、输出新样本 ChatGPT/文生图
Encoder-only:BERT,理解类,完形填空训练 阅读理解、分类
Decoder-only:GPT/Llama/DeepSeek,生成类,预测下一个词 聊天、写代码
Encoder-Decoder:T5/BART,转换类,先读后写 翻译、摘要
开源:Llama、Qwen、DeepSeek、Mistral 可本地部署
闭源:GPT、Claude、Gemini API 只给接口
模态:文本/代码/语音/图像/多模态 按输入输出信号分
⑨ 应用输出:帮公司选模型
实战场景:CTO 问"我们要做一个客服机器人,选 BERT 还是 GPT?"
① 先拆需求:客服机器人有两件事——先判断"用户这句话想干嘛"(意图分类),再"生成一段回复"。
② 分类那一步:用 BERT 微调一个意图分类器,便宜、快、准,一天能处理几百万条。
③ 生成那一步:用 Decoder-only 大模型(开源 Qwen 或闭源 GPT)来写回复。
④ 给建议:不是二选一,而是两个模型串起来用——BERT 当门卫,大模型当写手。这就是工业界典型的"小模型前置路由 + 大模型生成"架构。
口述全链路"模型可以从五个维度贴标签:判别还是生成、专用还是通用、什么模态、什么结构、开不开源。Encoder-only 找 BERT 做理解,Decoder-only 找 GPT 做生成,Encoder-Decoder 找 T5 做翻译。开源适合私有化部署,闭源适合直接调 API。"
⑩ 分层练习 16 题(基础 6 + 中档 5 + 拔高 5)
▍基础 6 题
基础1判别式模型的输出通常是什么?
一个类别标签或分数(比如"垃圾邮件 95%"),不是新内容。
基础2生成式模型学的是什么?
学数据本身的分布,从而能采样出全新的、跟训练数据类似但不重复的样本。
基础3BERT 属于哪种结构?
Encoder-only,双向注意力,擅长理解类任务。
基础4GPT 属于哪种结构?
Decoder-only,从左到右逐词预测,擅长生成。
基础5T5 是用来做什么的典型模型?
Encoder-Decoder,典型任务是机器翻译和文本摘要。
基础6Whisper 是哪一类模型?
语音模型,把语音转写成文字(ASR)。
▍中档 5 题
中档7为什么 Encoder-only 模型做不好开放式写作?
它训练时能看到完整句子(双向注意力),没有"只看前文写后文"的自回归能力。让它逐词生成会漏信息、自相矛盾。
中档8开源模型对企业最大的吸引力是什么?
① 权重可下载、可私有化部署,数据不出内网;② 可微调、可改结构;③ 长长期看成本可控,不用按 token 持续付费。
中档9多模态模型和"文本模型+图像模型拼接"有什么不同?
原生多模态在同一套注意力网络里联合训练,图文信息在底层就融合;拼接方案是各干各的再拼答案,理解深度差一截。
中档10专用模型在大模型时代为什么还没死?
便宜、快、准、可控。做意图分类、点击率预估这种高频低复杂度任务,一个小 BERT 一天几百万条也不心疼,没必要调用 GPT。
中档11CodeLlama、DeepSeek-Coder 为什么单独叫"代码模型"?
它们在代码语料上继续训练或专门预训练,对语法、API、报错信息理解更准,写代码补全和修 bug 比通用模型强。
▍拔高 5 题
拔高12BERT 的"完形填空"训练任务具体怎么做?
随机把句子里 15% 的词盖住,让模型根据上下文双向猜出被盖住的词。这个任务强迫模型真正理解每个词在句子里的语法和语义角色。
拔高13为什么现代大模型几乎都抛弃了 Encoder-Decoder?
工程上 Decoder-only 更简洁,且"任何任务都能写成文本生成"——翻译可以写成"把 X 翻译成英文:X →",摘要也能写成生成。统一架构后,一份代码、一套优化、一个模型通吃。
拔高14"基础模型"(Foundation Model)这个词强调的是什么?
强调它是"地基":在海量数据上预训练出来,然后可以被微调到无数下游任务,一个顶一万个专用模型。GPT、BERT、Llama 都算。
拔高15闭源模型在隐私敏感行业(银行、医院)为什么仍有市场?
合规上很多行业要求数据不出内网,闭源 API 直接出局;但如果是公有云推理(数据脱敏后调用)或对体验要求极高的场景,闭源的产品打磨和稳定性仍占优。很多公司是混合策略。
拔高16判断一个模型是"判别"还是"生成",最本质的依据是什么?
看它学的是 P(y|x)(条件分布,给定 x 预测 y) 还是 P(x)(数据本身的分布)。前者判类别,后者能采样出新样本。
⑪ 记忆口诀 + 7 天复习计划
三句口诀
① 判别学边界做裁判,生成学分布当作家。
② 理解找 BERT(Encoder),聊天找 GPT(Decoder),翻译找 T5(Encoder-Decoder)。
③ 开源能私有化(Llama/DeepSeek/Qwen),闭源只给 API(GPT/Claude)。
| 天 | 任务 | 自检 |
| 第 1 天 | 读②③,画模型分类树 | 说清五个维度 |
| 第 2 天 | 读④⑤,背三兄弟对比表 | BERT/GPT/T5 不串 |
| 第 3 天 | 背知识点卡 + 基础 1-6 | 基础全对 |
| 第 4 天 | 做中档 7-11 | 能讲开源闭源优劣 |
| 第 5 天 | 做⑦真题 4 题 + 拔高 12-16 | 限时每题 2 分钟 |
| 第 6-7 天 | 合上书口述三兄弟和选型思路 | 不看资料全说对 |
📌 知识链路
本节位置
在总览之后,把"模型"这一大类拆成判别式/生成式,锁定本系列真正要啃的生成式大模型。