← 第1课 · AI是什么 首页 / 算法与AI / AI 基础入门 / 第2课 · 模型类型
AI 基础入门 · 第2课

模型类型:判别式、生成式与 Encoder/Decoder 全家桶

同样叫"AI 模型",BERT 和 GPT 可不是一回事——一个是"阅读理解学霸",一个是"写作达人"。这一课带你从四个不同的分类维度把模型切开看:按"会不会创造"分判别/生成,按"专不专用"分专用/通用,按"处理什么信号"分文本/多模态/代码,按"内部结构"分 Encoder/Decoder,最后再聊聊开源闭源那点事。学完你再听到"BERT 是 Encoder-only""GPT 是 Decoder-only",心里就有一张清晰的对照表。

① 小白第一课怎么学(4 步走,约 55 分钟)

这一课信息密度大,但别怕——它就是给"模型"这只大象做一次解剖,按四个维度切四刀。

1建立直觉(10 分钟)
读③:判别式是"裁判",生成式是"作家"。
2理清四个分类维度(20 分钟)
读④:判别/生成、专用/通用、模态、结构,四条线别串。
3死磕 Encoder/Decoder 对比表(15 分钟)
读⑤:BERT vs GPT vs T5,三兄弟各管一摊。
4刷题自测(10 分钟)
做⑦⑩,错题回⑥看易错点。
本课小目标学完你要能:① 说清判别式和生成式的本质区别;② 记住 BERT/GPT/T5 分别属于哪种结构、适合干什么;③ 说出开源和闭源模型各自的优劣。

② 一图看懂:模型分类树

AI 模型 ① 按"会不会创造" 判别式 生成式 裁判 vs 作家 ② 按"专不专用" 专用模型 基础大模型 BERT vs GPT ③ 按"处理什么信号" 文本 / 代码 / 语音 图像 / 视频 / 多模态 (能同时吃几种信号) ④ 按"内部结构" Encoder-only(BERT) Decoder-only(GPT) Enc-Dec(T5) ⑤ 按"权重放不开放" 开源(Llama/DeepSeek) 闭源(GPT/Claude)
读法:分类不是"非此即彼",而是同一个模型可以同时落进好几个格子。比如 GPT-4o:它是生成式、是通用基础模型、是多模态、是 Decoder-only、是闭源。五个维度各打一个标签,拼出它的完整画像。

③ 本质直觉:判别式是"裁判",生成式是"作家"

先想一个生活场景:给你一万张猫和狗的照片,每张标好"猫"或"狗"。你要训练一个模型做两件不同的事——

判别式模型(Discriminative):它学的是"猫和狗的边界在哪"。你给它一张新照片,它说:"80% 是猫,20% 是狗。"它学的是条件概率 P(类别 | 图片)——给定这张图,它属于哪类?它像一个裁判,只判分,不创作。垃圾邮件识别、人脸识别、情感分析都是这一类。

生成式模型(Generative):它学的是"猫长什么样、狗长什么样"的整体规律。你跟它说"画一只猫",它能凭空捏出一张从来没存在过的猫图。它学的是数据本身的分布 P(图片)——世界上的猫大概长什么样?它像一个作家,读完万卷书之后能自己写新故事。ChatGPT、文生图 Sora、语音克隆都是这一类。

一句话记住区别:判别式学"边界"做判断,输出一个类别或分数;生成式学"分布"做创造,输出一个全新的样本。

判别式 = 裁判 狗 狗 猫 猫 学这条分界线 生成式 = 作家 真实猫分布 生成新猫
别被"生成式 AI"这个词带偏不是只有画图、聊天才叫生成式——早期的 GAN 生成人脸、VAE 生成手写数字、语音合成模型,都是生成式。判别式也没消失:今天你手机解锁的人脸识别、邮箱里的垃圾邮件过滤,大量还是判别式模型在干活。

④ 完整体系:四个分类维度逐项拆开

维度一:专用模型 vs 通用基础模型

专用模型(Task-specific)通用基础模型(Foundation Model)
训练目标只做一件事,比如判垃圾邮件在海量数据上预训练,什么都学一点
数据量几万到几十万条标注样本万亿 token 级别的无标注文本/图片
代表BERT 微调版、ResNet 图像分类GPT、Claude、Gemini、Llama、DeepSeek
优点小、快、便宜、单任务准一个模型干所有事,还能举一反三
缺点换任务就得重训大、贵、推理慢
BERT 是哪一种?BERT 本身是"通用预训练模型",但它的设计初衷是"理解后被微调到具体任务"(比如客服意图识别),所以工业界一提 BERT 往往指它微调后的专用版本。GPT 则是"预训练完直接通用对话",不再微调也能干活。这是两者最实际的差别。

维度二:按处理的模态分

类型吃什么吐什么代表
纯文本模型文字文字早期 GPT-3、LLaMA 文本版
代码模型文字+代码代码CodeLlama、DeepSeek-Coder
语音模型音频波形文字 或 语音Whisper(转写)、Suno(唱歌)
图像模型文字 或 图片图片Stable Diffusion、Midjourney
多模态模型文字+图+音+视频文字/图/音GPT-4o、Gemini、Claude 3.5

维度三:按开源闭源分

开源模型(Llama、DeepSeek、Qwen)闭源模型(GPT、Claude、Gemini API)
权重公开下载,可本地跑只给 API 调用,拿不到参数文件
定制能微调、能改结构、能私有化部署只能在提示词里玩花样
成本自己出 GPU,一次部署长期用按 token 计费,调用多了很贵
能力顶级开源追平闭源,但仍有差距通常是当前最强
数据隐私数据不出内网,适合金融医疗数据要发到厂商服务器

⑤ 重头戏:Encoder / Decoder / Encoder-Decoder 三兄弟

这是面试和考试最爱考的一块。Transformer 出来之后,大家发现它可以拆成"只编不解""只解不编""又编又解"三种用法,三种用法长出了三类模型。

Encoder-onlyDecoder-onlyEncoder-Decoder
别名理解型生成型转换型
代表模型BERT、RoBERTaGPT 全家族、Llama、Qwen、DeepSeekT5、BART
怎么工作双向看完整句话,理解每个词的意思从左到右,一个词一个词往外蹦先读懂输入,再逐词生成输出
训练任务完形填空(遮住一个词让它猜)预测下一个词把输入改写成另一种形式
擅长分类、情感分析、实体识别、阅读理解聊天、写作、写代码、开放式生成机器翻译、摘要、问答
不擅长自己写文章(它只会填空)精确分类(它在瞎猜下一个词)开放式闲聊(它偏"翻译腔")
类比语文考试做阅读理解的学霸坐在你对面陪你聊天的作家坐在翻译箱里的同传译员
为什么聊天机器人清一色是 Decoder-only?
你让 AI 写一段文章,它得一个字一个字往外蹦。
Decoder-only 天生就是"逐词预测下一个",跟写文章的过程一模一样。Encoder-only 训练时能看到完整句子,没法做"只看前面写后面"的自回归生成。所以 ChatGPT、Claude、Llama 全是 Decoder-only。
那为什么翻译要 Encoder-Decoder?
把 "I love you" 翻译成 "我爱你"。
翻译需要先把英文整句读明白(Encoder 的活),再从中文第一个字开始往外蹦(Decoder 的活)。两段式最自然。T5 就是干这个的,后来 BART 用它做摘要。
BERT 今天还能干什么?
BERT 不是过气了吗?
在"理解类"小任务上它又小又快又便宜:客服意图分类、简历筛选、搜索召回、广告点击率预估,工业界到处还是 BERT 的身影。它只是不跟 GPT 抢饭碗而已。
一张表记死理解找 BERT(Encoder),聊天找 GPT(Decoder),翻译摘要找 T5(Encoder-Decoder)。

⑥ 高频错误诊断(5 条)

错误 1:以为"模型大小"就是"模型类型"7B、70B 是参数规模,不是类型。一个 7B 的 Llama 是 Decoder-only,一个 70B 的 BERT 变体也是 Encoder-only。大小和结构是两码事。
错误 2:把 BERT 当成"写文章的模型"BERT 是 Encoder-only,训练目标是完形填空,它没有"逐词生成"的能力。让 BERT 写文章属于赶鸭子上架。
错误 3:以为开源模型一定不如闭源2024 年后 DeepSeek-R1、Llama 4、Qwen3 在很多榜单上追平甚至超过闭源模型。开源的劣势主要在"多模态整合"和"产品化打磨",不是智力。
错误 4:觉得多模态模型就是"多个模型拼起来"早期是拼,但 GPT-4o、Gemini 1.5 这种是原生多模态——图像和文字在同一个注意力网络里被联合训练,不是简单拼接。
错误 5:把"生成式"等同于"大模型"生成式模型小的有 GAN 生成手写数字(几百万参数),大的有 GPT-4o(万亿参数)。大模型是生成式的一种,但生成式不限于大模型。

⑦ 考点真题演练(4 题)

考点分布

考法出题形式应对
判别 vs 生成给任务选模型类型判分类→判别,创作→生成
三兄弟结构问 GPT/BERT/T5 各是哪种记代表模型
开源闭源问哪个权重公开Llama/DeepSeek/Qwen
模态分类问 Whisper 属于哪类语音模型

真题基础1. 你要训练一个模型识别"这封邮件是不是垃圾邮件",它最可能是哪一类?

真题中档2. GPT 系列、Llama、DeepSeek 在 Transformer 结构上属于哪一种?

真题中档3. 下面哪个模型属于"开源"、权重可以下载到本地?

真题拔高4. 做"中英文机器翻译"任务,历史上最经典的架构选择是?

⑧ 必背知识点卡

判别式:学边界、做判断、输出类别 垃圾邮件/人脸识别
生成式:学分布、做创造、输出新样本 ChatGPT/文生图
Encoder-only:BERT,理解类,完形填空训练 阅读理解、分类
Decoder-only:GPT/Llama/DeepSeek,生成类,预测下一个词 聊天、写代码
Encoder-Decoder:T5/BART,转换类,先读后写 翻译、摘要
开源:Llama、Qwen、DeepSeek、Mistral 可本地部署
闭源:GPT、Claude、Gemini API 只给接口
模态:文本/代码/语音/图像/多模态 按输入输出信号分

⑨ 应用输出:帮公司选模型

实战场景:CTO 问"我们要做一个客服机器人,选 BERT 还是 GPT?"
① 先拆需求:客服机器人有两件事——先判断"用户这句话想干嘛"(意图分类),再"生成一段回复"。
② 分类那一步:用 BERT 微调一个意图分类器,便宜、快、准,一天能处理几百万条。
③ 生成那一步:用 Decoder-only 大模型(开源 Qwen 或闭源 GPT)来写回复。
④ 给建议:不是二选一,而是两个模型串起来用——BERT 当门卫,大模型当写手。这就是工业界典型的"小模型前置路由 + 大模型生成"架构。
口述全链路"模型可以从五个维度贴标签:判别还是生成、专用还是通用、什么模态、什么结构、开不开源。Encoder-only 找 BERT 做理解,Decoder-only 找 GPT 做生成,Encoder-Decoder 找 T5 做翻译。开源适合私有化部署,闭源适合直接调 API。"

⑩ 分层练习 16 题(基础 6 + 中档 5 + 拔高 5)

▍基础 6 题

基础1判别式模型的输出通常是什么?
一个类别标签或分数(比如"垃圾邮件 95%"),不是新内容。
基础2生成式模型学的是什么?
学数据本身的分布,从而能采样出全新的、跟训练数据类似但不重复的样本。
基础3BERT 属于哪种结构?
Encoder-only,双向注意力,擅长理解类任务。
基础4GPT 属于哪种结构?
Decoder-only,从左到右逐词预测,擅长生成。
基础5T5 是用来做什么的典型模型?
Encoder-Decoder,典型任务是机器翻译和文本摘要。
基础6Whisper 是哪一类模型?
语音模型,把语音转写成文字(ASR)。

▍中档 5 题

中档7为什么 Encoder-only 模型做不好开放式写作?
它训练时能看到完整句子(双向注意力),没有"只看前文写后文"的自回归能力。让它逐词生成会漏信息、自相矛盾。
中档8开源模型对企业最大的吸引力是什么?
① 权重可下载、可私有化部署,数据不出内网;② 可微调、可改结构;③ 长长期看成本可控,不用按 token 持续付费。
中档9多模态模型和"文本模型+图像模型拼接"有什么不同?
原生多模态在同一套注意力网络里联合训练,图文信息在底层就融合;拼接方案是各干各的再拼答案,理解深度差一截。
中档10专用模型在大模型时代为什么还没死?
便宜、快、准、可控。做意图分类、点击率预估这种高频低复杂度任务,一个小 BERT 一天几百万条也不心疼,没必要调用 GPT。
中档11CodeLlama、DeepSeek-Coder 为什么单独叫"代码模型"?
它们在代码语料上继续训练或专门预训练,对语法、API、报错信息理解更准,写代码补全和修 bug 比通用模型强。

▍拔高 5 题

拔高12BERT 的"完形填空"训练任务具体怎么做?
随机把句子里 15% 的词盖住,让模型根据上下文双向猜出被盖住的词。这个任务强迫模型真正理解每个词在句子里的语法和语义角色。
拔高13为什么现代大模型几乎都抛弃了 Encoder-Decoder?
工程上 Decoder-only 更简洁,且"任何任务都能写成文本生成"——翻译可以写成"把 X 翻译成英文:X →",摘要也能写成生成。统一架构后,一份代码、一套优化、一个模型通吃。
拔高14"基础模型"(Foundation Model)这个词强调的是什么?
强调它是"地基":在海量数据上预训练出来,然后可以被微调到无数下游任务,一个顶一万个专用模型。GPT、BERT、Llama 都算。
拔高15闭源模型在隐私敏感行业(银行、医院)为什么仍有市场?
合规上很多行业要求数据不出内网,闭源 API 直接出局;但如果是公有云推理(数据脱敏后调用)或对体验要求极高的场景,闭源的产品打磨和稳定性仍占优。很多公司是混合策略。
拔高16判断一个模型是"判别"还是"生成",最本质的依据是什么?
看它学的是 P(y|x)(条件分布,给定 x 预测 y) 还是 P(x)(数据本身的分布)。前者判类别,后者能采样出新样本。

⑪ 记忆口诀 + 7 天复习计划

三句口诀 ① 判别学边界做裁判,生成学分布当作家。
② 理解找 BERT(Encoder),聊天找 GPT(Decoder),翻译找 T5(Encoder-Decoder)。
③ 开源能私有化(Llama/DeepSeek/Qwen),闭源只给 API(GPT/Claude)。
天任务自检
第 1 天读②③,画模型分类树说清五个维度
第 2 天读④⑤,背三兄弟对比表BERT/GPT/T5 不串
第 3 天背知识点卡 + 基础 1-6基础全对
第 4 天做中档 7-11能讲开源闭源优劣
第 5 天做⑦真题 4 题 + 拔高 12-16限时每题 2 分钟
第 6-7 天合上书口述三兄弟和选型思路不看资料全说对

📌 知识链路

前置知识(先学) · 第1课 · AI 是什么:先有"训练/推理"的总印象,再分类型就不混。
本节位置 在总览之后,把"模型"这一大类拆成判别式/生成式,锁定本系列真正要啃的生成式大模型。
下一步(学完去) · 第3课 · 评分体系:模型好不好,得靠榜单打分。
· 第4课 · 主流模型:市面上到底有哪些代表。
← 第1课 · AI是什么 算法与AI总览