← 返回算法与AI总览 算法与AI · 知识点深化 · 注意力机制与 Transformer:Self-Attention 到 GPT
知识点深化 · Transformer

注意力与 Transformer:ChatGPT 背后的骨架

ChatGPT、机器翻译、智能问答,底层都是 Transformer。它抛弃了 RNN 逐步串行的方式,让句子里任意两个词直接两两算相关度,谁和当前词相关就多听谁的。这一页从 Q/K/V 讲起,搞懂缩放点积注意力、多头、位置编码,以及 GPT 为什么就是带掩码的 Decoder。

① 小白第一课怎么学(4 步走,约 60 分钟)

Transformer 是 ChatGPT、翻译大模型的骨架:

1看直观(10 分钟)
读第②③部分:把注意力想象成"看句子时眼睛重点盯哪几个词"。
2记概念(15 分钟)
背第④部分:Q/K/V、缩放点积、多头、位置编码。
3算例题(15 分钟)
精读第⑤部分,理解一个词怎么和全句算相关度。
4刷题纠错(20 分钟)
做第⑦⑩部分,错题回到第⑥部分。
本课小目标学完你要能:① 说清 Q、K、V 各是什么;② 写出 Scaled Dot-Product Attention 公式;③ 解释多头注意力和位置编码的作用。

② 一图看懂:Transformer 的骨架

Transformer Q / K / V 查询/键/值 缩放点积注意力 softmax(QKᵀ/√d)V 多头 Multi-Head 多组视角并行看 位置编码 补上顺序信息 Encoder-Decoder 编码-解码结构 GPT = Decoder 只看左边生成下一词
读法:核心是注意力公式;Q/K/V 是输入的三种投影,多头并行看多种关系,位置编码补顺序,GPT 只用 Decoder 部分。

③ 先认识它:注意力就是"按相关度分配注意力"

读这句话:"小明把书给了小红,因为他很开心。"这个"他"指谁?你会自动回头看——和"开心"相关的是小明还是小红?这就是注意力。

Transformer 里每个词会变出三个角色:

· Query(查询 Q):我在找什么?("他"想知道自己指代谁)

· Key(键 K):我能提供什么?(每个词亮出自己的标签)

· Value(值 V):我实际的内容。

拿 Q 和所有 K 比相似度,得到一组权重(相关度),再按权重把 V 加权求和——和谁相关就多吸收谁的信息。

Q 和每个 K 算相关度 Q=他 K=小明 K=小红 权重0.8 权重0.2 和谁相关度高,就多吸收谁的 V
为什么 Transformer 比 RNN 强RNN 必须一个词一个词串行读,长句信息要一步步传;注意力让任意两个词直接连线,不管隔多远一步就关联上,而且整句可以并行计算——这就是大模型能又大又快的原因。

④ 完整体系与公式表

Scaled Dot-Product Attention 公式

核心公式 Attention(Q, K, V) = softmax( Q·Kᵀ / √dₖ ) · V

· Q·Kᵀ:算每个查询和每个键的相似度(点积)。
· ÷√dₖ:缩放,防止点积太大把 softmax 顶得太陡、梯度消失。
· softmax:把相似度变成和为 1 的权重。
· ·V:按权重对值加权求和。

多头注意力 Multi-Head

把 Q/K/V 切成好几份(多组头),每组各自做注意力,最后拼起来。不同头可以学不同关系(一个看语法、一个看指代)。

关键组件对照

组件作用大白话
位置编码给每个词加位置信息注意力本身不管顺序,必须额外告诉它谁在前谁在后
Encoder理解输入句双向看全句(BERT 用它)
Decoder逐词生成输出只能看左边已生成的词(GPT 用它)
残差+LayerNorm稳定深层训练每层加个"抄近路",防梯度消失
GPT 是什么GPT = Transformer 的 Decoder 部分,带"掩码"——预测下一个词时只能看到左边,不能偷看右边。这就是它能自动写文章、写代码的原因。

⑤ 应用场景与典型例题

例1(Q/K/V 角色)在"他把它放在桌上"里,处理"它"时 Q 代表什么?
Q 是当前词的"查询意图"。
Q="它"想找自己指代的物体;K 是"桌子/书/苹果"等词亮出的标签;和 Q 点积最大的那个词就是"它"指代的对象,V 把那个词的内容吸收进来。
例2(为什么除以 √dₖ)点积维数很大时会怎样?
点积随维数增大而变大。
dₖ 很大时点积方差大,softmax 会变成"一个很大、其余几乎 0",梯度趋近 0。除以 √dₖ 把数值拉回稳定范围,让训练更平稳。
例3(位置编码)为什么注意力本身需要位置编码?
注意力把词当成一个集合,不关心顺序。
"狗咬人"和"人咬狗"词完全一样,注意力算出来的加权结果却相同——它不知道顺序。所以必须额外给每个词加上位置向量,模型才知道谁先谁后。
一句话记住 Transformer没有循环、没有卷积,全靠"词与词两两算相关度"来建模关系,再加上位置编码,就能并行处理整句话。

⑥ 高频错误诊断(4 条)

错误 1:把 Q、K、V 当成三个不同的输入Q、K、V 是同一个输入向量乘三个不同权重矩阵投影出来的,不是三份原始数据。
错误 2:忘记缩放 √dₖ以为 QKᵀ 直接送 softmax 就行——维数一大就会梯度消失,必须除 √dₖ。
错误 3:以为注意力自带顺序注意力对词序不敏感,"狗咬人"="人咬狗"。位置编码是必须的。
错误 4:混淆 Encoder 和 DecoderEncoder 双向看全句(理解),Decoder 带掩码只能看左边(生成)。BERT 是 Encoder,GPT 是 Decoder。

⑦ 考点与真题演练(4 题)

考点分布

考法出题形式应对
Q/K/V 含义问三者角色查询/键/值
注意力公式写出 softmax(QKᵀ/√d)V记住缩放
位置编码为什么需要注意力不管顺序

真题1. 在自注意力中,Q(Query)的作用是?

真题2. Scaled Dot-Product Attention 公式里为什么要除以 √dₖ?

真题3. Transformer 为什么需要位置编码?

真题4. GPT 主要使用 Transformer 的哪一部分?

⑧ 必背公式卡

注意力:softmax(QKᵀ/√dₖ)V 核心公式
Q:查询,我在找什么 当前词需求
K:键,我能提供什么标签 被匹配对象
V:值,我的实际内容 被加权汇总
缩放:÷√dₖ 防 softmax 过陡 稳训练
多头:多组 Q/K/V 并行,学多种关系 拼接
位置编码:补词序;Encoder 双向、Decoder 掩码 BERT/GPT

⑨ 应用输出:用 Transformer 思维建模

建模场景:机器翻译"我爱中国"→英文
· Encoder 读完整句中文,每个词和全句算注意力,得到富含上下文的向量。
· Decoder 一个词一个词生成:先生成 "I",再基于已生成的 "I" 和 Encoder 输出算注意力,预测下一个词。
· 生成 "love" 时,注意力会自动把权重集中到源句的"爱"上。
· 最后输出 "I love China"。整个过程可并行训练,比 RNN 快得多。
口述训练说三句:"注意力就是 softmax(QKᵀ/√dₖ)V;Q 找信息、K 亮标签、V 给内容;注意力不管顺序要加位置编码,GPT 是带掩码的 Decoder。"

⑩ 分层练习 18 题(基础 6 + 中档 6 + 拔高 6)

▍基础 6 题

基础1写出注意力核心公式。
softmax(QKᵀ/√dₖ)·V。
基础2Q 代表什么?
查询,当前词在找什么信息。
基础3V 代表什么?
值,真正被加权汇总的内容。
基础4为什么需要位置编码?
注意力本身不区分词序,需额外加位置。
基础5GPT 用 Encoder 还是 Decoder?
Decoder(带掩码,只看左边)。
基础6BERT 用哪部分?
Encoder,双向看全句。

▍中档 6 题

中档7QKᵀ 算的是什么?
查询和键之间的相似度。
中档8为什么除以 √dₖ?
维数大时点积方差大,softmax 会过陡、梯度消失,缩放稳定训练。
中档9多头注意力好处?
多组头并行学不同类型的关系(语法、指代等)。
中档10掩码 Mask 作用?
Decoder 预测时禁止看到未来词,把未来位置设为 −∞。
中档11注意力相比 RNN 的优势?
任意两词直接关联(长程依赖强),且可并行计算。
中档12残差连接作用?
抄近路,缓解深层网络梯度消失,让深层可训练。

▍拔高 6 题

拔高13Q、K、V 从哪来?
同一输入向量分别乘 Wq、Wk、Wv 三个可训练矩阵投影得到。
拔高14自注意力 Self-Attention 的"自"指什么?
Q、K、V 都来自同一个序列内部,自己和自己算注意力。
拔高15注意力计算复杂度关于序列长度 n?
QKᵀ 是 n×n,复杂度 O(n²),长文本是瓶颈。
拔高16Layer Norm 作用?
归一化每层输出,稳定数值分布,加速收敛。
拔高17Cross-Attention 和 Self-Attention 区别?
Cross 的 Q 来自一个序列、K/V 来自另一个(如翻译时目标句看源句)。
拔高18位置编码为什么用正弦/余弦?
能推广到比训练时更长的序列,且不同相对位置有固定关系。

⑪ 记忆口诀 + 7 天复习计划

三句口诀 ① 注意力:softmax(QKᵀ/√dₖ)V,按相关度加权。
② Q 找信息、K 亮标签、V 给内容,多头并行看关系。
③ 注意力不管顺序要加位置编码,GPT 是带掩码的 Decoder。
天任务自检
第 1 天读②③④,画 Q/K/V 图说清三者角色
第 2 天背公式 + 基础 1-6默写注意力公式
第 3 天做中档 7-12讲清为什么缩放
第 4 天做拔高 13-18能解释 Encoder/Decoder
第 5 天做⑦真题 4 题限时每题 2 分钟
第 6-7 天合上书口述三句口诀不看资料全说对

← 返回算法与AI总览