前沿:大模型与 Agent
前面 11 个知识点叠在一起,再把参数堆到几千亿、数据堆到万亿 token,就成了你正在聊的 ChatGPT。这一节讲清楚它是怎么训出来的、Agent 又是什么。
上一模块认识了 Transformer,这一模块看它把参数堆到几千亿、数据堆到万亿 token 会变成什么——就是你正在用的大模型。为什么需要?你得知道 ChatGPT 不是魔法,是预训练 + 对齐两步走出来的。学完你能说清大模型怎么训、Agent 又是什么。下一模块补齐经典 ML 主力梯队。
4.10 大语言模型概念
LLM · 预训练 + 微调 + 对齐想三步走
① 预训练(Pre-training):把海量文本喂进去,让模型学"下一个词是什么"。GPT、LLaMA 都干这事。这一步花钱最多,学会语言规律、知识、推理。
② 微调 SFT(Supervised Fine-Tuning):用"问题-标准答案"对教它怎么回话。从"续写机器"变成"对话助手"。
③ 对齐 RLHF:让人给模型回答打分,训练奖励模型,再让 LLM 顺着人类偏好优化。让它说人话、不说脏话、不瞎说。
关键名词:Token=模型眼里的"字"(不等同于汉字/英文词);上下文窗口=一次能看多长;涌现能力=模型大到一定程度突然会了之前不会的事。
① 预训练学知识,SFT 学对话,RLHF 学做人。② Token/上下文/涌现是黑话三件套。③ ChatGPT 就是这条流水线的产物。
4.11 Agent 智能体概念
Agent · LLM 当大脑,配上手脚和记性想是什么
光聊天的 LLM 嘴强王者。Agent 给它加四件套:
① 大脑(LLM):思考决策。② 工具(Tools):搜索、跑代码、调 API、查数据库——突破"只会背"。③ 记忆(Memory):记住对话历史和事实。④ 规划(Planning):把大任务拆成小步。
ReAct 框架:Reason(想)+ Act(做)+ Observe(看结果)循环:思考→调工具→看结果→再思考。
多 Agent:几个 Agent 分工合作,一个写、一个审、一个跑,互相投喂结果。
① Agent=LLM+工具+记忆+规划。② ReAct=想做看循环。③ 这就是 Cursor、Claude Code、AutoGPT 的底层范式。
① 用自己的话解释:一句话说清预训练、SFT、RLHF 分别在教模型什么。
② 举个反例 / 生活例子:反例——为什么说"知识在预训练就学完了,RLHF 不教新知识"?
③ 哪里还说不清:ReAct 的"想-做-看"循环你能完整演一遍吗?