← 返回算法与AI总览 算法与AI · 知识点深化 · AI Agent 设计:规划、工具调用、记忆与 ReAct
知识点深化 · AI Agent

AI Agent 设计:规划、工具调用、记忆与 ReAct

普通大模型只会「说」,Agent 让它会「做」:能把大任务拆成小步、调用搜索/计算器/API、记住过程,边想边做直到完成。这一页讲透规划、工具、记忆、ReAct 循环四要素,以及工程上防失控的关键约束。

① 小白第一课怎么学(4 步走,约 65 分钟)

普通大模型只会"说",Agent 让它会"做":能拆解任务、调用工具、记住过程:

1建立直觉(10 分钟)
读②③:Agent=会自己拿主意、动手查/算/调接口的助手。
2记四要素(15 分钟)
读④:规划、工具调用、记忆、行动循环(ReAct)。
3跟例题(20 分钟)
精读⑤,看"查天气再订酒店"怎么一步步跑。
4刷题纠错(20 分钟)
做⑦⑩,错题回⑥。
本课小目标学完你要能:① 说清 Agent 与普通聊天的区别;② 讲懂 ReAct 的"思考-行动-观察"循环;③ 说出规划/工具/记忆各解决什么。

② 一图看懂:AI Agent 四要素

AI Agent 规划 Planning 把大任务拆成小步 工具调用 Tool 搜索/计算器/API 记忆 Memory 短期上下文+长期库 ReAct 循环 思考→行动→观察 应用:自动查价下单 多步任务自动化 易错:死循环/乱调工具 不设步数上限会失控
读法:中心 Agent 四要素——规划(拆任务)、工具(动手)、记忆(记过程)、ReAct(边想边做的循环)。

③ 本质直觉:从"会说"到"会做"的那一步

普通聊天模型你问一句它答一句,不能自己查资料、不能算数、不能调接口。比如你问"今天南京适合穿什么",它只能瞎猜天气。

Agent 给它装了"手和脚":先思考要做什么(思考 Thought),选择并行动(Action,比如调天气 API),拿到结果后观察(Observation),再决定下一步,直到得出结论。

ReAct = Reasoning + Acting:把"推理"和"动手"交替进行。不是一次性想完美再做,而是做一步看一步反馈,像人解题时"试一下、看结果、再调整"。

记忆分两种:短期记忆就是当前对话的上下文窗口;长期记忆把重要历史存进向量库,需要时检索回来。

① Thought 思考要干嘛 ② Action 调工具/搜索 ③ Observation 看结果 ④ 够了吗?不够回到①,够则作答
为什么必须设"最大步数"上限Agent 可能在两个工具间反复横跳、或陷入重试死循环。工程上必须设最大迭代次数和超时,否则烧钱不停。

④ 完整体系:四要素与 ReAct 模板

Agent 四要素

要素解决什么典型实现
规划 Planning复杂任务不会拆任务分解、子目标、反思 Reflection
工具 Tool模型自身不会算/查搜索、计算器、数据库、API、代码执行
记忆 Memory长对话记不住上下文窗口(短期)+ 向量库(长期)
行动循环如何边想边做ReAct:Thought→Action→Observation

ReAct 提示模板

经典 ReAct 格式 Question: 用户问题
Thought: 我现在该做哪一步?
Action: 选择工具 + 输入参数
Observation: 工具返回的结果
...(循环)...
Final Answer: 最终回答
对比普通 LLMAgent
能否外部取数不能能调工具/API
多步任务一次作答可迭代多步
错误恢复无根据 Observation 调整
MCP / Function Calling 是什么它们是"工具的标准接线方式":把可用工具的名称、参数 schema 告诉模型,模型决定何时调用、传什么参数,程序执行后把结果喂回。

⑤ 用法场景与典型例题

例1(ReAct 步骤)任务"南京今天几度?要不要带伞",Agent 第一步 Thought 写什么?
先想需要什么信息。
① Thought:"我不知道今天天气,需要先查南京实时天气。"
② Action:调用天气工具,参数 city=南京。
③ Observation:"22℃,有小雨"。
④ Final Answer:"22℃ 有小雨,建议带伞穿薄外套。"
答案:先思考信息缺口,再行动取数。
例2(规划)"帮我策划一次 3 天上海亲子游"为什么需要 Planning?
任务太大,要拆子目标。
① 一次生成容易漏。
② 拆成:查景点→订酒店→排行程→预估预算 几个子任务。
答案:规划把大目标分解成可执行的子步骤。
例3(记忆)用户三句后提到"上次说的那个酒店",Agent 怎么记得?
短期上下文+长期记忆。
① 若在同一上下文窗口,短期记忆直接有。
② 若跨会话,需把之前存进长期记忆/向量库,用时检索。
答案:短期靠上下文,长期靠外部记忆库。
Reflection 反思机制让 Agent 做完一步后自我检讨"这步有用吗、方向对不对",能减少跑偏,是高级 Agent 的常见设计。

⑥ 高频错误诊断(4 条)

错误 1:不给最大步数,Agent 死循环烧钱模型可能反复调同一工具。必须设 max_iterations、超时和重试上限。
错误 2:工具描述写得不清楚,模型乱选工具工具的用途、参数 schema 必须写清楚,否则模型会用错工具或传错参数。
错误 3:把工具返回结果忘了喂回模型Action 执行后必须把 Observation 拼回上下文,模型才能继续推理。
错误 4:让 Agent 直接执行危险操作不加确认删除、转账、发邮件等动作要人工确认或权限边界,不能全自动。

⑦ 考点真题演练(4 题)

考点分布

考法出题形式应对
ReAct 含义问思考-行动-观察循环Reasoning+Acting 交替
四要素判断属于哪个要素规划/工具/记忆/循环
工程约束问为什么设步数上限防死循环、控成本

真题基础1. ReAct 模式的核心循环是?

真题中档2. Agent 能调用搜索引擎/计算器/API,这属于哪一要素?

真题中档3. 工程上为什么必须给 Agent 设最大迭代次数?

真题拔高4. 跨会话记住用户偏好,主要靠?

⑧ 必背知识点卡

本质:Agent=会拆任务、会调工具、会记过程的助手 从会说到会做
四要素:规划、工具、记忆、行动循环 缺一不可
ReAct:Thought→Action→Observation 循环 边想边做
规划:大任务拆成子目标,可加反思 Reflection
工具:搜索/计算/API/代码,靠 Function Calling/MCP 接线 标准 schema
记忆:短期=上下文窗口,长期=向量库 按需检索
铁律:设最大步数+超时+人工确认危险操作 防失控

⑨ 应用输出:搭一个"查价→比价→下单"购物 Agent

实战场景:用户说"帮我买个最便宜的小米 14"
① 规划:拆成——搜商品、取多家价格、比价、确认、下单。
② ReAct:Thought 我要先搜商品 → Action 调搜索工具 → Observation 拿到链接列表。
③ 再循环:Thought 取各店价格 → Action 调比价 API → Observation 三店价格 3999/3899/4099。
④ 记忆:记住用户上次偏好"红色、12+256",避免再问。
⑤ 安全:下单前弹出确认给用户,不自动付款。
口述"Agent 就是给大模型装上手脚:先想做什么,调工具拿结果,看结果再决定下一步,循环到完成;要设步数上限和危险操作确认。"

⑩ 分层练习 16 题(基础 6 + 中档 5 + 拔高 5)

▍基础 6 题

基础1Agent 和普通聊天模型最大区别?
Agent 能调工具、多步行动,不只是问答。
基础2ReAct 三个步骤是?
Thought 思考 → Action 行动 → Observation 观察。
基础3"把大任务拆成小目标"属于哪要素?
规划 Planning。
基础4调搜索/计算器/API 属于?
工具 Tool 使用。
基础5当前对话能记住的内容叫什么记忆?
短期记忆(上下文窗口)。
基础6跨会话长期记忆通常存在哪?
外部存储/向量库,用时检索。

▍中档 5 题

中档7为什么 Agent 要根据 Observation 调整下一步?
工具结果可能不符预期,要边做边看反馈,而不是一条路走到黑。
中档8Function Calling/MCP 解决什么?
提供工具名称和参数 schema 的标准接线,让模型知道何时调、传什么。
中档9Reflection 反思是干嘛的?
做完一步自我评估方向对不对,纠偏,减少跑偏。
中档10为什么危险操作要人工确认?
模型可能误判,删除/转账/发邮件不可逆,需权限边界。
中档11工具描述写不清会怎样?
模型选错工具、传错参数,行为不可控。

▍拔高 5 题

拔高12ReAct 和纯 Chain-of-Thought 的区别?
CoT 只在脑子里推理;ReAct 在推理中穿插真实工具调用和外部观察,能取新信息。
拔高13多 Agent 协作适合什么场景?
需要分工角色(如产品+开发+评审)的复杂任务,单 Agent 负担过重时。
拔高14上下文窗口塞不下全部历史怎么办?
摘要压缩旧对话、重要信息存入长期记忆按需检索,而非全塞。
拔高15Agent 反复调同一工具不收敛,工程上怎么救?
设最大步数、检测重复调用、加错误退避、必要时人工接管。
拔高16Agent 与 RAG 如何配合?
把"检索知识库"作为一个工具,Agent 按需调用 RAG,再综合作答。

⑪ 记忆口诀 + 7 天复习计划

三句口诀 ① Agent 会拆任务、调工具、记过程,从"会说"变"会做"。
② ReAct:想一步、做一步、看结果,循环到完成。
③ 必设步数上限和危险确认,工具描述要写清。
天任务自检
第 1 天读②③④,画 ReAct 循环图说清四要素
第 2 天背知识点卡 + 基础 1-6基础全对
第 3 天做中档 7-11懂工具接线
第 4 天做拔高 12-16区分 ReAct 与 CoT
第 5 天做⑦真题 4 题限时每题 2 分钟
第 6-7 天合上书口述 ReAct 循环不看资料全说对

← 返回算法与AI总览