AI 基础入门 · 第10课
Agent 基础:从"聊天机器人"到"会干活的助手"
前面九课讲的大模型,本质上是个只会动嘴的"键盘侠"——你问一句它答一句。Agent(智能体)就是给它装上"手和脚":能自己拆任务、上网查资料、写代码、点按钮,一步一步把你交代的事干完。这一课带你看懂这个闭环是怎么转起来的。
① 小白第一课怎么学(4 步走,约 55 分钟)
这一课是 AI 基础板块的收尾,也是通往"实际做产品"的门槛,把前九课的零件组装成一个能跑的系统。
1建立闭环直觉(10 分钟)
读②③:LLM + 规划 + 工具 + 记忆。
2分清聊天 vs Agent(15 分钟)
读④:答一句 vs 自己拆步骤干活。
3看懂 ReAct 与工具调用(15 分钟)
读⑤:想一步做一步看结果。
4刷题自测(15 分钟)
做⑦⑩,错题回⑥看易错点。
本课小目标学完你要能:① 说出 Agent = LLM + 规划 + 工具 + 记忆;② 讲清它和普通聊天的区别;③ 解释 ReAct 的"想—做—看—再想"循环;④ 说清函数调用是怎么回事;⑤ 知道 Agent 现在能干什么、还容易在哪翻车。
② 一图看懂:Agent 的闭环
读法:中间是 LLM 大脑,它不直接动手,而是在四个环节之间转圈圈:先规划拆任务,再调用工具,然后观察工具返回了什么,同时把进展记进记忆,接着根据新情况再想下一步。转着转着,活就干完了。
③ 本质直觉:从"动嘴"到"动手"
普通聊天是什么样:你问"北京明天天气怎样",它只能凭训练数据里的旧知识瞎编一个大概,或者干脆说"我不能联网"。因为它只会输出文字,没有手,查不了、点不了、跑不了代码。
Agent 是什么样:你说"帮我订下周三去上海的最便宜机票"。它会自己想:先查日历确认日期 → 调订票工具搜航班 → 比价 → 发现上午更便宜 → 再调支付接口 → 把订单号告诉你。中间每一步它都根据上一步的结果决定下一步。
一句话定义:Agent = LLM(大脑)+ 规划(拆任务)+ 工具调用(动手)+ 记忆(记进展),四样东西拼成一个能自己闭环干活的系统。
核心区别就一句:聊天是"你问一句、它答一句";Agent 是"你只说目标,它自己拆步骤、调工具、检查结果、接着干",中间不用你一步步指挥。
为什么这一步是大趋势大模型再聪明,也只是个"顾问"——它给建议,活还得你自己干。Agent 把顾问变成了"执行者",这才是它能替代真实工作流的关键:从"陪你聊"到"替你做"。
④ 完整体系:Agent 的四个零件与两种模式
Agent 的四个零件
| 零件 | 作用 | 大白话 |
| LLM 大脑 | 理解、推理、决定下一步 | 整个系统的"主心骨" |
| 规划 Planning | 把大目标拆成小任务 | 列待办清单 |
| 工具 Tools | 搜索、跑代码、查数据库、调 API | 它的"手和脚" |
| 记忆 Memory | 记住历史步骤与中间结果 | 上一课讲的外挂记忆 |
两种常见工作模式
| 模式 | 怎么干 | 特点 |
| ReAct | 想一步、做一步、看结果、再想下一步 | 边走边看,灵活,适合不确定的任务 |
| Plan-and-Execute | 先把整个大目标拆成完整清单,再逐个执行 | 先谋后动,全局清楚,但开头计划可能跑偏 |
函数调用(Function Calling)是怎么回事它不是让模型真的去执行代码,而是模型输出一段结构化的话:"我要调用 search_flights 这个工具,参数是 日期=下周三、城市=上海"。真正执行的是你的程序,执行完把结果再喂回模型。模型负责"决定调什么、填什么参数",程序负责"真的去调"。
⑤ ReAct 跑一遍:订机票的真实流程
第 1 步 · 思考(Reasoning)
用户说"帮我订下周三去上海的最便宜机票"。
模型先想:我需要知道今天几号、下周三是哪天;还需要查航班价格。我得先调日历工具,再调机票搜索工具。
第 2 步 · 行动(Acting)
模型输出结构化调用:search_flights(从=南京, 到=上海, 日期=下周三)。
程序真正去调机票 API,拿到一堆航班和价格,返回给模型。
第 3 步 · 观察(Observation)
模型读到结果:上午 7 点 180 元,下午 14 点 320 元。
它比较后判断:最便宜是上午那班。但它不急着下单,因为涉及花钱,先把选项报给用户确认。
第 4 步 · 再想下一步
用户回"就订上午那班"。
模型再调 book_flight(航班号=上午那班, 乘客=用户),拿到订单号,最后用大白话汇报:"已订好,订单号 XXX,记得带身份证。"闭环完成。
多智能体协作(了解即可)更复杂的系统会派多个 Agent 分工:一个负责拆任务(管理者),一个负责写代码,一个负责做代码审查,互相交接结果。这是进阶话题,现在你只要知道"一个人干不过来时,可以组队"就行。
⑥ 高频错误诊断(4 条)
错误 1:把 Agent 等同于普通聊天机器人聊天是单轮问答,Agent 是能自主拆步骤、调工具、根据结果循环调整的闭环。差别在于"会不会自己动手干活"。
错误 2:以为模型自己会执行函数模型只输出"我要调哪个工具、参数是什么"这段结构化请求;真正执行是外部程序做的,结果再喂回模型。别把"决定调用"当成"已经执行"。
错误 3:以为 Agent 长链路很可靠步骤一多它容易跑偏:漏一步、调错工具、被错误结果带偏、在循环里出不来。真实 Agent 必须有人在关键节点盯着确认。
错误 4:忽视成本与风险Agent 每步都在调 LLM、调工具,长链路 token 消耗和费用远高于普通聊天;而且它真的会动手(发邮件、下单、删文件),权限给太大可能闯祸。
⑦ 考点真题演练(4 题)
考点分布
| 考法 | 出题形式 | 应对 |
| Agent 组成 | 问哪四样拼成 Agent | LLM+规划+工具+记忆 |
| ReAct 含义 | 问想一步做一步是哪种模式 | ReAct |
| 函数调用本质 | 问模型自己执行吗 | 只输出调用请求,程序执行 |
| Agent 局限 | 问为什么需要人盯着 | 长链路易跑偏、成本高 |
真题基础1. 一个完整的 Agent 通常由哪四样东西组成?
真题中档2. "想一步、做一步、看结果、再想下一步"指的是哪种模式?
真题中档3. 关于"函数调用(Function Calling)",正确的是?
真题拔高4. 为什么说 Agent"需要人盯着、不能完全放任"?
⑧ 必背知识点卡
Agent 公式:LLM + 规划 + 工具 + 记忆 = 能自己干活的闭环 大脑+手脚+待办+记性
聊天 vs Agent:你问一句答一句 / 你说目标它自己拆步骤干 动嘴 vs 动手
ReAct:Reasoning + Acting 交替 想一步做一步看结果
Plan-and-Execute:先拆完整任务清单,再逐个执行 先谋后动
函数调用:模型只输出调用请求,程序执行后喂回结果 它决定,你执行
多智能体:拆任务的、写代码的、做审查的分工协作 了解即可
局限:长链路跑偏、工具出错、成本高、需人兜底 别完全放手
⑨ 应用输出:给老板讲清"Agent 到底能帮公司干什么"
实战场景:老板问"现在老说的 AI Agent,对咱们公司到底有啥用?"
① 一句话定位:它不是聊天框,是个能自己上网、跑数据、点系统的"数字员工"。
② 举例子:你说"把上个月销售数据拉出来、做个图、写成一页报告发群里",它自己拆成拉数、画图、写稿、发送四步干完。
③ 说边界:但它不是百分百靠谱,步骤一多会跑偏、会调错工具,所以花钱、发邮件这种关键动作要留人工确认。
④ 算笔账:它每步都在烧 token,适合重复、规则清晰的流程;模糊、高风险的事还是人来。
口述全链路"Agent 就是给大模型装上规划、工具和记忆:你说目标,它自己拆任务、调搜索/代码/API,看结果再调整,循环到干完。ReAct 是边走边想,Plan-and-Execute 是先列清单;函数调用是它下指令、程序真去执行。它能干订机票、做分析、写报告,但长链路会跑偏、成本高,关键节点必须人盯着。"
⑩ 分层练习 16 题(基础 6 + 中档 5 + 拔高 5)
▍基础 6 题
基础1Agent 这个词中文常叫什么?
常译为智能体,指能自主感知、规划、调用工具完成目标的 AI 系统。
基础2Agent 的"大脑"是什么?
是大语言模型(LLM),负责理解、推理和决定下一步做什么。
基础3Agent 的"工具"是干什么的?
是它的"手脚":搜索、跑代码、查数据库、调 API 等,让它能真正动手做事。
基础4普通聊天和 Agent 最大的区别?
聊天是你问一句答一句;Agent 是你说目标,它自己拆步骤、调工具、循环干完。
基础5ReAct 是哪两个词的组合?
Reasoning(推理)+ Acting(行动),想一步做一步交替进行。
基础6函数调用时,真正执行工具的是谁?
是外部程序;模型只输出"调哪个工具、参数是什么"的结构化请求。
▍中档 5 题
中档7Plan-and-Execute 和 ReAct 有什么不同?
Plan-and-Execute 先把大目标拆成完整任务清单再逐个执行(先谋后动);ReAct 是边做边看、走一步想一步。前者全局清楚,后者灵活应变。
中档8为什么 Agent 需要"记忆"这个零件?
因为它要跨多步完成任务,必须记住已经做了什么、中间结果是什么,否则每步都从零开始,无法连贯地推进目标。
中档9举一个现在典型的 Agent 应用。
比如:自动订机票(查日期→搜航班→比价→确认→下单)、自动数据分析(拉数据→统计→画图→写报告)、自动写报告并发送。
中档10多智能体协作里通常怎么分工?
一个负责拆解和管理任务(管理者),一个负责执行(如写代码),一个负责审查把关(如做 review),互相交接结果。
中档11Agent 为什么比普通聊天更费钱?
因为它一个任务要调用 LLM 很多轮、还要反复调工具,每轮都消耗 token,长链路累计成本远高于单轮问答。
▍拔高 5 题
拔高12为什么 Agent 在长链路里容易"跑偏"?
每一步都基于上一步结果做决策,只要中间某步调错工具或被错误结果带偏,误差会沿链条累积放大;加上上下文越来越长,早期目标容易被遗忘。
拔高13为什么花钱、发邮件这类动作通常要"等人确认"?
因为 Agent 真会动手且可能出错,一旦误操作(订错票、发错人、删错文件)代价不可逆。在高风险动作前插入人工确认,是兜底的必要设计。
拔高14函数调用相比让模型"自由写代码"好在哪?
结构化的函数调用有固定接口和参数校验,可控、可审计、不会乱执行;自由生成的代码不可控、有安全风险。生产环境优先用函数调用。
拔高15Agent 和 RAG(上一课的检索)是什么关系?
RAG 常是 Agent 的一种"工具/记忆来源":Agent 需要查资料时,调用检索工具把相关文档捞出来作为依据。RAG 是零件,Agent 是把零件串起来干活的系统。
拔高16既然 Agent 这么强,为什么还没完全取代白领?
它在长链路可靠性、模糊目标理解、责任担当上还不行,成本也高。适合"规则清晰、重复、低风险"的流程辅助;涉及判断、创意、担责的环节仍需人主导。
⑪ 记忆口诀 + 7 天复习计划
三句口诀
① Agent 四件套:大脑 LLM、手是工具、待办是规划、记性是记忆。
② ReAct 走一步想一步,Plan-and-Execute 先列清单再干活。
③ 函数调用它下指令、程序真执行;长链易跑偏,花钱发信要人盯。
| 天 | 任务 | 自检 |
| 第 1 天 | 读②③,理解 Agent 闭环 | 说清四件套 |
| 第 2 天 | 读④⑤,跟一遍订机票流程 | 讲清 ReAct 循环 |
| 第 3 天 | 背知识点卡 + 基础 1-6 | 基础全对 |
| 第 4 天 | 做中档 7-11 | 比较两种模式 |
| 第 5 天 | 做⑦真题 + 拔高 12-16 | 说清局限与风险 |
| 第 6-7 天 | 合上书口述"Agent 怎么把一件事干完" | 不看资料全说对 |
📌 知识链路
本节位置
整条入门线的出口:模型 + 工具调用 + 记忆 = 能查资料、能写代码、能执行任务的 Agent。