← 算法与AI总览 首页 / 算法与AI / AI 基础入门 / 第10课 · Agent 基础
AI 基础入门 · 第10课

Agent 基础:从"聊天机器人"到"会干活的助手"

前面九课讲的大模型,本质上是个只会动嘴的"键盘侠"——你问一句它答一句。Agent(智能体)就是给它装上"手和脚":能自己拆任务、上网查资料、写代码、点按钮,一步一步把你交代的事干完。这一课带你看懂这个闭环是怎么转起来的。

① 小白第一课怎么学(4 步走,约 55 分钟)

这一课是 AI 基础板块的收尾,也是通往"实际做产品"的门槛,把前九课的零件组装成一个能跑的系统。

1建立闭环直觉(10 分钟)
读②③:LLM + 规划 + 工具 + 记忆。
2分清聊天 vs Agent(15 分钟)
读④:答一句 vs 自己拆步骤干活。
3看懂 ReAct 与工具调用(15 分钟)
读⑤:想一步做一步看结果。
4刷题自测(15 分钟)
做⑦⑩,错题回⑥看易错点。
本课小目标学完你要能:① 说出 Agent = LLM + 规划 + 工具 + 记忆;② 讲清它和普通聊天的区别;③ 解释 ReAct 的"想—做—看—再想"循环;④ 说清函数调用是怎么回事;⑤ 知道 Agent 现在能干什么、还容易在哪翻车。

② 一图看懂:Agent 的闭环

LLM 大脑(思考) 读情况 → 决定下一步 ① 规划 Planning 把大目标拆成小任务清单 ② 工具 Tools 搜索/代码/数据库/API ③ 观察 Observation 拿到工具返回的结果 ④ 记忆 Memory 记住历史步骤和中间结果 ReAct 循环 想一步 → 做一步 → 看结果 → 再想下一步,直到目标完成
读法:中间是 LLM 大脑,它不直接动手,而是在四个环节之间转圈圈:先规划拆任务,再调用工具,然后观察工具返回了什么,同时把进展记进记忆,接着根据新情况再想下一步。转着转着,活就干完了。

③ 本质直觉:从"动嘴"到"动手"

普通聊天是什么样:你问"北京明天天气怎样",它只能凭训练数据里的旧知识瞎编一个大概,或者干脆说"我不能联网"。因为它只会输出文字,没有手,查不了、点不了、跑不了代码。

Agent 是什么样:你说"帮我订下周三去上海的最便宜机票"。它会自己想:先查日历确认日期 → 调订票工具搜航班 → 比价 → 发现上午更便宜 → 再调支付接口 → 把订单号告诉你。中间每一步它都根据上一步的结果决定下一步。

一句话定义:Agent = LLM(大脑)+ 规划(拆任务)+ 工具调用(动手)+ 记忆(记进展),四样东西拼成一个能自己闭环干活的系统。

核心区别就一句:聊天是"你问一句、它答一句";Agent 是"你只说目标,它自己拆步骤、调工具、检查结果、接着干",中间不用你一步步指挥。

普通聊天 你问一句 → 它答一句,到此结束 Agent 你说目标 → 它自己拆步骤干活 规划→调工具→看结果→再规划 循环往复,直到把事干完 人只在关键节点确认/兜底
为什么这一步是大趋势大模型再聪明,也只是个"顾问"——它给建议,活还得你自己干。Agent 把顾问变成了"执行者",这才是它能替代真实工作流的关键:从"陪你聊"到"替你做"。

④ 完整体系:Agent 的四个零件与两种模式

Agent 的四个零件

零件作用大白话
LLM 大脑理解、推理、决定下一步整个系统的"主心骨"
规划 Planning把大目标拆成小任务列待办清单
工具 Tools搜索、跑代码、查数据库、调 API它的"手和脚"
记忆 Memory记住历史步骤与中间结果上一课讲的外挂记忆

两种常见工作模式

模式怎么干特点
ReAct想一步、做一步、看结果、再想下一步边走边看,灵活,适合不确定的任务
Plan-and-Execute先把整个大目标拆成完整清单,再逐个执行先谋后动,全局清楚,但开头计划可能跑偏
函数调用(Function Calling)是怎么回事它不是让模型真的去执行代码,而是模型输出一段结构化的话:"我要调用 search_flights 这个工具,参数是 日期=下周三、城市=上海"。真正执行的是你的程序,执行完把结果再喂回模型。模型负责"决定调什么、填什么参数",程序负责"真的去调"。

⑤ ReAct 跑一遍:订机票的真实流程

第 1 步 · 思考(Reasoning)
用户说"帮我订下周三去上海的最便宜机票"。
模型先想:我需要知道今天几号、下周三是哪天;还需要查航班价格。我得先调日历工具,再调机票搜索工具。
第 2 步 · 行动(Acting)
模型输出结构化调用:search_flights(从=南京, 到=上海, 日期=下周三)。
程序真正去调机票 API,拿到一堆航班和价格,返回给模型。
第 3 步 · 观察(Observation)
模型读到结果:上午 7 点 180 元,下午 14 点 320 元。
它比较后判断:最便宜是上午那班。但它不急着下单,因为涉及花钱,先把选项报给用户确认。
第 4 步 · 再想下一步
用户回"就订上午那班"。
模型再调 book_flight(航班号=上午那班, 乘客=用户),拿到订单号,最后用大白话汇报:"已订好,订单号 XXX,记得带身份证。"闭环完成。
多智能体协作(了解即可)更复杂的系统会派多个 Agent 分工:一个负责拆任务(管理者),一个负责写代码,一个负责做代码审查,互相交接结果。这是进阶话题,现在你只要知道"一个人干不过来时,可以组队"就行。

⑥ 高频错误诊断(4 条)

错误 1:把 Agent 等同于普通聊天机器人聊天是单轮问答,Agent 是能自主拆步骤、调工具、根据结果循环调整的闭环。差别在于"会不会自己动手干活"。
错误 2:以为模型自己会执行函数模型只输出"我要调哪个工具、参数是什么"这段结构化请求;真正执行是外部程序做的,结果再喂回模型。别把"决定调用"当成"已经执行"。
错误 3:以为 Agent 长链路很可靠步骤一多它容易跑偏:漏一步、调错工具、被错误结果带偏、在循环里出不来。真实 Agent 必须有人在关键节点盯着确认。
错误 4:忽视成本与风险Agent 每步都在调 LLM、调工具,长链路 token 消耗和费用远高于普通聊天;而且它真的会动手(发邮件、下单、删文件),权限给太大可能闯祸。

⑦ 考点真题演练(4 题)

考点分布

考法出题形式应对
Agent 组成问哪四样拼成 AgentLLM+规划+工具+记忆
ReAct 含义问想一步做一步是哪种模式ReAct
函数调用本质问模型自己执行吗只输出调用请求,程序执行
Agent 局限问为什么需要人盯着长链路易跑偏、成本高

真题基础1. 一个完整的 Agent 通常由哪四样东西组成?

真题中档2. "想一步、做一步、看结果、再想下一步"指的是哪种模式?

真题中档3. 关于"函数调用(Function Calling)",正确的是?

真题拔高4. 为什么说 Agent"需要人盯着、不能完全放任"?

⑧ 必背知识点卡

Agent 公式:LLM + 规划 + 工具 + 记忆 = 能自己干活的闭环 大脑+手脚+待办+记性
聊天 vs Agent:你问一句答一句 / 你说目标它自己拆步骤干 动嘴 vs 动手
ReAct:Reasoning + Acting 交替 想一步做一步看结果
Plan-and-Execute:先拆完整任务清单,再逐个执行 先谋后动
函数调用:模型只输出调用请求,程序执行后喂回结果 它决定,你执行
多智能体:拆任务的、写代码的、做审查的分工协作 了解即可
局限:长链路跑偏、工具出错、成本高、需人兜底 别完全放手

⑨ 应用输出:给老板讲清"Agent 到底能帮公司干什么"

实战场景:老板问"现在老说的 AI Agent,对咱们公司到底有啥用?"
① 一句话定位:它不是聊天框,是个能自己上网、跑数据、点系统的"数字员工"。
② 举例子:你说"把上个月销售数据拉出来、做个图、写成一页报告发群里",它自己拆成拉数、画图、写稿、发送四步干完。
③ 说边界:但它不是百分百靠谱,步骤一多会跑偏、会调错工具,所以花钱、发邮件这种关键动作要留人工确认。
④ 算笔账:它每步都在烧 token,适合重复、规则清晰的流程;模糊、高风险的事还是人来。
口述全链路"Agent 就是给大模型装上规划、工具和记忆:你说目标,它自己拆任务、调搜索/代码/API,看结果再调整,循环到干完。ReAct 是边走边想,Plan-and-Execute 是先列清单;函数调用是它下指令、程序真去执行。它能干订机票、做分析、写报告,但长链路会跑偏、成本高,关键节点必须人盯着。"

⑩ 分层练习 16 题(基础 6 + 中档 5 + 拔高 5)

▍基础 6 题

基础1Agent 这个词中文常叫什么?
常译为智能体,指能自主感知、规划、调用工具完成目标的 AI 系统。
基础2Agent 的"大脑"是什么?
是大语言模型(LLM),负责理解、推理和决定下一步做什么。
基础3Agent 的"工具"是干什么的?
是它的"手脚":搜索、跑代码、查数据库、调 API 等,让它能真正动手做事。
基础4普通聊天和 Agent 最大的区别?
聊天是你问一句答一句;Agent 是你说目标,它自己拆步骤、调工具、循环干完。
基础5ReAct 是哪两个词的组合?
Reasoning(推理)+ Acting(行动),想一步做一步交替进行。
基础6函数调用时,真正执行工具的是谁?
是外部程序;模型只输出"调哪个工具、参数是什么"的结构化请求。

▍中档 5 题

中档7Plan-and-Execute 和 ReAct 有什么不同?
Plan-and-Execute 先把大目标拆成完整任务清单再逐个执行(先谋后动);ReAct 是边做边看、走一步想一步。前者全局清楚,后者灵活应变。
中档8为什么 Agent 需要"记忆"这个零件?
因为它要跨多步完成任务,必须记住已经做了什么、中间结果是什么,否则每步都从零开始,无法连贯地推进目标。
中档9举一个现在典型的 Agent 应用。
比如:自动订机票(查日期→搜航班→比价→确认→下单)、自动数据分析(拉数据→统计→画图→写报告)、自动写报告并发送。
中档10多智能体协作里通常怎么分工?
一个负责拆解和管理任务(管理者),一个负责执行(如写代码),一个负责审查把关(如做 review),互相交接结果。
中档11Agent 为什么比普通聊天更费钱?
因为它一个任务要调用 LLM 很多轮、还要反复调工具,每轮都消耗 token,长链路累计成本远高于单轮问答。

▍拔高 5 题

拔高12为什么 Agent 在长链路里容易"跑偏"?
每一步都基于上一步结果做决策,只要中间某步调错工具或被错误结果带偏,误差会沿链条累积放大;加上上下文越来越长,早期目标容易被遗忘。
拔高13为什么花钱、发邮件这类动作通常要"等人确认"?
因为 Agent 真会动手且可能出错,一旦误操作(订错票、发错人、删错文件)代价不可逆。在高风险动作前插入人工确认,是兜底的必要设计。
拔高14函数调用相比让模型"自由写代码"好在哪?
结构化的函数调用有固定接口和参数校验,可控、可审计、不会乱执行;自由生成的代码不可控、有安全风险。生产环境优先用函数调用。
拔高15Agent 和 RAG(上一课的检索)是什么关系?
RAG 常是 Agent 的一种"工具/记忆来源":Agent 需要查资料时,调用检索工具把相关文档捞出来作为依据。RAG 是零件,Agent 是把零件串起来干活的系统。
拔高16既然 Agent 这么强,为什么还没完全取代白领?
它在长链路可靠性、模糊目标理解、责任担当上还不行,成本也高。适合"规则清晰、重复、低风险"的流程辅助;涉及判断、创意、担责的环节仍需人主导。

⑪ 记忆口诀 + 7 天复习计划

三句口诀 ① Agent 四件套:大脑 LLM、手是工具、待办是规划、记性是记忆。
② ReAct 走一步想一步,Plan-and-Execute 先列清单再干活。
③ 函数调用它下指令、程序真执行;长链易跑偏,花钱发信要人盯。
天任务自检
第 1 天读②③,理解 Agent 闭环说清四件套
第 2 天读④⑤,跟一遍订机票流程讲清 ReAct 循环
第 3 天背知识点卡 + 基础 1-6基础全对
第 4 天做中档 7-11比较两种模式
第 5 天做⑦真题 + 拔高 12-16说清局限与风险
第 6-7 天合上书口述"Agent 怎么把一件事干完"不看资料全说对

📌 知识链路

前置知识(先学) · 第4课 · 主流模型:先有一个会对话的模型,再给它长手脚。
· 第19课 · 推理引擎:模型靠什么引擎跑起来。
本节位置 整条入门线的出口:模型 + 工具调用 + 记忆 = 能查资料、能写代码、能执行任务的 Agent。
下一步(学完去) · 第11课 · 分词器:回头把 Agent 背后的每一环彻底看懂。
← 第9课 · 记忆 算法与AI总览