什么是 Agent
给完全没接触过 Agent 的人的入门科普——用类比、对比、真实例子讲清楚。 看完这篇你能:理解 Agent 是什么、和 ChatGPT 有什么区别、它怎么干活、为什么 2024 年突然火。
阅读指南
- 完全新手 → 按顺序看一~七章
- 想直接看本质 → 跳【一】+【十】+【附录术语表】
- 关心和其他概念的区别 → 看【六】【七】
一、一句话讲清楚 Agent 是什么
Agent = 能自主感知环境、做出决策、执行行动来完成任务的 AI 系统。
听起来抽象,三个类比让你秒懂。假设你说:“帮我订今晚到上海的机票”
| 类型 | 类比 | 它的反应 |
|---|---|---|
| 传统软件 | 电视遥控器 | ”我只是个软件,你要点按钮才能下指令” |
| ChatGPT 类聊天 AI | 学识渊博的客服 | ”建议你去携程搜索,选东航或国航” |
| Agent | 能干活的实习员工 | ”好的,我去查”→(自己打开携程 API、对比价格、下单付款)→“已订,东航 19:30,确认号 ABC123” |
核心区别:
- 传统软件:机械响应(你按它就动)
- ChatGPT:只动嘴(给建议但不能下单)
- Agent:能动手(拿到目标后自己规划 + 执行 + 反馈)
💡 关键词:自主性(Autonomy)+ 能干活(Action)。
二、Agent 的基本结构 —— 三段循环
所有 Agent 的内核都是这个闭环:
┌──────────┐ ┌──────────┐ ┌─────────┐
│ 感知 │ → │ 推理决策 │ → │ 行动 │
│Perception│ │Reasoning │ │ Action │
└──────────┘ └──────────┘ └─────────┘
↑ │
└────────── 看反馈 ───────────────┘
类比人完成任务的过程:
- 看到 / 听到(感知)
- 想一下怎么办(推理)
- 动手做(行动)
- 看做得对不对(反馈)
- 再想 → 再做……直到任务完成
2.1 感知(Perception):信息输入
Agent 从哪里”看到”信息?
- 用户输入:你的问题或指令
- 工具返回:调用 API / 读文件得到的结果
- 环境状态:当前所在目录、时间、外部数据
- 历史记忆:之前发生过什么
2.2 推理(Reasoning):决策大脑
这一步就是 LLM——Agent 把感知到的信息丢给大模型,让它判断:
- 下一步该做什么?
- 要不要调用工具?调哪个?
- 任务完成了吗?
⚠️ 这是 LLM Agent 与传统机器人最大的区别——推理由通用 LLM 完成,所以能处理任意领域的任务。老式 Agent(玩棋的 AlphaGo)的”推理”是写死的,换个领域就完全不会。
2.3 行动(Action):执行操作
LLM 决定后,Agent 真正”动手”:
- 调用 API(订机票、查天气)
- 操作文件(读、写、改代码)
- 执行命令(运行 Python、跑测试)
- 输出结果给用户
三、Agent 的 4 大核心能力
光有三段循环还不够,强大的 Agent 还需要 4 大支柱能力:
3.1 Tool Use(工具调用)—— 让 LLM 能动手
没有工具的 LLM = 只会动嘴的天才(知道答案但不能帮你执行) 有工具的 LLM = 能动手的助手
| 工具 | 让 Agent 能干什么 |
|---|---|
| 文件读写工具 | 改你电脑上的代码 |
| Bash 工具 | 运行命令、跑测试 |
| Web 搜索工具 | 查实时信息 |
| API 调用工具 | 接入外部服务(订机票、发邮件) |
| 数据库工具 | 查/改数据库 |
💡 Tool Use 是 Agent 区别于普通 LLM 的最核心特征——没有它就不算 Agent,只能算”会聊天的 AI”。
3.2 Memory(记忆)—— 跨轮不忘事
| 记忆类型 | 作用 | 例子 |
|---|---|---|
| 短期记忆 | 当前会话上下文 | 你 5 分钟前说过的话 |
| 长期记忆 | 跨会话持久化 | 你的偏好、项目历史、学过的经验 |
类比:
- 短期记忆 = 你脑子里的”工作内存”(聊完会忘)
- 长期记忆 = 你的笔记本(写下来下次还能看)
拓展阅读:本知识库 上下文窗口与 Token 计费 详细讲了短期记忆的物理基础。
3.3 Planning(规划)—— 把大任务拆小
用户说”帮我做个个人博客网站”,Agent 不会一上来就写代码,而是先拆:
任务:"做个个人博客网站"
│
├─ 子任务 1:设计页面结构
├─ 子任务 2:选技术栈(决定用 Next.js)
├─ 子任务 3:写代码(页面/路由/样式)
├─ 子任务 4:本地测试
└─ 子任务 5:部署到 Vercel
每个子任务还可以再拆。这就是 任务分解(Task Decomposition)。
3.4 Reflection(反思)—— 自己检查自己
聪明的 Agent 会:
- 写完代码 → 自己跑测试 → 发现失败 → 分析原因 → 改
- 输出答案前 → 自己检查一遍是否合理 → 不合理就重来
类比:好员工不会做完就交差,会自己 review 一遍。
四、一个真实例子 —— Claude Code 怎么完成”修 bug”
走一遍完整的 Agent 闭环。
用户输入:登录页报 500 错误,帮我修一下
回合 1:
├─ 感知:读取用户问题
├─ 推理(LLM):要先看错误日志和相关代码
└─ 行动:调用 Read 工具读 logs/error.log
回合 2:
├─ 感知:日志显示 "TypeError: Cannot read property 'id' of undefined"
├─ 推理:bug 在 user 对象未定义时还在访问 user.id
└─ 行动:调用 Grep 找出涉及 user.id 的文件
回合 3:
├─ 感知:找到 src/auth/login.ts:45
├─ 推理:需要加判空逻辑
└─ 行动:调用 Edit 工具修改代码
回合 4(反思):
├─ 感知:修改完毕
├─ 推理:要验证修复是否成功
└─ 行动:调用 Bash 工具运行测试
回合 5:
├─ 感知:测试通过
└─ 输出:报告用户"已修复,问题在 login.ts:45 缺少判空"
对比 ChatGPT 时代:
你说”修 bug” ChatGPT:“我不能直接看你的代码,请把相关代码和错误日志贴给我” (你贴上)“问题可能是…你试试这样改” (你按它说的改完)“还报错” ChatGPT:“那再试试…” ——你成了它的”手”,反复粘贴
而 Agent 是 它有手——自己读、自己改、自己测、自己反思。
五、Agent 不是新概念 —— 为什么 2024 年突然火?
5.1 Agent 的前世
| 年代 | 形态 | 例子 |
|---|---|---|
| 1980s | 专家系统 | MYCIN(医疗诊断决策树) |
| 1990s-2000s | 强化学习 Agent | DeepBlue(IBM 下棋打败卡斯帕罗夫) |
| 2010s | 深度强化学习 | AlphaGo(Google 围棋打败李世石) |
| 2020s | LLM Agent | Claude Code、AutoGPT、Devin… |
老 Agent 的局限:只能在狭窄领域搞(下棋、玩游戏),换个任务就完全不会。
5.2 LLM 的关键突破
LLM(GPT-4、Claude 等)解决了老 Agent 时代的核心瓶颈:通用推理能力。
老 Agent 时代:
规则系统 / 强化学习 → 只能解决预定义的特定任务
LLM Agent 时代:
LLM = 通用世界知识 + 通用推理 → 能处理任意语言任务
具体进展节点:
- 2022 ChatGPT:让 LLM 能聊天
- 2023 Function Calling:让 LLM 能调用工具(关键节点!)
- 2024 多模态 + 长上下文:Agent 能看图、能记更多事
- 2025-2026 Harness Engineering:工程化把 Agent 做成生产可用
📌 一句话:之前缺的是”会推理的大脑”,LLM 给了;之前缺的是”能动手的接口”,Function Calling 给了。两者一结合 → Agent 火了。
拓展阅读:本知识库 Agent 发展轨迹四阶段 详细讲了”Prompt → Reasoning → Context → Harness”四阶段演进史。
六、常见误区(小白最容易踩)
| 误区 | 正解 |
|---|---|
| Agent = 多轮对话 | ❌ 多轮对话只是”记忆”,没有自主行动;ChatGPT 也能多轮对话 |
| Agent = Function Calling | ❌ Function Calling 是技术实现,Agent 是更完整的系统(含规划、记忆、反思) |
| Agent = 自动化脚本 | ❌ 脚本流程固定,Agent 根据情况动态决策 |
| Agent = AGI | ❌ Agent 只是 AI 应用形态,距通用人工智能还远 |
| Agent 越复杂越好 | ❌ 简单任务用 Workflow 反而更稳定,Agent 是为不确定流程设计的 |
| Agent 一定要多个 LLM 协作 | ❌ 单 Agent 也算 Agent,多 Agent 是复杂场景的优化 |
| Agent 必须能上网 | ❌ 工具是按需配置的,本地工具(读文件、跑命令)也算工具 |
七、Agent vs 其他概念
7.1 Agent vs Workflow(工作流)
| 对比项 | Workflow | Agent |
|---|---|---|
| 流程 | 预先定义、固定 | LLM 动态决定 |
| 路径 | 静态(A→B→C) | 动态(每步看情况) |
| 适合 | 流程稳定(OA 审批、ETL) | 流程不确定(修 bug、研究问题) |
| 可控性 | 高(流程图清晰) | 中(黑盒推理) |
| 灵活性 | 低 | 高 |
| 稳定性 | 高 | 中(LLM 可能跑偏) |
💡 业界共识:能用 Workflow 解决就别用 Agent。Agent 是处理”流程没法预先画出来”的情况。
7.2 Agent vs LLM
LLM = 大脑(只会推理输出文字)
Agent = LLM(大脑)
+ 工具(手脚)
+ 记忆(笔记本)
+ 规划(任务清单)
+ 反思(自我 review)
LLM 是 Agent 的核心组件之一,但不等于 Agent。
7.3 Agent vs Copilot
| 维度 | Copilot(副驾驶) | Agent(代驾) |
|---|---|---|
| 谁主导 | 人主导,AI 辅助 | AI 主导,人确认 |
| 类比 | 副驾驶给方向建议 | 代驾自己开 |
| 例子 | GitHub Copilot 补全代码 | Claude Code 自己写代码 |
| 用户工作量 | 多(每步都要参与) | 少(只给目标) |
| 适合任务 | 提速重复性工作 | 完成端到端任务 |
💡 演进趋势:Copilot → Agent。从”AI 帮你”到”AI 替你”。
八、Agent 的几种典型形态
8.1 ReAct 模式(最常见的”骨架”)
Reasoning + Acting 的循环:
Thought(思考): 我需要查一下天气
Action(行动): 调用天气 API
Observation(观察): 北京今天 25 度,多云
Thought: 现在我知道了,可以回答用户
Action: 输出最终答案
这是大部分 Agent 的”骨架模式”,Claude Code、AutoGPT 等都基于它。
8.2 单 Agent vs 多 Agent
| 类型 | 特点 | 适合场景 |
|---|---|---|
| 单 Agent | 一个 Agent 干所有事 | 大部分场景(Claude Code 默认) |
| 多 Agent | 多个 Agent 分工协作 | 复杂任务(CEO Agent 派 PM Agent 派 工程师 Agent) |
多 Agent 不是”越多越好”——多 Agent 之间的通信成本、上下文同步、错误传播都是新问题。90% 场景单 Agent 就够。
🔗 想看真实的 7 人 Multi-Agent 系统怎么协作、Persona 文件怎么写、共享真相源怎么落地?读 Multi-Agent 工程实战与 Persona 设计——本节抽象对比的工程化延伸。
8.3 被动 Agent vs 主动 Agent
| 类型 | 特点 | 例子 |
|---|---|---|
| 被动 | 等用户指令才动 | ChatGPT、Claude Code |
| 主动 | 长期跑、自己监控、自己触发 | 监控告警 Agent、定时巡检 Agent |
九、知识库内的学习路径
如果你想继续深入,按这个顺序读:
第一站(你在这里)
└─ 什么是Agent.md ← 概念入门 ⭐ 你正在看的
│
第二站(历史)
└─ Agent发展轨迹四阶段.md ← Prompt → Reasoning → Context → Harness 演进
│
第三站(工程)
└─ Harness工程与Agent解剖.md ← Agent = Model + Harness 的工程视角
│
第四站(质量)
└─ Eval测评体系.md ← 怎么衡量 Agent 好不好
│
第五站(安全)
└─ Agent安全攻防.md ← 30 种攻击 + 17 种防御
十、一句话终极总结
Agent = LLM + 工具 + 记忆 + 规划 + 反思
不是”会聊天的 AI”,而是 “能干活的 AI 实习员工”——你给它目标,它自己感知、决策、行动,直到完成。
附:核心术语速查
| 术语 | 中文 | 含义 |
|---|---|---|
| Agent | 智能体 | 能自主完成任务的 AI 系统 |
| Tool Use | 工具调用 | LLM 调用外部函数/API 的能力 |
| Function Calling | 函数调用 | Tool Use 的具体技术实现(OpenAI 2023 提出) |
| ReAct | 推理+行动 | 最常见的 Agent 工作模式 |
| Memory | 记忆 | 跨轮/跨会话保存信息 |
| Planning | 规划 | 把大任务拆成小步骤 |
| Reflection | 反思 | Agent 自我检查与修正 |
| Multi-Agent | 多智能体 | 多个 Agent 协作 |
| Workflow | 工作流 | 预定义流程的自动化 |
| Copilot | 副驾驶 | 辅助型 AI(如 GitHub Copilot) |
| Harness | 脚手架 | Agent 中除模型外的所有工程基础设施 |
| Perception | 感知 | Agent 接收输入信息的环节 |
| Reasoning | 推理 | Agent 用 LLM 做决策的环节 |
| Action | 行动 | Agent 执行操作的环节 |