什么是 Agent

给完全没接触过 Agent 的人的入门科普——用类比、对比、真实例子讲清楚。 看完这篇你能:理解 Agent 是什么、和 ChatGPT 有什么区别、它怎么干活、为什么 2024 年突然火。


阅读指南

  • 完全新手 → 按顺序看一~七章
  • 想直接看本质 → 跳【一】+【十】+【附录术语表】
  • 关心和其他概念的区别 → 看【六】【七】

一、一句话讲清楚 Agent 是什么

Agent = 能自主感知环境、做出决策、执行行动来完成任务的 AI 系统。

听起来抽象,三个类比让你秒懂。假设你说:“帮我订今晚到上海的机票

类型类比它的反应
传统软件电视遥控器”我只是个软件,你要点按钮才能下指令”
ChatGPT 类聊天 AI学识渊博的客服”建议你去携程搜索,选东航或国航”
Agent能干活的实习员工”好的,我去查”→(自己打开携程 API、对比价格、下单付款)→“已订,东航 19:30,确认号 ABC123”

核心区别

  • 传统软件:机械响应(你按它就动)
  • ChatGPT:只动嘴(给建议但不能下单)
  • Agent:能动手(拿到目标后自己规划 + 执行 + 反馈)

💡 关键词:自主性(Autonomy)+ 能干活(Action)。


二、Agent 的基本结构 —— 三段循环

所有 Agent 的内核都是这个闭环:

┌──────────┐    ┌──────────┐    ┌─────────┐
│   感知    │ → │  推理决策 │ → │   行动   │
│Perception│    │Reasoning │    │ Action  │
└──────────┘    └──────────┘    └─────────┘
      ↑                                │
      └────────── 看反馈 ───────────────┘

类比人完成任务的过程

  1. 看到 / 听到(感知)
  2. 想一下怎么办(推理)
  3. 动手做(行动)
  4. 看做得对不对(反馈)
  5. 再想 → 再做……直到任务完成

2.1 感知(Perception):信息输入

Agent 从哪里”看到”信息?

  • 用户输入:你的问题或指令
  • 工具返回:调用 API / 读文件得到的结果
  • 环境状态:当前所在目录、时间、外部数据
  • 历史记忆:之前发生过什么

2.2 推理(Reasoning):决策大脑

这一步就是 LLM——Agent 把感知到的信息丢给大模型,让它判断:

  • 下一步该做什么?
  • 要不要调用工具?调哪个?
  • 任务完成了吗?

⚠️ 这是 LLM Agent 与传统机器人最大的区别——推理由通用 LLM 完成,所以能处理任意领域的任务。老式 Agent(玩棋的 AlphaGo)的”推理”是写死的,换个领域就完全不会。

2.3 行动(Action):执行操作

LLM 决定后,Agent 真正”动手”:

  • 调用 API(订机票、查天气)
  • 操作文件(读、写、改代码)
  • 执行命令(运行 Python、跑测试)
  • 输出结果给用户

三、Agent 的 4 大核心能力

光有三段循环还不够,强大的 Agent 还需要 4 大支柱能力:

3.1 Tool Use(工具调用)—— 让 LLM 能动手

没有工具的 LLM = 只会动嘴的天才(知道答案但不能帮你执行) 有工具的 LLM = 能动手的助手

工具让 Agent 能干什么
文件读写工具改你电脑上的代码
Bash 工具运行命令、跑测试
Web 搜索工具查实时信息
API 调用工具接入外部服务(订机票、发邮件)
数据库工具查/改数据库

💡 Tool Use 是 Agent 区别于普通 LLM 的最核心特征——没有它就不算 Agent,只能算”会聊天的 AI”。

3.2 Memory(记忆)—— 跨轮不忘事

记忆类型作用例子
短期记忆当前会话上下文你 5 分钟前说过的话
长期记忆跨会话持久化你的偏好、项目历史、学过的经验

类比:

  • 短期记忆 = 你脑子里的”工作内存”(聊完会忘)
  • 长期记忆 = 你的笔记本(写下来下次还能看)

拓展阅读:本知识库 上下文窗口与 Token 计费 详细讲了短期记忆的物理基础。

3.3 Planning(规划)—— 把大任务拆小

用户说”帮我做个个人博客网站”,Agent 不会一上来就写代码,而是先拆:

任务:"做个个人博客网站"
  │
  ├─ 子任务 1:设计页面结构
  ├─ 子任务 2:选技术栈(决定用 Next.js)
  ├─ 子任务 3:写代码(页面/路由/样式)
  ├─ 子任务 4:本地测试
  └─ 子任务 5:部署到 Vercel

每个子任务还可以再拆。这就是 任务分解(Task Decomposition)

3.4 Reflection(反思)—— 自己检查自己

聪明的 Agent 会:

  • 写完代码 → 自己跑测试 → 发现失败 → 分析原因 → 改
  • 输出答案前 → 自己检查一遍是否合理 → 不合理就重来

类比:好员工不会做完就交差,会自己 review 一遍。


四、一个真实例子 —— Claude Code 怎么完成”修 bug”

走一遍完整的 Agent 闭环。

用户输入登录页报 500 错误,帮我修一下

回合 1:
  ├─ 感知:读取用户问题
  ├─ 推理(LLM):要先看错误日志和相关代码
  └─ 行动:调用 Read 工具读 logs/error.log

回合 2:
  ├─ 感知:日志显示 "TypeError: Cannot read property 'id' of undefined"
  ├─ 推理:bug 在 user 对象未定义时还在访问 user.id
  └─ 行动:调用 Grep 找出涉及 user.id 的文件

回合 3:
  ├─ 感知:找到 src/auth/login.ts:45
  ├─ 推理:需要加判空逻辑
  └─ 行动:调用 Edit 工具修改代码

回合 4(反思):
  ├─ 感知:修改完毕
  ├─ 推理:要验证修复是否成功
  └─ 行动:调用 Bash 工具运行测试

回合 5:
  ├─ 感知:测试通过
  └─ 输出:报告用户"已修复,问题在 login.ts:45 缺少判空"

对比 ChatGPT 时代

你说”修 bug” ChatGPT:“我不能直接看你的代码,请把相关代码和错误日志贴给我” (你贴上)“问题可能是…你试试这样改” (你按它说的改完)“还报错” ChatGPT:“那再试试…” ——你成了它的”手”,反复粘贴

而 Agent 是 它有手——自己读、自己改、自己测、自己反思。


五、Agent 不是新概念 —— 为什么 2024 年突然火?

5.1 Agent 的前世

年代形态例子
1980s专家系统MYCIN(医疗诊断决策树)
1990s-2000s强化学习 AgentDeepBlue(IBM 下棋打败卡斯帕罗夫)
2010s深度强化学习AlphaGo(Google 围棋打败李世石)
2020sLLM AgentClaude Code、AutoGPT、Devin…

老 Agent 的局限:只能在狭窄领域搞(下棋、玩游戏),换个任务就完全不会。

5.2 LLM 的关键突破

LLM(GPT-4、Claude 等)解决了老 Agent 时代的核心瓶颈:通用推理能力

老 Agent 时代:
  规则系统 / 强化学习 → 只能解决预定义的特定任务

LLM Agent 时代:
  LLM = 通用世界知识 + 通用推理 → 能处理任意语言任务

具体进展节点:

  • 2022 ChatGPT:让 LLM 能聊天
  • 2023 Function Calling:让 LLM 能调用工具(关键节点!
  • 2024 多模态 + 长上下文:Agent 能看图、能记更多事
  • 2025-2026 Harness Engineering:工程化把 Agent 做成生产可用

📌 一句话:之前缺的是”会推理的大脑”,LLM 给了;之前缺的是”能动手的接口”,Function Calling 给了。两者一结合 → Agent 火了。

拓展阅读:本知识库 Agent 发展轨迹四阶段 详细讲了”Prompt → Reasoning → Context → Harness”四阶段演进史。


六、常见误区(小白最容易踩)

误区正解
Agent = 多轮对话❌ 多轮对话只是”记忆”,没有自主行动;ChatGPT 也能多轮对话
Agent = Function Calling❌ Function Calling 是技术实现,Agent 是更完整的系统(含规划、记忆、反思)
Agent = 自动化脚本❌ 脚本流程固定,Agent 根据情况动态决策
Agent = AGI❌ Agent 只是 AI 应用形态,距通用人工智能还远
Agent 越复杂越好❌ 简单任务用 Workflow 反而更稳定,Agent 是为不确定流程设计的
Agent 一定要多个 LLM 协作❌ 单 Agent 也算 Agent,多 Agent 是复杂场景的优化
Agent 必须能上网❌ 工具是按需配置的,本地工具(读文件、跑命令)也算工具

七、Agent vs 其他概念

7.1 Agent vs Workflow(工作流)

对比项WorkflowAgent
流程预先定义、固定LLM 动态决定
路径静态(A→B→C)动态(每步看情况)
适合流程稳定(OA 审批、ETL)流程不确定(修 bug、研究问题)
可控性高(流程图清晰)中(黑盒推理)
灵活性
稳定性中(LLM 可能跑偏)

💡 业界共识:能用 Workflow 解决就别用 Agent。Agent 是处理”流程没法预先画出来”的情况。

7.2 Agent vs LLM

LLM = 大脑(只会推理输出文字)

Agent = LLM(大脑)
       + 工具(手脚)
       + 记忆(笔记本)
       + 规划(任务清单)
       + 反思(自我 review)

LLM 是 Agent 的核心组件之一,但不等于 Agent。

7.3 Agent vs Copilot

维度Copilot(副驾驶)Agent(代驾)
谁主导人主导,AI 辅助AI 主导,人确认
类比副驾驶给方向建议代驾自己开
例子GitHub Copilot 补全代码Claude Code 自己写代码
用户工作量多(每步都要参与)少(只给目标)
适合任务提速重复性工作完成端到端任务

💡 演进趋势:Copilot → Agent。从”AI 帮你”到”AI 替你”。


八、Agent 的几种典型形态

8.1 ReAct 模式(最常见的”骨架”)

Reasoning + Acting 的循环:

Thought(思考): 我需要查一下天气
Action(行动): 调用天气 API
Observation(观察): 北京今天 25 度,多云
Thought: 现在我知道了,可以回答用户
Action: 输出最终答案

这是大部分 Agent 的”骨架模式”,Claude Code、AutoGPT 等都基于它。

8.2 单 Agent vs 多 Agent

类型特点适合场景
单 Agent一个 Agent 干所有事大部分场景(Claude Code 默认)
多 Agent多个 Agent 分工协作复杂任务(CEO Agent 派 PM Agent 派 工程师 Agent)

多 Agent 不是”越多越好”——多 Agent 之间的通信成本、上下文同步、错误传播都是新问题。90% 场景单 Agent 就够。

🔗 想看真实的 7 人 Multi-Agent 系统怎么协作、Persona 文件怎么写、共享真相源怎么落地?读 Multi-Agent 工程实战与 Persona 设计——本节抽象对比的工程化延伸。

8.3 被动 Agent vs 主动 Agent

类型特点例子
被动等用户指令才动ChatGPT、Claude Code
主动长期跑、自己监控、自己触发监控告警 Agent、定时巡检 Agent

九、知识库内的学习路径

如果你想继续深入,按这个顺序读:

第一站(你在这里)
   └─ 什么是Agent.md           ← 概念入门 ⭐ 你正在看的
       │
第二站(历史)
   └─ Agent发展轨迹四阶段.md    ← Prompt → Reasoning → Context → Harness 演进
       │
第三站(工程)
   └─ Harness工程与Agent解剖.md ← Agent = Model + Harness 的工程视角
       │
第四站(质量)
   └─ Eval测评体系.md           ← 怎么衡量 Agent 好不好
       │
第五站(安全)
   └─ Agent安全攻防.md          ← 30 种攻击 + 17 种防御

十、一句话终极总结

Agent = LLM + 工具 + 记忆 + 规划 + 反思

不是”会聊天的 AI”,而是 “能干活的 AI 实习员工”——你给它目标,它自己感知、决策、行动,直到完成。


附:核心术语速查

术语中文含义
Agent智能体能自主完成任务的 AI 系统
Tool Use工具调用LLM 调用外部函数/API 的能力
Function Calling函数调用Tool Use 的具体技术实现(OpenAI 2023 提出)
ReAct推理+行动最常见的 Agent 工作模式
Memory记忆跨轮/跨会话保存信息
Planning规划把大任务拆成小步骤
Reflection反思Agent 自我检查与修正
Multi-Agent多智能体多个 Agent 协作
Workflow工作流预定义流程的自动化
Copilot副驾驶辅助型 AI(如 GitHub Copilot)
Harness脚手架Agent 中除模型外的所有工程基础设施
Perception感知Agent 接收输入信息的环节
Reasoning推理Agent 用 LLM 做决策的环节
Action行动Agent 执行操作的环节