模型技术

Agent

智能体

Agent(智能体)是能感知环境、自主决策、调用工具、完成多步任务的 AI 系统。如果说 LLM 是'大脑',Agent 就是'大脑+手脚'——它能用搜索引擎查资料、用代码解释器算数、用 API 操作软件。本文拆解 Agent 的核心架构、与 Chatbot 的本质差异、ReAct 范式、主流框架与常见误区。

2026-08-09
Agent智能体LLM工具调用基础概念

什么是 Agent

Agent(智能体) 是能自主感知环境、做出决策、调用工具、完成多步任务的 AI 系统。

打个比方:

  • LLM = 大脑(能思考、能回答,但没手脚)
  • Chatbot = 大脑 + 嘴巴(能对话,但仍不能行动)
  • Agent = 大脑 + 嘴巴 + 手脚(能对话、能用工具、能完成任务)
用户:"帮我查一下明天北京的天气,如果下雨就提醒我带伞"

Chatbot:"我无法查询实时天气"(没工具)

Agent:
  1. 调用天气 API 查询 → 明天北京小雨
  2. 判断:下雨 → 需提醒
  3. 调用日历 API → 创建提醒"带伞"
  4. 回复:"已查询,明天北京小雨,已设置带伞提醒"

Agent 让 AI 从"回答问题"进化到"完成任务"。

Agent 的核心架构

一个完整的 Agent 系统包含五个组件:

┌─────────────────────────────────────────┐
│                  Agent                   │
│                                         │
│  ┌─────────┐    ┌─────────────────┐    │
│  │  LLM    │←──→│  规划器 Planner  │    │
│  │ (大脑)  │    │  (拆解任务)      │    │
│  └─────────┘    └─────────────────┘    │
│       ↓                 ↓               │
│  ┌─────────────────────────────────┐   │
│  │        记忆 Memory              │   │
│  │  (短期:对话 / 长期:向量库)       │   │
│  └─────────────────────────────────┘   │
│       ↓                                 │
│  ┌─────────────────────────────────┐   │
│  │      工具调用 Tool Use           │   │
│  │  (搜索/API/代码/数据库)          │   │
│  └─────────────────────────────────┘   │
│       ↓                                 │
│  ┌─────────────────────────────────┐   │
│  │      执行器 Executor            │   │
│  │  (执行动作 + 观察结果)           │   │
│  └─────────────────────────────────┘   │
└─────────────────────────────────────────┘

1. LLM(大脑)

负责理解、推理、决策。主流选择:

  • GPT-4o / o1(OpenAI)
  • Claude 3.5 Sonnet(Anthropic)
  • 通义千问 / 文心(国产)

2. 规划器(Planner)

把复杂任务拆解为子任务:

任务:"写一篇竞品分析报告"
→ 子任务:
   1. 搜索竞品信息
   2. 整理功能对比
   3. 分析定价策略
   4. 撰写报告

3. 记忆(Memory)

类型说明实现
短期记忆当前对话上下文LLM 上下文窗口
长期记忆跨会话的知识与偏好向量数据库
工作记忆当前任务的中间状态临时变量/文件

4. 工具调用(Tool Use)

让 LLM 能"动手":

工具类型示例
搜索Brave Search / Google
代码执行Python / JavaScript 沙箱
API 调用任意 REST/GraphQL API
数据库SQL 查询
文件操作读写本地文件

5. 执行器(Executor)

执行工具调用并观察结果,形成"行动-观察"循环。

Agent vs Chatbot

维度ChatbotAgent
核心能力回答问题完成任务
工具使用
多步执行
自主决策
环境感知
错误恢复✅ 重试/换方案
主动性被动回答主动规划
复杂度
成本高(多步调用)

一句话区分:Chatbot 是"你问我答",Agent 是"你说目标,我想办法完成"。

ReAct 范式

ReAct(Reasoning + Acting) 是最经典的 Agent 范式,由 Yao et al. 2022 提出:

循环:
  Thought(思考):分析当前状态,决定下一步
  Action(行动):调用工具
  Observation(观察):获取工具返回结果
  → 回到 Thought,直到任务完成

示例

任务:查一下 OpenAI 最新估值

Thought 1:我需要搜索 OpenAI 估值最新消息
Action 1:search("OpenAI valuation 2026")
Observation 1:找到新闻"OpenAI 估值达 5000 亿美元"

Thought 2:找到了,需要确认来源可靠性
Action 2:search("OpenAI 5000亿 估值 来源")
Observation 2:多家主流媒体报道,可信

Thought 3:信息充分,可以回答
Final Answer:OpenAI 最新估值约 5000 亿美元(2026 年 X 月报道)

ReAct 的精髓:推理与行动交替,边想边做,根据观察调整策略。

其他 Agent 范式

Plan-and-Execute

1. 先规划全部步骤
2. 逐步执行
3. 必要时重新规划

适合:步骤明确的任务(如"按这个流程做")。

ReWOO

1. 一次性生成所有工具调用计划
2. 并行执行
3. 汇总结果

适合:可并行的独立子任务。

Reflexion

1. 执行任务
2. 自我反思(哪里做得不好)
3. 改进后重试

适合:需要自我纠正的高质量任务。

主流 Agent 框架

框架特点适合
LangGraph状态机,多 Agent 协作复杂系统
AutoGen多 Agent 对话多角色协作
CrewAI角色分工团队模拟
OpenAI Assistants API官方托管快速上线
Claude Computer Use操作电脑桌面自动化
Dify Agent可视化编排低代码
Coze Bot多平台分发C 端 Bot

详见 Dify vs LangChain 对比。

MCP 与 Agent 的关系

MCP(Model Context Protocol) 是 Agent 调用工具的标准化协议

Agent → MCP 协议 → 各种工具服务器
                    ├── Filesystem MCP(文件操作)
                    ├── Postgres MCP(数据库查询)
                    ├── Brave Search MCP(搜索)
                    └── GitHub MCP(仓库操作)

MCP 让 Agent 的工具接入标准化,无需为每个工具写定制集成。

Agent 的应用场景

1. 编程助手

任务:"给这个项目加单元测试"
Agent:
  1. 读取项目结构
  2. 识别测试框架
  3. 生成测试代码
  4. 运行测试
  5. 修复失败用例
  6. 提交 PR

代表:Claude Code、Cursor Composer、Devin。

2. 数据分析

任务:"分析销售数据下降原因"
Agent:
  1. 查询数据库
  2. 多维度拆解
  3. 生成图表
  4. 提炼洞察
  5. 撰写报告

代表:ChatGPT Code Interpreter、Claude Analysis。

3. 研究助手

任务:"调研 RAG 技术最新进展"
Agent:
  1. 搜索论文
  2. 摘要提炼
  3. 对比分析
  4. 生成综述

代表:Perplexity、ChatGPT Search。

4. 工作流自动化

任务:"每天早上整理邮件摘要发飞书"
Agent:
  1. 读取邮件
  2. 分类摘要
  3. 调用飞书 API 发送

代表:Zapier AI、Make.com。

常见误区

  • 误区 1:Agent = Chatbot + 工具。Agent 的核心是自主决策与多步规划,不只是"能调工具的 Chatbot"。
  • 误区 2:Agent 能完成任何任务。Agent 受限于工具能力与 LLM 推理水平,复杂任务仍需人工介入。
  • 误区 3:Agent 不会出错。Agent 可能在某步走错,需设计错误恢复机制。
  • 误区 4:Agent 越自主越好。高风险场景需"人机协作",关键步骤人工确认。
  • 误区 5:Agent = AGI。Agent 是工具增强的 LLM,不是通用人工智能。
  • 误区 6:Agent 不需要 Prompt 工程。Agent 的系统 Prompt 与工具描述质量直接影响效果。

Agent 的挑战

挑战说明当前方案
可靠性多步执行易累积错误Self-Consistency / Reflexion
成本多次 LLM 调用费用高缓存 / 小模型做规划
延迟多步串行耗时长并行 / Plan-and-Execute
安全性Agent 能执行真实操作权限控制 / 人工确认
可观测性难以调试黑盒行为LangSmith / 逐步日志
评估难以量化 Agent 效果AgentBench / 任务完成率

与其他术语的关系

  • LLM:大语言模型,Agent 的大脑
  • RAG:检索增强,Agent 的知识来源
  • Embedding:嵌入,Agent 记忆的基础
  • Token:token,Agent 多步调用的成本单位
  • Hallucination:幻觉,Agent 工具调用可缓解

小结

Agent 是 LLM 的进化形态:从"回答问题"到"完成任务",从"单轮对话"到"多步自主执行"。理解 Agent 的关键要点:

  • 五组件:LLM + 规划器 + 记忆 + 工具 + 执行器
  • 核心范式:ReAct(思考-行动-观察循环)
  • 与 Chatbot 区别:Agent 能用工具、能多步、能自主
  • MCP 标准化工具接入:让 Agent 能力可扩展
  • 挑战:可靠性、成本、安全需平衡

掌握 Agent,就掌握了 AI 应用的终极形态。从 Chatbot 起步,按需升级到 Agent,是 AI 应用演进的典型路径。