什么是 Agent
Agent(智能体) 是能自主感知环境、做出决策、调用工具、完成多步任务的 AI 系统。
打个比方:
- LLM = 大脑(能思考、能回答,但没手脚)
- Chatbot = 大脑 + 嘴巴(能对话,但仍不能行动)
- Agent = 大脑 + 嘴巴 + 手脚(能对话、能用工具、能完成任务)
用户:"帮我查一下明天北京的天气,如果下雨就提醒我带伞"
Chatbot:"我无法查询实时天气"(没工具)
Agent:
1. 调用天气 API 查询 → 明天北京小雨
2. 判断:下雨 → 需提醒
3. 调用日历 API → 创建提醒"带伞"
4. 回复:"已查询,明天北京小雨,已设置带伞提醒"
Agent 让 AI 从"回答问题"进化到"完成任务"。
Agent 的核心架构
一个完整的 Agent 系统包含五个组件:
┌─────────────────────────────────────────┐
│ Agent │
│ │
│ ┌─────────┐ ┌─────────────────┐ │
│ │ LLM │←──→│ 规划器 Planner │ │
│ │ (大脑) │ │ (拆解任务) │ │
│ └─────────┘ └─────────────────┘ │
│ ↓ ↓ │
│ ┌─────────────────────────────────┐ │
│ │ 记忆 Memory │ │
│ │ (短期:对话 / 长期:向量库) │ │
│ └─────────────────────────────────┘ │
│ ↓ │
│ ┌─────────────────────────────────┐ │
│ │ 工具调用 Tool Use │ │
│ │ (搜索/API/代码/数据库) │ │
│ └─────────────────────────────────┘ │
│ ↓ │
│ ┌─────────────────────────────────┐ │
│ │ 执行器 Executor │ │
│ │ (执行动作 + 观察结果) │ │
│ └─────────────────────────────────┘ │
└─────────────────────────────────────────┘
1. LLM(大脑)
负责理解、推理、决策。主流选择:
- GPT-4o / o1(OpenAI)
- Claude 3.5 Sonnet(Anthropic)
- 通义千问 / 文心(国产)
2. 规划器(Planner)
把复杂任务拆解为子任务:
任务:"写一篇竞品分析报告"
→ 子任务:
1. 搜索竞品信息
2. 整理功能对比
3. 分析定价策略
4. 撰写报告
3. 记忆(Memory)
| 类型 | 说明 | 实现 |
|---|---|---|
| 短期记忆 | 当前对话上下文 | LLM 上下文窗口 |
| 长期记忆 | 跨会话的知识与偏好 | 向量数据库 |
| 工作记忆 | 当前任务的中间状态 | 临时变量/文件 |
4. 工具调用(Tool Use)
让 LLM 能"动手":
| 工具类型 | 示例 |
|---|---|
| 搜索 | Brave Search / Google |
| 代码执行 | Python / JavaScript 沙箱 |
| API 调用 | 任意 REST/GraphQL API |
| 数据库 | SQL 查询 |
| 文件操作 | 读写本地文件 |
5. 执行器(Executor)
执行工具调用并观察结果,形成"行动-观察"循环。
Agent vs Chatbot
| 维度 | Chatbot | Agent |
|---|---|---|
| 核心能力 | 回答问题 | 完成任务 |
| 工具使用 | ❌ | ✅ |
| 多步执行 | ❌ | ✅ |
| 自主决策 | ❌ | ✅ |
| 环境感知 | ❌ | ✅ |
| 错误恢复 | ❌ | ✅ 重试/换方案 |
| 主动性 | 被动回答 | 主动规划 |
| 复杂度 | 低 | 高 |
| 成本 | 低 | 高(多步调用) |
一句话区分:Chatbot 是"你问我答",Agent 是"你说目标,我想办法完成"。
ReAct 范式
ReAct(Reasoning + Acting) 是最经典的 Agent 范式,由 Yao et al. 2022 提出:
循环:
Thought(思考):分析当前状态,决定下一步
Action(行动):调用工具
Observation(观察):获取工具返回结果
→ 回到 Thought,直到任务完成
示例
任务:查一下 OpenAI 最新估值
Thought 1:我需要搜索 OpenAI 估值最新消息
Action 1:search("OpenAI valuation 2026")
Observation 1:找到新闻"OpenAI 估值达 5000 亿美元"
Thought 2:找到了,需要确认来源可靠性
Action 2:search("OpenAI 5000亿 估值 来源")
Observation 2:多家主流媒体报道,可信
Thought 3:信息充分,可以回答
Final Answer:OpenAI 最新估值约 5000 亿美元(2026 年 X 月报道)
ReAct 的精髓:推理与行动交替,边想边做,根据观察调整策略。
其他 Agent 范式
Plan-and-Execute
1. 先规划全部步骤
2. 逐步执行
3. 必要时重新规划
适合:步骤明确的任务(如"按这个流程做")。
ReWOO
1. 一次性生成所有工具调用计划
2. 并行执行
3. 汇总结果
适合:可并行的独立子任务。
Reflexion
1. 执行任务
2. 自我反思(哪里做得不好)
3. 改进后重试
适合:需要自我纠正的高质量任务。
主流 Agent 框架
| 框架 | 特点 | 适合 |
|---|---|---|
| LangGraph | 状态机,多 Agent 协作 | 复杂系统 |
| AutoGen | 多 Agent 对话 | 多角色协作 |
| CrewAI | 角色分工 | 团队模拟 |
| OpenAI Assistants API | 官方托管 | 快速上线 |
| Claude Computer Use | 操作电脑 | 桌面自动化 |
| Dify Agent | 可视化编排 | 低代码 |
| Coze Bot | 多平台分发 | C 端 Bot |
详见 Dify vs LangChain 对比。
MCP 与 Agent 的关系
MCP(Model Context Protocol) 是 Agent 调用工具的标准化协议:
Agent → MCP 协议 → 各种工具服务器
├── Filesystem MCP(文件操作)
├── Postgres MCP(数据库查询)
├── Brave Search MCP(搜索)
└── GitHub MCP(仓库操作)
MCP 让 Agent 的工具接入标准化,无需为每个工具写定制集成。
Agent 的应用场景
1. 编程助手
任务:"给这个项目加单元测试"
Agent:
1. 读取项目结构
2. 识别测试框架
3. 生成测试代码
4. 运行测试
5. 修复失败用例
6. 提交 PR
代表:Claude Code、Cursor Composer、Devin。
2. 数据分析
任务:"分析销售数据下降原因"
Agent:
1. 查询数据库
2. 多维度拆解
3. 生成图表
4. 提炼洞察
5. 撰写报告
代表:ChatGPT Code Interpreter、Claude Analysis。
3. 研究助手
任务:"调研 RAG 技术最新进展"
Agent:
1. 搜索论文
2. 摘要提炼
3. 对比分析
4. 生成综述
代表:Perplexity、ChatGPT Search。
4. 工作流自动化
任务:"每天早上整理邮件摘要发飞书"
Agent:
1. 读取邮件
2. 分类摘要
3. 调用飞书 API 发送
代表:Zapier AI、Make.com。
常见误区
- 误区 1:Agent = Chatbot + 工具。Agent 的核心是自主决策与多步规划,不只是"能调工具的 Chatbot"。
- 误区 2:Agent 能完成任何任务。Agent 受限于工具能力与 LLM 推理水平,复杂任务仍需人工介入。
- 误区 3:Agent 不会出错。Agent 可能在某步走错,需设计错误恢复机制。
- 误区 4:Agent 越自主越好。高风险场景需"人机协作",关键步骤人工确认。
- 误区 5:Agent = AGI。Agent 是工具增强的 LLM,不是通用人工智能。
- 误区 6:Agent 不需要 Prompt 工程。Agent 的系统 Prompt 与工具描述质量直接影响效果。
Agent 的挑战
| 挑战 | 说明 | 当前方案 |
|---|---|---|
| 可靠性 | 多步执行易累积错误 | Self-Consistency / Reflexion |
| 成本 | 多次 LLM 调用费用高 | 缓存 / 小模型做规划 |
| 延迟 | 多步串行耗时长 | 并行 / Plan-and-Execute |
| 安全性 | Agent 能执行真实操作 | 权限控制 / 人工确认 |
| 可观测性 | 难以调试黑盒行为 | LangSmith / 逐步日志 |
| 评估 | 难以量化 Agent 效果 | AgentBench / 任务完成率 |
与其他术语的关系
- LLM:大语言模型,Agent 的大脑
- RAG:检索增强,Agent 的知识来源
- Embedding:嵌入,Agent 记忆的基础
- Token:token,Agent 多步调用的成本单位
- Hallucination:幻觉,Agent 工具调用可缓解
小结
Agent 是 LLM 的进化形态:从"回答问题"到"完成任务",从"单轮对话"到"多步自主执行"。理解 Agent 的关键要点:
- 五组件:LLM + 规划器 + 记忆 + 工具 + 执行器
- 核心范式:ReAct(思考-行动-观察循环)
- 与 Chatbot 区别:Agent 能用工具、能多步、能自主
- MCP 标准化工具接入:让 Agent 能力可扩展
- 挑战:可靠性、成本、安全需平衡
掌握 Agent,就掌握了 AI 应用的终极形态。从 Chatbot 起步,按需升级到 Agent,是 AI 应用演进的典型路径。