模型技术

RAG

检索增强生成

RAG(Retrieval-Augmented Generation)是一种让 AI 基于外部知识库回答问题的技术,解决了大模型知识过时和幻觉问题。是企业落地 AI 最常用的架构。

2026-08-02
RAG知识库Embedding向量检索

什么是 RAG

RAG(Retrieval-Augmented Generation,检索增强生成) 是一种结合了信息检索和文本生成的 AI 架构。它的工作原理是:先从外部知识库中检索相关文档,再将检索结果作为上下文传给大模型,让模型基于真实文档生成回答。

用一句话理解:RAG 是给 AI 开卷考试。普通 LLM 是闭卷考试(只能靠训练数据),RAG 让 AI 先翻书再答题。

为什么需要 RAG

大模型有三个固有问题,RAG 能有效缓解:

问题不用 RAG用 RAG
知识过时只知道训练截止前的信息可检索最新文档
幻觉编造看似合理的事实基于真实文档回答
领域知识不足缺乏企业内部知识可接入企业知识库

RAG 工作流程

1. 文档处理(离线)

原始文档 → 分块(Chunking)→ 向量化(Embedding)→ 存入向量数据库

2. 检索生成(在线)

用户提问 → 向量化 → 在向量库中检索相似文档 → 拼接为上下文 → 传给 LLM → 生成回答

核心概念

Embedding(向量嵌入)

把文本转换为向量(数字数组),使语义相似的文本在向量空间中距离更近。常用模型:

  • OpenAI text-embedding-3-small
  • BGE(中文效果好)
  • Cohere embed

向量数据库

专门存储和检索向量的数据库:

  • Pinecone(SaaS)
  • Milvus(开源自托管)
  • Qdrant(轻量开源)
  • Chroma(本地开发)

Chunking(分块)

把长文档切成小段落,每段 200-500 tokens。分块策略影响检索质量:

  • 按字数分块:最简单
  • 按语义分块:更好但更复杂
  • 递归分块:兼顾层次结构

RAG vs Fine-tuning

维度RAGFine-tuning
更新知识实时更新需重新训练
成本
可解释性高(可引用来源)
适合场景知识频繁变化调整模型风格/格式

常用 RAG 工具

工具定位特点
LangChainRAG 框架最流行的 LLM 应用框架
LlamaIndexRAG 专用框架专注数据连接
DifyRAG 平台可视化搭建
FastGPTRAG 平台知识库为核心

相关概念

  • Embedding:文本向量化的技术
  • 向量数据库:存储向量并支持相似度检索
  • Fine-tuning:微调模型(RAG 的替代方案)
  • MCP:让 AI 连接外部数据源的协议(可替代 RAG 的部分场景)