基础概念

LLM

大语言模型

LLM(Large Language Model,大语言模型)是 ChatGPT、Claude、Gemini 背后的核心技术,通过海量文本训练学会'理解与生成语言'。本文用通俗语言拆解 LLM 的定义、训练流程、核心能力、与传统 NLP 的区别、能力边界与常见误区,帮你建立对 LLM 的完整认知。

2026-08-11
LLM大语言模型GPT基础概念

什么是 LLM

LLM(Large Language Model,大语言模型) 是用海量文本数据训练的 AI 模型,能理解与生成人类语言。

打个比方:

  • 传统程序 = 按规则执行(if-else)
  • LLM = 像人一样"读了很多书",能理解与回答
输入:"今天天气真好"
传统程序:匹配"天气"关键词 → 调用天气 API
LLM:理解语义 → "是啊,适合出门散步"

LLM 不是"查字典",而是"学会了语言的规律"。

LLM 的"大"指什么

LLM 的"大"体现在三个维度:

1. 参数量大

模型参数量比喻
GPT-215 亿小学水平
GPT-31750 亿高中水平
GPT-4约 1.8 万亿大学水平
Claude 3.5未公开大学水平

参数 = 模型的"脑容量"。参数越多,理解能力越强。

2. 训练数据量大

GPT-3 训练数据:
- 5000 亿 token(约 3750 亿字)
- 相当于 750 万本书
- 涵盖网页、书籍、论文、代码

3. 计算量大

GPT-3 训练成本:
- 355 个 GPU 运行 40 天
- 成本约 460 万美元
- 耗电量相当于 120 个家庭一年用电

LLM 的训练流程

LLM 训练分三个阶段:

阶段 1:预训练(Pre-training)

海量文本 → 学习"下一个词预测" → 基础语言能力
输入:"今天天气真___"
模型学习预测:"好"(概率最高)

通过预测下一个词,模型学会了语法、知识、推理。

阶段 2:指令微调(Instruction Tuning)

问答对示例 → 学习"遵循指令" → 对话能力
指令:"写一首关于秋天的诗"
训练模型:生成诗歌(而非继续输入文本)

阶段 3:人类反馈强化学习(RLHF)

人类标注偏好 → 强化"好回答" → 对齐人类价值观
同一问题的两个回答:
A:"秋天是收获的季节..."(人类偏好)
B:"秋天叶子黄了..."(一般)
→ 强化 A 的生成概率

LLM 的核心能力

1. 语言理解

"这个产品不错,就是有点贵"
LLM:理解"正面评价"+"价格顾虑"

2. 语言生成

"写一封请假邮件"
LLM:生成完整的请假邮件

3. 知识储备

"量子力学的基本原理是什么?"
LLM:从训练数据中调取相关知识

4. 推理能力

"如果 A>B, B>C, 则 A?C"
LLM:推理出 A>C

5. 代码能力

"写一个 Python 排序函数"
LLM:生成可运行的代码

6. 多语言

"Translate to English: 你好世界"
LLM:Hello World

LLM vs 传统 NLP

维度传统 NLPLLM
工作方式规则 + 统计神经网络
理解能力浅(关键词匹配)深(语义理解)
生成能力模板填充自由生成
适应新任务需重新训练零样本/少样本
开发成本高(每个任务独立开发)低(一个模型多任务)
准确性高(特定任务)中-高(通用)
可控性
成本低(推理快)高(推理慢)

关键区别:传统 NLP 是"专才"(一个任务一个模型),LLM 是"通才"(一个模型做所有任务)。

LLM 的工作原理(简化)

1. 文本 → Tokenize → Token 序列
   "你好" → [57668, 53901]

2. Token → Embedding → 向量
   [57668] → [0.1, 0.3, ..., 0.8](768 维向量)

3. 向量 → Transformer → 上下文理解
   注意力机制让每个 token "看到"其他 token

4. 预测下一个 Token → 采样 → 输出
   概率分布 → 选一个 token → 解码为文字

详见 TokenEmbedding

主流 LLM 一览

模型出品方特点适合
GPT-4oOpenAI最均衡通用
Claude 3.5Anthropic编程与写作强开发/创作
Gemini 1.5Google上下文最大长文档
通义千问阿里中文优秀国内场景
文心一言百度中文+生态国内场景
Llama 3.1Meta开源自部署
DeepSeek深度求索开源+便宜性价比

详见 Claude vs GPT-4o 对比。

LLM 的能力边界

✅ 擅长

  • 文本理解与生成
  • 知识问答(训练数据范围内)
  • 代码编写
  • 翻译
  • 摘要
  • 分类
  • 创意写作

❌ 不擅长

  • 实时信息:训练后的新闻不知道
  • 精确计算:大数乘法易出错
  • 事实核查:会编造看似可信的答案(幻觉
  • 逻辑必然:复杂逻辑链可能出错
  • 物理世界理解:没见过真实世界
  • 个性化:不了解具体用户
  • 长期记忆:跨会话不记得(需 Memory

常见误区

  • 误区 1:LLM 是"搜索引擎"。LLM 不是检索,是生成,可能编造。
  • 误区 2:LLM"懂"一切。LLM 只懂训练数据中的内容,训练后不知道。
  • 误区 3:LLM 不会错。LLM 会幻觉、会推理错误、会有偏见。
  • 误区 4:参数越大越好。模型规模与质量非线性相关,训练数据与对齐同样重要。
  • 误区 5:LLM 有"意识"。LLM 是统计模型,没有自我意识。
  • 误区 6:LLM 能替代搜索。LLM + RAG 才是正解。
  • 误区 7:LLM 是"数据库"。LLM 存的是"语言规律"而非"事实数据库"。

如何选择 LLM

场景推荐理由
通用问答GPT-4o最均衡
编程Claude 3.5代码质量优
长文档分析Gemini 1.5 / Claude 3.5上下文大
中文场景通义千问 / GPT-4o中文好
成本敏感GPT-4o-mini / DeepSeek便宜
自部署Llama 3.1开源
实时搜索GPT-4o + RAG实时

LLM 的演进趋势

2018:BERT(理解为主)
2020:GPT-3(生成突破)
2022:ChatGPT(对话能力)
2023:GPT-4(多模态)
2024:Claude 3.5 / GPT-4o(编程与推理)
2025:Agent 时代(自主完成任务)
2026:多模态 Agent(看听说做)

详见 Agent 概念。

与其他术语的关系

小结

LLM 是 AI 时代的"大脑":通过海量文本训练学会理解与生成语言。理解 LLM 的关键要点:

  • "大"在参数、数据、算量
  • 训练三阶段:预训练 → 指令微调 → RLHF
  • 核心能力:理解、生成、知识、推理
  • 有边界:不擅长实时、精确计算、事实核查
  • 不是万能:需配合 RAG、Agent、Memory 等技术

掌握 LLM 的基本原理,是理解整个 AI 应用生态的基础。从 LLM 出发,配合 RAG(知识)、Agent(行动)、Memory(记忆),才能构建完整的 AI 应用。