什么是 LLM
LLM(Large Language Model,大语言模型) 是用海量文本数据训练的 AI 模型,能理解与生成人类语言。
打个比方:
- 传统程序 = 按规则执行(if-else)
- LLM = 像人一样"读了很多书",能理解与回答
输入:"今天天气真好"
传统程序:匹配"天气"关键词 → 调用天气 API
LLM:理解语义 → "是啊,适合出门散步"
LLM 不是"查字典",而是"学会了语言的规律"。
LLM 的"大"指什么
LLM 的"大"体现在三个维度:
1. 参数量大
| 模型 | 参数量 | 比喻 |
|---|---|---|
| GPT-2 | 15 亿 | 小学水平 |
| GPT-3 | 1750 亿 | 高中水平 |
| GPT-4 | 约 1.8 万亿 | 大学水平 |
| Claude 3.5 | 未公开 | 大学水平 |
参数 = 模型的"脑容量"。参数越多,理解能力越强。
2. 训练数据量大
GPT-3 训练数据:
- 5000 亿 token(约 3750 亿字)
- 相当于 750 万本书
- 涵盖网页、书籍、论文、代码
3. 计算量大
GPT-3 训练成本:
- 355 个 GPU 运行 40 天
- 成本约 460 万美元
- 耗电量相当于 120 个家庭一年用电
LLM 的训练流程
LLM 训练分三个阶段:
阶段 1:预训练(Pre-training)
海量文本 → 学习"下一个词预测" → 基础语言能力
输入:"今天天气真___"
模型学习预测:"好"(概率最高)
通过预测下一个词,模型学会了语法、知识、推理。
阶段 2:指令微调(Instruction Tuning)
问答对示例 → 学习"遵循指令" → 对话能力
指令:"写一首关于秋天的诗"
训练模型:生成诗歌(而非继续输入文本)
阶段 3:人类反馈强化学习(RLHF)
人类标注偏好 → 强化"好回答" → 对齐人类价值观
同一问题的两个回答:
A:"秋天是收获的季节..."(人类偏好)
B:"秋天叶子黄了..."(一般)
→ 强化 A 的生成概率
LLM 的核心能力
1. 语言理解
"这个产品不错,就是有点贵"
LLM:理解"正面评价"+"价格顾虑"
2. 语言生成
"写一封请假邮件"
LLM:生成完整的请假邮件
3. 知识储备
"量子力学的基本原理是什么?"
LLM:从训练数据中调取相关知识
4. 推理能力
"如果 A>B, B>C, 则 A?C"
LLM:推理出 A>C
5. 代码能力
"写一个 Python 排序函数"
LLM:生成可运行的代码
6. 多语言
"Translate to English: 你好世界"
LLM:Hello World
LLM vs 传统 NLP
| 维度 | 传统 NLP | LLM |
|---|---|---|
| 工作方式 | 规则 + 统计 | 神经网络 |
| 理解能力 | 浅(关键词匹配) | 深(语义理解) |
| 生成能力 | 模板填充 | 自由生成 |
| 适应新任务 | 需重新训练 | 零样本/少样本 |
| 开发成本 | 高(每个任务独立开发) | 低(一个模型多任务) |
| 准确性 | 高(特定任务) | 中-高(通用) |
| 可控性 | 高 | 中 |
| 成本 | 低(推理快) | 高(推理慢) |
关键区别:传统 NLP 是"专才"(一个任务一个模型),LLM 是"通才"(一个模型做所有任务)。
LLM 的工作原理(简化)
1. 文本 → Tokenize → Token 序列
"你好" → [57668, 53901]
2. Token → Embedding → 向量
[57668] → [0.1, 0.3, ..., 0.8](768 维向量)
3. 向量 → Transformer → 上下文理解
注意力机制让每个 token "看到"其他 token
4. 预测下一个 Token → 采样 → 输出
概率分布 → 选一个 token → 解码为文字
主流 LLM 一览
| 模型 | 出品方 | 特点 | 适合 |
|---|---|---|---|
| GPT-4o | OpenAI | 最均衡 | 通用 |
| Claude 3.5 | Anthropic | 编程与写作强 | 开发/创作 |
| Gemini 1.5 | 上下文最大 | 长文档 | |
| 通义千问 | 阿里 | 中文优秀 | 国内场景 |
| 文心一言 | 百度 | 中文+生态 | 国内场景 |
| Llama 3.1 | Meta | 开源 | 自部署 |
| DeepSeek | 深度求索 | 开源+便宜 | 性价比 |
详见 Claude vs GPT-4o 对比。
LLM 的能力边界
✅ 擅长
- 文本理解与生成
- 知识问答(训练数据范围内)
- 代码编写
- 翻译
- 摘要
- 分类
- 创意写作
❌ 不擅长
- 实时信息:训练后的新闻不知道
- 精确计算:大数乘法易出错
- 事实核查:会编造看似可信的答案(幻觉)
- 逻辑必然:复杂逻辑链可能出错
- 物理世界理解:没见过真实世界
- 个性化:不了解具体用户
- 长期记忆:跨会话不记得(需 Memory)
常见误区
- 误区 1:LLM 是"搜索引擎"。LLM 不是检索,是生成,可能编造。
- 误区 2:LLM"懂"一切。LLM 只懂训练数据中的内容,训练后不知道。
- 误区 3:LLM 不会错。LLM 会幻觉、会推理错误、会有偏见。
- 误区 4:参数越大越好。模型规模与质量非线性相关,训练数据与对齐同样重要。
- 误区 5:LLM 有"意识"。LLM 是统计模型,没有自我意识。
- 误区 6:LLM 能替代搜索。LLM + RAG 才是正解。
- 误区 7:LLM 是"数据库"。LLM 存的是"语言规律"而非"事实数据库"。
如何选择 LLM
| 场景 | 推荐 | 理由 |
|---|---|---|
| 通用问答 | GPT-4o | 最均衡 |
| 编程 | Claude 3.5 | 代码质量优 |
| 长文档分析 | Gemini 1.5 / Claude 3.5 | 上下文大 |
| 中文场景 | 通义千问 / GPT-4o | 中文好 |
| 成本敏感 | GPT-4o-mini / DeepSeek | 便宜 |
| 自部署 | Llama 3.1 | 开源 |
| 实时搜索 | GPT-4o + RAG | 实时 |
LLM 的演进趋势
2018:BERT(理解为主)
2020:GPT-3(生成突破)
2022:ChatGPT(对话能力)
2023:GPT-4(多模态)
2024:Claude 3.5 / GPT-4o(编程与推理)
2025:Agent 时代(自主完成任务)
2026:多模态 Agent(看听说做)
详见 Agent 概念。
与其他术语的关系
- Token:LLM 处理的基本单位
- Embedding:LLM 理解语义的方式
- Context Window:LLM 一次能处理的大小
- Fine-tuning:定制 LLM 的方法
- RAG:给 LLM 外挂知识库
- Agent:LLM + 工具 = Agent
- Hallucination:LLM 的核心缺陷
小结
LLM 是 AI 时代的"大脑":通过海量文本训练学会理解与生成语言。理解 LLM 的关键要点:
- "大"在参数、数据、算量
- 训练三阶段:预训练 → 指令微调 → RLHF
- 核心能力:理解、生成、知识、推理
- 有边界:不擅长实时、精确计算、事实核查
- 不是万能:需配合 RAG、Agent、Memory 等技术
掌握 LLM 的基本原理,是理解整个 AI 应用生态的基础。从 LLM 出发,配合 RAG(知识)、Agent(行动)、Memory(记忆),才能构建完整的 AI 应用。