自然语言处理的介绍与历史
自然语言处理的历史与介绍
每个词的选择、语调、时机都承载着无数信号,而听者以独特的方式解读这些信号。
NLP 简史:从规则到 Transformer
1960s 1980s 2010s 2017 2022+
| 符号/规则系统 | 统计方法 | 神经网络 | Transformer | LLM 时代
| Symbolic AI | Statistical NLP | Neural NLP | Self-Attention | ChatGPT, GPT-5
1.1 第一阶段: 规则方法与符号系统(1960s–2010s)
核心理念
认为智能 = 符号处理。语言被视为一套形式符号系统,可以通过手工编写的规则来理解。
关键人物与里程碑
| 人物 | 贡献 |
|---|---|
| John McCarthy | 提出"人工智能"概念,希望构建类似数学和逻辑的 AI |
| Newell & Simon | 物理符号系统假说:物理符号系统是产生通用智能行为的充分必要条件 |
| Richard Montague | 构建自然语言的形式语义学,以组合性原则推导句子意义 |
典型技术:语义解析 (Semantic Parsing)
句子 → 句法解析 → 查词典获取词义 → 组合推导短语意义 → 句子意义表示
核心局限
这些系统总是极其脆弱,只能在极其有限的领域内工作。
-
覆盖率低:手工写规则永远追不上语言的变化
-
歧义问题:无法处理自然语言中的大量歧义
-
无法扩展:每新增一个领域需要重新编写规则
1.2 第二阶段:统计方法(1980s–2010s)
核心理念
从数据中学习,而非手工编写规则。
1980 年代末开始,领域从规则转向数据驱动的方法:人工标注大量句子的句法结构(构建树库 Treebank),然后训练统计/机器学习模型。
代表性技术
| 技术 | 用途 |
|---|---|
| N-gram 语言模型 | 基于前 N-1 个词预测下一个词 |
| HMM (隐马尔可夫模型) | 词性标注 (POS Tagging) |
| CRF (条件随机场) | 命名实体识别 (NER) |
| TF-IDF | 文档表示与检索 |
| 统计机器翻译 (SMT) | IBM Models, 基于短语的翻译 |
关键工具:BLEU 评估指标
机器翻译最常用的自动评估指标,基于 N-gram 重叠计算分数。
核心局限
N-gram 模型本质上是"记忆和检索固定的词组",存在三个根本问题:
-
稀疏性问题 (Sparsity)
-
N 增大 → N-gram 数量指数增长
-
大量序列从未出现 → 概率估计为 0
-
即使使用平滑 (smoothing) 和回退 (back-off),问题仍然存在
-
-
上下文有限
-
只能看固定窗口(通常 N=3~5)
-
长距离依赖完全丢失
-
-
缺乏深层理解
-
无法捕捉词与词之间的语义关系
-
“hotel” 和 “motel” 在 N-gram 模型中毫无关联
-
1.3 神经网络方法(2010s 至今)
阶段一:词向量突破 — Word2Vec (2013)
Tomas Mikolov 等人提出 Word2Vec,核心突破:
-
词义由上下文决定 → 分布语义学 (Distributional Semantics)
-
每个词被表示为 稠密实数向量(如 300 维),而非稀疏的 one-hot
-
语义相近的词在向量空间中距离更近
经典例子:king − man + woman ≈ queen
这展示了词向量空间中的线性语义关系。
两种架构:
-
CBOW: 用上下文词预测中心词
-
Skip-gram: 用中心词预测上下文词
目标函数 (Skip-gram):
J(θ)=−1T∑t=1T∑−m≤j≤mj≠0logP(wt+j∣wt;θ)J(\theta) = -\frac{1}{T} \sum_{t=1}^{T} \sum_{\substack{-m \leq j \leq m \\ j \neq 0}} \log P(w_{t+j} \mid w_t; \theta)J(θ)=−T1∑t=1T∑−m≤j≤mj=0logP(wt+j∣wt;θ)
Softmax 概率:
P(o∣c)=exp(uoTvc)∑w∈Vexp(uwTvc)P(o \mid c) = \frac{\exp(u_o^T v_c)}{\sum_{w \in V} \exp(u_w^T v_c)}P(o∣c)=∑w∈Vexp(uwTvc)exp(uoTvc); 这里的exp为指数函数exe^xex
每个词有两个向量:vwv_wvw(作为中心词)和 uwu_wuw(作为上下文词)。
梯度直觉:
∇vclogP(o∣c)=uo−∑x∈VP(x∣c)⋅ux\nabla_{v_c} \log P(o|c) = u_o - \sum_{x \in V} P(x|c) \cdot u_x∇vclogP(o∣c)=uo−∑x∈VP(x∣c)⋅ux
= 观测到的 − 期望的 (observed − expected)
阶段二:循环神经网络 RNN / LSTM
RNN 的贡献:
-
引入隐藏状态 (hidden state) 作为"记忆"
-
处理变长序列,参数跨时间共享
LSTM 的突破 (Hochreiter & Schmidhuber):
通过细胞状态 (cell state) 和门控机制 (gate mechanism) 解决梯度消失问题
$ f_t = \sigma(W_f \cdot [h_{t-1}, x_t] + b_f) \quad \text{(遗忘门)} $
it=σ(Wi⋅[ht−1,xt]+bi)(输入门)i_t = \sigma(W_i \cdot [h_{t-1}, x_t] + b_i) \quad \text{(输入门)}it=σ(Wi⋅[ht−1,xt]+bi)(输入门)
ot=σ(Wo⋅[ht−1,xt]+bo)(输出门)o_t = \sigma(W_o \cdot [h_{t-1}, x_t] + b_o) \quad \text{(输出门)}ot=σ(Wo⋅[ht−1,xt]+bo)(输出门)
Ct=ft⊙Ct−1+it⊙C~t(细胞状态更新)C_t = f_t \odot C_{t-1} + i_t \odot \tilde{C}_t \quad \text{(细胞状态更新)}Ct=ft⊙Ct−1+it⊙C~t(细胞状态更新)
神经机器翻译 (NMT) 革命 (2014):
翻译质量迅速超越耕耘了数十年的统计机器翻译系统——这是深度学习在 NLP 领域的第一个重大成功案例。
RNN 的核心局限:
-
线性交互距离:信息需要经过 O(序列长度) 步才能传播
-
不可并行化:前向/反向传播具有 O(序列长度) 的串行操作
-
梯度消失/爆炸:长序列中梯度信号衰减或爆炸
阶段三:注意力机制 Attention (2015)
核心思想 (Bahdanau et al., 2015):
解码器生成每个词时,动态"查看"编码器所有隐藏状态,选取最相关信息
-
解决了长序列信息压缩的瓶颈问题
-
提供了可解释性:可以可视化模型在"看"哪里
阶段四:Transformer 架构 (2017)
现代自然语言处理乃至更广泛人工智能领域大多数进展的基础
Vaswani 等人的论文 “Attention Is All You Need” 引入了全新架构:
| 核心组件 | 作用 |
|---|---|
| 自注意力 (Self-Attention) | 序列中每个词与所有词直接交互,O(1) 步建立任意距离联系 |
| 多头注意力 (Multi-Head Attention) | 不同表示子空间中并行关注序列不同部分 |
| 缩放点积注意力 | Attention(Q,K,V)=softmax(QKTdk)V\text{Attention}(Q,K,V) = \text{softmax}(\frac{QK^T}{\sqrt{d_k}})VAttention(Q,K,V)=softmax(dkQKT)V |
| 残差连接 + 层归一化 | 缓解梯度消失,加速收敛 |
| 位置编码 (Positional Encoding) | 补充序列顺序信息(因为自注意力本身不感知位置) |
三种架构变体:
| 变体 | 特点 | 代表模型 |
|---|---|---|
| Transformer Encoder | 双向注意力 | BERT |
| Transformer Decoder | 自回归(因果注意力) | GPT 系列 |
| Transformer Encoder-Decoder | 序列到序列 | T5, 原始 Transformer |
Transformer 的挑战:
自注意力计算复杂度为 O(n2)O(n^2)O(n2),处理长文档是核心瓶颈。
阶段五:预训练革命 Pretraining (2018 至今)
| 模型 | 年份 | 方法 | 关键贡献 |
|---|---|---|---|
| BERT | 2018 | 掩码语言建模 (MLM) + 下一句预测 | 双向上下文理解,刷新多项基准 |
| GPT-2 | 2019 | 自回归语言建模 | 展示 zero-shot 能力 |
| GPT-3 | 2020 | 自回归 + 1750 亿参数 | 涌现能力:上下文学习、思维链推理 |
| T5 | 2020 | 跨度损坏预训练 | 统一的 text-to-text 框架 |
| RoBERT | 2019 | 改进的 MLM | 证明仅 MLM + 更长训练就足够好 |
缩放定律 (Scaling Laws):
模型性能随参数量、训练数据量、计算量的增加而可预测地提升。
Chinchilla 模型表明三者的增长需要平衡。
GPT-3 的涌现能力:
-
上下文学习 (In-Context Learning):仅通过提示中的示例即可执行新任务
-
思维链 (Chain-of-Thought):生成推理步骤显著提升复杂推理准确性
阶段六:对齐与后训练 Alignment (2022 至今)
RLHF (基于人类反馈的强化学习) — ChatGPT 核心技术
Step 1: 监督微调 (SFT) → 在高质量人类回答上微调
Step 2: 奖励模型 (RM) → 训练模型学习人类偏好排序
Step 3: PPO 强化学习 → 用奖励模型优化策略,加 KL 散度约束防止跑偏
DPO (直接偏好优化, Rafailov et al., 2023)
将偏好优化转化为简单的分类损失,实现简单、计算高效、效果与 RLHF 相当。
DPO 已成为众多开源和生产模型的首选方法。
阶段七:前沿模型与最新突破 (2024–2026)
2024–2025 年是 AI 从实验技术转向基础设施的分水岭,推理模型 (reasoning models) 和智能体 (agentic AI) 成为核心主题。
DeepSeek-R1 推理突破:
-
R1-Zero:在 V3-Base 上用纯 RL(无 SFT) 训练,仅依赖答案正确性 + 格式合规两个奖励信号
-
自主涌现:反思 (self-reflection)、验证 (verification)、多步检查等复杂推理行为
-
AIME 2024 准确率:15.6% → 71.0%(纯 RL)→ 86.7%(多数投票)
-
GRPO (Group Relative Policy Optimization):去除 Critic 模型,计算量从 O(2N) 降至 O(N),显存减少 ~40%
2025 年主要前沿模型
| 模型 | 发布 | GPQA 得分 | 核心特点 |
|---|---|---|---|
| GPT-5 (OpenAI) | 2025.08 | 89.4% | 统一通用 + 推理能力,~3.5-4T 参数,400K 上下文 |
| Grok-4 (xAI) | 2025.07 | 88.9% | Colossus H100 集群训练,72-75% SWE-Bench |
| Gemini 2.5 Pro (Google) | 2025.06 | 84.0% | 多模态能力强,原生 1M+ token 上下文 |
| Claude Opus 4.1 (Anthropic) | 2025.08 | 83.3% | 安全对齐领先,混合推理(快速 ↔ 深度思考切换 |
| DeepSeek-R1 | 2025.01 | 71.5% | 开源最强推理,成本仅为闭源模型零头 |
| 人类 PhD 基线 | — | ~65% | — |
2.总结:NLP 发展的核心脉络
| 维度 | 规则方法 | 统计方法 | 神经网络 | 大语言模型 (LLM) |
|---|---|---|---|---|
| 核心原理 | 手工规则 + 形式逻辑 | 概率统计 + 数据驱动 | 分布式表示 + 深度学习 | 大规模预训练 + 人类对齐 |
| 知识表示 | 符号组合 | 稀疏统计特征 | 稠密向量 / 上下文表示 | 上下文嵌入 / 思维链 / 工具使用 |
| 泛化能力 | 极弱(有限领域) | 有限(N-gram 窗口) | 强(预训练迁移) | 极强(零样本/少样本/涌现) |
| 数据需求 | 专家规则 | 标注语料 | 海量文本 | 互联网级语料 + 人类偏好 |
| 关键局限 | 脆弱、覆盖窄 | 稀疏、无深层理解 | 计算成本高、可解释性差 | 幻觉、推理成本极高、安全对齐 |
| 代表模型 | ELIZA, SHRDLU | SMT, CRF | Word2Vec, LSTM, Transformer | GPT-5, Claude, DeepSeek, Gemini |
贯穿始终的核心洞察
“一个词的完整意义总是依赖于语境” ——这一语言学洞见,从 Word2Vec 的词向量,到 Transformer 的自注意力,再到大规模预训练与人类偏好对齐,驱动了 NLP 每一个阶段的突破。
符号AI → 统计NLP → 词向量 → RNN/LSTM → Attention → Transformer → 预训练 → LLM对齐 → 推理时代
│ │ │ │ │ │ │ │ │
│ │ │ │ │ │ │ │ │
手工规则 数据驱动 稠密表示 序列记忆 动态聚焦 并行计算 涌现能力 人类对齐 Agent+Reasoning
3.关键术语 Glossary
| 术语 | 解释 |
|---|---|
| One-hot encoding | 稀疏向量表示,V 维中只有一维为 1,其余为 0 |
| Distributional Semantics | “一个词的意义由其上下文决定” (Firth, 1957) |
| Word Embedding | 词的稠密实数向量表示 |
| Word2Vec | Mikolov 等人提出的词向量学习框架 (2013) |
| Skip-gram | 用中心词预测上下文词的 Word2Vec 架构 |
| Softmax | 将任意实数向量映射为概率分布的函数 |
| N-gram | 连续的 N 个词的序列 |
| BLEU | 机器翻译的自动评估指标 |
| Treebank | 人工标注句法结构的语料库 |
| Self-Attention | 序列中每个位置与其他所有位置直接交互的机制 |
| RLHF | 基于人类反馈的强化学习 |
| DPO | 直接偏好优化,RLHF 的简化替代方案 |
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)