自然语言处理的历史与介绍

每个词的选择、语调、时机都承载着无数信号,而听者以独特的方式解读这些信号。

NLP 简史:从规则到 Transformer

1960s              1980s              2010s              2017              2022+
  | 符号/规则系统     | 统计方法          | 神经网络          | Transformer      | LLM 时代
  | Symbolic AI      | Statistical NLP  | Neural NLP       | Self-Attention   | ChatGPT, GPT-5

1.1 第一阶段: 规则方法与符号系统(1960s–2010s)

核心理念

认为智能 = 符号处理。语言被视为一套形式符号系统,可以通过手工编写的规则来理解。

关键人物与里程碑

人物 贡献
John McCarthy 提出"人工智能"概念,希望构建类似数学和逻辑的 AI
Newell & Simon 物理符号系统假说:物理符号系统是产生通用智能行为的充分必要条件
Richard Montague 构建自然语言的形式语义学,以组合性原则推导句子意义

典型技术:语义解析 (Semantic Parsing)

句子 → 句法解析 → 查词典获取词义 → 组合推导短语意义 → 句子意义表示

核心局限

这些系统总是极其脆弱,只能在极其有限的领域内工作。

  • 覆盖率低:手工写规则永远追不上语言的变化

  • 歧义问题:无法处理自然语言中的大量歧义

  • 无法扩展:每新增一个领域需要重新编写规则

1.2 第二阶段:统计方法(1980s–2010s)

核心理念

从数据中学习,而非手工编写规则。

1980 年代末开始,领域从规则转向数据驱动的方法:人工标注大量句子的句法结构(构建树库 Treebank),然后训练统计/机器学习模型。

代表性技术

技术 用途
N-gram 语言模型 基于前 N-1 个词预测下一个词
HMM (隐马尔可夫模型) 词性标注 (POS Tagging)
CRF (条件随机场) 命名实体识别 (NER)
TF-IDF 文档表示与检索
统计机器翻译 (SMT) IBM Models, 基于短语的翻译

关键工具:BLEU 评估指标

机器翻译最常用的自动评估指标,基于 N-gram 重叠计算分数。

核心局限

N-gram 模型本质上是"记忆和检索固定的词组",存在三个根本问题:

  1. 稀疏性问题 (Sparsity)

    • N 增大 → N-gram 数量指数增长

    • 大量序列从未出现 → 概率估计为 0

    • 即使使用平滑 (smoothing) 和回退 (back-off),问题仍然存在

  2. 上下文有限

    • 只能看固定窗口(通常 N=3~5)

    • 长距离依赖完全丢失

  3. 缺乏深层理解

    • 无法捕捉词与词之间的语义关系

    • “hotel” 和 “motel” 在 N-gram 模型中毫无关联

1.3 神经网络方法(2010s 至今)

阶段一:词向量突破 — Word2Vec (2013)

Tomas Mikolov 等人提出 Word2Vec,核心突破:

  • 词义由上下文决定 → 分布语义学 (Distributional Semantics)

  • 每个词被表示为 稠密实数向量(如 300 维),而非稀疏的 one-hot

  • 语义相近的词在向量空间中距离更近

经典例子:king − man + woman ≈ queen

这展示了词向量空间中的线性语义关系

两种架构:

  • CBOW: 用上下文词预测中心词

  • Skip-gram: 用中心词预测上下文词

目标函数 (Skip-gram):

J(θ)=−1T∑t=1T∑−m≤j≤mj≠0log⁡P(wt+j∣wt;θ)J(\theta) = -\frac{1}{T} \sum_{t=1}^{T} \sum_{\substack{-m \leq j \leq m \\ j \neq 0}} \log P(w_{t+j} \mid w_t; \theta)J(θ)=T1t=1Tmjmj=0logP(wt+jwt;θ)

Softmax 概率:

P(o∣c)=exp⁡(uoTvc)∑w∈Vexp⁡(uwTvc)P(o \mid c) = \frac{\exp(u_o^T v_c)}{\sum_{w \in V} \exp(u_w^T v_c)}P(oc)=wVexp(uwTvc)exp(uoTvc); 这里的exp为指数函数exe^xex

每个词有两个向量vwv_wvw(作为中心词)和 uwu_wuw(作为上下文词)。

梯度直觉

∇vclog⁡P(o∣c)=uo−∑x∈VP(x∣c)⋅ux\nabla_{v_c} \log P(o|c) = u_o - \sum_{x \in V} P(x|c) \cdot u_xvclogP(oc)=uoxVP(xc)ux

= 观测到的 − 期望的 (observed − expected)

阶段二:循环神经网络 RNN / LSTM

RNN 的贡献

  • 引入隐藏状态 (hidden state) 作为"记忆"

  • 处理变长序列,参数跨时间共享

LSTM 的突破 (Hochreiter & Schmidhuber):

通过细胞状态 (cell state) 和门控机制 (gate mechanism) 解决梯度消失问题

$ f_t = \sigma(W_f \cdot [h_{t-1}, x_t] + b_f) \quad \text{(遗忘门)} $

it=σ(Wi⋅[ht−1,xt]+bi)(输入门)i_t = \sigma(W_i \cdot [h_{t-1}, x_t] + b_i) \quad \text{(输入门)}it=σ(Wi[ht1,xt]+bi)(输入门)

ot=σ(Wo⋅[ht−1,xt]+bo)(输出门)o_t = \sigma(W_o \cdot [h_{t-1}, x_t] + b_o) \quad \text{(输出门)}ot=σ(Wo[ht1,xt]+bo)(输出门)

Ct=ft⊙Ct−1+it⊙C~t(细胞状态更新)C_t = f_t \odot C_{t-1} + i_t \odot \tilde{C}_t \quad \text{(细胞状态更新)}Ct=ftCt1+itC~t(细胞状态更新)

神经机器翻译 (NMT) 革命 (2014)

翻译质量迅速超越耕耘了数十年的统计机器翻译系统——这是深度学习在 NLP 领域的第一个重大成功案例

RNN 的核心局限

  • 线性交互距离:信息需要经过 O(序列长度) 步才能传播

  • 不可并行化:前向/反向传播具有 O(序列长度) 的串行操作

  • 梯度消失/爆炸:长序列中梯度信号衰减或爆炸


阶段三:注意力机制 Attention (2015)

核心思想 (Bahdanau et al., 2015):

解码器生成每个词时,动态"查看"编码器所有隐藏状态,选取最相关信息

  • 解决了长序列信息压缩的瓶颈问题

  • 提供了可解释性:可以可视化模型在"看"哪里


阶段四:Transformer 架构 (2017)

现代自然语言处理乃至更广泛人工智能领域大多数进展的基础

Vaswani 等人的论文 “Attention Is All You Need” 引入了全新架构:

核心组件 作用
自注意力 (Self-Attention) 序列中每个词与所有词直接交互,O(1) 步建立任意距离联系
多头注意力 (Multi-Head Attention) 不同表示子空间中并行关注序列不同部分
缩放点积注意力 Attention(Q,K,V)=softmax(QKTdk)V\text{Attention}(Q,K,V) = \text{softmax}(\frac{QK^T}{\sqrt{d_k}})VAttention(Q,K,V)=softmax(dk QKT)V
残差连接 + 层归一化 缓解梯度消失,加速收敛
位置编码 (Positional Encoding) 补充序列顺序信息(因为自注意力本身不感知位置)

三种架构变体:

变体 特点 代表模型
Transformer Encoder 双向注意力 BERT
Transformer Decoder 自回归(因果注意力) GPT 系列
Transformer Encoder-Decoder 序列到序列 T5, 原始 Transformer

Transformer 的挑战

自注意力计算复杂度为 O(n2)O(n^2)O(n2),处理长文档是核心瓶颈。


阶段五:预训练革命 Pretraining (2018 至今)

模型 年份 方法 关键贡献
BERT 2018 掩码语言建模 (MLM) + 下一句预测 双向上下文理解,刷新多项基准
GPT-2 2019 自回归语言建模 展示 zero-shot 能力
GPT-3 2020 自回归 + 1750 亿参数 涌现能力:上下文学习、思维链推理
T5 2020 跨度损坏预训练 统一的 text-to-text 框架
RoBERT 2019 改进的 MLM 证明仅 MLM + 更长训练就足够好

缩放定律 (Scaling Laws)

模型性能随参数量、训练数据量、计算量的增加而可预测地提升

Chinchilla 模型表明三者的增长需要平衡

GPT-3 的涌现能力

  • 上下文学习 (In-Context Learning):仅通过提示中的示例即可执行新任务

  • 思维链 (Chain-of-Thought):生成推理步骤显著提升复杂推理准确性


阶段六:对齐与后训练 Alignment (2022 至今)

RLHF (基于人类反馈的强化学习) — ChatGPT 核心技术

Step 1: 监督微调 (SFT) → 在高质量人类回答上微调
Step 2: 奖励模型 (RM) → 训练模型学习人类偏好排序
Step 3: PPO 强化学习 → 用奖励模型优化策略,加 KL 散度约束防止跑偏

DPO (直接偏好优化, Rafailov et al., 2023)

将偏好优化转化为简单的分类损失,实现简单、计算高效、效果与 RLHF 相当。

DPO 已成为众多开源和生产模型的首选方法。


阶段七:前沿模型与最新突破 (2024–2026)

2024–2025 年是 AI 从实验技术转向基础设施的分水岭,推理模型 (reasoning models) 和智能体 (agentic AI) 成为核心主题。

DeepSeek-R1 推理突破:

  • R1-Zero:在 V3-Base 上用纯 RL(无 SFT) 训练,仅依赖答案正确性 + 格式合规两个奖励信号

  • 自主涌现:反思 (self-reflection)、验证 (verification)、多步检查等复杂推理行为

  • AIME 2024 准确率:15.6% → 71.0%(纯 RL)→ 86.7%(多数投票)

  • GRPO (Group Relative Policy Optimization):去除 Critic 模型,计算量从 O(2N) 降至 O(N),显存减少 ~40%

2025 年主要前沿模型

模型 发布 GPQA 得分 核心特点
GPT-5 (OpenAI) 2025.08 89.4% 统一通用 + 推理能力,~3.5-4T 参数,400K 上下文
Grok-4 (xAI) 2025.07 88.9% Colossus H100 集群训练,72-75% SWE-Bench
Gemini 2.5 Pro (Google) 2025.06 84.0% 多模态能力强,原生 1M+ token 上下文
Claude Opus 4.1 (Anthropic) 2025.08 83.3% 安全对齐领先,混合推理(快速 ↔ 深度思考切换
DeepSeek-R1 2025.01 71.5% 开源最强推理,成本仅为闭源模型零头
人类 PhD 基线 ~65%

2.总结:NLP 发展的核心脉络

维度 规则方法 统计方法 神经网络 大语言模型 (LLM)
核心原理 手工规则 + 形式逻辑 概率统计 + 数据驱动 分布式表示 + 深度学习 大规模预训练 + 人类对齐
知识表示 符号组合 稀疏统计特征 稠密向量 / 上下文表示 上下文嵌入 / 思维链 / 工具使用
泛化能力 极弱(有限领域) 有限(N-gram 窗口) 强(预训练迁移) 极强(零样本/少样本/涌现)
数据需求 专家规则 标注语料 海量文本 互联网级语料 + 人类偏好
关键局限 脆弱、覆盖窄 稀疏、无深层理解 计算成本高、可解释性差 幻觉、推理成本极高、安全对齐
代表模型 ELIZA, SHRDLU SMT, CRF Word2Vec, LSTM, Transformer GPT-5, Claude, DeepSeek, Gemini

贯穿始终的核心洞察

“一个词的完整意义总是依赖于语境” ——这一语言学洞见,从 Word2Vec 的词向量,到 Transformer 的自注意力,再到大规模预训练与人类偏好对齐,驱动了 NLP 每一个阶段的突破。

符号AI → 统计NLP → 词向量 → RNN/LSTM → Attention → Transformer → 预训练 → LLM对齐 → 推理时代
  │         │         │         │          │           │           │          │          │
  │         │         │         │          │           │           │          │          │
手工规则   数据驱动   稠密表示  序列记忆   动态聚焦    并行计算    涌现能力   人类对齐   Agent+Reasoning

3.关键术语 Glossary

术语 解释
One-hot encoding 稀疏向量表示,V 维中只有一维为 1,其余为 0
Distributional Semantics “一个词的意义由其上下文决定” (Firth, 1957)
Word Embedding 词的稠密实数向量表示
Word2Vec Mikolov 等人提出的词向量学习框架 (2013)
Skip-gram 用中心词预测上下文词的 Word2Vec 架构
Softmax 将任意实数向量映射为概率分布的函数
N-gram 连续的 N 个词的序列
BLEU 机器翻译的自动评估指标
Treebank 人工标注句法结构的语料库
Self-Attention 序列中每个位置与其他所有位置直接交互的机制
RLHF 基于人类反馈的强化学习
DPO 直接偏好优化,RLHF 的简化替代方案
Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐