深度学习概述知识点讲解

知识导图

深度学习概述
├── 基础认知
│   ├── AI/ML/DL的层级关系
│   ├── 深度学习的核心概念
│   └── 深度学习的优缺点
├── 发展历程
│   ├── 四次技术浪潮:符号/统计/神经网络/预训练
│   └── 关键里程碑事件
└── 相关工具与模型
    ├── 主流框架:TensorFlow/PyTorch/Paddle/ONNX
    └── 主流模型:CNN/RNN/Transformer/GAN等

核心名词解释

  • 人工智能 (AI):最广泛的概念,指使机器能够模拟人类智能行为的技术和研究领域,涵盖理解语言、识别图像、解决问题等能力。

  • 机器学习 (ML):实现人工智能的一种方法,让计算机从数据中学习改进,不需要显式编程,包含 KNN、回归、决策树、聚类等多种算法。

  • 深度学习 (DL):机器学习的一个分支,使用深层神经网络从数据中自动提取特征,特别适合处理高维的大规模数据。

  • 反向传播 (BP):神经网络的优化算法,通过梯度下降来更新网络的参数,让多层神经网络可以训练复杂的非线性问题。

  • 卷积神经网络 (CNN):专门处理空间结构数据的深度学习模型,擅长图像、视频类的任务。

  • 循环神经网络 (RNN):处理序列数据的模型,适合时间序列、语音、文本这类带有序列关系的数据。

  • Transformer:基于自注意力机制的架构,是当前 NLP 领域的核心架构,支撑了 BERT、GPT 等大模型。

  • 生成对抗网络 (GAN):通过生成器和判别器的对抗训练,来生成逼真的数据,常用于图像生成、数据增强。

  • PyTorch:Meta 推出的深度学习框架,动态图,Python 友好,是学术界的主流框架。

  • TensorFlow:Google 推出的深度学习框架,静态图,分布式能力强,适合工程部署。

  • PaddlePaddle:百度推出的国产深度学习框架,功能完善,适合国内开发者。

  • ONNX:开源的模型格式,用来在不同的框架之间转换模型,是框架之间的中间件。


一、深度学习基础认知

本章节学习目标:

  • 知道什么是深度学习

  • 了解深度学习发展史

1.1 AI、ML、DL 的关系

这三个是包含的层级关系:

  1. 人工智能(AI, Artificial Intelligence):最广泛的概念,指的是使机器能够模拟人类智能行为的技术和研究领域。AI 包括理解语言、识别图像、解决问题等各种能力。

  2. 机器学习(ML, Machine Learning):机器学习是实现人工智能的一种方法。它涉及到算法和统计模型的使用,使得计算机系统能够从数据中 “学习” 和改进任务的执行,而不是通过明确的编程来实现。

  3. 深度学习(DL, Deep Learning):深度学习是机器学习中的一种特殊方法,它使用称为神经网络的复杂结构,特别是 “深层” 的神经网络,来学习和做出预测。深度学习特别适合处理大规模和高维度的数据,如图像、声音和文本。

在这里插入图片描述

1.2 深度学习的概念

传统机器学习算术依赖人工设计特征,并进行特征提取,而深度学习方法不需要人工,而是依赖算法自动提取特征。
深度学习模仿人类大脑的运行方式,从经验中学习获取知识。这也是深度学习被看做黑盒子,可解释性差的原因。
深度学习尤其擅长处理高维数据,如图像和文本。

在这里插入图片描述

1.3 深度学习的优缺点

优点
  1. 精度高,性能优于其他的机器学习算法,甚至在某些领域超过了人类

  2. 随着计算机硬件的发展,可以近似任意的非线性函数

  3. 近年来在学界和业界受到了热捧,有大量的框架和库可供调用

缺点
  1. 黑箱,很难解释模型是怎么工作的

  2. 训练时间长,需要大量的计算资源

  3. 网络结构复杂,需要调整超参数多

  4. 部分数据集上表现不佳,容易发生过拟合


二、深度学习的发展历程

深度学习的发展经历了四次技术浪潮:

  1. 符号主义(20 世纪 50-70):专家系统占主导

  2. 统计主义(20 世纪 80-2000):主要用统计模型解决问题

  3. 神经网络(21 世纪初期):神经网络、深度学习流派开始复兴

  4. 大规模预训练模型(2017 - 至今):大模型、AIGC、智能体的时代

关键的里程碑事件:

  • 1943: 提出了 McCulloch-Pitts 神经元模型,人工神经网络的开创性工作

  • 1950:图灵设计国际象棋程序

  • 1956: 达特茅斯会议,首次提出了 “人工智能” 这一术语

  • 1957: 提出单层感知器概念

  • 1962: IBM 的跳棋程序战胜人类高手,第一次 AI 浪潮

  • 1986: 反向传播算法的研究成果,解决了多层神经网络的训练问题

  • 1997: IBM 深蓝战胜卡斯帕罗夫,第二次 AI 浪潮

  • 2006: 深度置信网络提出,深度学习的复兴

  • 2012: AlexNet 在 ImageNet 挑战赛取得成功,引爆深度学习革命

  • 2016: AlphaGO 战胜李世石,第三次 AI 浪潮

  • 2017: Transformer 框架出现

  • 2018: BERT 和 GPT 出现

  • 2022: ChatGPT 出现,进入大模型 AIGC 时代

  • 2023: 大模型技术突破,引发全球热潮

  • 2024: AI 应用大规模落地,硬件与场景深度融合

  • 2025: 开启智能体时代,AI 自主性提升


三、主流深度学习框架

框架对比辨析

框架 推出方 核心特点 适用场景 评价
PyTorch Meta
(Facebook)
动态图,
Python 友好,
上手简单
学术研究 入门快,学术界的霸主,顶会论文首选
TensorFlow Google 静态图,
分布式能力强,
部署方便
工程部署 工程友好,部署能力强,学术界市场逐渐被 PyTorch 抢占
PaddlePaddle 百度 国产框架,
API 完善,
工具丰富
国内开发者 中文教程多,工具链完善,适合国内用户
ONNX 多厂商联合 模型转换中间件 跨框架模型转换 不用刻意学习,用到的时候再了解即可

各框架的详细介绍

  1. TensorFlow
    Google 开发的开源库,专为深度学习设计,支持多语言,可部署在不同设备上,还支持 TensorBoard 可视化。

  2. Pytorch
    Meta 的框架,前身是 Torch,支持动态图,Python 优先,GPU 加速,上手简单,是现在学术界的主流,大部分顶会论文都用它实现。

  3. PaddlePaddle
    百度推出的国产框架,支持动态图和静态图,有丰富的工具包,还有专门的可视化工具,对国内开发者非常友好。

  4. ONNX
    开放式的模型格式,用来在不同的框架之间转换模型,相当于一个中间件,实现 “万物先转 ONNX,ONNX 再转万物”。


四、主流深度学习模型

模型类型 核心能力 适用场景
卷积神经网络(CNN) 处理空间结构数据 图像识别、视频分析、医学影像
循环神经网络(RNN) 处理序列的动态性 时间序列、语音识别、自然语言处理
Transformer 自注意力机制,处理长序列 自然语言理解与生成,大模型的基础
自编码器 特征学习与降维 数据降维、去噪、异常检测
生成对抗网络(GANs) 对抗生成数据 图像生成、艺术创作、数据增强

各个模型的详细介绍:

  1. 卷积神经网络(CNN):适用于图像识别、视频分析、医学影像等,特别擅长处理带有空间关系的数据。

  2. 循环神经网络(RNN):及其变体 LSTM、GRU,适用于时间序列数据处理,如语音识别、音乐生成、自然语言处理,能够处理序列数据中的时间动态性。

  3. Transformer 架构:引领自然语言处理的新浪潮,比如 BERT、GPT 系列,适用于复杂的语言理解和生成任务。

  4. 自编码器(Autoencoders):用于数据降维、去噪、特征学习等,在异常检测和数据生成中也有应用。

  5. 生成对抗网络(GANs):用于图像生成、艺术创作、数据增强等,擅长生成逼真的图像和视频。


Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐