神经网络原理 第十二章:神经动态规划
一、 简介 (12.1节)
神经动态规划 是神经网络无教师学习部分的压轴章节,它标志着神经网络从单纯的模式识别或聚类工具,走向了序贯决策 这一人工智能的核心领域。
本章的核心任务是:将动态规划的数学严谨性与强化学习的试错探索机制相结合,并利用神经网络作为函数逼近器,解决传统动态规划无法处理的“维数灾”问题。重点探讨Markov决策过程、Bellman最优准则以及Q-学习 等核心算法。
通俗理解:如果把人生比作一系列选择,动态规划就像是拥有“上帝视角”的预言家,它能计算出每一步的最优解,但前提是它必须精确知道世界的所有规则(模型已知)。而神经动态规划则是一个在迷雾中摸索的探险家,它没有完整地图,只能通过“尝试-反馈”(奖励/惩罚)来学习。神经网络在这里扮演的角色就是探险家的“经验总结本”,当状态空间太大(维数灾)写不下时,神经网络负责提炼规律,预测未来的价值,从而做出明智决策。
二、 Markov决策过程 (12.2节)
这是描述序贯决策问题的数学框架。
💡 核心概念通俗讲解
MDP由五个要素定义:(S,A,P,R,γ)
- 状态集 S:环境当前的状况(如棋盘布局、机器人位置)。
- 动作集 A:智能体可以采取的操作(如走棋、前进)。
- 转移概率 P:采取动作后,环境转移到下一状态的概率。Markov性意味着“未来只与现在有关,与过去无关”。
- 奖励函数 R:采取动作后获得的即时回报(吃子得分、避障成功)。
- 折扣因子 γ:衡量未来奖励相对于即时奖励的重要性。γ 接近 1 表示远视,接近 0 表示短视。
通俗讲解:MDP就是一套游戏规则。状态是“我现在在哪”,动作是“我能干什么”,转移概率是“我这么干之后世界会怎么变”,奖励是“我得了多少分”,折扣因子是“我是要眼前的肉还是未来的大餐”。
三、 Bellman最优准则与方程 (12.3节)
这是动态规划的灵魂,定义了“什么是好的决策”。
💡 栰心思想通俗讲解
Bellman方程的核心思想是最优性原理:一个最优策略的任何子策略也必须是最优的。
状态价值函数 V(s):从状态 s 出发,遵循最优策略,预期能获得的累积奖励。
V∗(s)=maxa[R(s,a)+γ∑s′P(s′∣s,a)V∗(s′)]
通俗讲解:你现在有多“值钱”(价值),取决于两点:1. 你现在采取什么行动能立刻拿到多少奖励 R;2. 你到了下一步之后,那个新状态有多“值钱”。Bellman方程就是一把连接“现在”与“未来”的锁链,它把复杂的序列决策问题分解为“当前选择+后续价值”的递归结构。
四、 动态规划方法 (12.4-12.5节)
在已知环境模型(P,R)的情况下,求解Bellman方程的两种经典方法。
💡 核心算法通俗讲解
- 策略迭代:
- 步骤:评估当前策略的价值 -> 根据价值改进策略 -> 再评估 -> 再改进,循环直到收敛。
- 通俗讲解:这就像练车。先假设一种开车习惯(策略),开一段路看看效果(评估),然后针对弯道改进操作(改进),再用新习惯开,直到技术完美。
- 值迭代:
- 步骤:不需要显式提取策略,直接反复利用Bellman方程迭代更新每个状态的价值,直到价值函数不再变化,再从最终价值推导策略。
- 通俗讲解:这是一种更“功利”的方法。不管什么策略,我就盯着每个位置的价值表不断更新,谁的价值高我就流向谁,最后价值表稳定了,最优路线自然就出来了。
五、 神经动态规划 (12.6-12.7节)
本章的核心亮点,解决“维数灾”。
💡 核心思想通俗讲解
问题:当状态空间巨大或连续时(如国际象棋、自动驾驶),无法存储所有状态的值 V(s)(表格法失效)。
解决方案(神经动态规划):使用神经网络作为函数逼近器,用参数 w 来近似价值函数 V(s)≈V(s;w) 或动作价值函数 Q(s,a)≈Q(s,a;w)。
通俗讲解:传统的动态规划是在写一本厚厚的“全宇宙价值百科全书”,这显然不可能。神经动态规划则是训练一个“聪明的预言家”(神经网络),你给它一个状态,它通过泛化能力直接“猜”出这个状态的价值。虽然可能不如百科全书精确,但它能处理无限大的世界,而且学一反三。
逼近策略迭代:将策略迭代中的“评估”步骤用神经网络逼近,从而在复杂环境中高效求解。
六、 Q-学习 (12.8节)
一种无模型 的强化学习算法,也是神经动态规划的重要实现。
💡 核心算法通俗讲解
Q-学习直接学习最优的动作价值函数 Q∗(s,a),而不需要知道环境的转移概率 P。
更新规则:在状态 s 采取动作 a,观察到奖励 r 和下一状态 s′ 后:
Q(s,a)←Q(s,a)+α[r+γmaxa′Q(s′,a′)−Q(s,a)]
通俗讲解:Q-学习就像是边玩边改的“攻略”。你在某个路口(状态)选了一条路(动作),走完后发现有个宝箱(奖励),并且根据地图知道下一个路口的攻略评级(maxQ(s′,a′))。你据此修改当前路口这条路的评级(更新Q值)。只要不断探索,Q值最终会收敛到最优策略。当结合神经网络时(如DQN),就是用神经网络来拟合Q表,这就是现代深度强化学习的起点。
七、 小结与讨论 (12.10节)
神经动态规划的核心价值:
- 突破维数灾:利用神经网络的泛化能力,将动态规划从有限离散状态解放到高维连续状态。
- 连接规划与学习:融合了动态规划的最优性逻辑和强化学习的无模型探索能力。
- 序贯决策的基石:为机器人控制、游戏AI(如AlphaGo)、资源调度等复杂决策问题提供了理论基础。
启示:本章展示了智能不仅仅是识别模式,更是在复杂环境中通过行动最大化长期收益。神经动态规划赋予了神经网络“思考未来”的能力。
🗺️ 第十二章知识全景脑图
<code>mindmap
root((神经网络原理<br/>第十二章 神经动态规划))
简介(12.1)
序贯决策问题
动态规划+强化学习
解决维数灾
Markov决策过程 MDP(12.2)
状态S, 动作A
转移概率P
奖励函数R
折扣因子γ
Markov性(无记忆)
Bellman最优准则(12.3)
最优性原理
状态价值函数V(s)
动作价值函数Q(s,a)
连接现在与未来
动态规划方法(12.4-12.5)
策略迭代
评估策略 -> 改进策略
值迭代
反复更新价值 -> 推导策略
局限(维数灾)
神经动态规划 NDP(12.6-12.7)
函数逼近器(神经网络)
V(s; w) ≈ V*(s)
逼近策略迭代
泛化能力
Q-学习(12.8)
无模型学习
异策略
更新规则 TD Target
深度Q网络(DQN)的雏形
小结(12.10)
价值(突破维数灾, 智能决策)
应用(机器人, 游戏AI, 控制)
</code>
📐 第十二章核心公式通俗讲解
1. Bellman最优方程
V∗(s)=maxa[R(s,a)+γ∑s′P(s′∣s,a)V∗(s′)]
讲解:这是“最优决策的数学定义”。V∗(s) 是状态 s 的“黄金价值”。它由两部分组成:当前动作带来的即时快乐 R(s,a),加上未来所有可能性的折扣总和。“加号”体现了短期与长期的权衡,“max”体现了决策者的智慧——在所有选项中选最好的。
2. 值迭代更新
Vk+1(s)←maxa[R(s,a)+γ∑s′P(s′∣s,a)Vk(s′)]
讲解:这是“价值传播”的过程。第 k+1 步的价值,是由第 k 步的后续状态价值计算得出的。就像水波纹一样,有价值的信息从终点(目标状态)一步步向起始状态传播,最终每个状态都照亮了自己的价值。
3. Q-学习更新规则
Q(s,a)←Q(s,a)+α[r+γmaxa′Q(s′,a′)−Q(s,a)]
讲解:
- r+γmaxa′Q(s′,a′):这是TD目标,即“我实际体验到的奖励 + 我对未来最好的估计”。这是智能体的“新认知”。
- r+γmaxa′Q(s′,a′)−Q(s,a):这是TD误差,即“新认知”与“旧认知”的差距。如果差距为正,说明这次体验比预期好,要抬高这个动作的Q值;反之则压低。
- α:学习率,控制你多快相信这次体验。 这个公式是强化学习最伟大的遗产之一,它证明了无需上帝视角(模型),仅凭试错和时空差分,也能找到最优策略。
💡 第十二章学习要点:
本章是无教师学习从“特征提取”向“决策智能”的跃迁。重点掌握:
- MDP框架的五个要素,理解Markov性为何是简化问题的关键。
- Bellman方程的核心思想,它是所有动态规划和强化学习算法的“公理”。
- 神经动态规划为何诞生——解决维数灾,理解神经网络作为函数逼近器 在强化学习中的角色。
- Q-学习的更新逻辑,特别是TD误差的物理意义,这是理解现代DRL(Deep Reinforcement Learning)的关键。
通过第十二章,我们看到了神经网络如何从“被动观察数据”的感知器,进化为“主动在环境中试错学习”的智能体,这标志着向通用人工智能迈出了坚实的一步。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)