Week 1: 深度学习:监督学习中的回归与偏差-方差分析
1 绪论
本周学习了李宏毅老师机器学习课程的前四讲,根据本科数学分析中的函数分析方法进行机器学习整体概览回归案例分析(以宝可梦 CP 值预测为例)以及详解误差来源分析与模型选择(偏差与方差)
2 主要内容
1). 机器学习本质与分类
机器学习可以视为寻找一个函数 ,将输入
映射到输出
。根据训练数据的不同,分为:
· 监督学习(有标注数据,如回归、分类)
· 半监督学习(少量标注 + 大量未标注)
· 迁移学习(利用源领域知识解决目标领域问题)
· 无监督学习(无标注,如聚类、降维)
· 强化学习(通过奖励机制学习策略)
2). 回归案例:宝可梦 CP 值预测
1. 模型选择:初始采用线性模型
后续尝试多项式(二次、三次等)以捕捉非线性关系。
2. 定义损失函数:使用均方误差
衡量模型好坏。
3. 优化:通过梯度下降找到 ,
使损失最小。观察到模型复杂度提高时,训练误差持续下降,但测试误差先降后升,引出过拟合问题。
3). 梯度下降细节
· 基本更新式:
学习率 是关键。
· Adagrad:自适应学习率,用历史梯度的均方根缩放,公式大致为
缓解了需手动调学习率的问题。
· 随机梯度下降 (SGD):每次用一个样本更新,速度快但震荡大;后续会自然过渡到 mini-batch。
· 特征缩放:将不同特征的尺度统一,使梯度下降路径更平滑,收敛更快。
· 理论补充:梯度下降每一步实际是在当前点的邻域内用泰勒展开做一阶近似,寻找下降最快的方向。
4). 误差来源
同一模型在不同训练集上得到的 不同,其期望
与真实
的差距可分解:
· 偏差 (Bias): 与真实值的差距,反映模型拟合能力不足。
· 方差 (Variance): 本身的离散程度,反映模型对数据扰动的敏感性。
· 诊断方法:
· 高偏差(欠拟合):训练误差高,测试误差也高 → 增大模型复杂度,增加特征,减少正则化。
· 高方差(过拟合):训练误差低,测试误差高 → 增加数据量,正则化,使用早停或集成(如 Bagging)。
3 总结
本周建立起“训练-验证-测试”的严谨评估思维,并与本科学习内容进行连接,运用函数进行偏差与方差的权衡,在模型调优时极具指导意义。对梯度下降的认识从“黑盒优化器”深入到自适应学习率和特征缩放的原理,为后续更复杂的优化器打下基础。对本节提出疑问:多项式回归中,除了增加高次项,是否可以通过数据变换(如 log)来降低模型复杂度?下周计划学习第五讲分类与逻辑回归。主要内容为推导交叉熵损失与 softmax 的关系,并尝试用代码复现分类任务。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)