登录社区云,与社区用户共同成长
邀请您加入社区
auto-sklearn 把自动化机器学习的能力封装在 sklearn 风格的接口里,从 scikit-learn 切换过来的成本很低。几行代码的改变,换来的是模型选择和参数调优环节的自动化。这套方案在 NeurIPS 2015 上发表过论文,auto-sklearn 也是学术界和工业界认可度较高的 AutoML 方案之一。用户只需要准备好训练数据和标签,调用 fit 方法,系统会在后台自动搜索最
预处理 + 模型 + 调参 + 评估 全部自动化。输出:准确率、精确率、召回率、F1、混淆矩阵。,你可以把它当成 KNN、随机森林直接用。,直接套 Pipeline 就行!所有模型评估、交叉验证代码。
是微软开源的另一个王牌算法。它的底层原理和 XGBoost 完全一样,都是让多棵树接力去学习不正确的部分(残差)。但微软当年在开发它时,心里憋着一个大招。他们觉得 XGBoost 性能好是好,但在处理时,。于是,微软对树模型的建树过程进行了大刀阔斧的“偷懒式”改造。LightGBM 之所以能做到“又快又准”
线性回归是机器学习中最基础、最经典的监督学习算法,也是新手入门机器学习的首选算法。它的核心思想是通过拟合一条直线 / 超平面,来描述自变量和因变量之间的线性关系,既可以用于预测连续数值,也能分析变量间的关联规律。scikit-learn(简称 sklearn)是 Python 中最常用的机器学习库,封装了完善的线性回归算法接口,无需手动实现复杂数学计算,只需几行代码就能完成模型训练、预测和评估。专
机器学习是智能体从数据中自动学习知识的一种人工智能方法。其目标是从原始数据中提取特征,学习一个映射函数fff将特征映射到语义空间,寻找数据和任务目标之间的关系。机器学习通常分为三大类:此外,介于监督学习和无监督学习之间还有半监督学习,它依赖于少量标注数据和大量未标注数据。监督学习从标注数据出发,学习一个映射函数 fff。模型的预测结果 f(xi)f(x_i)f(xi) 与真实值 yiy_iyi
在机器学习众多经典算法中,K 近邻算法(KNN,K-Nearest Neighbors) 是最简单、最容易理解且实用性极强的惰性监督学习算法。它无需复杂的模型训练过程,核心逻辑源于生活常识:物以类聚,人以群分。无论是分类任务还是回归任务,KNN 都能快速上手实现,常作为机器学习初学者入门的第一个实战算法。KNN(K-Nearest Neighbors,K 最近邻)是一种基础且常用的机器学习算法,可
如果你写带随机行为的工具函数,强烈建议用它统一处理种子# 标准化处理随机种子# 使用返回的 rng 生成随机数# 调用:传整数 → 可复现作用:统一校验随机数种子,返回标准实例,保证随机性可复现。输入:支持None/ 非负整数 /实例。使用:自定义随机函数、调用 sklearn 模型时都可以用,是实现可复现实验的核心工具。优势:安全、无副作用、兼容 sklearn 全生态。两个导入路径,指向同一个
本文通过一个辣椒酱购买决策案例,演示了逻辑回归算法的实际应用。基于24名顾客的辣度和保质期调查数据,构建了二分类模型,分析结果显示:辣度对购买意愿有负向影响(-0.712),保质期有正向影响(0.624)。模型在测试集上达到75%准确率,预测当辣度为3、保质期为7时,顾客会购买该产品。研究通过可视化决策边界,直观展示了分类结果,验证了逻辑回归在二分类问题中的有效性。案例还对比了回归与分类问题的差异
前言 学数据挖掘,光看理论不够,必须动手跑项目。但很多初学者卡在没有数据、没有完整案例上。 这篇文章分享一个完整可运行的数据挖掘项目,包含代码、数据、运行结果。即使你零基础,跟着跑一遍也能理解数据挖掘的全流程。 声明:本文使用的数据是模拟生成的,目的是演示数据挖掘的完整流程和方法。实际业务中请使用真实数据。 项目能产出什么? 运行完整代码后,你会得到: 3张分析图表:数据探索可视化、模型对比ROC
本文实现了一个房价预测模型,结合sklearn特征工程和PyTorch神经网络建模。流程包括数据预处理、特征工程、模型训练与结果可视化。使用Kaggle房价数据集,通过特征划分、标准化和One-Hot编码处理数值与类别特征,采用多层感知机(MLP)模型进行训练。关键优化包括对目标变量进行log变换缓解长尾分布,使用BatchNorm和Dropout提升泛化能力。实验结果表明该方法能有效预测房价,并
本文探讨了深度学习从理论研究到工程化实践的关键过渡。首先强调了数据管道的重要性,指出专业数据管道需解决内存效率、计算效率和代码可维护性三大问题,并详细介绍了PyTorch中DataLoader和Dataset的最佳实践配置。其次深入分析了学习率这一核心超参数,比较了Step Decay、ReduceLROnPlateau和One Cycle Policy三种调度策略的特点,特别推荐了先增后减的单周
通过上述设置,风储联合参与系统一次调频,从仿真结果来看,系统的频率特性表现良好。风电的虚拟惯性控制和储能的下垂控制相互配合,在系统频率波动时,能够快速响应并提供必要的功率支撑,有效地抑制了频率的过度变化。这种基于MATLAB的风储联合一次调频仿真模型为我们深入研究电力系统在高比例风电接入下的频率稳定性提供了有力工具,也为实际电力系统的运行和控制策略优化提供了重要参考。后续我们还可以进一步调整参数、
速度给定和速度反馈作差,经速度PI得q轴电流给定,与其反馈比较后进行电流PI调节,得到q轴电压;速度给定和速度反馈作差,经速度PI得q轴电流给定,与其反馈比较后进行电流PI调节,得到q轴电压;速度环的PI输出q轴电流给定值,电流环再怼出电压指令,这流程听着简单对吧?注意这里用了三相电流之和为零的特性,实际调试时遇到过ADC采样不同步导致变换后坐标飘移的情况,后来加了实时校验才稳。(4)Pi调节器参
data= load_iris():获取鸢尾花数据集对象,此对象类似字典的特殊对象(Bunch),包含了数据集的所有信息(特征的数据,特征的名子,标签,对数据集的描述)每一次迭代都是机器在学习如何分类鸢尾花,并且获取经验,调整学习参数,得到最优的参数来接受最终的分类检验任务。只规定了划分的 “比例”,但 “哪些样本进训练集 / 测试集” 是由随机种子控制的。4个特征:花萼长度,花萼宽度,花瓣长度,
Judea Pearl的因果推断工作奠定了现代因果科学的基础。该论文系统阐述了因果图模型(DAG)、do-演算等核心思想,将因果从统计相关性中分离出来,为理解"为什么"提供了数学框架。本文深入解析因果推断的核心概念、do-演算规则及其对科学发现的影响。
Constitutional AI提出了一种无需人类标注的AI对齐方法,通过预设的宪法原则(Constitution)指导AI自我改进。该方法分为监督学习阶段和强化学习阶段,使用AI反馈替代人类反馈,减少对人工标注的依赖。实验表明,Constitutional AI能够训练出既无害又有帮助的AI助手,为AI安全提供了新的技术路径。
CLIP通过自然语言监督学习视觉模型,在4亿图文对上训练后,实现了零样本迁移到多种视觉任务。该方法将图像和文本映射到同一嵌入空间,通过对比学习对齐图文表征。CLIP在ImageNet上达到76.2%的零样本准确率,与有监督的ResNet-50相当,开启了多模态预训练的新范式。本文深入解析CLIP的架构设计、训练方法及其对多模态学习的影响。
MAML提出了一种模型无关的元学习算法,通过学习一个好的参数初始化,使得模型能够在少量梯度更新后快速适应新任务。该方法与任何基于梯度优化的模型兼容,适用于分类、回归、强化学习等多种学习问题。本文深入解析MAML的核心思想、算法实现及其对小样本学习和元学习领域的影响。