D6:聚类分析科普与实战应用
目录
有监督学习(分析): 就像老师用卡片教你这是苹果,那是香蕉,电脑学会后在拿来水果给他分析
但它也有缺点,如 :极度依赖高质量标注数据成本极高;泛化能力有限,容易过拟合;无法处理开放世界问题
无监督学习(聚类): 就像把一堆你从未见过的水果倒在桌上,不告诉电脑它们叫什么。电脑只能自己观察
初中生也能看懂的聚类分析科普
乐高积木
我用分类积木来类比
你现在有一筐积木你把他们倒在了地上,你又根据他们的形状,颜色(如有三种颜色于是你根据他们的颜色分成了三组,颜色相同的在一组)
聚类分析就像是让电脑整理积木一样,自动把一堆积木按照不同的特征分类
注意事项
但要注意的是聚类分析本质是无监督学习,可能导致不可预测的后果
核心逻辑
在机器学习的世界里,聚类分析属于无监督学习,就是自己找规律
有监督学习(分析): 就像老师用卡片教你这是苹果,那是香蕉,电脑学会后在拿来水果给他分析
但它也有缺点,如 :极度依赖高质量标注数据成本极高;泛化能力有限,容易过拟合;无法处理开放世界问题
无监督学习(聚类): 就像把一堆你从未见过的水果倒在桌上,不告诉电脑它们叫什么。电脑只能自己观察
最经常用的聚类分析方法可以用如下方法演示
1.先把全班分成三组,选三个临时组长
2.其他同学看谁离自己最近,就跑到哪个队长身边站好。这时候,大家就初步分成了3堆。
3.队伍站好后,原来的“临时队长”可能不在队伍的正中心了。于是,每一堆人重新计算中心位置,选出一个站在最中间的当“新队长”。
4.换了新队长后,有些同学可能发现隔壁队的新队长离自己更近,于是过去。然后大家又重新选队长
5.不断重复此过程,直到稳定
局限性
需要事先告诉他分成几组,对奇怪的数据没有办法(如甜甜的,在嘴里还会跳的东西是什么,它会回达跳跳糖,但人类可能会说抹了糖的青蛙)
聚类分析案例:电商分层
故事背景:假设你是一家大型电商网站的数据分析师。老板给了你一份包含 10万名用户 的交易记录,对你说:“下个月是双11大促,预算有限,不能给所有人都发大额优惠券。请你帮我把用户分分类,我们要对不同的人说不同的话。”
第一步:确定特征
为了描述一个用户,我们不能只看他买了多少钱。在商业分析中,我们通常使用 RFM模型 来提取三个关键特征:
| 代码 | 含义 | 业务意义 |
|---|---|---|
| R | Recency (最近一次消费时间) | 用户是不是刚买过?越近越活跃。 |
| F | Frequency (消费频率) | 用户多久买一次?越频繁越忠诚。 |
| M | Monetary (消费金额) | 用户花了多少钱?越多越有价值。 |
第二部:数据预处理
- 异常值处理: 剔除那些一次买了1个亿的“超级土豪”或系统错误数据,防止它们把聚类中心拉偏。
- 数据标准化
R的单位是“天”(如30),M的单位是“元”(如5000)。如果不处理,算法会认为5000比30大得多,从而只关注金额。我们需要用 StandardScaler 把它们拉到同一个维度(比如都变成 -1 到 1 之间的数值)。 - 算法执行与确定k值
我们使用 K-Means 算法。但是分几类呢?
通常我们会使用 手肘法 或 轮廓系数 来寻找最佳的 K 值。
假设经过计算,我们发现 K=4 时效果最好
算法跑完后,输出了4个簇。我们需要查看每个簇在 R、F、M 上的平均值,并赋予它们业务含义
实战应用
聚类模型训练好后,不仅可以用在老用户身上,还可以用在 新用户 身上。
当有一个新用户注册并下了第一单,系统会自动提取他的RFM数据,输入到模型中
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)