目录

乐高积木

注意事项

核心逻辑

有监督学习(分析): 就像老师用卡片教你这是苹果,那是香蕉,电脑学会后在拿来水果给他分析

但它也有缺点,如 :极度依赖高质量标注数据成本极高;泛化能力有限,容易过拟合;无法处理开放世界问题

无监督学习(聚类): 就像把一堆你从未见过的水果倒在桌上,不告诉电脑它们叫什么。电脑只能自己观察

局限性

聚类分析案例:电商分层

第一步:确定特征

第二部:数据预处理

实战应用


初中生也能看懂的聚类分析科普

乐高积木

我用分类积木来类比

        你现在有一筐积木你把他们倒在了地上,你又根据他们的形状,颜色(如有三种颜色于是你根据他们的颜色分成了三组,颜色相同的在一组)

        聚类分析就像是让电脑整理积木一样,自动把一堆积木按照不同的特征分类

注意事项

但要注意的是聚类分析本质是无监督学习,可能导致不可预测的后果

核心逻辑

在机器学习的世界里,聚类分析属于无监督学习,就是自己找规律

有监督学习(分析): 就像老师用卡片教你这是苹果,那是香蕉,电脑学会后在拿来水果给他分析
但它也有缺点,如 :极度依赖高质量标注数据成本极高;泛化能力有限,容易过拟合;无法处理开放世界问题
无监督学习(聚类): 就像把一堆你从未见过的水果倒在桌上,不告诉电脑它们叫什么。电脑只能自己观察

最经常用的聚类分析方法可以用如下方法演示

1.先把全班分成三组,选三个临时组长

2.其他同学看谁离自己最近,就跑到哪个队长身边站好。这时候,大家就初步分成了3堆。

3.队伍站好后,原来的“临时队长”可能不在队伍的正中心了。于是,每一堆人重新计算中心位置,选出一个站在最中间的当“新队长”。

4.换了新队长后,有些同学可能发现隔壁队的新队长离自己更近,于是过去。然后大家又重新选队长

5.不断重复此过程,直到稳定

局限性

需要事先告诉他分成几组,对奇怪的数据没有办法(如甜甜的,在嘴里还会跳的东西是什么,它会回达跳跳糖,但人类可能会说抹了糖的青蛙)

聚类分析案例:电商分层

故事背景:假设你是一家大型电商网站的数据分析师。老板给了你一份包含 10万名用户 的交易记录,对你说:“下个月是双11大促,预算有限,不能给所有人都发大额优惠券。请你帮我把用户分分类,我们要对不同的人说不同的话。”

第一步:确定特征

为了描述一个用户,我们不能只看他买了多少钱。在商业分析中,我们通常使用 RFM模型 来提取三个关键特征:

代码 含义 业务意义
R Recency (最近一次消费时间) 用户是不是刚买过?越近越活跃。
F Frequency (消费频率) 用户多久买一次?越频繁越忠诚。
M Monetary (消费金额) 用户花了多少钱?越多越有价值。

第二部:数据预处理

  1. 异常值处理: 剔除那些一次买了1个亿的“超级土豪”或系统错误数据,防止它们把聚类中心拉偏。
  2. 数据标准化
    R的单位是“天”(如30),M的单位是“元”(如5000)。如果不处理,算法会认为5000比30大得多,从而只关注金额。我们需要用 StandardScaler 把它们拉到同一个维度(比如都变成 -1 到 1 之间的数值)。
  3. 算法执行与确定k值

         我们使用 K-Means 算法。但是分几类呢?
         通常我们会使用 手肘法 或 轮廓系数 来寻找最佳的 K 值。
         假设经过计算,我们发现 K=4 时效果最好

算法跑完后,输出了4个簇。我们需要查看每个簇在 R、F、M 上的平均值,并赋予它们业务含义

实战应用

聚类模型训练好后,不仅可以用在老用户身上,还可以用在 新用户 身上。

当有一个新用户注册并下了第一单,系统会自动提取他的RFM数据,输入到模型中

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐