前言

打开抖音,你看到的是感兴趣的视频;

打开淘宝,你看到的是可能购买的商品;

打开网易云音乐,你看到的是符合口味的歌曲;

打开B站,你看到的是想看的内容。

这些背后都有一个共同的核心技术:

推荐系统(Recommendation System)。

如今推荐系统已经成为互联网平台的核心竞争力之一。

甚至可以说:

搜索决定你能否找到内容,而推荐决定你最终会看到什么内容。

本文将系统介绍推荐系统的发展历程、核心算法、工业级架构以及大模型时代的发展趋势。


一、什么是推荐系统

推荐系统的目标非常简单:

在海量信息中,为用户推荐最可能感兴趣的内容。

本质上解决的是:

用户太多
↓
内容太多
↓
如何精准匹配

问题。

例如:

电商平台

推荐:

  • 商品
  • 店铺
  • 活动

视频平台

推荐:

  • 视频
  • 直播
  • UP主

音乐平台

推荐:

  • 歌曲
  • 歌单
  • 歌手

社交平台

推荐:

  • 用户
  • 帖子
  • 话题

二、推荐系统的发展历程

第一阶段:人工推荐

早期网站规模较小时:

编辑
↓
挑选内容
↓
展示首页

例如门户网站时代。

缺点:

  • 效率低
  • 个性化差

第二阶段:热门推荐

根据:

  • 点击量
  • 浏览量
  • 销量

排序。

例如:

销量排行榜
热门视频
热搜榜

优点:

简单有效。

缺点:

千人一面。


第三阶段:协同过滤

推荐系统真正进入智能时代。

核心思想:

喜欢相似内容的人,可能拥有相似兴趣。

这也是现代推荐系统的起点。


第四阶段:深度学习推荐

2016年以后:

  • CNN
  • RNN
  • Transformer

逐渐进入推荐领域。

推荐系统开始进入AI时代。


第五阶段:大模型推荐

2024年以来:

GPT、Claude、Gemini等大模型技术开始融入推荐系统。

推荐逐渐从:

猜你喜欢

变成:

真正理解你

三、推荐系统核心架构

工业级推荐系统一般包括:

用户
↓
召回
↓
粗排
↓
精排
↓
重排
↓
推荐结果

1. 召回(Recall)

目标:

从千万级内容中筛选几千条候选结果。

例如:

1000万商品
↓
召回
↓
1000件商品

常用方法:

  • 协同过滤
  • Embedding召回
  • 向量检索

2. 粗排(Ranking)

进一步过滤。

例如:

1000条
↓
100条

常用模型:

  • LR
  • GBDT
  • Wide&Deep

3. 精排(Re-ranking)

核心环节。

例如:

100条
↓
10条

预测:

  • 点击率(CTR)
  • 转化率(CVR)
  • 停留时间

4. 重排

解决:

  • 多样性
  • 新颖性
  • 去重复

问题。

例如:

不能首页全是手机。

需要:

手机
电脑
耳机
配件

混合展示。


四、协同过滤算法

推荐系统最经典的算法。


基于用户的协同过滤

核心思想:

用户A
喜欢电影1、2、3

用户B
喜欢电影1、2、3

那么:

A喜欢的电影4
可能推荐给B

计算用户相似度:

常用:

  • 余弦相似度
  • Pearson相关系数

基于物品的协同过滤

工业界更常用。

例如:

买了iPhone

↓

推荐AirPods

因为:

很多用户同时购买。


优点

实现简单。

效果优秀。


缺点

冷启动问题严重。


五、矩阵分解推荐

Netflix大奖赛推动了这一方向的发展。

核心思想:

用户和物品都映射到低维向量空间。

例如:

用户向量
(0.2,0.8)

商品向量
(0.3,0.7)

利用向量内积预测兴趣程度。


SVD

经典方法:

评分矩阵
↓

矩阵分解

↓

隐向量

发现用户潜在兴趣。


六、深度学习推荐系统

随着用户规模增长。

传统协同过滤逐渐无法满足需求。

深度学习开始进入推荐领域。


Wide & Deep

Google提出。

结构:

Wide
+
Deep

优势:

既能记忆历史规律。

又能学习新的特征组合。


DeepFM

目前工业界经典方案。

融合:

FM
+
DNN

特点:

自动学习特征交互。


DIN

阿里巴巴提出。

引入注意力机制。

例如:

用户最近浏览:

篮球
球鞋
NBA

那么推荐时:

篮球相关内容权重更高。


七、推荐系统中的Transformer

近年来最重要的发展之一。

Transformer能够建模:

用户行为序列

例如:

浏览A
↓

浏览B
↓

浏览C
↓

预测D

典型模型:

SASRec

自注意力推荐模型。


BERT4Rec

利用BERT思想。

预测用户未来行为。


八、大模型时代的推荐系统

目前各大互联网公司正在探索:

推荐 + LLM

例如:

用户输入:

我最近想学习人工智能

传统推荐:

可能推荐热门AI视频。


大模型推荐:

能够理解:

用户背景
学习目标
知识水平
兴趣方向

进行更精准推荐。


推荐 + RAG

流程:

用户行为
↓

向量数据库

↓

大模型理解

↓

生成推荐结果

推荐结果更加个性化。


九、推荐系统面临的挑战

冷启动问题

新用户:

没有历史行为。


数据稀疏问题

评分矩阵大量为空。


兴趣漂移

用户兴趣不断变化。

例如:

昨天关注考研

今天关注工作

明天关注旅游

信息茧房

推荐系统可能不断强化已有兴趣。

导致:

越看越单一

这是当前推荐领域的重要研究方向。


十、未来发展趋势

多模态推荐

融合:

  • 文本
  • 图像
  • 视频
  • 音频

大模型推荐

LLM逐渐成为推荐核心。


Agent推荐

未来推荐系统可能不只是推荐内容。

而是:

理解需求
↓

制定计划
↓

执行任务

例如:

用户说:

我想学习机器学习。

系统不仅推荐课程。

还会生成学习路线图。


总结

        推荐系统是人工智能领域最成功的落地应用之一,也是互联网平台增长的核心引擎。

        从最初的热门推荐,到协同过滤、矩阵分解、深度学习,再到今天的大模型推荐,推荐系统正在不断向着“理解用户”的方向演进。

        未来的推荐系统将不再只是简单地预测点击率,而是成为真正能够理解用户需求、辅助用户决策的智能助手。

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐