暂无图片
暂无图片
暂无图片
暂无图片
暂无图片

推荐系统之集体智慧再理解

尼萌工作室 2020-09-20
415


 这是尼萌工作室的第【 15篇文章。本文正文1470字,阅读完成约15分钟。


摘要:基于人口统计学,协同过滤,基于内容推荐都是是一种集体智慧的体现,也就是需要借助于群体信息做决策。


在推荐工程中, 常用到的一种思想为集体智慧决策。

一般来说,凡是借助于群体信息来进行信息过滤的推荐算法都可归为集体智慧。

 

基于人口统计学,协同过滤,基于内容推荐都是是一种集体智慧的体现,也就是需要借助于群体信息做决策。从另一个角度来讲,其实就是“借用数据”,在自身数据稀缺的情况下利用其他相似的信息帮助建模。




01 基于人口统计学Demogtaphic-based)

一种最易于实现的推荐方法,它只是简单的根据系统用户的基本信息发现用户的相关程度,然后将相似群体的用户喜爱的其他物品推荐给当前用户。

基于大数据技术,将企业用户标签化,构建成用户画像,如四川推荐麻辣火锅,做到群体大致精准的推荐。


02 协同过滤(Memory-based)


通过历史行为数据来找到某种人(User)和物(Item)的可能关联来进行推荐,又称为Neighborhood-based(近邻推荐)

基于用户行为相似信息的推荐模型, 根据用户在物品上的行为找到物品或者用户的“近邻”,这里的“邻”,一般指群体,其基本假设是相似的用户可能会有相似的喜好,相似的物品可能会被相似的人所偏好。

熟悉的包括基于用户(User-CF)的协同过滤,基于物品(Item-CF)的协同过滤,word2vect embedding 等方式。

优点:不需要对物品,用户进行严格的建模,也不要求推荐的可解释性,是领域无关的。

缺点也明显:

  • 对物品和用户都存在冷启动问题(本质是基于历史行为数据)

  • 对用户行为数据准确性和完备性较高。如果用户行为太少,出现推荐偏差。

  • 若历史行为中热点集中爆发,则会出现大量用户推荐都为热门物品,有失个性化

  • 对于品味独特,小众,长尾推荐也不能很好的契合。


🌰根据李四与其它用户的购买行为分析计算,对李四做耳机推荐。


手机

耳机

平板

电脑

电视

李四

推荐



03 基于内容的推荐(Content-based)

大都提取自物品的相关特征或者相关描述 ,训练一个推荐模型(隐语义模型,如ALS,SVD矩阵分解等),找到内在规律,来获取推荐结果,叫做基于模型的推荐

  • 基于样本的用户偏好信息 + 物品的相关特征

用户偏好特征矩阵*物品特征矩阵 = 用户-物品评分矩阵

  • 基于物品之间的相关特征

🌰 假设物品一和物品二计算相似性为98%,那么对已经购买了物品一的用户可以推荐为他推荐物品二


类别1

类别2

类别3

标签1

标签2

其它属性

物品一

物品二


优点:

  • 用户之间独立,与他人的行为无关。

  • 对推荐结果具有好的可解释性。如物品1有xxx,yyy,zzz属性,正好与用户的偏好契合,所以给予推荐

  • 新物品能很好的推荐。新加入的物品,相关特征相对完备的情况下,其推荐几率是和老的物品是一致的。

同样也存在缺点:

  • 对物品标签提取的准确性要求较高。

  • 无法挖掘用的潜在趣,惊喜度低。由于大都提取自物品的相关特征或者相关描述,因此种方式推荐的物品其都是和你所商品在某方面十分相似的,也决定了基于模型(内容)的推荐算法没有太大的惊喜度。

  • 无法解决新用冷启动问题。同CF一样,新用没有行,也无法算出偏好。



在工业界实际操作过程中,基于内容的推荐成本较大(1.提取的物品标签,2.用户偏好相对准确),在大多数情况下推荐情况效果不好,我们主要采取基于协同过滤方式,辅之以基于内容的推荐(解决新物品冷启动问题) 和 人口统计学推荐解决新用户冷启动问题)。


基于基于内容的推荐与其它推荐算法结合的比较多,在很多算法中都能看到其影子,如FM,FTRL等。


推荐算法思路很多,具体如何使用还需要结合实际业务情况,因地制宜,对症下药。

 


- END -



谁怕,一蓑烟雨任平生




文章转载自尼萌工作室,如果涉嫌侵权,请发送邮件至:contact@modb.pro进行举报,并提供相关证据,一经查实,墨天轮将立刻删除相关内容。

评论