“ 这是尼萌工作室的第【 15】篇文章。本文正文1470字,阅读完成约15分钟。”
摘要:基于人口统计学,协同过滤,基于内容推荐都是是一种集体智慧的体现,也就是需要借助于群体信息做决策。
在推荐工程中, 常用到的一种思想为集体智慧决策。
一般来说,凡是借助于群体信息来进行信息过滤的推荐算法都可归为集体智慧。
基于人口统计学,协同过滤,基于内容推荐都是是一种集体智慧的体现,也就是需要借助于群体信息做决策。从另一个角度来讲,其实就是“借用数据”,在自身数据稀缺的情况下利用其他相似的信息帮助建模。
01 基于人口统计学(Demogtaphic-based)
—
一种最易于实现的推荐方法,它只是简单的根据系统用户的基本信息发现用户的相关程度,然后将相似群体的用户喜爱的其他物品推荐给当前用户。
基于大数据技术,将企业用户标签化,构建成用户画像,如四川推荐麻辣火锅,做到群体大致精准的推荐。
02 协同过滤(Memory-based)
—
通过历史行为数据来找到某种人(User)和物(Item)的可能关联来进行推荐,又称为Neighborhood-based(近邻推荐)。
基于用户行为相似信息的推荐模型, 根据用户在物品上的行为找到物品或者用户的“近邻”,这里的“邻”,一般指群体,其基本假设是相似的用户可能会有相似的喜好,相似的物品可能会被相似的人所偏好。
熟悉的包括基于用户(User-CF)的协同过滤,基于物品(Item-CF)的协同过滤,word2vect embedding 等方式。
优点:不需要对物品,用户进行严格的建模,也不要求推荐的可解释性,是领域无关的。
缺点也明显:
对物品和用户都存在冷启动问题(本质是基于历史行为数据)
对用户行为数据准确性和完备性较高。如果用户行为太少,出现推荐偏差。
若历史行为中热点集中爆发,则会出现大量用户推荐都为热门物品,有失个性化
对于品味独特,小众,长尾推荐也不能很好的契合。
🌰根据李四与其它用户的购买行为分析计算,对李四做耳机推荐。
手机 | 耳机 | 平板 | 电脑 | 电视机 | |
张三 | ☑ | ☑ | ☑ | ☑ | ☑ |
李四 | ☑ | 推荐 | ☑ | ☑ | ☑ |
03 基于内容的推荐(Content-based)
—
大都提取自物品的相关特征或者相关描述 ,训练一个推荐模型(隐语义模型,如ALS,SVD矩阵分解等),找到内在规律,来获取推荐结果,也叫做基于模型的推荐。
基于样本的用户偏好信息 + 物品的相关特征
用户偏好特征矩阵*物品特征矩阵 = 用户-物品评分矩阵
基于物品之间的相关特征
🌰 假设物品一和物品二计算相似性为98%,那么对已经购买了物品一的用户可以推荐为他推荐物品二
类别1 | 类别2 | 类别3 | 标签1 | 标签2 | 其它属性 | |
物品一 | ☑ | ☑ | ☑ | ☑ | ☑ | … |
物品二 | ☑ | ☑ | ☑ | ☑ | ☑ | … |
优点:
用户之间独立,与他人的行为无关。
对推荐结果具有好的可解释性。如物品1有xxx,yyy,zzz属性,正好与用户的偏好契合,所以给予推荐
新物品能很好的推荐。新加入的物品,相关特征相对完备的情况下,其推荐几率是和老的物品是一致的。
同样也存在缺点:
对物品标签提取的准确性要求较高。
无法挖掘用户的潜在兴趣,惊喜度低。由于大都提取自物品的相关特征或者相关描述,因此这种方式推荐的物品其实都是和你所购商品在某方面十分相似的,这也决定了基于模型(内容)的推荐算法没有太大的惊喜度。
无法解决新用户冷启动问题。同CF一样,新用户没有行为,也无法计算出偏好。
在工业界实际操作过程中,基于内容的推荐成本较大(1.提取的物品标签,2.用户偏好相对准确),在大多数情况下推荐情况效果不好,我们主要采取基于协同过滤方式,辅之以基于内容的推荐(解决新物品冷启动问题) 和 人口统计学推荐(解决新用户冷启动问题)。
基于基于内容的推荐与其它推荐算法结合的比较多,在很多算法中都能看到其影子,如FM,FTRL等。
推荐算法思路很多,具体如何使用还需要结合实际业务情况,因地制宜,对症下药。
- END -

谁怕,一蓑烟雨任平生




