暂无图片
暂无图片
暂无图片
暂无图片
暂无图片

鲸品堂|利用深度特征工程打造个性化营销微单元

浩鲸科技 2021-11-29
27
现状分析



随着电信运营商业务互联网化的运营和推广,各类新业务和增值业务蓬勃发展,并呈现出迭代周期快、受众群体范围窄、营销窗口期短、频次高的特点。营销行为不同于传统4G营销套餐拥有刚性和强技术演进的方式,呈现长尾的特点,如:留学生回国期间的定向流量、娱乐以及出行权益包订购等,营销包推广的窗口期短,能否快速和准确触达这些营销场景有效目标用户群是一个比较大挑战,目前基本是用固定报表的方式进行统计并基于历史数据,运用多维工具进行可视化探索。


这也存在以下一些问题:


1)   营销精度不够

传统的报表统计方式比较粗放,不能以更细的粒度、更精准地量化营销单元用户的特点,以及进行定向营销的用户成功相对几率多大,通常只能选择报表中几个关键维度的方向进行笼统的广撒网,这样的方式只能比随机提取的方式转化率略有提升,无法量化每个用户的转化概率,在营销过程不能有针对性倾斜资源和渠道。


2)   业务经验知识门槛高

要精准定位出小众业务可能转化的群体,需要非常强的业务洞察和预判能力,需要分析大量报表,同时需要结合专业的业务背景,进行特定指标和特征构建,运用大量的数据分析工具,依靠职业敏感度进行定向营销和产品的迭代;运用大量行业和业务背景知识进行深度分析,进行特征和指标的拟定,再将需求反馈给数据处理部门,造成营销活动上线周期长、评估和反馈流程复杂的局面。


3)   特征分析手段不灵活

特征的来源只能依靠数据中台的应用宽表中通用概况性固定字段,不能根据营销目标场景针对性对特征进行扩充和衍生,新特征的发现和加工自主性不够,极大影响了营销单元的细分对象范围。


深度特征工程方法介绍



在目前人力成本不断上升和互联网快速推进的大背景下,营销单元已不是传统的广撒网的模式,特别是大规模互联网线上营销模式的兴起,小批量、个性化的精准营销是一个大趋势,需要为每类营销目标构建粒度更细的营销微单元,如果只是用常规的挖掘算法进行粗暴的筛选,只能比随机选择转化率略有提升,但还是存在比较多目标用户群覆盖度不全、转化命中率低的弊端,特征工程作为数据挖掘的重要组成部分,在近几年数据挖掘比赛甚至是算法比赛中都扮演着越来越重要的角色。


在算法空间难以突破的时候,好的特征组合往往可以事半功倍,但特征工程的常规方法如:归一化、特征缩放、特征降维、特征编码等,对挖掘模型整体指标提升有限,需要更深层次地从特征的构造、量化以及泛化方面进行系统化的探索,本文结合多个挖掘项目的实际经验,提出了组合特征、权重量化、特征漂移3种深度特征工程方法。


01
组合特征


以用户为中心的业务数据通常包括用户属性特征、用户事件数据、产品属性、产品分类、用户及即时场景上下文数据5类基础数据,通过运用特征交叉、特征组合统计、预测标签等多种组合手段衍生出新特征。


丰富用户数据特征信息,特征的分层结构图如下所示:



通过提供自动特征组合工具和指标加工平台,将用户属性和用户事件进行交叉、组合、统计形成更多元化、更加贴近用户行为变化以及针对产品形态的变化趋势。


产品特征属于稀疏特征,所含的信息量比较少,而产品类别特征的信息量相对较大,如:APP种类非常多,呈现长尾的特点,单个APP的订购和消费非常低频,但如果按APP类别进行特征复合就能够对转化目标进行比较大的区分。因此,复合而成的特征群互补了两类特征的优劣,通过各类属性和场景上下文进行交叉,采用一些统计方法,有以下特征组合和衍生的典型场景:


点击图片查看大图

02
权重量化


数据挖掘算法的选择和参数的调整是一个非常专业化的工作,但随着浩鲸科技推出智能化数据挖掘平台,已经可以让小白变成挖掘专家,实现算法和参数的全自动适配,特征采用全量自动方式,目前自动训练框架中没有将特征选择作为一个单独模块独立出来,而是作为整个自动化训练管道的一个步骤。


一次训练流程只采用一种特性选择算法,同时训练过程特征无法感知和对外输出,如果在训练前加入太多的坏特征,会加大自动训练的周期,也会对模型评估指标造成干扰。


通过设置一些干扰因素,在特征权重量化中实现以下功能:


1)   训练前提供更为全面的特征优选模块,采用多种特征选择算法,进行综合排名;

2)   在数据编排完后,根据设置目标表里,以后台任务方式计算编排后宽表特征字段和所有目标字段的特征权重贡献系数;

3)   提供特征分布、特征优选和特征探索3大部分功能,特征分布和特征优选以界面方式提供给自动建模人员使用,特征探索以功能包的方式,提供专业算法开发开发人员使用,特征工程计算采用dask计算引擎;

4)   在数据编排和训练流程的入口提供特征分布和特征权重贡献排名展示。


权重量化计算过程如下所示:


将每个特征对预测标签的预估结果在挖掘模型训练时可视化提示,大大减少了模型训练时候的特征选取盲目性,界面如下所示:


03
特征漂移


模型泛化能力是机器学习领域难度非常高的命题,一些模型在训练集的效果非常好,但在实际应用上的效果往往下降很厉害。其中一个比较大的原因是应用集上的数据发生了漂移。在进行模型应用时候,需要根据应用集数据对模型进行评估和重构,观察评价测试集与训练集分布是否相像,如果不像,则有可能是发生了漂移,特征的筛选思路如下:

1)  对训练集打标签0,测试集打标签1生成新数据集;

2)  训练一个二分类模型;

3)  评价AUC指标,如果非常高,则发生漂移(模型能轻易分辨出训练和测试数据);

4)  依据特征重要性,删除若干个指标,重新训练,并重复步骤2-4,直到auc很低;

5)  用保留下来的数据训练模型。


案例介绍



某客户通过采用浩鲸科技的智能数据挖掘平台+深度特征工程的方案,能够快速根据营销场景的转化需求,在线上全流程构建个性化营销微单元,直接服务一线的细分服务单元,模型挖掘的查全率提升了30%,转化率比对照组提升了50%,模型和目标客户群到达市场执行的周期时长缩短了40%

文章转载自浩鲸科技,如果涉嫌侵权,请发送邮件至:contact@modb.pro进行举报,并提供相关证据,一经查实,墨天轮将立刻删除相关内容。

评论