这个实时数据处理平台是董同学手头上一个真实的大数据项目,里面涉及到大部分大数据实时架构,希望对大家有所帮助,最后非常感谢董同学的分享
第一篇:【实时流式系统实战】集群安装
第二篇: 实时数据处理平台(2)--应用场景
基于信令位置及特定需求群沉淀的一类实时化交互能力,通过一个虚拟的栅栏圈定出一个地理边界,实时感知手机进入、离开或在某个特定地理区域内活动情况,结合各类触点可支撑场景化营销、位置社交网站自动登记等服务。
接口信息
实时数据目前以kafka形式提供。以下为zookeeper和kafka集群信息。
zookeeper list:
xxx.xxx.xxx.xxx:2181
,xxx.xxx.xxx.xxx:2181,
xxx.xxx.xxx.xxx:2181
kafka-broker-list:xxx.xxx.xxx.195:6667,xxx.xxx.xxx.xxx:6667,xxx.xxx.xxx.xxx:6667
主机与IP对应关系:
xxx.xxx.xxx.xxx master1
xxx.xxx.xxx.xxx slave1
xxx.xxx.xxx.xxx slave2
xxx.xxx.xxx.xxx slave3
xxx.xxx.xxx.xxx slave4
xxx.xxx.xxx.xxx slave5
xxx.xxx.xxx.xxx slave6
xxx.xxx.xxx.xxx slave7
如果IP连接有问题,请使用主机名。
topic:DLTE1,DLTE2,DLTE3,DLTE4,DLTE5
topic:DMC
查看kafka消息,在xxx.xxx.xxx.xxx节点执行以下命令:
kafka-console-consumer.sh --zookeeper master1:2181 -topic DLTE1,DLTE2,DLTE3,DLTE4,DLTE5
加载基站码表:LocationDlteDmc

大数据平台侧xxx.xxx.xxx.xxx(hadoop002),
执行以下语句:
set hive.exec.compress.output=false;
insert overwrite local directory
'/home/hadoop/yxy/20170503'
row format delimited
fields terminated by '\t'
NULL DEFINED AS ''
select lac,ci,lng,lat
from dim.dim_lac_ci_new;
修改导出文件的名称为dim_lac_ci_new.txt,并拉取到本地,将文件上传到spark程序提交节点的/home/spark目录下。


定时扫描活动

从kafka拉取消息,根据interface type判断2/3G还是4G,采用不同的方式解析数据。

获取基站位置时,根据不同的话单类型取不同的值。

拼接json串,将符合活动规则的消息发送到kafka,目标端kafka topic名称为topic_location。
加入技术讨论群
《大数据和云计算技术》社区群人数已经3000+,欢迎大家加下面助手微信,拉大家进群,自由交流。

喜欢QQ群的,可以扫描下面二维码:

欢迎大家通过二维码打赏支持技术社区(英雄请留名,社区感谢您,打赏次数超过108+):





