点击上方“IT那活儿”,关注后了解更多内容,不管IT什么活儿,干就完了!!!
01
基本数据源
一个目录会被监控,像hdfs://namenode:8040/logs,目录中的所有文件会被发现并处理。 全局模式应用,像hdfs://namenode:8040/logs/2017/*,这样spark streaming会监控所有匹配的目录下的文件。 所有文件必须是相同格式文件。 文件会被当作时间段的一部分根据修改时间而不是创建时间。 文件被读取处理后,如果对文件又进行了修改,不会导致spark streaming重新读取文件,即忽略更新。 就算没有修改任何文件,目录下文件数量越多,扫描的时间就越长。 如果使用通配符标识监控目录,重命名目录名称以匹配通配符,只有目录中修改时间当前窗口内的文件才会包含在流中。 调用FileSystem.setTimes()来修复时间戳是在以后的窗口中摄取文件的一种方法,尽管其内容未修改。

02
高级数据源
03
自定义数据源
onStart():开始接收数据需要做的事情;
onStop():停止接收数据需要做的事情。



可靠接收器-对于允许确认发送数据的可靠源,可靠接收器正确地向源确认数据已可靠地接收并存储在Spark中(即成功复制)。通常,实现此接收器需要仔细考虑源确认的语义。 不可靠接收器-不可靠接收器不向源发送确认。


本文作者:潘宗昊
本文来源:IT那活儿(上海新炬王翦团队)

文章转载自IT那活儿,如果涉嫌侵权,请发送邮件至:contact@modb.pro进行举报,并提供相关证据,一经查实,墨天轮将立刻删除相关内容。




