介绍2003-2017年大规模数据处理的演变,通过时间的发展来表现整个大数据生态技术的发展过程,涉及到系统设计paper,包括未来发展的方向。重在带领大家探索时间驱动技术的演变过程,中间很多系统的权衡设计,分分合合的流处理+批处理,不同的框架对现有技术的改进和高质量的工业级的系统编码实现权衡。
最后说Apache Beam是统一Batch+Streaming的未来,重点介绍它的可移植性,能跑在Flink、Spark、Google Cloud DataFlow之上。
我们都允许不同的观点出现,Flink才是真正做到统一Batch+Streaming,他把Batch处理看做是一种特殊的Streaming,思想相对Spark Streaming已经是很大的进步了,从一开始就自己管理内存,性能不错,并且已经大规模开始应用。
观点和片子中指出Flink是解决”Open-source out-of-order”,有些不同,允许不同观点。 获取源PPT文件,请看文末。
























































































PPT原文件:链接: https://pan.baidu.com/s/1midzKgC 密码: 9sbv
欢迎关注微信公众号,第一时间,阅读更多有关云计算、大数据文章。
原创文章,转载请注明: 转载自Itweet的博客本博客的文章集合:
http://www.itweet.cn/blog/archive/
文章转载自whoami,如果涉嫌侵权,请发送邮件至:contact@modb.pro进行举报,并提供相关证据,一经查实,墨天轮将立刻删除相关内容。




