Hadoop的发展可谓如火如荼。根据美国联合市场研究(Allied Market Research)机构的调查,Hadoop目前的市场估值约30亿美金,而且会在本年代末超过500亿。我们不禁会问Hadoop如此迅速崛起的原因究竟是什么?
最初,Hadoop扬名是作为一项处理大量数据存储和分析的开源技术。通过Apache软件基金会运作,它赢得了Facebook、谷歌、雅虎和亚马逊等大公司的青睐,成为了这些公司内部非结构化数据的存储库。
自成立以来,Hadoop的发展远远超出我们的想象。一个日益流行的标志就是这个领域内最畅销的书籍之一《Hadoop:权威指南》(作者:汤姆怀特,Cloudera工程师),刚刚发布了它的第四个版本。
EnterpriseApps Today采访了该书的作者,了解到了新版本的特性以及Hadoop演进过程。
怀特说:”面对不断增长的数据量,Hadoop出色的表现向我们证明了它就是我们需要的通用数据处理平台,它能适用于各种用户场景。因为Hadoop发展的太快了,我不得不修订这本书。”
怀特透露,最初Hadoop在Apache内部是一个很小的项目。当时它只有两部分组成:Hadoop分布式文件系统(HDFS)和在其基础上的MapReduce计算引擎。这就已经强大到足以把Hadoop推到聚光灯下,一些人甚至称其为EMC杀手,因为它能利用普通硬件代替专用存储阵列。
Hadoop相关项目
经过六年的发展,Hadoop成为一个拥有几十个项目的庞大生态系统。怀特列举了一些有名的项目:
Spark——怀特介绍道,这种新型的数据处理引擎改进了传统的 MapReduce。虽然 MapReduce很可靠而且有它的用武之地,但Apache Spark很可能会取代它,至少会用于新的工作负载。Spark速度更快,而且具有应用程序接口(API),易于整合和使用,它支持现有数据并与现有数据格式完全兼容。怀特说:“Spark 擅长交互式的数据分析和调查,当您感觉无从下手进行分析的时候,它是最好的选择”。
Crunch——Apache Crunch作为一个应用程序接口(API)运行在MapReduce和Spark之上,它能让MapReduce在很多方面更易于使用,比如在数据整合以及处理非结构化数据方面都能提供便利。
Flume是一个分布式的海量数据采集和传输系统。它包括容错、故障转移和恢复机制。使用Flume,Hadoop可以摄取来自多个数据源的数据,如社交媒体、应用程序日志、传感器和地理位置信息,再把这些海量数据传输到HDFS用于数据分析。
Parquet——它是能让Hadoop提高数据处理效率的一种存储格式,它把传统数据库信息存储使用的行存储变为列存储。这让数据压缩和快速查询变得更容易。
Yarn——这个新的Hadoop核心组件能让多个处理引擎处理存储的数据。它增加了资源管理、集中管理、更平稳的性能、强化了数据安全性和更好的Hadoop集群数据管理。
Kafka是最新加入的组件之一,Apache Kafka为Hadoop 添加了一个消息系统,据说比以往使用的消息系统更快、更可靠、更具可伸缩性。举个例子,当我们对来自车辆的地理信息数据或者网络传感器的数据进行分析的时候,这个组件会显得非常有用,因为它能同时处理大量的信息流。
怀特表示,这里只列举了几个ApacheHadoop生态系统里发展很好的项目。
怀特新书最大的变化就是关于Hadoop初始版本的介绍几乎消失了,这个版本被称为Hadoop One或HD1。怀特解释道,自从HD2发布以来,已经有越来越多的用户迁移到新版本。现在还在使用HD1的用户相对较少,所以是时候只关注HD2了。
Hadoop作为中央数据中心
联合市场研究机构预测Hadoop年增长率约为60%。怀特预言随着技术的不断成熟,Hadoop正走向企业级食物链的顶端。他说:“Hadoop作为海量数据中心,正越来越多的涉及企业核心业务。您只管把大量数据倾倒给它,用生态圈内的工具做实时的数据提取和分析或者批处理即可”。
怀特指出,Hadoop更多的被用来做实时或接近实时的摄取和处理工作负载。他乐观的看待Kafka的应用前景,因为它允许您将数据发布到Hadoop和并能快速的做出反应。同时,它也能改善长期存档在HDFS的数据。
他认为,Hadoop目前面临最大的挑战就是能否在它的基础上更简便的构建应用程序,如果要让Hadoop平台达到完美,它还需要在这一点上不断完善。
对Cloudera方面,怀特提到了公司最近参与构建一个医疗保健应用,它能存储和分析成千上万大规模基因组数据集。该公司还做包装和工具来帮助管理大型集群。例如Cloudera管理器,能帮助集群升级以及更好地管理。
他说:“虽然基于Hadoop的集群工具改进了不少,但是如果没有Cloudera,他们仍然需要一个漫长的学习过程。”




