Hadoop3与Hadoop2及Spark比较_hadoop3 vs hadoop2-程序员宅基地

技术标签: spark  hadoop3  大数据  hadoop2  

     2017年12月发布的Hadoop 3标志着数据科学新时代的开始。Hadoop框架是整个Hadoop生态系统的核心,其他各种库都依赖它。

     在本文中,我们将讨论Hadoop 3与Hadoop 2相比的主要变化。我们还将解释Hadoop和Apache Spark之间的差异,并建议如何为您的特定任务选择最佳工具。

概要

     Hadoop 2和Hadoop 3是用Java开发的数据处理引擎,分别于2013年和2017年发布。创建Hadoop的主要目标是维护磁盘上的数据分析,称为批处理。因此,原生Hadoop不支持实时分析和交互性。

     Spark 2.X是Scala开发的处理和分析引擎,于2016年发布。对信息的实时分析变得至关重要,因为许多巨型互联网服务强烈依赖于立即处理数据的能力。因此,Apache Spark是为实时数据处理而构建的,现在很受欢迎,因为它可以在交互模式下有效地处理实时信息流和处理数据。

     Hadoop和Spark都是开源的,Apache 2许可。

抽象程度和学习和使用的难度

     这些框架之间的主要区别之一是抽象级别,Hadoop低,Spark高。因此,Hadoop的学习和使用更具挑战性,因为开发人员必须知道如何编写大量基本操作。Hadoop只是核心引擎,因此使用高级功能需要其他组件的插件,这使得系统更加复杂。

     与Hadoop不同,Apache Spark是一个完整的数据分析工具。它具有许多有用的内置高级功能,可以使用弹性分布式数据集(RDD) - Spark中的核心概念。该框架包含许多有用的库。例如,MLlib允许使用机器学习,Spark SQL可用于执行SQL查询等。

硬件和成本

     Hadoop适用于磁盘,因此无需大量RAM即可运行。这可能比拥有大RAM便宜。由于容错提供系统的变化,Hadoop 3比Hadoop 2需要更少的磁盘空间。

     Spark需要大量RAM才能在内存模式下运行,因此总成本可能比Hadoop更昂贵。

支持编程语言

     两个版本的Hadoop都支持使用Hadoop Streaming的几种编程语言,但主要的是Java。Spark 2.X支持Scala,Java,Python和R。

速度

     通常,Hadoop比Spark慢,因为它适用于磁盘。Hadoop无法将数据缓存在内存中。由于向MapReduce添加了map输出收集器的原生Java实现,Hadoop 3的工作速度比Hadoop 2快30%。

     Spark在处理内存中信息,所以可以比Hadoop快100倍。如果使用磁盘,Spark比Hadoop快10倍。

安全

     由于使用了Kerberos(计算机网络身份验证协议)和访问控制列表(ACL)的支持,Hadoop被认为比Spark更安全。Spark依次使用共享密码提供身份验证。

容错

     Hadoop 2中的容错是由复制技术提供的,其中复制每个信息块以创建2个副本。这意味着Hadoop 2存储的信息不是存储1条信息,而是存储3条信息。这引起了浪费磁盘空间的问题。

     在Hadoop 3中,通过擦除编码提供容错。该方法允许使用另一个块和奇偶校验块来恢复信息块。Hadoop 3在每两个数据块上创建一个奇偶校验块。这需要的磁盘空间仅为1.5倍,而Hadoop 2中的复制次数则为3倍.Hadoop 3中的容错级别保持不变,但其操作所需的磁盘空间更少。

     Spark可以通过重新计算DAG(有向无环图)来恢复信息。DAG由顶点和边形成。顶点表示RDD,边表示RDD上的操作。在某些部分数据丢失的情况下,Spark可以通过将操作序列应用于RDD来恢复它。请注意,每次需要重新计算RDD时,都需要等到Spark执行所有必要的计算。Spark还创建了检查点以防止故障。

YARN版

     Hadoop 2使用YARN版本1. YARN(Yet Another Resource Negotiator)是资源管理器。它管理可用资源(CPU,内存,磁盘)。此外,YARN执行作业调度。

     YARN在Hadoop 3中更新为版本2.有几个重大变化提高了可用性和可伸缩性。YARN 2支持流 - YARN应用程序的逻辑组,并在流级别提供聚合度量。收集过程(写入数据)和服务过程(读取数据)之间的分离提高了可伸缩性。此外,YARN 2使用Apache HBase作为主要后备存储。

     Spark可以在具有YARN的群集上独立运行,也可以与Mesos一起运行。

NameNodes的数量

     Hadoop 2支持整个命名空间的单活动NameNode和单备用NameNode,而Hadoop 3支持多个备用NameNode。

     Spark在管理SparkContext的主节点上运行驱动程序。

文件系统

     主要的Hadoop 2文件系统是HDFS - Hadoop分布式文件系统。该框架还兼容其他几个文件系统,如Amazon S3和Azure存储的Blob存储,以及分布式文件系统。

     Hadoop 3支持所有文件系统,如Hadoop 2.此外,Hadoop 3 与Microsoft Azure Data Lake和Aliyun对象存储系统兼容。

     Spark支持本地文件系统,Amazon S3和HDFS。

     为方便起见,我们创建了一个表格,总结了上述所有信息,并简要比较了两个版本的Hadoop和Spark 2.X的关键参数。
在这里插入图片描述

结论

     Hadoop 3和2之间的主要区别在于新版本提供了更好的优化和可用性,以及某些体系结构改进。

     Spark和Hadoop主要在抽象层次上有所不同。Hadoop被创建为处理大量现有数据的引擎。它具有较低的抽象级别,允许执行复杂的操作,但可能导致学习和管理困难。Spark更容易,更快捷,具有许多方便的高级工具和功能,可以简化您的工作。Spark在Hadoop之上运行,并且拥有许多优秀的库,如Spark SQL或机器学习库MLlib。总而言之,如果您的工作不需要特殊功能,Spark可能是最合理的选择。

版权声明:本文为博主原创文章,遵循 CC 4.0 BY-SA 版权协议,转载请附上原文出处链接和本声明。
本文链接:https://blog.csdn.net/psp0001060/article/details/87597624

智能推荐

class和struct的区别-程序员宅基地

文章浏览阅读101次。4.class可以有⽆参的构造函数,struct不可以,必须是有参的构造函数,⽽且在有参的构造函数必须初始。2.Struct适⽤于作为经常使⽤的⼀些数据组合成的新类型,表示诸如点、矩形等主要⽤来存储数据的轻量。1.Class⽐较适合⼤的和复杂的数据,表现抽象和多级别的对象层次时。2.class允许继承、被继承,struct不允许,只能继承接⼝。3.Struct有性能优势,Class有⾯向对象的扩展优势。3.class可以初始化变量,struct不可以。1.class是引⽤类型,struct是值类型。

android使用json后闪退,应用闪退问题:从json信息的解析开始就会闪退-程序员宅基地

文章浏览阅读586次。想实现的功能是点击顶部按钮之后按关键字进行搜索,已经可以从服务器收到反馈的json信息,但从json信息的解析开始就会闪退,加载listview也不知道行不行public abstract class loadlistview{public ListView plv;public String js;public int listlength;public int listvisit;public..._rton转json为什么会闪退

如何使用wordnet词典,得到英文句子的同义句_get_synonyms wordnet-程序员宅基地

文章浏览阅读219次。如何使用wordnet词典,得到英文句子的同义句_get_synonyms wordnet

系统项目报表导出功能开发_积木报表 多线程-程序员宅基地

文章浏览阅读521次。系统项目报表导出 导出任务队列表 + 定时扫描 + 多线程_积木报表 多线程

ajax 如何从服务器上获取数据?_ajax 获取http数据-程序员宅基地

文章浏览阅读1.1k次,点赞9次,收藏9次。使用AJAX技术的好处之一是它能够提供更好的用户体验,因为它允许在不重新加载整个页面的情况下更新网页的某一部分。另外,AJAX还使得开发人员能够创建更复杂、更动态的Web应用程序,因为它们可以在后台与服务器进行通信,而不需要打断用户的浏览体验。在Web开发中,AJAX(Asynchronous JavaScript and XML)是一种常用的技术,用于在不重新加载整个页面的情况下,从服务器获取数据并更新网页的某一部分。使用AJAX,你可以创建异步请求,从而提供更快的响应和更好的用户体验。_ajax 获取http数据

Linux图形终端与字符终端-程序员宅基地

文章浏览阅读2.8k次。登录退出、修改密码、关机重启_字符终端

随便推点

Python与Arduino绘制超声波雷达扫描_超声波扫描建模 python库-程序员宅基地

文章浏览阅读3.8k次,点赞3次,收藏51次。前段时间看到一位发烧友制作的超声波雷达扫描神器,用到了Arduino和Processing,可惜啊,我不会Processing更看不懂人家的程序,咋办呢?嘿嘿,所以我就换了个思路解决,因为我会一点Python啊,那就动手吧!在做这个案例之前先要搞明白一个问题:怎么将Arduino通过超声波检测到的距离反馈到Python端?这个嘛,我首先想到了串行通信接口。没错!就是串口。只要Arduino将数据发送给COM口,然后Python能从COM口读取到这个数据就可以啦!我先写了一个测试程序试了一下,OK!搞定_超声波扫描建模 python库

凯撒加密方法介绍及实例说明-程序员宅基地

文章浏览阅读4.2k次。端—端加密指信息由发送端自动加密,并且由TCP/IP进行数据包封装,然后作为不可阅读和不可识别的数据穿过互联网,当这些信息到达目的地,将被自动重组、解密,而成为可读的数据。不可逆加密算法的特征是加密过程中不需要使用密钥,输入明文后由系统直接经过加密算法处理成密文,这种加密后的数据是无法被解密的,只有重新输入明文,并再次经过同样不可逆的加密算法处理,得到相同的加密密文并被系统重新识别后,才能真正解密。2.使用时,加密者查找明文字母表中需要加密的消息中的每一个字母所在位置,并且写下密文字母表中对应的字母。_凯撒加密

工控协议--cip--协议解析基本记录_cip协议embedded_service_error-程序员宅基地

文章浏览阅读5.7k次。CIP报文解析常用到的几个字段:普通类型服务类型:[0x00], CIP对象:[0x02 Message Router], ioi segments:[XX]PCCC(带cmd和func)服务类型:[0x00], CIP对象:[0x02 Message Router], cmd:[0x101], fnc:[0x101]..._cip协议embedded_service_error

如何在vs2019及以后版本(如vs2022)上添加 添加ActiveX控件中的MFC类_vs添加mfc库-程序员宅基地

文章浏览阅读2.4k次,点赞9次,收藏13次。有时候我们在MFC项目开发过程中,需要用到一些微软已经提供的功能,如VC++使用EXCEL功能,这时候我们就能直接通过VS2019到如EXCEL.EXE方式,生成对应的OLE头文件,然后直接使用功能,那么,我们上篇文章中介绍了vs2017及以前的版本如何来添加。但由于微软某些方面考虑,这种方式已被放弃。从上图中可以看出,这一功能,在从vs2017版本15.9开始,后续版本已经删除了此功能。那么我们如果仍需要此功能,我们如何在新版本中添加呢。_vs添加mfc库

frame_size (1536) was not respected for a non-last frame_frame_size (1024) was not respected for a non-last-程序员宅基地

文章浏览阅读785次。用ac3编码,执行编码函数时报错入如下:[ac3 @ 0x7fed7800f200] frame_size (1536) was not respected for anon-last frame (avcodec_encode_audio2)用ac3编码时每次送入编码器的音频采样数应该是1536个采样,不然就会报上述错误。这个数字并非刻意固定,而是跟ac3内部的编码算法原理相关。全网找不到,国内音视频之路还有很长的路,音视频人一起加油吧~......_frame_size (1024) was not respected for a non-last frame

Android移动应用开发入门_在安卓移动应用开发中要在活动类文件中声迷你一个复选框变量-程序员宅基地

文章浏览阅读230次,点赞2次,收藏2次。创建Android应用程序一个项目里面可以有很多模块,而每一个模块就对应了一个应用程序。项目结构介绍_在安卓移动应用开发中要在活动类文件中声迷你一个复选框变量

推荐文章

热门文章

相关标签