【HBase入门与实战】一文搞懂HBase!_hbase入门与实践_hbase实战-程序员宅基地

技术标签： 2024年程序员学习数据库 hbase 大数据

微服务和高并发：随着传统开发逐渐转向微服务架构，面向"老百姓"的应用需要处理的并发量急剧增加。在这种高并发环境下，传统关系型数据库在增删改查操作上的速度往往跟不上项目的需求。

传统开发解决高并发的策略：
在这里插入图片描述

① 将数据库中的数据定期存储到Redis中，后端查询操作直接面向Redis来执行。
② 构建数据库的Redis的集群化。

引入HBase的原因：当Redis的存储能力不足或主从结构过于复杂导致效率下降，Hbase成为一个优秀的选择。HBase以其【快速的读写速度】和【高吞吐量】，能够有效且快速地处理大数据的增删改查操作。

HBase特点：

① 高吞吐量的读写操作

为什么HBase有快速的读写速度(高吞吐量)？
写操作：

内存写入：所有的写操作首先被写入到MemStore中，这一操作是在内存中完成的，高效。并且对于HBase而言，只要数据写入MemStore存储区就标志着写操作已经完成，无需等待落盘。
数据备份：在数据刷新到磁盘之前，所有的写操作都会被记录在Hlog，即使故障，也能够恢复数据。
并行写操作：HBase的每个列族对应一个MemStore，能够对不同列族的数据进行并行处理。

如何理解"无需暂停写入操作以等待数据落盘"的设计理念？

MemStore提供了一种暂存数据的方式，直至数据被刷新到磁盘上的StoreFile中。
通过WAL机制保证MemStore在数据未落盘时发生故障也不会导致数据丢失。
保障数据一定能够落盘(即使数据丢失也可以通过HLog恢复数据)，此时可以认为操作已经完成。
因此写入的数据得到保障后，允许系统在高吞吐量的情况下继续接受和处理新的写请求。

读操作：

读操作可以直接从内存中的MemStore或者是缓存中的BlockCache获取数据
使用Bloom Filter检查所需的数据是否不在StoreFile中，如果数据不在那里，能够及时终止读操作，避免了不必要的磁盘访问。
(为什么Bloom Filter能够实现快速检查的功能？BloomFilter的算法原理。)

② HBase天生支持集群部署，无需进行复杂的分表或者分库操作。简化了大规模数据处理的复杂性。
③ HBase是列式存储

列式存储和行式存储的理解

定义

列式存储是指每一列的数据存储在一起。
行式存储是指每一行的数据存储在一起。

列式存储的优势

高效的数据存储：当查询特定列的数据(字段)时，数据库可以直接访问这部分连续存储的数据。(相当于索引)
对于复杂的分析查询通常只关注数据集中的特定几列，列式存储能够只读取必要的列。
压缩与优化：同类型的数据便于压缩与优化。
减少冗余：如果存在某部分列数据缺失，则可以在列存储时不存储该部分的值。
HBase 列族：列族是列的逻辑分组，同个列族的所有列存储在一起。

二、了解NoSQL的概念

NoSQL(Not Only SQL)：非关系型数据库

NoSQL 与 RDBMS 的区别：
在这里插入图片描述

数据模型

非关系型 VS 关系型

查询语言

不使用SQL，有独特指令。

可【伸缩性】和【可用性】问题

伸缩性

数据分裂【伸】和分布式架构
文件合并【缩】

数据分裂

数据分裂是HBase中自动管理数据存储容量的一种机制。
当表初始创建时，可能只有一个Region。随着数据量的不断增加，一个HBase表的数据量可能会增长到超出单个Region的承载能力。
为了有效管理这种情况，HBase通过数据分裂自动地将表分割为N部分，每个Region包含一部分的数据。

Region：

HBase的基本存储单元，由一系列行组成，内部的数据是按照行键(row key)排序的。

自动分裂：

Region大小达到的分裂阈值、RegionServer的数量都可以进行配置。(RegionServer的数量可以进行手动添加)
得到的新Region可以被分配到新的RegionServer上(保证负载均衡)
分裂的缺陷：分裂阶段处于阻塞状态，往里面写数据可能会导致数据丢失。
【优化：可以通过预分裂的方式确定数据规模大概需要分为多少个Region，并在相应的HRegionServer中提前建好Region，就无需做分裂了。能够大大提高写的效率】
分裂的过程是由HMaster主导，告诉该台HRegionServer应该迁移到哪一台不同的服务器上面。并且会在HMaster中存储元数据信息的表中记录某张HBase表的数据分别存储在哪几台RegionServer中的哪几个Region?

文件合并：

min_compact：

合并较小的、最近生成的HFiles
不会丢弃任何删除标记的数据(即使数据被标记为删除，物理上仍然存在于合并过后的文件中)

major_compact：

合并一个表中的所有HFiles
会彻底删除标记为删除的数据
通常是手动触发

compact后的数据【实际存储】在HDFS上，小的HFile应该远小于128M
分布式架构

HBase表：抽象概念，物理存储上被细分为多个Region。
Region：数据存储和访问的基本单元。
RegionServer：运行在集群中的服务器，负责管理和服务其上存储的一个或多个Region。
HBase采用的是典型的Master/Slave架构。HBase Master负责管理表和Region的元数据信息，以及RegionServer的负载均衡。而RegionServers负责处理客户端的读写请求，并管理存储在其上的Regions。

可用性

ZooKeeper实现了Client和HMaster之间的协调管理
HLog(WAL：Write Ahead Log 当数据写入具体的磁盘之前，先将其写一份在日志文件上)

HLog能够将死去的RegionServer"复活"，获取其原来的表数据。
当HRegionServer死的时候，则将HLog的数据迁移到另一台服务器上。
而数据迁移又依靠HMaster，因此HMaster也需要容灾机制，则出现了HMaster Backup和ZooKeeper进行协调管理。
如果ZooKeeper和HMaster之间心跳"断"了，则启用HMaster Backup.
事务性

NoSQL 更加注重性能、扩展性、灵活性，不像RDBMS一样强调原子性或一致性。
一致性问题

发生场景：通常发生在实时数仓。
批处理：规定记录数达到一定值才发送，可能导致时效性差（前后两条记录的时间间隔长）。
流处理：采用每隔一段时间（水位线）就进行数据发送的策略。面临的挑战是如何确保在时间范围内的数据都被纳入处理。

解决方案：允许一定的延迟（例如，计算3秒内的数据，但结果会在5秒内出来），这是为了等待那些符合时间范围但尚未被处理的数据。

流批一体：流处理和批处理结合的处理模式(Flink)
侧输出流：

为了保证最终一致性，对因延迟未能纳入批次的数据放入侧输出流中。
例如:如果在一个设定的时间窗口(如秒级窗口)内，某些数据未能被处理，这些数据就可以被放入侧输出流中。随后，可以在一个更长的时间窗口(如分钟窗口)内对这些数据进行处理。

实时数仓 VS 离线数仓

数据准确性：离线数仓高于实时数仓
时间范围：

实时数仓的时间范围：秒、分、时、天
离线数仓的时间范围：天、周、月、年

数据校准：

可以使用离线数仓的数据去校准实施数仓中同维度的数据（如天），以检测实时数仓的实时性。
这种校准通常使用大量模拟数据进行。

三、NoSQL、BI、大数据的关系

BI：商务智能

它是一套完整的解决方案
BI应用设计模型，模型依赖于模式
BI主要支持标准SQL(RDB)
难在业务掌握和熟悉的能力

NoSQL和大数据相关性较高，但是NoSQL!=大数据

NoSQL主要帮助大数据解决数据存储问题

四、HBase概述

定义

是一个面向列存储的NoSQL数据库
是一个分布式HashMap，底层数据是Key-Value格式
使用HDFS作为存储并利用其可靠性什么是【分布式HashMap】？
HashMap的本质是用一个简单的值形式映射一个复杂的值形式。
HBase通过一个RowKey提取该RowKey下多个列族下多个列的多个值。

特点

数据访问速度快，响应时间约2~20ms。
实时数仓和离线数仓都会用到HBase：

实时数仓

响应速度快

离线数仓

宽表列存储

支持随机读写，每个节点20k~100k+ ops/s

哈希表也可以随机读写

可扩展性

对Hadoop，1个NameNode只能带1024(实际1009)台DataNode
但是HBase可以扩展到20000+节点

高并发

HBase的物理架构

这张图描述了HBase的物理架构,主要包括以下几个部分:

Client: 客户端,用于与Zookeeper和HMaster进行交互。
Zookeeper: 用于维护HBase集群的状态和元数据信息。(协调管理)
HMaster: HBase集群的主控制节点,负责监控集群状态和管理区域服务器(RegionServer)。
HRegionServer: 区域服务器,负责存储和管理HBase数据。每个RegionServer管理着多个HRegion。
HRegion: 表的水平分区,一个Region包含一个或多个MemStore和多个StoreFile。
MemStore: 内存存储区,用于缓存新写入的数据。
StoreFile: 持久化存储文件,用于存储从MemStore刷新的数据。
HFile: StoreFile中的底层物理文件,实际存储数据。
DFS Client: 与底层HDFS集群交互的客户端。
HDFS: 底层的分布式文件系统,用于持久化存储HBase数据。

自我介绍一下，小编13年上海交大毕业，曾经在小公司待过，也去过华为、OPPO等大厂，18年进入阿里一直到现在。

深知大多数大数据工程师，想要提升技能，往往是自己摸索成长或者是报班学习，但对于培训机构动则几千的学费，着实压力不小。自己不成体系的自学效果低效又漫长，而且极易碰到天花板技术停滞不前！

因此收集整理了一份《2024年大数据全套学习资料》，初衷也很简单，就是希望能够帮助到想自学提升又不知道该从何学起的朋友。

既有适合小白学习的零基础资料，也有适合3年以上经验的小伙伴深入学习提升的进阶课程，基本涵盖了95%以上大数据开发知识点，真正体系化！

由于文件比较大，这里只是将部分目录大纲截图出来，每个节点里面都包含大厂面经、学习笔记、源码讲义、实战项目、讲解视频，并且后续会持续更新

如果你觉得这些内容对你有帮助，可以添加VX：vip204888 （备注大数据获取）

的小伙伴深入学习提升的进阶课程，基本涵盖了95%以上大数据开发知识点，真正体系化！**

如果你觉得这些内容对你有帮助，可以添加VX：vip204888 （备注大数据获取）
[外链图片转存中…(img-xnITAk6J-1712542833484)]

本文链接：https://blog.csdn.net/2401_84181125/article/details/137497953

原作者删帖不实内容删帖广告或垃圾文章投诉

智能推荐

什么是内部类？成员内部类、静态内部类、局部内部类和匿名内部类的区别及作用？_成员内部类和局部内部类的区别-程序员宅基地

文章浏览阅读3.4k次，点赞8次，收藏42次。一、什么是内部类？or 内部类的概念内部类是定义在另一个类中的类；下面类TestB是类TestA的内部类。即内部类对象引用了实例化该内部对象的外围类对象。public class TestA{ class TestB {}}二、为什么需要内部类？or 内部类有什么作用？1、内部类方法可以访问该类定义所在的作用域中的数据，包括私有数据。2、内部类可以对同一个包中的其他类隐藏起来。3、当想要定义一个回调函数且不想编写大量代码时，使用匿名内部类比较便捷。三、内部类的分类成员内部_成员内部类和局部内部类的区别

分布式系统_分布式系统运维工具-程序员宅基地

文章浏览阅读118次。分布式系统要求拆分分布式思想的实质搭配要求分布式系统要求按照某些特定的规则将项目进行拆分。如果将一个项目的所有模板功能都写到一起，当某个模块出现问题时将直接导致整个服务器出现问题。拆分按照业务拆分为不同的服务器，有效的降低系统架构的耦合性在业务拆分的基础上可按照代码层级进行拆分(view、controller、service、pojo)分布式思想的实质分布式思想的实质是为了系统的..._分布式系统运维工具

用Exce分析l数据极简入门_exce l趋势分析数据量-程序员宅基地

文章浏览阅读174次。1.数据源准备2.数据处理step1：数据表处理应用函数：①VLOOKUP函数; ② CONCATENATE函数终表：step2：数据透视表统计分析（1）透视表汇总不同渠道用户数, 金额（2）透视表汇总不同日期购买用户数，金额（3）透视表汇总不同用户购买订单数，金额step3：讲第二步结果可视化, 比如, 柱形图（1）不同渠道用户数, 金额（2）不同日期..._exce l趋势分析数据量

宁盾堡垒机双因素认证方案_horizon宁盾双因素配置-程序员宅基地

文章浏览阅读3.3k次。堡垒机可以为企业实现服务器、网络设备、数据库、安全设备等的集中管控和安全可靠运行，帮助IT运维人员提高工作效率。通俗来说，就是用来控制哪些人可以登录哪些资产（事先防范和事中控制），以及录像记录登录资产后做了什么事情（事后溯源）。由于堡垒机内部保存着企业所有的设备资产和权限关系，是企业内部信息安全的重要一环。但目前出现的以下问题产生了很大安全隐患：密码设置过于简单，容易被暴力破解；为方便记忆，设置统一的密码，一旦单点被破，极易引发全面危机。在单一的静态密码验证机制下，登录密码是堡垒机安全的唯一_horizon宁盾双因素配置

谷歌浏览器安装（Win、Linux、离线安装）_chrome linux debian离线安装依赖-程序员宅基地

文章浏览阅读7.7k次，点赞4次，收藏16次。Chrome作为一款挺不错的浏览器，其有着诸多的优良特性，并且支持跨平台。其支持（Windows、Linux、Mac OS X、BSD、Android），在绝大多数情况下，其的安装都很简单，但有时会由于网络原因，无法安装，所以在这里总结下Chrome的安装。Windows下的安装：在线安装：离线安装：Linux下的安装：在线安装：离线安装：..._chrome linux debian离线安装依赖

烤仔TVの尚书房 | 逃离北上广？不如押宝越南“北上广”-程序员宅基地

文章浏览阅读153次。中国发达城市榜单每天都在刷新，但无非是北上广轮流坐庄。北京拥有最顶尖的文化资源，上海是“摩登”的国际化大都市，广州是活力四射的千年商都。GDP和发展潜力是衡量城市的数字指...

随便推点

java spark的使用和配置_使用java调用spark注册进去的程序-程序员宅基地

文章浏览阅读3.3k次。前言spark在java使用比较少，多是scala的用法，我这里介绍一下我在项目中使用的代码配置详细算法的使用请点击我主页列表查看版本jar版本说明spark3.0.1scala2.12这个版本注意和spark版本对应，只是为了引jar包springboot版本2.3.2.RELEASEmaven <dependency> <gro_使用java调用spark注册进去的程序

汽车零部件开发工具巨头V公司全套bootloader中UDS协议栈源代码，自己完成底层外设驱动开发后，集成即可使用_uds协议栈源代码-程序员宅基地

文章浏览阅读4.8k次。汽车零部件开发工具巨头V公司全套bootloader中UDS协议栈源代码，自己完成底层外设驱动开发后，集成即可使用，代码精简高效，大厂出品有量产保证。:139800617636213023darcy169_uds协议栈源代码

AUTOSAR基础篇之OS(下)_autosar 定义了 5 种多核支持类型-程序员宅基地

文章浏览阅读4.6k次，点赞20次，收藏148次。AUTOSAR基础篇之OS(下)前言首先，请问大家几个小小的问题，你清楚：你知道多核OS在什么场景下使用吗？多核系统OS又是如何协同启动或者关闭的呢？AUTOSAR OS存在哪些功能安全等方面的要求呢？多核OS之间的启动关闭与单核相比又存在哪些异同呢？。。。。。。今天，我们来一起探索并回答这些问题。为了便于大家理解，以下是本文的主题大纲：[外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传(img-JCXrdI0k-1636287756923)(https://gite_autosar 定义了 5 种多核支持类型

VS报错无法打开自己写的头文件_vs2013打不开自己定义的头文件-程序员宅基地

文章浏览阅读2.2k次，点赞6次，收藏14次。原因：自己写的头文件没有被加入到方案的包含目录中去，无法被检索到，也就无法打开。将自己写的头文件都放入header files。然后在VS界面上，右键方案名，点击属性。将自己头文件夹的目录添加进去。_vs2013打不开自己定义的头文件

【Redis】Redis基础命令集详解_redis命令-程序员宅基地

文章浏览阅读3.3w次，点赞80次，收藏342次。此时，可以将系统中所有用户的 Session 数据全部保存到 Redis 中，用户在提交新的请求后，系统先从Redis 中查找相应的Session 数据，如果存在，则再进行相关操作，否则跳转到登录页面。此时，可以将系统中所有用户的 Session 数据全部保存到 Redis 中，用户在提交新的请求后，系统先从Redis 中查找相应的Session 数据，如果存在，则再进行相关操作，否则跳转到登录页面。当数据量很大时，count 的数量的指定可能会不起作用，Redis 会自动调整每次的遍历数目。_redis命令

URP渲染管线简介-程序员宅基地

文章浏览阅读449次，点赞3次，收藏3次。URP的设计目标是在保持高性能的同时，提供更多的渲染功能和自定义选项。与普通项目相比，会多出Presets文件夹，里面包含着一些设置，包括本色，声音，法线，贴图等设置。全局只有主光源和附加光源，主光源只支持平行光，附加光源数量有限制，主光源和附加光源在一次Pass中可以一起着色。URP：全局只有主光源和附加光源，主光源只支持平行光，附加光源数量有限制，一次Pass可以计算多个光源。可编程渲染管线：渲染策略是可以供程序员定制的，可以定制的有：光照计算和光源，深度测试，摄像机光照烘焙，后期处理策略等等。_urp渲染管线