首先需要澄清一个常见误区:Hadoop 本身不是数据库,而是一个分布式系统基础架构(核心包括 HDFS 分布式文件系统和 MapReduce 计算框架,后来衍生出 YARN 等资源调度组件)。
常说的“Hadoop 生态数据库”(如 HBase、Hive、Impala 等)火起来,本质是因为传统关系型数据库在“大数据场景”下扛不住了,而 Hadoop 生态精准解决了痛点。下面从原因、核心优势、典型数据库组件三个层面说明:
数据爆发式增长 互联网、物联网、日志、视频等数据量从 TB 级飙到 PB/EB 级,传统 Oracle、MySQL 等单机/主从数据库:
数据类型变复杂 不只是结构化数据(表格),还有大量半结构化(JSON、日志)、非结构化数据(文本、图片),传统数据库难以高效存储和处理。
成本与灵活性需求 企业不想花天价买大型机/商业数据库License,希望用廉价 x86 机器集群实现海量数据存储与计算。
水平扩展能力极强 加机器就能扩存储和计算能力,理论上无上限,而传统数据库垂直扩容成本指数级上升。
成本低廉 基于开源+普通服务器,摆脱商业数据库绑定,硬件和软件成本大幅降低。
支持全类型数据 HDFS 能存任何格式数据,上层数据库组件可分别处理结构化、半结构化数据。
高容错性 数据多副本存储(默认3份),单机故障不影响整体服务,适合大规模集群。
批处理+分析能力强 适合离线海量数据清洗、统计、挖掘(如用户行为分析、报表)。
很多人说的“Hadoop数据库”通常指这些:
简单说:Hadoop 不是“数据库”但构建了大数据数据库/数仓的生态基础,火是因为它第一次让“廉价存算海量数据”成为现实。
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。