当前位置: 首页 > news >正文

大数据发展史

一、hadoop发展史

        hadoop创始人Doug Cutting,主要为了实现Google类似全文搜索功能,该功能是基于Lucene框架进行优化升级,索引引擎;

        2001年底Lucence成为Apache基金会的一个子项目,当时为了解决存储海量数据困难,检索海量速度慢,可以说Google是hadoop的思想之源;

        GFS ---> HDFS

        MapReduce ---> MR

        BigTable ---> HBase

        2006年3月份,MapReduce和Nutch Distributed File System(NDFS)被纳入到Hadoop项目,Hadoop正式诞生;

二、hadoop三大发行版本

        Hadoop三大发行版本:Aapche、Cloudera、Hortonworks。

        Apache版本最原始(最基础)的版本,对于入门学习最好。

         Cloudera内部集成了很多大数据框架,对应产品CDH。

        Hortonworks文档较好,对应产品HDP。

        Hortonworks现在已经被Cloudera公司收购,推出新的品牌CDP。

三、hadoop优势

        1)高可靠性:hadoop底层维护多个数据副本,即使某个计算或者存储出现故障,也不会丢失数据;

        2)高扩展:集群可方便的扩展数以千计的节点;

        3)  高效性:在MapReduce下,Hadoop工作是并行的,这样能加速任务的处理速度;

        4)高容错性:能够自动将失败的任务重新分配;

http://www.lryc.cn/news/191760.html

相关文章:

  • 有关范数的学习笔记
  • 如何通过MES系统提高生产计划效率?
  • 持续提升信息安全运维保障服务能力,天玑科技助力企业快速实现数字化转型
  • 【PostgreSQL启动,停止命令(重启)】
  • TLS 详解
  • 【重拾C语言】十、递归程序设计
  • SQL日期字段去时分秒
  • NLP项目:维基百科文章爬虫和分类【02】 - 语料库转换管道
  • 如何在Ubuntu 20.04.6 LTS系统上运行Playwright自动化测试
  • c++ sort函数cmp比较参数传入
  • 【计算机网络笔记】什么是计算机网络?
  • 极简C++(2) 类与对象
  • 【Java 进阶篇】JavaScript流程控制语句详解
  • 【Page-level Heap Fengshui -- Cross-Cache Overflow】corCTF2022-cache-of-castaways
  • vue-mixin
  • 力扣刷题 day43:10-13
  • 3、在docker 容器中安装tomcat
  • 工业互联网系列1 - 智能制造中有哪些数据在传输
  • centos7部署Nginx和RabbitMQ
  • Nacos集群搭建
  • 运维小工具分享
  • Eclipse插件安装版本不兼容问题解决方案——Papyrus插件为例
  • 【Qt之QTimer】使用及技巧
  • 零基础快速自学SQL,2天足矣。
  • Meta开源数字水印Stable Signature,极大增强生成式AI安全
  • python实现分词器
  • 第五十二章 学习常用技能 - Global 映射
  • vue实现瀑布流
  • 【虹科干货】Redis Enterprise 自动分层技术:大数据集高性能解决方案
  • 代码随想录训练营二刷第五十四天 | 300.最长递增子序列 674. 最长连续递增序列 718. 最长重复子数组