写点什么

MapReduce 设计构思

发布于: 4 小时前

MapReduce 是一个分布式运算程序的编程框架,核心功能是将用户编写的业务逻辑代码和自带默认组件整合成一个完整的分布式运算程序,并发运行在 Hadoop 集群上。


既然是做计算的框架,那么表现形式就是有个输入(input),MapReduce 操作这个输入(input),通过本身定义好的计算模型,得到一个输出(output)。


对许多开发者来说,自己完完全全实现一个并行计算程序难度太大,而 MapReduce 就是一种简化并行计算的编程模型,降低了开发并行应用的入门门槛。


Hadoop MapReduce 构思体现在如下的三个方面:


  1. 如何对付大数据处理:分而治之


对相互间不具有计算依赖关系的大数据,实现并行最自然的办法就是采取分而治之的策略。并行计算的第一个重要问题是如何划分计算任务或者计算数据以便对划分的子任务或数据块同时进行计算。不可分拆的计算任务或相互间有依赖关系的数据无法进行并行计算!


  1. 构建抽象模型:Map 和 Reduce


MapReduce 借鉴了函数式语言中的思想,用 Map 和 Reduce 两个函数提供了高层的并行编程抽象模型。


Map: 对一组数据元素进行某种重复式的处理;


Reduce: 对 Map 的中间结果进行某种进一步的结果整理。


MapReduce 中定义了如下的 Map 和 Reduce 两个抽象的编程接口,由用户去编程实现:


map: (k1; v1) → [(k2; v2)]


reduce: (k2; [v2]) → [(k3; v3)]


Map 和 Reduce 为程序员提供了一个清晰的操作接口抽象描述。通过以上两个编程接口,大家可以看出 MapReduce 处理的数据类型是<key,value>键值对。


  1. MapReduce 框架结构


一个完整的 mapreduce 程序在分布式运行时有三类实例进程:


1、MR AppMaster:负责整个程序的过程调度及状态协调


2、MapTask:负责 map 阶段的整个数据处理流程


3、ReduceTask:负责 reduce 阶段的整个数据处理流程


发布于: 4 小时前阅读数: 4
用户头像

专注于大数据技术研究 2020.11.10 加入

运营公众号:五分钟学大数据。大数据领域原创技术号,深入大数据技术

评论

发布
暂无评论
MapReduce 设计构思