阅读背景:

Hadoop中Map端shuffle过程及源码解析

来源:互联网 

        在Hadoop这样的集群环境中,大部分map task与reduce task的执行是在不同的节点上。当然很多情况下Reduce执行时需要跨节点去拉取其它节点上的map task结果。如果集群正在运行的job有很多,那么task的正常执行对集群内部的网络资源消耗会很严重。这种网络消耗是正常的,我们不能限制,能做的就是最大化地减少不必要的消耗。还有在节点内,相比于内存,磁盘IO对job完成时间的影响也是可观的。从最基本的要求来说,我们对Shuffle过程的期望可以有:         在Hadoop这样的集群环境中,大部分map task与reduce task的执行



你的当前访问异常,请进行认证后继续阅读剩余内容。

分享到: