最近在做大数据处置时,遇到两个大表 join 致使数据处置太慢(乃至算不出来)的问题。我们的数仓基于阿里的 ODPS,它与 Hive 相似,所以这篇文章也实用于应用 Hive 优化。处置优化问题,通常为先指定一些常常使用的优化参数,但是当设置参数依然不见效的时候,我们就要联合具体的业务,在 SQL 上做优化了。为了不增长大家的浏览累赘,我会简化这篇文章的业务描写最近在做大数据处置时,遇到两个大表 join 致使数据处置太慢(乃至算不出来)的问题。我们的数仓基于
最近在做大数据处置时,遇到两个大表 join 致使数据处置太慢(乃至算不出来)的问题。我们的数仓基于阿里的 ODPS,它与 Hive 相似,所以这篇文章也实用于应用 Hive 优化。处置优化问题,通常为先指定一些常常使用的优化参数,但是当设置参数依然不见效的时候,我们就要联合具体的业务,在 SQL 上做优化了。为了不增长大家的浏览累赘,我会简化这篇文章的业务描写最近在做大数据处置时,遇到两个大表 join 致使数据处置太慢(乃至算不出来)的问题。我们的数仓基于