阅读背景:

39、Parquet数据源之自动分区推断&合并元数据

来源:互联网 

一、自动分区推断

1、概述

表分区是一种常见的优化方式,比如Hive中就提供了表分区的特性。在一个分区表中,不同分区的数据通常存储在不同的目录中,
分区列的值通常就包含在了分区目录的目录名中。Spark SQL中的Parquet数据源,支持自动根据目录名推断出分区信息。
例如,如果将人口数据存储在分区表中,并且使用性别和国家作为分区列。那么目录结构可能如下所示:

tableName
  表分区是一种常见的优化方式,比如Hive中就提供了



你的当前访问异常,请进行认证后继续阅读剩余内容。

分享到: