ApacheHive中如何进行分区

网友 36大数据

Hive 是用于大数据集查询的好工具 —— 特别是当数据集需要全表扫描时。但用户经常需要对某个列的值进行过滤，这时候分区就非常有效。分区是一个包含数据块的目录。当我们做分区的时候，会为某个列的唯一值创建一个分区。

让我们来运行一个简单的示例来了解分区特性。创建分区表的语法是：

create table tablename(colname type) partitioned by(colname type);

如果 hive.exec.dynamic.partition.mode 设置为 strict，那么你至少需要一个静态分区。而 non-stric 模式下，所有的分区都是动态的。

大数据

这里我们创建了一个名为 emp_info 的表，包含两个字段 name 和 address。我们通过列 ID (类型 nt)对表进行分区，然后往表里插入数据。重点需要考虑的时候分区的列的基数(也就是该列包含唯一值的个数)。选择基数很高的列来做分区会导致数据严重的碎片化。不要对数据过分的分区。如果有太多的小分区，那么对这么多的分区目录进行扫描代价也是比较高的，甚至可能比全表扫描还高。

下面是插入 values 的语法：