2023江苏省赛样题解析-离线数据处理

抱歉，只有登录会员才可浏览！<a href='/member/login'>会员登录</a>

2023江苏省赛样题解析-离线数据处理任务一：数据抽取

任务描述

编写Scala工程代码，将MySQL的shtd_store库中表table1的数据全量抽取到Hive的ods库中对应表table1中，将表table2的数据增量抽取到Hive的ods库中对应表table2中。

启动Hive Metastore服务

Spark读写Hive表，需要访问Metastore服务。在终端中执行如下命令：

$ hive --service metastore

这将保持Hive Metastore服务一直运行，请勿关闭终端。如果要将其作为后台服务启动，则可以使用下面的命令：

$ nohup hive --service metastore &

这个命令将启动Hive Metastore服务，并在后台持续运行。

在Hive端，创建数据库：

hive> create database ds_ods;

子任务1

子任务1说明

1、抽取shtd_store库中table1的全量数据进入Hive的ods库中表table1。字段排序、类型不变，同时添加静态分区，分区字段类型为String，且值为当前比赛日的前一天日期（分区字段格式为yyyyMMdd）。并在hive cli执行show partitions ods.table1 ......

......

抱歉，只有登录会员才可浏览！会员登录

小白学苑PBCP

PBCP, 让大数据竞赛更简单!

2023江苏省赛样题解析-离线数据处理任务一：数据抽取

任务描述

启动Hive Metastore服务

子任务1

小白学苑PBCP

PBCP, 让大数据竞赛更简单!

2023江苏省赛样题解析-离线数据处理 任务一：数据抽取

任务描述

启动Hive Metastore服务

子任务1

2023江苏省赛样题解析-离线数据处理任务一：数据抽取