配置数据接入
安装完成后数据湖仍是空的——还没有勾选任何数据库。以下是让第一批数据进入所需的最小配置。
1. 选择数据来源
Section titled “1. 选择数据来源”在 Origens(数据来源)中开启快照事件接收,并勾选哪些集群为数据湖提供数据。你可以 选择只接收自动快照、只接收手动快照,或者两者都接收。
2. 运行第一次快照
Section titled “2. 运行第一次快照”这里有一个出乎意料的顺序:第一次快照仅用于揭示结构。数据库和表的清单来自导出本身, 而不是来自与数据库的连接——正因如此才不需要凭证和到源端的网络访问。代价是 Data Pump 必须先看到一次导出,才知道有哪些对象存在。
你可以等待备份窗口,也可以手动创建一个快照以免等待。
3. 选择数据库
Section titled “3. 选择数据库”在 Bancos(数据库)中,导出里发现的数据库会列出供你勾选。只有被勾选的才会接入。
在数据湖中重命名
Section titled “在数据湖中重命名”每个勾选的数据库都会显示它在数据湖中使用的名称——点击即可修改。数据库名称是编目表名的
前缀:若别名设为 vendas,则 payment 表会变成 vendas.payment。
表级别同理:打开 选择表,每张表都会显示目标名称,同样可点击修改。例如把 tb_pgto
改成 pagamentos。
表清单有两种行为方式,其差异在数据库中出现 新表 时才会显现:
| 模式 | 清单记录的是 | 新出现的表 |
|---|---|---|
| 排除 | 不 接入的表 | 自动被接入 |
| 包含 | 接入的表 | 在勾选之前不会接入 |
按变动更少的方式来选:需要几乎整个数据库的,用排除模式,新表出现时无需改动;只需要少数 几张表的,用包含模式,可避免意外接入不该接入的数据。
4. 核对结果
Section titled “4. 核对结果”下一次快照时,流水线会完整运行。在 Execuções(执行记录)中可以看到每个阶段以及哪些 表被更新;在 Datalake(数据湖)中可以看到已编目的表,包括字段和行数。
如果数据没有到达,请参阅 出现问题时。
无需等待即可重新处理
Section titled “无需等待即可重新处理”已经位于 S3 中的导出可以重新接入,无需生成新的快照。在 Extrações(导出记录)中, 每个导出都提供重新处理的操作——在修改别名、过滤规则或分区之后很有用。