从快照开始
无需安装代理,无需复制,无需 CDC。AWS 已经生成的快照就是数据源 — 跨账号的数据库同样适用。
Data Pump 从 AWS 每天已经生成的快照开始。导出、整理、编目 — 结果就是可以在 Athena 中查询的数据。全程不连接运行中的数据库。
快照是时间上凝固的副本。一切都从那里取出 — 没有任何查询触及生产环境,连查看有哪些表也不会。
exported/{cluster}/{export}/pagila/public.payment/catalog/{cluster}/pagila.pagamentos/catalog/{cluster}/pagila.pagamentos/ano=2024/mes=03/快照就绪后,流程自动触发。从通知到编目,无需人工介入。
无需安装代理,无需复制,无需 CDC。AWS 已经生成的快照就是数据源 — 跨账号的数据库同样适用。
跨账号场景下,导出在源账号执行,直接写入你的存储桶。原始数据不会传输两次。
选择数据库、过滤表,并重命名那些技术性的名字。`tb_pgto` 在数据湖中变成 `payments`。
按年月重新分区后,Athena 只读取查询需要的那一部分 — 而不是整张表。
长期历史不会在每次运行时被清除。从 Postgres 中清理旧数据后,它们在这里依然可查。
每次运行都记录各个步骤、被更新的表,以及各组件的版本。失败时,错误清晰可见。
从运行中的 Postgres 取数据,每种方式都有代价。从快照开始,代价最小。
Data Pump 全部运行在客户的 AWS 账号中 — 控制台也不例外。你的数据任何时候都不会经过我们。
指定哪些集群供给数据湖、哪些数据库被纳入。表清单直接来自导出内容本身。
配置每张表如何重新分区,以及已纳入的数据行在数据库中被修改后如何处理。
按步骤跟踪每次运行,查看哪些表被更新、哪一步失败,并附带该步骤的日志。
每次部署都从一次沟通开始:确定账号、区域、VPC 和数据来源后,我们为该场景构建对应的软件包。没有通用安装程序 — 告诉我们你的情况,我们会给出合适的方案。