Data Pump
Data Pump 读取 AWS 已经为你的 RDS 生成的快照,构建一个可在 Athena 中查询的数据湖。 没有任何组件会连接生产数据库——连查询有哪些表也不会连接。
它解决的问题
Section titled “它解决的问题”分析生产环境 Postgres 中的数据,通常意味着一个糟糕的选择:在支撑应用的数据库上跑分析 查询、维护一个只读副本,或者部署 CDC。每种方式都有代价——资源争用、数据库侧的配置、 需要维护的代理,或者一条会变成安全例外的网络路径。
快照本来就存在。AWS 每天都会生成,备份费用也已经计入账单。Data Pump 就从它开始。
你会得到什么
Section titled “你会得到什么”一条在快照就绪时自动触发的流水线,以及一个用于运维的控制台——两者都运行在 你自己的 AWS 账号中。你的数据在任何时候都不会经过 CO2 Lab。
| 数据来源 | 自动或手动快照,可来自本账号或其他账号 |
| 格式 | Parquet,在 Glue 中编目 |
| 查询 | Athena,或任何能读取 Glue Data Catalog 的工具 |
| 运维 | 部署在你的 VPC 内、需登录访问的 Web 控制台 |
Data Pump 按安装实例授权,并且 没有通用安装程序。每一次安装都从与 CO2 Lab 的交接 (handoff)开始:我们在交接中确定账号、区域、VPC、存储桶和源账号,你随后会收到一个 按此场景组装的软件包。
原因在于这些决定会改变模板所声明的资源,因此无法留到安装时再定。交接中具体确定哪些 内容,请参阅安装步骤。
它不是开源软件,也不在 AWS Marketplace 上架。如需采购,请联系 contato@co2lab.io。
如果源数据库位于另一个 AWS 账号中,请参阅 跨账号部署——这需要在交接时确定,因为它会向模板追加权限。