Consultar no Athena
O Data Pump cataloga o resultado no Glue Data Catalog. Qualquer ferramenta que leia o catálogo — Athena, Redshift Spectrum, EMR, Spark — enxerga as tabelas.
Como as tabelas aparecem
Seção intitulada “Como as tabelas aparecem”O nome vem do banco e da tabela, com os apelidos que você configurou:
| No banco | No datalake | No Athena |
|---|---|---|
pagila / public.payment |
pagila.payment |
pagila_payment |
com apelidos vendas / pagamentos |
vendas.pagamentos |
vendas_pagamentos |
O schema public é removido; outros schemas são preservados.
Consultar
Seção intitulada “Consultar”SELECT customer_id, sum(CAST(amount AS DECIMAL(10,2))) AS total FROM datalake.vendas_pagamentos WHERE ano = 2024 AND mes = 3 GROUP BY customer_id ORDER BY total DESC LIMIT 20;O WHERE nas colunas de partição é o que faz diferença no custo: sem ele, o
Athena lê a tabela inteira.
O export do RDS entrega várias colunas como texto, incluindo datas e números decimais. Isso é do formato, não do Data Pump.
-- dataCAST(payment_date AS TIMESTAMP)
-- decimalCAST(amount AS DECIMAL(10,2))Se um CAST é usado toda vez, vale criar uma coluna extra na configuração
da partição: ela é calculada uma vez, na ingestão, e chega pronta ao Athena.
Ver o que existe
Seção intitulada “Ver o que existe”A tela Datalake do console lista as tabelas catalogadas com colunas, tipos, contagem de linhas e a origem de cada uma. É mais rápido que consultar o catálogo pelo Athena quando você só quer saber o que tem.