Pular para o conteúdo
InícioPT · EN · ES · JA · ZH

Consultar no Athena

O Data Pump cataloga o resultado no Glue Data Catalog. Qualquer ferramenta que leia o catálogo — Athena, Redshift Spectrum, EMR, Spark — enxerga as tabelas.

O nome vem do banco e da tabela, com os apelidos que você configurou:

No banco No datalake No Athena
pagila / public.payment pagila.payment pagila_payment
com apelidos vendas / pagamentos vendas.pagamentos vendas_pagamentos

O schema public é removido; outros schemas são preservados.

SELECT customer_id, sum(CAST(amount AS DECIMAL(10,2))) AS total
FROM datalake.vendas_pagamentos
WHERE ano = 2024 AND mes = 3
GROUP BY customer_id
ORDER BY total DESC
LIMIT 20;

O WHERE nas colunas de partição é o que faz diferença no custo: sem ele, o Athena lê a tabela inteira.

O export do RDS entrega várias colunas como texto, incluindo datas e números decimais. Isso é do formato, não do Data Pump.

-- data
CAST(payment_date AS TIMESTAMP)
-- decimal
CAST(amount AS DECIMAL(10,2))

Se um CAST é usado toda vez, vale criar uma coluna extra na configuração da partição: ela é calculada uma vez, na ingestão, e chega pronta ao Athena.

A tela Datalake do console lista as tabelas catalogadas com colunas, tipos, contagem de linhas e a origem de cada uma. É mais rápido que consultar o catálogo pelo Athena quando você só quer saber o que tem.