Ir al contenido
InicioPT · EN · ES · JA · ZH

Consultar en Athena

Data Pump cataloga el resultado en el Glue Data Catalog. Cualquier herramienta que lea el catálogo — Athena, Redshift Spectrum, EMR, Spark — ve las tablas.

El nombre viene de la base y de la tabla, con los alias que configuraste:

En la base En el datalake En Athena
pagila / public.payment pagila.payment pagila_payment
con alias vendas / pagamentos vendas.pagamentos vendas_pagamentos

El schema public se elimina; los demás schemas se preservan.

SELECT customer_id, sum(CAST(amount AS DECIMAL(10,2))) AS total
FROM datalake.vendas_pagamentos
WHERE ano = 2024 AND mes = 3
GROUP BY customer_id
ORDER BY total DESC
LIMIT 20;

El WHERE sobre las columnas de partición es lo que hace la diferencia en el costo: sin él, Athena lee la tabla entera.

El export de RDS entrega varias columnas como texto, incluidas fechas y números decimales. Eso es del formato, no de Data Pump.

-- data
CAST(payment_date AS TIMESTAMP)
-- decimal
CAST(amount AS DECIMAL(10,2))

Si un CAST se usa cada vez, vale crear una columna extra en la configuración de la partición: se calcula una vez, en la ingesta, y llega lista a Athena.

La pantalla Datalake de la consola lista las tablas catalogadas con columnas, tipos, conteo de filas y el origen de cada una. Es más rápido que consultar el catálogo desde Athena cuando solo quieres saber qué hay.