Consultar en Athena
Data Pump cataloga el resultado en el Glue Data Catalog. Cualquier herramienta que lea el catálogo — Athena, Redshift Spectrum, EMR, Spark — ve las tablas.
Cómo aparecen las tablas
Sección titulada «Cómo aparecen las tablas»El nombre viene de la base y de la tabla, con los alias que configuraste:
| En la base | En el datalake | En Athena |
|---|---|---|
pagila / public.payment |
pagila.payment |
pagila_payment |
con alias vendas / pagamentos |
vendas.pagamentos |
vendas_pagamentos |
El schema public se elimina; los demás schemas se preservan.
Consultar
Sección titulada «Consultar»SELECT customer_id, sum(CAST(amount AS DECIMAL(10,2))) AS total FROM datalake.vendas_pagamentos WHERE ano = 2024 AND mes = 3 GROUP BY customer_id ORDER BY total DESC LIMIT 20;El WHERE sobre las columnas de partición es lo que hace la diferencia en el
costo: sin él, Athena lee la tabla entera.
El export de RDS entrega varias columnas como texto, incluidas fechas y números decimales. Eso es del formato, no de Data Pump.
-- dataCAST(payment_date AS TIMESTAMP)
-- decimalCAST(amount AS DECIMAL(10,2))Si un CAST se usa cada vez, vale crear una columna extra en la
configuración de la partición: se calcula una vez, en la ingesta, y llega lista
a Athena.
Ver qué existe
Sección titulada «Ver qué existe»La pantalla Datalake de la consola lista las tablas catalogadas con columnas, tipos, conteo de filas y el origen de cada una. Es más rápido que consultar el catálogo desde Athena cuando solo quieres saber qué hay.