roda na sua conta AWSem produção há mais de um ano

Seu banco de produção
não precisa saber que existe análise.

O Data Pump parte do snapshot que a AWS já tira todo dia. Ele exporta, organiza e cataloga — e o resultado é uma base consultável no Athena. Nada se conecta ao banco vivo.

Um snapshot é uma cópia parada no tempo. É de lá que o Data Pump tira tudo — nenhuma query toca o banco em produção, nem para descobrir quais tabelas existem.

o caminho de uma tabela
A AWS tira o snapshotautomático, ou quando você pedir
O RDS exporta em Parquetexported/{cluster}/{export}/pagila/public.payment/
O Data Pump organiza e renomeiacatalog/{cluster}/pagila.pagamentos/
Reparticiona pelo que você consultacatalog/{cluster}/pagila.pagamentos/ano=2024/mes=03/o Athena lê só o mês que a query pede
O Glue catalogapronto para SELECT
como funciona

Cinco etapas, nenhuma delas no seu banco

O pipeline dispara sozinho quando um snapshot fica pronto. Da notificação ao catálogo, não há intervenção.

origem

Parte do snapshot

Sem agente instalado, sem replicação, sem CDC. O snapshot que a AWS já tira é a fonte — inclusive de bancos em outra conta.

transporte

Exporta onde o dado está

Em cenário cross-account, a exportação roda na conta de origem e escreve direto no seu bucket. O dado bruto não trafega duas vezes.

organização

Você decide o que entra

Escolha os bancos, filtre tabelas e renomeie o que tiver nome técnico. `tb_pgto` vira `pagamentos` no datalake.

consulta

Particiona pelo que você pergunta

Uma tabela reparticionada por ano e mês faz o Athena ler só o recorte da query — não a tabela inteira.

histórico

Guarda o que o banco descarta

O histórico de longo prazo não é apagado a cada execução. Você expurga dado antigo do Postgres e ele continua consultável aqui.

operação

Mostra o que aconteceu

Cada execução registra as etapas, quais tabelas foram tocadas e a versão de cada componente. Quando falha, o erro fica visível.

por que assim

A alternativa é mexer no banco que não pode parar

Toda forma de tirar dado de um Postgres em produção cobra um preço. O snapshot é a que cobra menos.

consultar direto ou replicar
  • A query analítica concorre com a aplicação
  • Réplica exige configuração no banco e alguém para cuidar
  • CDC precisa de agente, conector e monitoração próprios
  • Acesso à rede do banco vira exceção de segurança
  • Dado expurgado some junto
partir do snapshot
  • O banco não recebe nenhuma conexão nova
  • A AWS já tira o snapshot — o custo do backup já existe
  • Nada instalado na origem, nem em outra conta
  • Sem rota de rede: o pipeline lê arquivos, não o banco
  • O histórico sobrevive ao expurgo
o console

Um painel na sua infraestrutura, não na nossa

O Data Pump inteiro roda na conta AWS do cliente — incluindo o console. Seus dados não passam por nós em momento nenhum.

Origens e bancos

Marque quais clusters alimentam o datalake e quais bancos são ingeridos. A lista de tabelas vem do próprio export.

Partições

Configure como cada tabela é reparticionada, e o que fazer quando uma linha muda no banco depois de já ingerida.

Execuções

Acompanhe cada rodada por etapa, veja quais tabelas foram atualizadas e o que falhou, com o log da etapa.

Quer ver funcionando no seu ambiente?

Toda instalação começa por uma conversa: definimos conta, região, VPC e bancos de origem, e montamos um pacote para esse cenário. Não há instalador genérico — conte o seu caso e respondemos com o que faz sentido.