Configurar la ingesta
Después de instalar, el datalake todavía está vacío — ninguna base está marcada. Esta es la configuración mínima para que llegue el primer dato.
1. Elegir los orígenes
Sección titulada «1. Elegir los orígenes»En Origens (Orígenes), activa la recepción de eventos de snapshot y marca qué clústeres alimentan el datalake. Eliges si quieres snapshots automáticos, manuales, o ambos.
2. Ejecutar el primer snapshot
Sección titulada «2. Ejecutar el primer snapshot»Aquí hay un orden que sorprende: el primer snapshot sirve solo para revelar la estructura. La lista de bases y tablas viene del propio export, no de una conexión con la base — es eso lo que evita credenciales y acceso de red al origen. El precio es que Data Pump solo sabe qué existe después de ver un export.
Espera la ventana de backup, o toma un snapshot manual para no esperar.
3. Elegir las bases
Sección titulada «3. Elegir las bases»En Bancos (Bases), las bases encontradas en el export aparecen para marcar. Solo lo que se marque se ingiere.
Renombrar en el datalake
Sección titulada «Renombrar en el datalake»Cada base marcada muestra el nombre que tendrá en el datalake — haz clic para
cambiarlo. El nombre de la base es el prefijo de las tablas catalogadas: con el
alias vendas, la tabla payment pasa a ser vendas.payment.
Lo mismo aplica por tabla: abre Escolher tabelas (Elegir tablas) y cada
tabla muestra su nombre de destino, también clicable. Así es como tb_pgto pasa
a ser pagamentos.
Filtrar tablas
Sección titulada «Filtrar tablas»La lista de tablas tiene dos comportamientos, y la diferencia aparece cuando surge una tabla nueva en la base:
| Modo | La lista guarda | Tabla nueva |
|---|---|---|
| Exclusión | lo que no entra | se ingiere sola |
| Inclusión | lo que entra | queda fuera hasta que se marque |
Elige por lo que cambie menos: quien quiere casi toda la base usa exclusión y no necesita intervenir cuando aparece una tabla; quien quiere pocas tablas usa inclusión y queda protegido de ingerir algo inesperado.
4. Verificar
Sección titulada «4. Verificar»En el siguiente snapshot, el pipeline se ejecuta completo. En Execuções (Ejecuciones) ves cada etapa y qué tablas se actualizaron; en Datalake, las tablas catalogadas, con columnas y conteo de filas.
Si algo no llegó, mira cuando algo falla.
Reprocesar sin esperar
Sección titulada «Reprocesar sin esperar»Un export que ya está en S3 puede reingerirse sin tomar un snapshot nuevo. En Extrações (Extracciones), cada export tiene la acción de reprocesar — útil después de cambiar alias, filtros o particiones.