Estado: Preview. O pipeline é determinístico e provado por teste (conjunto de testes de referência); a materialização real no datalake = NÃO MEDIDO (liberação em nuvem ainda não exercida). Exemplos sintéticos.
Leia antes: Como os dados fluem · Pipeline medalhão.
O que é#
Um pipeline full recalcula tudo, do zero, a cada execução: lê a fonte, carrega o Bronze verbatim, aplica qualidade/deduplicação na Silver e recria os marts Gold. É o modo mais simples e sempre correto — e o fallback dos modos incrementais.
Para que serve#
- Fazer a primeira carga de uma fonte (que já serve de backfill).
- Garantir exatidão máxima quando a tabela é pequena ou muda pouco.
- Reprocessar tudo após uma mudança de regra de negócio.
Quando usar / quando não usar#
- Use quando: é a 1ª carga; a tabela é pequena; a fonte apaga linhas; ou você quer a garantia máxima.
- Não use quando: a tabela é grande e só cresce — aí o incremental por watermark é muito mais barato.
Plano e permissões#
- Núcleo · verificação de acesso · chaves de desligamento para execução de ingestão (carga) e atualização de painéis (republicar o painel).
Pré-requisitos#
- Uma fonte conectada e testada (ex.: PostgreSQL, BigQuery ou um arquivo importado).
- Pelo menos uma tabela selecionada para ingestão.
As duas trilhas#
O produto mostra o progresso ao vivo em passos serializáveis:
Ingestão de uma fonte (detalhe do pipeline, seção Tabelas do Bronze → Ingerir ao vivo):
validar → landing → bronze → registrarPipeline de engenharia (página do pipeline):
ingest → bronze → silver → gold → publishPasso a passo#
- Abra o pipeline, vá na seção Tabelas do Bronze e clique em Ingerir ao vivo para trazer os brutos até o
Bronze (
validar → landing → bronze → registrar). - Vá à página do pipeline e rode a trilha completa
ingest → bronze → silver → gold → publish, deixando o modo em full (padrão). - Acompanhe, na tela de execução, os contadores Bronze / Silver / rejeitadas e a lista de marts Gold gerados.
- Ao final, o dashboard Gold é republicado automaticamente (você não precisa publicar à mão).
Exemplo (sintético)#
Fonte: uma tabela vendas com as colunas pedido_id, data_pedido, uf, categoria, preco_unitario, quantidade, status. Depois do full, os marts Gold típicos são:
| Mart | Conteúdo |
|---|---|
gold_receita_mensal | receita e nº de pedidos por mês |
gold_receita_uf | receita e pedidos por UF |
gold_receita_categoria | receita e share por categoria |
gold_kpis | linha única: receita total, pedidos, ticket médio, nº de UFs, período |
Resultado esperado#
- Um registro de execução com Bronze / Silver / rejeitadas / nº de marts / duração / KPIs.
rejectedRows = bronzeRows − silverRows— a diferença é sempre visível.- O painel público Gold é atualizado e passa a mostrar os dados recém-processados.
Limites e custos#
- Carga SaaS/arquivo → Bronze: default
batchSize5.000,maxRows200.000. - Full lê tudo — é o modo mais caro por definição. As consultas no datalake são cobráveis e limitadas pelo teto de volume lido por consulta (padrão 1 GiB). Custo faturado em BRL = NÃO MEDIDO.
Segurança#
- Datasets/buckets escopados por workspace (
<prefix>_bronze/_silver/_gold). - Nomes de coluna interpolados apenas a partir de allowlist; PII mascarada no profiling.
Erros comuns#
| Sintoma | Causa provável | O que fazer |
|---|---|---|
| Muitas linhas rejeitadas | dados fora das regras de qualidade | Veja quais regras reprovaram em Qualidade |
| Mart não atualizou | pipeline parou antes do gold/publish | Rode a trilha completa; confira o log de execução |
| Carga estourou o teto de bytes | query lê demais | Reduza o escopo ou ajuste o teto conscientemente |
Diagnóstico#
- Compare
bronzeRows(o que chegou) comsilverRows(o que passou na limpeza). - Confira a lista de marts Gold na tela de execução.
Relacionados#
Última revisão: 2026-09-08.