Pular para o conteúdo

Fonte → Bronze → Silver → Gold → publish

Aula 3 de 129 minOperarAtualizada em 2026-10-04

Vídeo em produção

A gravação desta aula está no lote de produção. O objetivo, o exercício e a documentação já valem. Duração-alvo: 9 min.

Objetivo: Executar pipeline full ponta a ponta

Selo de estado: Preview (teto atual do produto) · Curso ACD-220 — Pipelines e medalhão Bronze/Silver/Gold · Aula 3 de 12 · Atualizado em 2026-10-04.

Objetivo#

Ao final desta aula você vai executar pipeline full ponta a ponta — disparar a carga, descer até o log da tentativa e conferir o resultado nos dados, não no selo verde.

Vídeo#

Identificador no manifesto: acd-220-03-pipeline-full · duração-alvo 9 min · tela do produto: /sources.

Roteiro de gravação (5 capítulos):

#Minutagem-alvoCapítuloTela do produto
10:00–0:50Abertura: título + selo. As duas trilhas do produto e por que elas têm nomes diferentes./sources
20:50–3:00Hub da fonte: Processar agora e os quatro passos ao vivo validar → landing → bronze → registrar./sources/[id]
33:00–5:30Painel Publicação e agenda → Executar agora: revisar contexto, versão e destino antes de confirmar; a resposta diz que a agenda não foi ligada./sources/[id]
45:30–7:40Execuções (DAGs): contadores, descida Execução → Tarefa → Tentativa → Logs, aba Grafo./dags
57:40–9:00Conferir no Console de dados (contagem, chaves, valores conhecidos); encerramento com o "faça você mesmo"./dados

Conteúdo#

"Sucesso" não substitui a conferência

Um selo verde diz que o job terminou, não que o número está certo. A carga só está conferida quando você abriu o destino e viu a contagem e as chaves conhecidas do seu conjunto de teste.

As duas trilhas, e por que são duas

O produto mostra o progresso em passos serializáveis, ao vivo, em duas trilhas com propósitos diferentes:

Ingestão de uma fonte — no hub da fonte, botão Processar agora:

código
validar → landing → bronze → registrar
PassoRótulo na telaO que faz
validarValidando fonte e credenciaisConfere conexão e credenciais cifradas
landingEnviando arquivos para a landing (GCS)Cópia bruta para a área de ingestão do workspace
bronzeCarregando na camada Bronze (BigQuery)Ingestão verbatim (cru) das tabelas
registrarRegistrando no datalakeAtualiza catálogo e última sincronização (grava a data da última carga)

Pipeline de engenharia — a trilha completa da definição publicada:

código
ingest → bronze → silver → gold → publish

A primeira trilha traz o cru até a Bronze. A segunda leva o cru até os marts prontos para BI e republica o painel Gold no fim. Quem só precisa de dado na Bronze para investigar usa a primeira; quem quer dashboard atualizado roda a segunda.

O que o modo full garante (e o que ele custa)

Um pipeline full recalcula tudo, do zero, a cada execução: lê a fonte, carrega a Bronze verbatim, aplica qualidade e deduplicação na Silver e recria os marts Gold. É o modo mais simples e sempre correto — e é o fallback de qualquer modo incremental que não consiga garantir a identidade com o full. Por isso também é o mais caro: ele lê tudo, todas as vezes.

Use full quando: é a primeira carga (ela já é o backfill), a tabela é pequena, a origem apaga linhas, ou você quer exatidão máxima depois de mudar uma regra de negócio.

Executar: as duas portas

Processar agora (hub da fonte) dispara a trilha de ingestão. Executar agora (painel Publicação e agenda) dispara uma execução do pipeline publicado — e a resposta do produto é explícita: "Execução disparada — ela NÃO liga a agenda. Acompanhe na página da DAG." Antes de confirmar, a tela pede que você revise contexto, versão e destino.

Executar é ação cara: passa pela verificação de acesso do workspace. Com assinatura em atraso, suspensão ou cancelamento, a execução é bloqueada com mensagem explícita e link para Planos — não falha em silêncio.

Acompanhar: a descida em quatro níveis

Em Orquestração → Execuções (DAGs) (/dags), a lista separa falha na última execução (o que pede ação agora) de falhas no período (histórico), mostra a agenda por pipeline e carimba os horários com o fuso explícito. Abra a execução e desça: Execução → Tarefa → Tentativa → Logs. O log mostrado é o daquela tentativa — o seletor de tentativa fica no topo, ao lado do seletor de execução. A aba Grafo mostra as dependências entre as tarefas da versão executada.

Conferir: os contadores e o destino

Cada execução grava o trio Bronze / Silver / rejeitadas, o número de marts, a duração e os KPIs. A regra é visível e não negociável:

código
rejectedRows = bronzeRows − silverRows

A diferença é sempre explícita: nada desaparece em silêncio. Depois, abra Dados → Console de dados e valide que as tabelas existem, que a contagem bate com o conjunto de teste e que chaves e valores conhecidos estão lá.

Exemplo: a Comércio Aurora

Maria roda o full de produtos (1.800 linhas, modo Full). A trilha de ingestão passa por validar → landing → bronze → registrar e a Bronze fica com 1.800 linhas. Na trilha do pipeline, a Silver descarta 12 linhas sem código de produto: rejectedRows = 1.800 − 1.788 = 12. A Gold recria os marts (gold_receita_mensal, gold_receita_uf, gold_receita_categoria, gold_kpis), o publish republica o painel, e Maria confere no Console de dados que aurora_silver tem 1.788 linhas e que o produto P-1001 está lá com o preço que ela conhece.

Erros comuns

SintomaCausa provávelO que fazer
Muitas linhas rejeitadasDado fora das regras de qualidade da SilverVeja quais regras reprovaram — aula 7
Mart não atualizouO pipeline parou antes de gold/publishRode a trilha completa; confira o log da tentativa
Não iniciouAssinatura, limite de concorrência ou permissãoLeia a mensagem na tela; regularize em Planos se for cobrança
Falha de autenticaçãoA conexão referenciadaCorrija na conexão; não recadastre a senha no pipeline
Sucesso, mas painel vazioDestino, materialização, vínculo do BI ou filtrosConfira o destino no Console de dados antes de culpar o painel
A carga estourou o teto de bytesA query lê demaisReduza o escopo ou particione a origem — aula 12
Reexecutei e duplicouModo de carga da tarefa (Silver/Gold append insere)Reveja o efeito no destino na etapa Carga/Transformações

O que é Preview aqui

O pipeline medalhão é determinístico e congelado por testes de referência; a materialização real em BigQuery depende do ambiente de nuvem do workspace e é Preview. Sem ambiente configurado a execução falha com mensagem em vez de fingir sucesso — nunca interprete a ausência de erro como prova de carga. Tempo de execução não é publicado: depende do seu volume, da origem e da fila.

Faça você mesmo#

No workspace de treino Aurora Varejo, como dono, com um conjunto pequeno e sintético cujas contagens você conhece de antemão.

  1. Abra /sources, escolha o pipeline de produtos e confirme na etapa Carga que o tipo de ingestão é Full.
  2. No hub da fonte, use Processar agora e acompanhe os quatro passos: validar → landing → bronze → registrar.
  3. No painel Publicação e agenda, use Executar agora; revise contexto, versão e destino e confirme. Leia a resposta: ela diz que a agenda não foi ligada.
  4. Em /dags, abra a execução criada e desça Execução → Tarefa → Tentativa → Logs. Troque de tentativa no seletor do topo e note que o log muda.
  5. Abra a aba Grafo e identifique a ordem Bronze → Silver → Gold da versão executada.
  6. Anote os contadores da execução e confirme a conta rejeitadas = Bronze − Silver.
  7. Em Dados → Console de dados, confira a contagem de produtos na Bronze e na Silver e procure uma chave que você conhece (ex.: P-1001).

Você terminou quando existe uma execução rastreável com log por tentativa, os contadores Bronze/Silver/rejeitadas fecham a conta, você viu os marts Gold recriados e conferiu a contagem no destino — não apenas o selo verde. A agenda continua como estava.

Checagem rápida#

Três perguntas no final da aula, corrigidas no servidor. A aula só conta como concluída depois da checagem.

Documentação relacionada#

Capacidades ensinadas#

(conceitual — sem capacidade específica da matriz) — o selo exibido na aula é sempre o estado mais conservador entre as capacidades citadas; nada aqui é "GA".

Carregando seu progresso…