Skip to content
Docs

This page has not been translated yet — you are reading the Portuguese version. View in Portuguese

GA candidateUpdated on 2026-09-08

BigQuery — conector

Extrai dados de um projeto BigQuery seu (via SQL, com projeto de billing opcional) e carrega na nossa cloud.

On this page (15)

Estado: GA-candidato — motor provado por testes; o limite atual do produto ainda é Preview (sem SLA nem certificação de nuvem). Métricas de nuvem: NÃO MEDIDO.

Leia antes: ../conectores.md (mapa de estados) e fichas.md (índice das fichas).


O que é#

Extrai dados de um projeto BigQuery seu (via SQL, com projeto de billing opcional) e carrega na nossa cloud.

Modos de ingestão suportados:

  • Nós buscamos — Nós buscamos os dados na sua fonte.

Para que serve#

Trazer os dados de BigQuery para o seu datalake e disponibilizá-los às camadas Bronze/Silver/Gold, aos modelos de BI e ao wizard de perguntas em linguagem natural.

Quando usar / quando não usar#

Use quando você precisa consolidar esta fonte no datalake de forma agendada, com isolamento por workspace.

Evite enviar arquivos com esquema instável sem antes conferir o profiling e o schema drift.

Plano e permissões#

  • Plano: núcleo do produto (conectores fazem parte de todos os planos; o limite é o número de fontes do plano).
  • Acesso: exige workspace ativo — com a assinatura em atraso, suspensa ou cancelada, a execução fica bloqueada.
  • Desligamento: a execução de ingestão pode ser desligada temporariamente (manutenção ou incidente). Quando isso acontece, a tela informa que o recurso está indisponível no momento.

Pré-requisitos#

  • Um usuário somente leitura no banco, com acesso ao schema/tabelas desejados.
  • Rede: escolha como chegamos até o banco — IP público + allowlist, túnel SSH (bastion), Cloud SQL ou VPN.

Credenciais#

Campos sensíveis. Eles são cifrados (AES-256-GCM) e nunca ficam no config da conexão, na definição do pipeline, no export ou na DAG. Por padrão o valor cifrado fica no banco; mover a credencial desta conexão para o cofre externo de credenciais é uma escolha explícita, feita por conexão depois de salvar — ver ../../administracao/credenciais-e-rotacao.md.

  • Chave da service account (JSON) (serviceAccountJson)

Segredos nunca são reexibidos e passam pela redação em todo erro/log (token cru, URL-encoded e em JSON).

Campos do formulário#

CampoRótuloTipoObrigatórioObservação
projectIdProjeto dos dados (Project ID)textosim—
billingModeCobrança das consultas (billing)seleçãonãopadrão: same; opções: same / separate
billingProjectIdProjeto de billing (Project ID)textonãoaparece quando billingMode = separate
datasetDatasettextonão—
locationLocationtextonão—
serviceAccountJson 🔒Chave da service account (JSON)senha/segredosimsegredo (cifrado; cofre externo opcional)

Passo a passo#

  1. No menu ETL/ELT → Conexões, use Nova conexão.
  2. Escolha BigQuery no catálogo.
  3. Preencha os campos do formulário (veja a tabela acima).
  4. Use Testar conexão. O resultado vem separado por Rede (alcance do servidor), Autenticação (usuário e senha) e Leitura (listar tabelas) — cada um com OK, Falhou, Não se aplica ou Não testado.
  5. Use Salvar conexão. Salvar NÃO inicia ingestão nenhuma.
  6. No cartão da conexão, use Montar extração (ou vá em ETL/ELT → Pipelines e use Novo pipeline). O pipeline aponta para a conexão salva — a credencial não é copiada.
  7. Na revisão, Publicar (agenda desligada) cria a versão 1 sem executar nada. Depois, Ativar agenda e Executar agora são ações separadas.

Exemplo — teste de conexão#

Configuração de exemplo (todos os valores são fictícios; segredos aparecem mascarados):

text
# Exemplo sintético (valores fictícios — não são credenciais reais)
projectId = meu-projeto-exemplo
billingMode = same
dataset = vendas
location = southamerica-east1
serviceAccountJson = •••••• (cifrado — nunca exibido)

Resultado esperado#

O Testar conexão retorna a lista de tabelas/recursos descobertos. Após a primeira carga, as linhas aparecem na camada Bronze do seu workspace, prontas para o pipeline.

Limites e custos#

  • Paginação: teto duro por execução (default 10.000 páginas / 5.000.000 linhas); guarda anti-loop.
  • Volume estimado: ~5 GB/mês (estimativa de catálogo, não medição).
  • Custo: a extração em si não é cobrada pela plataforma; a carga Bronze consome carga no datalake (cobrável). Custo faturado real de nuvem = NÃO MEDIDO.

Segurança#

  • Escopo por workspace: cada cliente lê e escreve só no seu próprio datalake (<prefixo>_bronze / _silver / _gold); nunca há vazamento entre workspaces.
  • Segredos cifrados: material sensível é cifrado com AES-256-GCM antes de ser gravado. O cofre externo de credenciais é opcional e ligado por conexão; sem ele, o valor cifrado fica no banco. Trocar o valor aqui NÃO revoga a credencial na origem.
  • Redaction: todo erro/log passa pela redação de segredos (cru, URL-encoded e em JSON).
  • Produção não finge: um caminho que cairia em mock aciona a guarda de produção (falha explícita em vez de simular sucesso).

Erros comuns#

  • Conexão recusada / timeout — host, porta ou regra de rede (allowlist/SSH/VPN) incorretos. Confira o modo de rede escolhido em Como conectamos.
  • Autenticação falhou — usuário/senha inválidos ou usuário sem permissão de leitura no schema.
  • SSL/handshake — ajuste o sslmode (PostgreSQL) ou o encrypt (SQL Server) conforme a exigência do servidor.
  • Tabela/consulta grande — a extração respeita o teto de páginas/linhas; use carga incremental por watermark para reduzir o volume.

Diagnóstico#

  • Use Testar conexão para isolar problemas de credencial/rede antes de agendar.
  • Acompanhe as execuções na observabilidade por conector (taxa de erro, p50/p95, freshness).
  • Uma mudança de esquema na origem é sinalizada pelo schema drift (coluna nova = info; coluna removida/tipo mudado = atenção).

Relacionados#


Última revisão: 2026-09-08. Ficha gerada automaticamente do catálogo de conectores do produto.

Related links