Estado: GA-candidato — motor provado por testes; o limite atual do produto ainda é Preview (sem SLA nem certificação de nuvem). Métricas de nuvem: NÃO MEDIDO.
Leia antes:
../conectores.md(mapa de estados) efichas.md(índice das fichas).
O que é#
Extrai dados de um projeto BigQuery seu (via SQL, com projeto de billing opcional) e carrega na nossa cloud.
Modos de ingestão suportados:
- Nós buscamos — Nós buscamos os dados na sua fonte.
Para que serve#
Trazer os dados de BigQuery para o seu datalake e disponibilizá-los às camadas Bronze/Silver/Gold, aos modelos de BI e ao wizard de perguntas em linguagem natural.
Quando usar / quando não usar#
Use quando você precisa consolidar esta fonte no datalake de forma agendada, com isolamento por workspace.
Evite enviar arquivos com esquema instável sem antes conferir o profiling e o schema drift.
Plano e permissões#
- Plano: núcleo do produto (conectores fazem parte de todos os planos; o limite é o número de fontes do plano).
- Acesso: exige workspace ativo — com a assinatura em atraso, suspensa ou cancelada, a execução fica bloqueada.
- Desligamento: a execução de ingestão pode ser desligada temporariamente (manutenção ou incidente). Quando isso acontece, a tela informa que o recurso está indisponível no momento.
Pré-requisitos#
- Um usuário somente leitura no banco, com acesso ao schema/tabelas desejados.
- Rede: escolha como chegamos até o banco — IP público + allowlist, túnel SSH (bastion), Cloud SQL ou VPN.
Credenciais#
Campos sensíveis. Eles são cifrados (AES-256-GCM) e nunca ficam no config da conexão, na definição do pipeline, no export ou na DAG. Por padrão o valor cifrado fica no banco; mover a credencial desta conexão para o cofre externo de credenciais é uma escolha explícita, feita por conexão depois de salvar — ver ../../administracao/credenciais-e-rotacao.md.
- Chave da service account (JSON) (
serviceAccountJson)
Segredos nunca são reexibidos e passam pela redação em todo erro/log (token cru, URL-encoded e em JSON).
Campos do formulário#
| Campo | Rótulo | Tipo | Obrigatório | Observação |
|---|---|---|---|---|
projectId | Projeto dos dados (Project ID) | texto | sim | — |
billingMode | Cobrança das consultas (billing) | seleção | não | padrão: same; opções: same / separate |
billingProjectId | Projeto de billing (Project ID) | texto | não | aparece quando billingMode = separate |
dataset | Dataset | texto | não | — |
location | Location | texto | não | — |
serviceAccountJson 🔒 | Chave da service account (JSON) | senha/segredo | sim | segredo (cifrado; cofre externo opcional) |
Passo a passo#
- No menu ETL/ELT → Conexões, use Nova conexão.
- Escolha BigQuery no catálogo.
- Preencha os campos do formulário (veja a tabela acima).
- Use Testar conexão. O resultado vem separado por Rede (alcance do servidor), Autenticação (usuário e senha) e Leitura (listar tabelas) — cada um com OK, Falhou, Não se aplica ou Não testado.
- Use Salvar conexão. Salvar NÃO inicia ingestão nenhuma.
- No cartão da conexão, use Montar extração (ou vá em ETL/ELT → Pipelines e use Novo pipeline). O pipeline aponta para a conexão salva — a credencial não é copiada.
- Na revisão, Publicar (agenda desligada) cria a versão 1 sem executar nada. Depois, Ativar agenda e Executar agora são ações separadas.
Exemplo — teste de conexão#
Configuração de exemplo (todos os valores são fictícios; segredos aparecem mascarados):
# Exemplo sintético (valores fictícios — não são credenciais reais)
projectId = meu-projeto-exemplo
billingMode = same
dataset = vendas
location = southamerica-east1
serviceAccountJson = •••••• (cifrado — nunca exibido)Resultado esperado#
O Testar conexão retorna a lista de tabelas/recursos descobertos. Após a primeira carga, as linhas aparecem na camada Bronze do seu workspace, prontas para o pipeline.
Limites e custos#
- Paginação: teto duro por execução (default 10.000 páginas / 5.000.000 linhas); guarda anti-loop.
- Volume estimado: ~5 GB/mês (estimativa de catálogo, não medição).
- Custo: a extração em si não é cobrada pela plataforma; a carga Bronze consome carga no datalake (cobrável). Custo faturado real de nuvem = NÃO MEDIDO.
Segurança#
- Escopo por workspace: cada cliente lê e escreve só no seu próprio datalake (
<prefixo>_bronze/_silver/_gold); nunca há vazamento entre workspaces. - Segredos cifrados: material sensível é cifrado com AES-256-GCM antes de ser gravado. O cofre externo de credenciais é opcional e ligado por conexão; sem ele, o valor cifrado fica no banco. Trocar o valor aqui NÃO revoga a credencial na origem.
- Redaction: todo erro/log passa pela redação de segredos (cru, URL-encoded e em JSON).
- Produção não finge: um caminho que cairia em mock aciona a guarda de produção (falha explícita em vez de simular sucesso).
Erros comuns#
- Conexão recusada / timeout — host, porta ou regra de rede (allowlist/SSH/VPN) incorretos. Confira o modo de rede escolhido em Como conectamos.
- Autenticação falhou — usuário/senha inválidos ou usuário sem permissão de leitura no schema.
- SSL/handshake — ajuste o
sslmode(PostgreSQL) ou oencrypt(SQL Server) conforme a exigência do servidor. - Tabela/consulta grande — a extração respeita o teto de páginas/linhas; use carga incremental por watermark para reduzir o volume.
Diagnóstico#
- Use Testar conexão para isolar problemas de credencial/rede antes de agendar.
- Acompanhe as execuções na observabilidade por conector (taxa de erro, p50/p95, freshness).
- Uma mudança de esquema na origem é sinalizada pelo schema drift (coluna nova = info; coluna removida/tipo mudado = atenção).
Relacionados#
../conectores.md— catálogo de conectores por estado../ingestao-incremental-backfill.md— full, incremental por watermark, backfill e checkpoint../pipeline-medalhao.md— camadas Bronze/Silver/Gold e qualidade../agendamento-retry-dlq.md— agendamento, retry/backoff e DLQ../custo-limites-seguranca.md— custo, tetos e segurança por workspace
Última revisão: 2026-09-08. Ficha gerada automaticamente do catálogo de conectores do produto.