Skip to content

This page has not been translated yet — you are reading the Portuguese version. View in Portuguese

GA candidateUpdated on 2026-09-08

Parquet — conector

Ingere arquivos Parquet (formato colunar auto-descritivo). Modo "Você deposita" (upload) ou "Nós buscamos" (bucket).

On this page (17)

Estado: GA-candidato — motor provado por testes; o limite atual do produto ainda é Preview (sem SLA nem certificação de nuvem). Métricas de nuvem: NÃO MEDIDO.

Leia antes: ../conectores.md (mapa de estados) e fichas.md (índice das fichas).


O que é#

Ingere arquivos Parquet (formato colunar auto-descritivo). Modo "Você deposita" (upload) ou "Nós buscamos" (bucket).

Modos de ingestão suportados:

  • Nós buscamos — Nós buscamos os dados na sua fonte.
  • Você deposita — Você deposita os dados na nossa cloud.

Para que serve#

Trazer os dados de Parquet para o seu datalake e disponibilizá-los às camadas Bronze/Silver/Gold, aos modelos de BI e ao wizard de perguntas em linguagem natural.

Quando usar / quando não usar#

Use quando você precisa consolidar esta fonte no datalake de forma agendada, com isolamento por workspace.

Evite enviar arquivos com esquema instável sem antes conferir o profiling e o schema drift.

Plano e permissões#

  • Plano: núcleo do produto (conectores fazem parte de todos os planos; o limite é o número de fontes do plano).
  • Acesso: exige workspace ativo — com a assinatura em atraso, suspensa ou cancelada, a execução fica bloqueada.
  • Desligamento: a execução de ingestão pode ser desligada temporariamente (manutenção ou incidente). Quando isso acontece, a tela informa que o recurso está indisponível no momento.
  • Upload (modo "Você deposita"): o arquivo vai para a área de recebimento do seu próprio workspace.

Pré-requisitos#

  • Os arquivos que você vai enviar (modo "Você deposita").
  • Um bucket de origem com credenciais de leitura (modo "Nós buscamos").

Credenciais#

Campos sensíveis. Eles são cifrados (AES-256-GCM) e nunca ficam no config da conexão, na definição do pipeline, no export ou na DAG. Por padrão o valor cifrado fica no banco; mover a credencial desta conexão para o cofre externo de credenciais é uma escolha explícita, feita por conexão depois de salvar — ver ../../administracao/credenciais-e-rotacao.md.

  • Secret Access Key (S3) (secretAccessKey)
  • Service Account JSON (GCS) (serviceAccountJson)

Segredos nunca são reexibidos e passam pela redação em todo erro/log (token cru, URL-encoded e em JSON).

Campos do formulário#

Modo "Nós buscamos" (pull)

CampoRótuloTipoObrigatórioObservação
bucketBuckettextosim—
prefixPrefixo / pastatextonão—
providerProvedorseleçãosimpadrão: s3; opções: s3 / gcs
accessKeyIdAccess Key ID (S3)textonão—
secretAccessKey 🔒Secret Access Key (S3)senha/segredonãosegredo (cifrado; cofre externo opcional)
serviceAccountJson 🔒Service Account JSON (GCS)senha/segredonãosegredo (cifrado; cofre externo opcional)

Modo "Você deposita" (push)

CampoRótuloTipoObrigatórioObservação

Passo a passo#

  1. No menu ETL/ELT → Conexões, use Nova conexão.
  2. Escolha Parquet no catálogo e selecione o modo de ingestão.
  3. Preencha os campos do formulário (veja a tabela acima).
  4. No modo "Você deposita", envie os arquivos; no modo "Nós buscamos", use Testar conexão.
  5. Use Salvar conexão. Salvar NÃO inicia ingestão nenhuma.
  6. No cartão da conexão, use Montar extração (ou vá em ETL/ELT → Pipelines e use Novo pipeline). O pipeline aponta para a conexão salva — a credencial não é copiada.
  7. Na revisão, Publicar (agenda desligada) cria a versão 1 sem executar nada. Depois, Ativar agenda e Executar agora são ações separadas.

Exemplo — teste de conexão#

Configuração de exemplo (todos os valores são fictícios; segredos aparecem mascarados):

text
# Exemplo sintético (valores fictícios — não são credenciais reais)
bucket = meu-bucket-exemplo
prefix = dados/2026/
provider = s3
accessKeyId = AKIAEXEMPLOFICTICIO0
secretAccessKey = •••••• (cifrado — nunca exibido)
serviceAccountJson = •••••• (cifrado — nunca exibido)

Resultado esperado#

O Testar conexão retorna a lista de tabelas/recursos descobertos. Após a primeira carga, as linhas aparecem na camada Bronze do seu workspace, prontas para o pipeline.

Limites e custos#

  • Paginação: teto duro por execução (default 10.000 páginas / 5.000.000 linhas); guarda anti-loop.
  • Volume estimado: ~0.5 GB/mês (estimativa de catálogo, não medição).
  • Custo: a extração em si não é cobrada pela plataforma; a carga Bronze consome carga no datalake (cobrável). Custo faturado real de nuvem = NÃO MEDIDO.

Segurança#

  • Escopo por workspace: cada cliente lê e escreve só no seu próprio datalake (<prefixo>_bronze / _silver / _gold); nunca há vazamento entre workspaces.
  • Segredos cifrados: material sensível é cifrado com AES-256-GCM antes de ser gravado. O cofre externo de credenciais é opcional e ligado por conexão; sem ele, o valor cifrado fica no banco. Trocar o valor aqui NÃO revoga a credencial na origem.
  • Redaction: todo erro/log passa pela redação de segredos (cru, URL-encoded e em JSON).
  • Produção não finge: um caminho que cairia em mock aciona a guarda de produção (falha explícita em vez de simular sucesso).

Erros comuns#

  • Delimitador/encoding (CSV) — confira o delimitador e prefira UTF-8; colunas coladas costumam indicar delimitador errado.
  • Formato JSON — escolha entre linhas (ndjson) e array único conforme o arquivo.
  • Bucket/prefixo (modo "Nós buscamos") — verifique o bucket, o prefixo e as credenciais de leitura.

Diagnóstico#

  • Use Testar conexão para isolar problemas de credencial/rede antes de agendar.
  • Acompanhe as execuções na observabilidade por conector (taxa de erro, p50/p95, freshness).
  • Uma mudança de esquema na origem é sinalizada pelo schema drift (coluna nova = info; coluna removida/tipo mudado = atenção).

Relacionados#


Última revisão: 2026-09-08. Ficha gerada automaticamente do catálogo de conectores do produto.

Related links