Estado: Roadmap — planejado, ainda não implementado nesta fase.
Leia antes:
../conectores.md(mapa de estados) efichas.md(índice das fichas).
⚠️ Aviso — Roadmap (não disponível)#
Este conector não está implementado: a configuração e a execução são recusadas pelo produto (nada finge sucesso).
O conector Amazon S3 ainda está no roadmap: não há extração implementada. Use o modo "Você deposita" (envie os arquivos para a landing) enquanto isso.
O restante desta página descreve a especificação planejada (campos e forma de conexão), não um recurso ativo.
O que é#
Puxaria arquivos de um bucket Amazon S3 seu para a nossa cloud. Ainda no Roadmap: não há extração implementada.
Modos de ingestão suportados:
- Nós buscamos — Nós buscamos os dados na sua fonte.
Para que serve#
Trazer os dados de Amazon S3 para o seu datalake e disponibilizá-los às camadas Bronze/Silver/Gold, aos modelos de BI e ao wizard de perguntas em linguagem natural.
Quando usar / quando não usar#
Use quando você precisa consolidar esta fonte no datalake de forma agendada, com isolamento por workspace.
Não use para produção hoje: o conector está no Roadmap. Enquanto isso, para arquivos, use o modo "Você deposita" (envie os arquivos para a landing).
Plano e permissões#
- Plano: núcleo do produto (conectores fazem parte de todos os planos; o limite é o número de fontes do plano).
- Acesso: exige workspace ativo — com a assinatura em atraso, suspensa ou cancelada, a execução fica bloqueada.
- Desligamento: a execução de ingestão pode ser desligada temporariamente (manutenção ou incidente). Quando isso acontece, a tela informa que o recurso está indisponível no momento.
Pré-requisitos#
- O bucket/container de origem, e o prefixo (pasta) a partir do qual os objetos serão lidos.
- Uma credencial com permissão de listar o bucket e ler os objetos sob esse prefixo — só isso. Não é preciso (nem desejável) conceder escrita, exclusão ou administração do bucket.
- Os arquivos sob o prefixo precisam estar num formato que o pipeline saiba ler (CSV, JSON ou Parquet). Object storage é transporte, não formato: o esquema vem do arquivo.
Credenciais#
Campos sensíveis. Eles são cifrados (AES-256-GCM) e nunca ficam no config da conexão, na definição do pipeline, no export ou na DAG. Por padrão o valor cifrado fica no banco; mover a credencial desta conexão para o cofre externo de credenciais é uma escolha explícita, feita por conexão depois de salvar — ver ../../administracao/credenciais-e-rotacao.md.
- Secret Access Key (
secretAccessKey)
Segredos nunca são reexibidos e passam pela redação em todo erro/log (token cru, URL-encoded e em JSON).
Campos do formulário#
| Campo | Rótulo | Tipo | Obrigatório | Observação |
|---|---|---|---|---|
bucket | Bucket | texto | sim | — |
region | Região | texto | sim | — |
prefix | Prefixo / pasta | texto | não | — |
accessKeyId | Access Key ID | texto | sim | — |
secretAccessKey 🔒 | Secret Access Key | senha/segredo | sim | segredo (cifrado; cofre externo opcional) |
Passo a passo#
- No menu ETL/ELT → Conexões, use Nova conexão.
- Escolha Amazon S3 no catálogo.
- Preencha os campos do formulário (veja a tabela acima).
- Use Testar conexão. O resultado vem separado em três capacidades, cada uma com OK, Falhou, Não se aplica ou Não testado. Nesta ficha elas significam: Rede — o endpoint do serviço de armazenamento é alcançável a partir do servidor da aplicação; Autenticação — a credencial do formulário (chave de acesso ou conta de serviço, não usuário e senha) foi aceita; Leitura — foi possível listar os objetos do bucket/container sob o prefixo informado (a contagem exibida é de objetos visíveis, não de tabelas).
- Use Salvar conexão. Salvar NÃO inicia ingestão nenhuma.
- No cartão da conexão, use Montar extração (ou vá em ETL/ELT → Pipelines e use Novo pipeline). O pipeline aponta para a conexão salva — a credencial não é copiada.
- Na revisão, Publicar (agenda desligada) cria a versão 1 sem executar nada. Depois, Ativar agenda e Executar agora são ações separadas.
No estado atual (Roadmap), os passos 4–5 são recusados pelo produto.
Exemplo — teste de conexão#
Configuração de exemplo (todos os valores são fictícios; segredos aparecem mascarados):
# Exemplo sintético (valores fictícios — não são credenciais reais)
bucket = meu-bucket-exemplo
region = us-east-1
prefix = dados/2026/
accessKeyId = AKIAEXEMPLOFICTICIO0
secretAccessKey = •••••• (cifrado — nunca exibido)Resultado esperado#
O produto recusa a configuração com uma mensagem clara de que o conector está no Roadmap.
Limites e custos#
- Paginação: teto duro por execução (default 10.000 páginas / 5.000.000 linhas); guarda anti-loop.
- Volume estimado: ~3 GB/mês (estimativa de catálogo, não medição).
- Custo: a extração em si não é cobrada pela plataforma; a carga Bronze consome carga no datalake (cobrável). Custo faturado real de nuvem = NÃO MEDIDO.
Segurança#
- Escopo por workspace: cada cliente lê e escreve só no seu próprio datalake (
<prefixo>_bronze/_silver/_gold); nunca há vazamento entre workspaces. - Segredos cifrados: material sensível é cifrado com AES-256-GCM antes de ser gravado. O cofre externo de credenciais é opcional e ligado por conexão; sem ele, o valor cifrado fica no banco. Trocar o valor aqui NÃO revoga a credencial na origem.
- Redaction: todo erro/log passa pela redação de segredos (cru, URL-encoded e em JSON).
- Produção não finge: um caminho que cairia em mock aciona a guarda de produção (falha explícita em vez de simular sucesso).
Erros comuns#
- Autenticação falhou — a credencial deste conector NÃO é usuário e senha: é chave de acesso (ou conta de serviço). Confira o par informado no formulário e se ele ainda está ativo no provedor.
- Listagem negada — a credencial autentica mas não pode listar o bucket. Conceda listagem do bucket e leitura dos objetos sob o prefixo; permissão de leitura sem listagem não basta, porque o pipeline precisa descobrir quais arquivos existem.
- Bucket/prefixo inexistente ou vazio — confira o nome exato do bucket e o prefixo (pasta). Prefixo sem nenhum objeto devolve zero objetos visíveis, não um erro.
- Arquivo em formato não suportado — object storage transporta arquivos; o pipeline precisa conseguir ler o conteúdo (CSV, JSON ou Parquet). Um objeto em outro formato é ignorado ou falha na carga, conforme a política do pipeline.
Diagnóstico#
- Use Testar conexão para isolar problemas de credencial/rede antes de agendar.
- Acompanhe as execuções na observabilidade por conector (taxa de erro, p50/p95, freshness).
- Uma mudança de esquema na origem é sinalizada pelo schema drift (coluna nova = info; coluna removida/tipo mudado = atenção).
Relacionados#
../conectores.md— catálogo de conectores por estado../ingestao-incremental-backfill.md— full, incremental por watermark, backfill e checkpoint../pipeline-medalhao.md— camadas Bronze/Silver/Gold e qualidade../agendamento-retry-dlq.md— agendamento, retry/backoff e DLQ../custo-limites-seguranca.md— custo, tetos e segurança por workspace
Última revisão: 2026-09-08. Ficha gerada automaticamente do catálogo de conectores do produto.