Quando a transformação passa do que cabe num SQL — limpar texto, aplicar um modelo de previsão, cruzar arquivos grandes, usar uma biblioteca Python — você escreve um notebook e roda num cluster Spark do seu workspace.
Os dois conceitos#
| O que é | Você paga | |
|---|---|---|
| Cluster | o conjunto de máquinas Spark onde o código roda. Você escolhe o tamanho, liga quando vai usar e ele desliga sozinho depois de um tempo parado | só enquanto ele está ligado, por hora, do saldo de créditos |
| Notebook | uma sequência de células — Python / PySpark, SQL ou Texto (Markdown) — que você escreve e roda célula a célula, vendo o resultado na hora | nada além do cluster onde ele roda |
O código é Spark comum: um notebook daqui roda igual em qualquer PySpark, e
você pode importar e baixar notebooks no formato .ipynb (Jupyter).
O notebook lê e grava nas camadas do seu datalake (Bronze, Silver e Gold). O cluster só enxerga os dados do seu workspace — nenhum outro.
Quando usar notebook, e quando não#
| Você quer | Use |
|---|---|
| Juntar, filtrar e agregar tabelas | uma etapa Silver/Gold guiada ou em SQL livre — mais simples e mais barata |
| Explorar os dados, testar uma ideia, investigar um número | um notebook num cluster ligado |
| Uma transformação em Python (biblioteca, modelo, regra difícil em SQL) que rode todo dia | um notebook publicado como etapa do pipeline |
Passo a passo#
1. Crie um cluster
Em ETL/ELT → Clusters, clique em Novo cluster. Dê um nome, escolha o Tamanho (Pequeno basta para começar) e o tempo de Desligar sozinho depois de parado por. Confira a Projeção de custo e clique em Criar cluster.
2. Ligue o cluster
No detalhe do cluster, clique em Ligar. Ele passa por Ligando e fica Ligado em cerca de 6 minutos.
3. Crie um notebook
Em ETL/ELT → Notebooks, clique em Novo notebook e depois em Criar notebook (ele já vem com exemplos de pandas, PySpark e SQL) — ou escolha um arquivo
.ipynbe clique em Importar notebook.4. Anexe e rode
No editor, clique em Anexar a um cluster, escolha o cluster e rode as células (▶ ou Shift+Enter). Use Rodar todas as células para o notebook inteiro.
5. Publique uma versão
Quando o notebook estiver pronto para rodar sozinho, clique em Publicar versão. Só versões publicadas entram em pipeline.
6. Desligue o cluster
Terminou? Clique em Desligar no cluster. Se esquecer, ele desliga sozinho no tempo que você escolheu.
Custo#
- O cluster cobra por hora ligado, pelo tamanho escolhido. A tela de criação mostra a Projeção de custo (por hora, 8 horas de uso, mês útil e quanto o seu saldo cobre).
- Para ligar, o saldo precisa cobrir pelo menos uma hora. Se o saldo acabar com o cluster ligado, ele desliga sozinho.
- Desanexar um notebook não desliga o cluster. Quem para a cobrança é Desligar (ou o desligamento automático).
- Seu plano define quantos clusters podem ficar ligados ao mesmo tempo e o tamanho máximo de cada um.
- Uma etapa notebook de pipeline, por padrão, liga um cluster só para aquela execução e o apaga no fim — você paga só os minutos da execução.
Bibliotecas#
- Só nesta sessão:
%pip install pacotenuma célula Python. - Para sempre e em todas as máquinas (obrigatório para funções distribuídas, as UDFs, e para a etapa de pipeline): coloque a biblioteca em Bibliotecas Python extras, na tela do cluster.
Limites#
- Comandos de terminal (
!comando,%%bash,%%sh,%system) não rodam: a tela recusa com Comando não permitido. - A célula SQL mostra até 1.000 linhas de resultado.
- Ligar um cluster leva alguns minutos; para respostas imediatas, use o Console de dados ou uma consulta.