Selo de estado:
Preview(limite atual do produto) · Atualizado em 2026-10-05. Esta página é inventário de interface: o que está escrito aqui é o texto que aparece na tela, literalmente.
Onde fica: menu ETL/ELT → Notebooks.
Um notebook é uma sequência de células que rodam no seu cluster Spark: Python puro (pandas, por exemplo), PySpark e SQL. Ele serve para explorar os dados, testar transformações e criar tabelas novas. O código é Spark comum: roda igual em qualquer PySpark, sem nada proprietário.
Ver os notebooks (/notebooks)#
Os notebooks aparecem agrupados por pasta; quem não tem pasta fica em Sem pasta. Cada um mostra a versão publicada ou Rascunho. Para criar um, clique em Novo notebook.
Criar ou importar (/notebooks/novo)#
- Dê um nome e, se quiser, uma Pasta (opcional) (ex.:
Vendas/Mensal). - Para começar do zero, clique em Criar notebook: ele já vem com exemplos de pandas, PySpark lendo a sua camada Silver e SQL.
- Para trazer um notebook de outro lugar, escolha o arquivo
.ipynbe clique em Importar notebook. As saídas não são importadas; as células rodam de novo no seu cluster.
Escrever e rodar (/notebooks/<id>)#
No topo, à direita, clique em Anexar a um cluster e escolha onde as células vão rodar (aparecem o estado e o custo por hora de cada um). Se o cluster estiver desligado, use ligar e anexar — ligar leva alguns minutos. Anexado, o cluster vira um selo com nome, estado e R$/hora; clique nele para Desanexar, trocar de cluster, Ligar o cluster ou desligá-lo, ou Reiniciar a sessão. Desanexar não desliga o cluster: ele continua cobrando até você desligá-lo.
A barra de ícones (pare o mouse em cima para ver o nome de cada um):
| Você quer | Faça |
|---|---|
| Rodar uma célula | ▶ ao lado da célula, ou Shift+Enter (vai para a próxima) |
| Rodar o notebook inteiro | Rodar todas as células |
| Parar o que está rodando | Interromper |
| Começar a sessão do zero (apaga as variáveis) | Reiniciar a sessão |
| Levar o notebook para outra ferramenta | Baixar o notebook (.ipynb) |
| Congelar a versão que os pipelines vão rodar | Publicar versão |
Cada célula tem um Nome da célula (aparece no topo dela e no programa do pipeline) e os atalhos de teclado do Jupyter: Esc sai da edição, A/B criam uma célula acima/abaixo, D D apaga, M vira texto, Y vira código.
Cada célula tem um tipo: Python / PySpark, SQL ou Texto (Markdown). A célula SQL roda no Spark e mostra o resultado como tabela (até 1.000 linhas). O rascunho é salvo sozinho a cada mudança.
Bibliotecas
- Só nesta sessão: numa célula Python, rode
%pip install pacote. Vale só para a sessão aberta e só na máquina principal do cluster. - Em todas as máquinas (necessário para usar dentro de funções distribuídas do Spark, as UDFs): coloque a biblioteca em Bibliotecas Python extras, na tela do cluster.
O que não roda
Comandos de terminal não rodam no cluster: linhas que começam com ! e células
%%bash, %%sh ou %system são recusadas com o aviso Comando não
permitido. Use Python para o mesmo trabalho.