Saltar al contenido

Esta página aún no está traducida — estás leyendo la versión en portugués. Ver en portugués

Actualizado el 2026-10-05

Notebooks e clusters Spark — o que são e como usar

O conceito de cluster e de notebook, quando usar cada um, quanto custa e o passo a passo para criar um cluster, escrever um notebook e levá-lo para o pipeline.

En esta página (7)

Quando a transformação passa do que cabe num SQL — limpar texto, aplicar um modelo de previsão, cruzar arquivos grandes, usar uma biblioteca Python — você escreve um notebook e roda num cluster Spark do seu workspace.

Os dois conceitos#

O que éVocê paga
Clustero conjunto de máquinas Spark onde o código roda. Você escolhe o tamanho, liga quando vai usar e ele desliga sozinho depois de um tempo paradosó enquanto ele está ligado, por hora, do saldo de créditos
Notebookuma sequência de células — Python / PySpark, SQL ou Texto (Markdown) — que você escreve e roda célula a célula, vendo o resultado na horanada além do cluster onde ele roda

O código é Spark comum: um notebook daqui roda igual em qualquer PySpark, e você pode importar e baixar notebooks no formato .ipynb (Jupyter).

O notebook lê e grava nas camadas do seu datalake (Bronze, Silver e Gold). O cluster só enxerga os dados do seu workspace — nenhum outro.

Quando usar notebook, e quando não#

Você querUse
Juntar, filtrar e agregar tabelasuma etapa Silver/Gold guiada ou em SQL livre — mais simples e mais barata
Explorar os dados, testar uma ideia, investigar um númeroum notebook num cluster ligado
Uma transformação em Python (biblioteca, modelo, regra difícil em SQL) que rode todo diaum notebook publicado como etapa do pipeline

Passo a passo#

  1. 1. Crie um cluster

    Em ETL/ELT → Clusters, clique em Novo cluster. Dê um nome, escolha o Tamanho (Pequeno basta para começar) e o tempo de Desligar sozinho depois de parado por. Confira a Projeção de custo e clique em Criar cluster.

  2. 2. Ligue o cluster

    No detalhe do cluster, clique em Ligar. Ele passa por Ligando e fica Ligado em cerca de 6 minutos.

  3. 3. Crie um notebook

    Em ETL/ELT → Notebooks, clique em Novo notebook e depois em Criar notebook (ele já vem com exemplos de pandas, PySpark e SQL) — ou escolha um arquivo .ipynb e clique em Importar notebook.

  4. 4. Anexe e rode

    No editor, clique em Anexar a um cluster, escolha o cluster e rode as células (▶ ou Shift+Enter). Use Rodar todas as células para o notebook inteiro.

  5. 5. Publique uma versão

    Quando o notebook estiver pronto para rodar sozinho, clique em Publicar versão. Só versões publicadas entram em pipeline.

  6. 6. Desligue o cluster

    Terminou? Clique em Desligar no cluster. Se esquecer, ele desliga sozinho no tempo que você escolheu.

Lista de clusters com Nome, Estado, Tamanho, Custo por hora e Gasto no mês, e o botão Novo cluster
Editor de notebook com células de texto, Python / PySpark e SQL, o resultado da consulta em tabela e, no topo, o cluster escolhido e o botão Publicar versão

Custo#

  • O cluster cobra por hora ligado, pelo tamanho escolhido. A tela de criação mostra a Projeção de custo (por hora, 8 horas de uso, mês útil e quanto o seu saldo cobre).
  • Para ligar, o saldo precisa cobrir pelo menos uma hora. Se o saldo acabar com o cluster ligado, ele desliga sozinho.
  • Desanexar um notebook não desliga o cluster. Quem para a cobrança é Desligar (ou o desligamento automático).
  • Seu plano define quantos clusters podem ficar ligados ao mesmo tempo e o tamanho máximo de cada um.
  • Uma etapa notebook de pipeline, por padrão, liga um cluster só para aquela execução e o apaga no fim — você paga só os minutos da execução.

Bibliotecas#

  • Só nesta sessão: %pip install pacote numa célula Python.
  • Para sempre e em todas as máquinas (obrigatório para funções distribuídas, as UDFs, e para a etapa de pipeline): coloque a biblioteca em Bibliotecas Python extras, na tela do cluster.

Limites#

  • Comandos de terminal (!comando, %%bash, %%sh, %system) não rodam: a tela recusa com Comando não permitido.
  • A célula SQL mostra até 1.000 linhas de resultado.
  • Ligar um cluster leva alguns minutos; para respostas imediatas, use o Console de dados ou uma consulta.

Onde ler mais#

Enlaces relacionados