Pular para o conteúdo principal

Instalação do PySpark (todos os sistemas operacionais)

Este tutorial mostra como instalar o PySpark e como gerenciar as variáveis de ambiente no Windows, Linux e macOS.
Atualizado 17 de set. de 2026  · 8 min lido

Explorar com IA

ChatGPTClaudePerplexity

banner

PySpark = Python + Apache Spark

Apache Spark é um framework novo e de código aberto usado na área de Big Data para processamento em tempo real e em lote. Ele suporta diferentes linguagens, como Python, Scala, Java e R.

Apache Spark foi escrito inicialmente em uma linguagem da Java Virtual Machine (JVM) chamada Scala, enquanto PySpark é como uma API em Python que contém uma biblioteca chamada Py4J. Isso permite a interação dinâmica com objetos da JVM.

Instalação no Windows

A instalação a seguir é para o sistema operacional Windows. Ela inclui a instalação do Java com a variável de ambiente e do Apache Spark com a variável de ambiente.

O pré-requisito recomendado é o Python, que pode ser instalado aqui.

Instalação do Java

  1. Acesse Download Java JDK.
    Visite o site da Oracle para baixar o Java Development Kit (JDK).

  2. Vá até a seção de download para o sistema operacional Windows e, no meu caso, é Windows Offline (64-bit). O instalador será baixado. Instalação do Java

  3. Abra o arquivo do instalador para iniciar a instalação. Instalação do Java

  4. Abra o "Prompt de Comando" e digite "java -version" para ver a versão e confirmar se foi instalado. Instalação do Java

  5. Adicione o caminho do Java. Instalação do Java

  6. No campo de busca, procure por "EDITAR AS VARIÁVEIS DE AMBIENTE". Instalação do Java
  7. Clique em "Variáveis de Ambiente". Instalação do Java
  8. Clique em "Novo" para criar uma nova variável de ambiente. Instalação do Java
  9. Use o Nome da variável como "JAVA_HOME" e o Valor da variável como "C:\\Program Files (x86)\\Java\\jdk1.8.0_251". Esse é o local do Java. Clique em "OK" após finalizar. Instalação do Java
  10. Vamos adicionar a variável do usuário: selecione "Path" e clique em "Novo" para criar. Instalação do Java
  11. Adicione o nome da variável como "PATH" e o valor como "C:\\Program Files (x86)\\Java\\jdk1.8.0_251\\bin", que é o local do arquivo bin do Java. Clique em "OK" ao finalizar. Instalação do Java

Observação: você pode localizar o arquivo do Java indo até a unidade C, em "C:\\Program Files (x86)\\Java\\jdk1.8.0_251" se não tiver alterado o local durante o download. Instalação do Java

Instalando o PySpark

  1. Acesse a página de downloads do Spark.

  2. Selecione a versão do Spark e o tipo de pacote conforme indicado e baixe o arquivo .tgz.

Instalando o PySpark Instalando o PySpark

Você pode criar uma nova pasta chamada "spark" no diretório C e extrair o arquivo usando o WinRAR, o que vai ajudar nas próximas etapas.

Baixar e configurar o winutils.exe

Acesse o Winutils, escolha a mesma versão do Hadoop que você selecionou antes e baixe o arquivo winutils.exe dentro da pasta "bin". O link para a minha versão do Hadoop é: https://github.com/steveloughran/winutils/blob/master/hadoop-2.7.1/bin/winutils.exe

Crie uma nova pasta chamada "winutils" e, dentro dela, outra chamada "bin". Depois, coloque o arquivo "winutils" que você acabou de baixar dentro dessa pasta.

Variáveis de ambiente

  1. Vamos criar uma nova variável de ambiente com o nome "hadoop_home" e valor como o local do winutils, que é "C:\\winutils". Clique em "OK".
    Variáveis de ambiente
  2. Para o Spark, crie também uma variável de ambiente com o nome "Spark_home" e o valor como o local do Spark, que é "C:\\spark". Clique em "OK".
    Variáveis de ambiente
  3. Por fim, dê um duplo clique em "Path" e edite como abaixo, adicionando um novo caminho "%Spark_Home%\\bin" e clique em "OK".
    Variáveis de ambiente

Finalizando a instalação do PySpark

  1. Abra o Prompt de Comando e digite o comando a seguir.
    Finalizando a instalação do PySpark
  2. Se tudo der certo, a mensagem abaixo será exibida.
    Finalizando a instalação do PySpark

Instalação no Linux

A instalação a seguir é para o sistema operacional Linux. Ela inclui a instalação do Java com a variável de ambiente, além do Apache Spark e sua variável de ambiente.

O pré-requisito recomendado é o Python, que pode ser instalado aqui.

Instalação do Java

  1. Acesse Download Java JDK.
    Visite o site da Oracle para baixar o Java Development Kit (JDK).

  2. Vá até a seção de download para o sistema operacional Linux e baixe conforme a necessidade do seu sistema.
    Instalação do Java
  3. Salve o arquivo e clique em "Ok" para salvar na sua máquina.
    Instalação do Java
  4. Abra o terminal e verifique o arquivo recém‑baixado usando o comando "ls".
    Instalação do Java
  5. Instale o pacote com o seguinte comando, que vai instalar o pacote Debian do Java que você acabou de baixar. Instalação do Java
  6. Por fim, você pode verificar a versão do Java com o comando "java --version".
    Instalação do Java
  7. Para configurar as variáveis de ambiente, abra o editor de texto gedit com o comando abaixo.
    Instalação do Java
  8. Faça a alteração informando o caminho do Java, como no exemplo a seguir.
    Instalação do Java
  9. Para concluir, digite o comando final abaixo. Instalação do Java

Instalando o Spark

  1. Acesse a página de downloads do Spark.
  2. Selecione a versão do Spark e o tipo de pacote como a seguir e baixe o arquivo .tgz. Instalando o Spark
    Instalando o Spark
  3. Salve o arquivo na sua máquina e clique em "Ok".
    Instalando o Spark
  4. Abra o terminal e navegue até o arquivo recém‑baixado.
    Instalando o Spark
  5. Extraia o arquivo com o comando abaixo.
    Instalando o Spark
  6. Depois de extrair, um novo diretório será criado e pode ser visto com o comando "ls".
    Instalando o Spark

Configurando variáveis de ambiente no Linux

  1. Abra o arquivo ".bashrc" usando o editor vim com o comando "vim ~/.bashrc".
    Configurando variáveis de ambiente no Linux
  2. Informe os caminhos adequados ao seu computador. No meu caso, eram os caminhos do Spark, do Python e do Java. Primeiro, pressione "Esc" e depois digite ":wq" para salvar e sair do vim.
    Configurando variáveis de ambiente no Linux
  3. Para finalizar, salve e saia. Isso permite acessar o comando pyspark em qualquer diretório. Configurando variáveis de ambiente no Linux
  4. Abra o PySpark com o comando "pyspark" e a mensagem final será exibida como abaixo. Configurando variáveis de ambiente no Linux Configurando variáveis de ambiente no Linux

Instalação no Mac

A instalação a seguir é para o sistema operacional Mac. Ela inclui a instalação do Java com a variável de ambiente, além do Apache Spark e sua variável de ambiente.

O pré-requisito recomendado é o Python, que pode ser instalado aqui.

Instalação do Java

  1. Acesse Download Java JDK.
    Visite o site da Oracle para baixar o Java Development Kit (JDK).

  2. Vá até a seção de download para macOS e baixe conforme a necessidade do seu sistema.
    Instalação do Java
  3. A instalação do Java pode ser confirmada usando $java --showversion no Terminal.

Instalando o Apache Spark

  1. Acesse a página de downloads do Spark.
  2. Selecione a versão do Spark e o tipo de pacote como a seguir e baixe o arquivo .tgz. Instalando o Apache Spark
    Instalando o Apache Spark
  3. Salve o arquivo na sua máquina e clique em "Ok".
  4. Extraia o arquivo com o comando abaixo.
    $ tar -xzf spark-2.4.6-bin-hadoop2.7.tgz

Configurando variáveis de ambiente para Apache Spark e Python

Você precisa abrir o arquivo ~/.bashrc ou ~/.zshrc, dependendo da sua versão do macOS.

export SPARK_HOME="/Downloads/spark"
export PATH=$SPARK_HOME/bin:$PATH
export PYSPARK_PYTHON=python3

Abra o PySpark usando o comando "pyspark" e a mensagem final será exibida como abaixo. Configurando variáveis de ambiente para Apache Spark e Python

Parabéns

Parabéns, você chegou ao final deste tutorial!

Neste tutorial, você aprendeu a instalar o PySpark, começando pela instalação do Java e do Apache Spark e configurando as variáveis de ambiente no Windows, Linux e macOS.

Se quiser aprender mais sobre PySpark, faça o curso Introduction to PySpark da DataCamp.

Confira também nosso tutorial de Apache Spark: ML com PySpark.

Tópicos
Python
Ciência de dados

Cursos de PySpark

Curso

Fundamentos do PySpark

4 h
157.8K
Aprenda a implementar o gerenciamento de dados distribuídos e o machine learning no Spark usando o pacote PySpark.
Ver detalhesRight Arrow
Iniciar Curso
Ver maisRight Arrow
Relacionado

blog

Tutorial: Como instalar o Python no macOS e no Windows

Saiba como instalar o Python em sua máquina pessoal com este tutorial passo a passo. Se você é um usuário do Windows ou do macOS, descubra vários métodos para começar a usar o Python em sua máquina.
Richie Cotton's photo

Richie Cotton

14 min

Tutorial

Tutorial do Pyspark: Primeiros passos com o Pyspark

Descubra o que é o Pyspark e como ele pode ser usado, com exemplos.
Natassha Selvaraj's photo

Natassha Selvaraj

10 min

Tutorial

Tutorial de instalação do Anaconda no Windows

Este tutorial demonstrará como você pode instalar o Anaconda, um poderoso gerenciador de pacotes, no Microsoft Windows.
DataCamp Team's photo

DataCamp Team

5 min

Tutorial

Tutorial de como executar scripts Python

Saiba como executar um script Python a partir da linha de comando e também como fornecer argumentos de linha de comando ao seu script.
Aditya Sharma's photo

Aditya Sharma

10 min

Tutorial

Guia de torchchat do PyTorch: Configuração local com Python

Saiba como configurar o torchchat do PyTorch localmente com Python neste tutorial prático, que fornece orientação e exemplos passo a passo.

Tutorial

Tutorial do Python pandas: O guia definitivo para iniciantes

Você está pronto para começar sua jornada com os pandas? Aqui está um guia passo a passo sobre como você pode começar.
Vidhi Chugh's photo

Vidhi Chugh

15 min

Ver MaisVer Mais