Weiter zum Inhalt

Installation von PySpark (Alle Betriebssysteme)

Dieses Tutorial zeigt dir, wie du PySpark installierst und wie du die Umgebungsvariablen unter Windows, Linux und macOS verwaltest.
Aktualisiert 18. Sept. 2026  · 8 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity

banner

PySpark = Python + Apache Spark

Apache Spark ist ein modernes Open-Source-Framework, das in der Big-Data-Welt für Echtzeit- und Batch-Verarbeitung eingesetzt wird. Es unterstützt verschiedene Sprachen wie Python, Scala, Java und R.

Apache Spark ist ursprünglich in einer JVM-Sprache namens Scala geschrieben, während PySpark eine Python-API ist, die die Bibliothek Py4J enthält. Diese erlaubt die dynamische Interaktion mit JVM-Objekten.

Windows-Installation

Die folgende Anleitung gilt für Windows. Sie umfasst die Installation von Java inklusive Umgebungsvariablen sowie Apache Spark inklusive Umgebungsvariablen.

Als empfohlene Voraussetzung installierst du Python von hier.

Java-Installation

  1. Gehe zu Java JDK herunterladen.
    Besuche die Oracle-Website, um das Java Development Kit (JDK) herunterzuladen.

  2. Wechsle zum Download-Bereich für Windows. In meinem Fall ist es „Windows Offline (64-bit)“. Die Installationsdatei wird heruntergeladen. Java installation

  3. Öffne die Installationsdatei, die Installation startet. Java installation

  4. Öffne die Eingabeaufforderung und tippe „java -version“, um die Version zu prüfen und sicherzustellen, dass Java installiert ist. Java installation

  5. Füge den Java-Pfad hinzu. Java installation

  6. Öffne über die Suche „UMGEBUNGSVARIABLEN BEARBEITEN“. Java installation
  7. Klicke auf „Umgebungsvariablen“. Java installation
  8. Klicke auf „Neu“, um eine neue Umgebungsvariable anzulegen. Java installation
  9. Verwende als Variablennamen „JAVA_HOME“ und als Wert „C:\Program Files (x86)\Java\jdk1.8.0_251“. Das ist dein Speicherort der Java-Installation. Klicke auf „OK“, wenn du fertig bist. Java installation
  10. Füge nun unter „Benutzervariablen“ den Eintrag „Path“ hinzu und klicke auf „Neu“. Java installation
  11. Setze als Variablennamen „PATH“ und als Wert „C:\Program Files (x86)\Java\jdk1.8.0_251\bin“ – das ist der Pfad zum Java-Bin-Verzeichnis. Klicke auf „OK“, wenn du fertig bist. Java installation

Hinweis: Du findest dein Java-Verzeichnis auf dem Laufwerk C, z. B. unter „C:\Program Files (x86)\Java\jdk1.8.0_251“, sofern du den Speicherort beim Download nicht geändert hast. Java installation

PySpark installieren

  1. Rufe die Spark-Downloadseite auf.

  2. Wähle die Spark-Version und den Pakettyp wie gezeigt und lade die .tgz-Datei herunter.

Installing Pyspark Installing Pyspark

Lege im Laufwerk C einen neuen Ordner namens „spark“ an und entpacke die Datei mit „WinRAR“. Das ist später hilfreich.

winutils.exe herunterladen und einrichten

Gehe zu Winutils, wähle deine zuvor geladene Hadoop-Version und lade die Datei winutils.exe im Ordner „bin“ herunter. Der Link zu meiner Hadoop-Version ist: https://github.com/steveloughran/winutils/blob/master/hadoop-2.7.1/bin/winutils.exe

Erstelle einen neuen Ordner „winutils“ und darin einen weiteren Ordner „bin“. Lege die eben heruntergeladene „winutils“-Datei dort ab.

Umgebungsvariablen

  1. Lege eine neue Umgebungsvariable mit dem Namen „hadoop_home“ und dem Wert „C:\winutils“ (Speicherort von winutils) an und klicke auf „OK“.
    Environment variables
  2. Für Spark legst du eine weitere Variable an: Name „Spark_home“, Wert „C:\spark“, und klicke auf „OK“.
    Environment variables
  3. Öffne anschließend die Variable „Path“ und füge einen neuen Eintrag „%Spark_Home%\bin“ hinzu. Bestätige mit „OK“.
    Environment variables

PySpark-Installation abschließen

  1. Öffne die Eingabeaufforderung und gib folgenden Befehl ein.
    Finalizing Pyspark Installation
  2. Wenn alles erfolgreich war, siehst du die folgende Meldung.
    Finalizing Pyspark Installation

Linux-Installation

Die folgende Anleitung gilt für Linux. Sie umfasst die Installation von Java inklusive Umgebungsvariablen sowie Apache Spark inklusive Umgebungsvariablen.

Als empfohlene Voraussetzung installierst du Python von hier.

Java-Installation

  1. Gehe zu Java JDK herunterladen.
    Besuche die Oracle-Website, um das Java Development Kit (JDK) herunterzuladen.

  2. Wechsle zum Download-Bereich für Linux und lade die passende Version für dein System herunter.
    Java Installation
  3. Speichere die Datei lokal und klicke auf „OK“.
    Java Installation
  4. Öffne dein Terminal und prüfe die eben geladene Datei mit dem Befehl „ls“.
    Java Installation
  5. Installiere das Paket mit folgendem Befehl. Damit wird das eben geladene Debian-Paket von Java installiert. Java Installation
  6. Prüfe abschließend deine Java-Version mit „java --version“.
    Java Installation
  7. Zum Konfigurieren der Umgebungsvariablen öffnest du den Texteditor „gedit“ mit folgendem Befehl.
    Java Installation
  8. Füge die folgenden Zeilen mit dem Pfad zu deiner Java-Installation ein.
    Java Installation
  9. Zum Abschluss führe folgenden Befehl aus. Java Installation

Spark installieren

  1. Rufe die Spark-Downloadseite auf.
  2. Wähle die Spark-Version und den Pakettyp wie gezeigt und lade die .tgz-Datei herunter. Installing Spark
    Installing Spark
  3. Speichere die Datei lokal und klicke auf „OK“.
    Installing Spark
  4. Öffne dein Terminal und wechsle in das Download-Verzeichnis.
    Installing Spark
  5. Entpacke die Datei mit folgendem Befehl.
    Installing Spark
  6. Nach dem Entpacken wird ein neuer Ordner erstellt, den du mit „ls“ siehst.
    Installing Spark

Umgebungsvariablen unter Linux konfigurieren

  1. Öffne die Datei „.bashrc“ im Vim-Editor mit „vim ~/.bashrc“.
    Configuring Environment Variable in Linux
  2. Füge die folgenden Pfade passend zu deinem System hinzu. In meinem Fall sind dies die Pfade zu Spark, Python und Java. Drücke zuerst „Esc“ und gib dann „:wq“ ein, um zu speichern und Vim zu verlassen.
    Configuring Environment Variable in Linux
  3. Zum Abschluss speichern und beenden. Damit kannst du den Befehl „pyspark“ in jedem Verzeichnis aufrufen. Configuring Environment Variable in Linux
  4. Starte PySpark mit dem Befehl „pyspark“. Die Ausgabe sieht dann wie folgt aus. Configuring Environment Variable in Linux Configuring Environment Variable in Linux

Mac-Installation

Die folgende Anleitung gilt für macOS. Sie umfasst die Installation von Java inklusive Umgebungsvariablen sowie Apache Spark inklusive Umgebungsvariablen.

Als empfohlene Voraussetzung installierst du Python von hier.

Java-Installation

  1. Gehe zu Java JDK herunterladen.
    Besuche die Oracle-Website, um das Java Development Kit (JDK) herunterzuladen.

  2. Wechsle zum Download-Bereich und lade die passende Version herunter.
    Java Installation
  3. Die Installation von Java kannst du im Terminal mit $java --showversion überprüfen.

Apache Spark installieren

  1. Rufe die Spark-Downloadseite auf.
  2. Wähle die Spark-Version und den Pakettyp wie gezeigt und lade die .tgz-Datei herunter. Installing Apache Spark
    Installing Apache Spark
  3. Speichere die Datei lokal und klicke auf „OK“.
  4. Entpacke die Datei mit folgendem Befehl.
    $ tar -xzf spark-2.4.6-bin-hadoop2.7.tgz

Umgebungsvariablen für Apache Spark und Python konfigurieren

Öffne je nach Setup die Datei ~/.bashrc oder ~/.zshrc auf deinem Mac.

export SPARK_HOME="/Downloads/spark"
export PATH=$SPARK_HOME/bin:$PATH
export PYSPARK_PYTHON=python3

Starte PySpark mit dem Befehl „pyspark“. Die Ausgabe sieht dann wie folgt aus. Configuring Environment Variable for Apache Spark and Python

Glückwunsch

Glückwunsch, du hast das Ende dieses Tutorials erreicht!

In diesem Tutorial hast du gelernt, wie du PySpark installierst – beginnend mit Java, über Apache Spark bis hin zur Verwaltung der Umgebungsvariablen unter Windows, Linux und macOS.

Wenn du mehr über PySpark lernen möchtest, schau dir den DataCamp-Kurs Introduction to PySpark an.

Wirf auch einen Blick auf unser Apache-Spark-Tutorial: ML mit PySpark.

Themen
Python
Datenwissenschaft

PySpark-Kurse

Kurs

Grundlagen von PySpark

4 Std.
157.8K
Lerne, verteiltes Datenmanagement und maschinelles Lernen in Spark mit dem PySpark-Paket zu implementieren.
Details anzeigenRight Arrow
Kurs Starten
Mehr anzeigenRight Arrow
Verwandt

Tutorial

Python-Anweisungen IF, ELIF und ELSE

In diesem Tutorial lernst du ausschließlich Python if else-Anweisungen kennen.
Sejal Jaiswal's photo

Sejal Jaiswal

9 Min.

Tutorial

Python Datenstrukturen Tutorial

Mach dich mit Python-Datenstrukturen vertraut: Lerne mehr über Datentypen und primitive sowie nicht-primitive Datenstrukturen wie Strings, Listen, Stapel usw.
Sejal Jaiswal's photo

Sejal Jaiswal

24 Min.

Tutorial

Python Switch Case Statement: Ein Leitfaden für Anfänger

Erforsche Pythons match-case: eine Anleitung zu seiner Syntax, Anwendungen in Data Science und ML sowie eine vergleichende Analyse mit dem traditionellen switch-case.
Matt Crabtree's photo

Matt Crabtree

5 Min.

Tutorial

Python-Arrays

Python-Arrays mit Code-Beispielen. Lerne noch heute, wie du mit Python NumPy Arrays erstellen und ausdrucken kannst!
DataCamp Team's photo

DataCamp Team

3 Min.

Tutorial

Python .append() und .extend() Methoden Tutorial

Lerne, wie du mit den Methoden .append() und .extend() Elemente zu einer Liste hinzufügst.
DataCamp Team's photo

DataCamp Team

2 Min.

Tutorial

if…elif…else in Python Tutorial

Lerne, wie du in Python if…elif…else-Anweisungen erstellst.
DataCamp Team's photo

DataCamp Team

4 Min.

Mehr AnzeigenMehr Anzeigen