Kurs
PySpark = Python + Apache Spark
Apache Spark ist ein modernes Open-Source-Framework, das in der Big-Data-Welt für Echtzeit- und Batch-Verarbeitung eingesetzt wird. Es unterstützt verschiedene Sprachen wie Python, Scala, Java und R.
Apache Spark ist ursprünglich in einer JVM-Sprache namens Scala geschrieben, während PySpark eine Python-API ist, die die Bibliothek Py4J enthält. Diese erlaubt die dynamische Interaktion mit JVM-Objekten.
Windows-Installation
Die folgende Anleitung gilt für Windows. Sie umfasst die Installation von Java inklusive Umgebungsvariablen sowie Apache Spark inklusive Umgebungsvariablen.
Als empfohlene Voraussetzung installierst du Python von hier.
Java-Installation
- Gehe zu Java JDK herunterladen.
Besuche die Oracle-Website, um das Java Development Kit (JDK) herunterzuladen. - Wechsle zum Download-Bereich für Windows. In meinem Fall ist es „Windows Offline (64-bit)“. Die Installationsdatei wird heruntergeladen.

- Öffne die Installationsdatei, die Installation startet.

-
Öffne die Eingabeaufforderung und tippe „java -version“, um die Version zu prüfen und sicherzustellen, dass Java installiert ist.

-
Füge den Java-Pfad hinzu.

- Öffne über die Suche „UMGEBUNGSVARIABLEN BEARBEITEN“.

- Klicke auf „Umgebungsvariablen“.

- Klicke auf „Neu“, um eine neue Umgebungsvariable anzulegen.

- Verwende als Variablennamen „JAVA_HOME“ und als Wert „C:\Program Files (x86)\Java\jdk1.8.0_251“. Das ist dein Speicherort der Java-Installation. Klicke auf „OK“, wenn du fertig bist.

- Füge nun unter „Benutzervariablen“ den Eintrag „Path“ hinzu und klicke auf „Neu“.

- Setze als Variablennamen „PATH“ und als Wert „C:\Program Files (x86)\Java\jdk1.8.0_251\bin“ – das ist der Pfad zum Java-Bin-Verzeichnis. Klicke auf „OK“, wenn du fertig bist.

Hinweis: Du findest dein Java-Verzeichnis auf dem Laufwerk C, z. B. unter „C:\Program Files (x86)\Java\jdk1.8.0_251“, sofern du den Speicherort beim Download nicht geändert hast. 
PySpark installieren
-
Rufe die Spark-Downloadseite auf.
-
Wähle die Spark-Version und den Pakettyp wie gezeigt und lade die .tgz-Datei herunter.

Lege im Laufwerk C einen neuen Ordner namens „spark“ an und entpacke die Datei mit „WinRAR“. Das ist später hilfreich.
winutils.exe herunterladen und einrichten
Gehe zu Winutils, wähle deine zuvor geladene Hadoop-Version und lade die Datei winutils.exe im Ordner „bin“ herunter. Der Link zu meiner Hadoop-Version ist: https://github.com/steveloughran/winutils/blob/master/hadoop-2.7.1/bin/winutils.exe
Erstelle einen neuen Ordner „winutils“ und darin einen weiteren Ordner „bin“. Lege die eben heruntergeladene „winutils“-Datei dort ab.
Umgebungsvariablen
- Lege eine neue Umgebungsvariable mit dem Namen „hadoop_home“ und dem Wert „C:\winutils“ (Speicherort von winutils) an und klicke auf „OK“.

- Für Spark legst du eine weitere Variable an: Name „Spark_home“, Wert „C:\spark“, und klicke auf „OK“.

- Öffne anschließend die Variable „Path“ und füge einen neuen Eintrag „%Spark_Home%\bin“ hinzu. Bestätige mit „OK“.

PySpark-Installation abschließen
- Öffne die Eingabeaufforderung und gib folgenden Befehl ein.

- Wenn alles erfolgreich war, siehst du die folgende Meldung.

Linux-Installation
Die folgende Anleitung gilt für Linux. Sie umfasst die Installation von Java inklusive Umgebungsvariablen sowie Apache Spark inklusive Umgebungsvariablen.
Als empfohlene Voraussetzung installierst du Python von hier.
Java-Installation
- Gehe zu Java JDK herunterladen.
Besuche die Oracle-Website, um das Java Development Kit (JDK) herunterzuladen. - Wechsle zum Download-Bereich für Linux und lade die passende Version für dein System herunter.

- Speichere die Datei lokal und klicke auf „OK“.

- Öffne dein Terminal und prüfe die eben geladene Datei mit dem Befehl „ls“.

- Installiere das Paket mit folgendem Befehl. Damit wird das eben geladene Debian-Paket von Java installiert.

- Prüfe abschließend deine Java-Version mit „java --version“.

- Zum Konfigurieren der Umgebungsvariablen öffnest du den Texteditor „gedit“ mit folgendem Befehl.

- Füge die folgenden Zeilen mit dem Pfad zu deiner Java-Installation ein.

- Zum Abschluss führe folgenden Befehl aus.

Spark installieren
- Rufe die Spark-Downloadseite auf.
- Wähle die Spark-Version und den Pakettyp wie gezeigt und lade die .tgz-Datei herunter.


- Speichere die Datei lokal und klicke auf „OK“.

- Öffne dein Terminal und wechsle in das Download-Verzeichnis.

- Entpacke die Datei mit folgendem Befehl.

- Nach dem Entpacken wird ein neuer Ordner erstellt, den du mit „ls“ siehst.

Umgebungsvariablen unter Linux konfigurieren
- Öffne die Datei „.bashrc“ im Vim-Editor mit „vim ~/.bashrc“.

- Füge die folgenden Pfade passend zu deinem System hinzu. In meinem Fall sind dies die Pfade zu Spark, Python und Java. Drücke zuerst „Esc“ und gib dann „:wq“ ein, um zu speichern und Vim zu verlassen.

- Zum Abschluss speichern und beenden. Damit kannst du den Befehl „pyspark“ in jedem Verzeichnis aufrufen.

- Starte PySpark mit dem Befehl „pyspark“. Die Ausgabe sieht dann wie folgt aus.

Mac-Installation
Die folgende Anleitung gilt für macOS. Sie umfasst die Installation von Java inklusive Umgebungsvariablen sowie Apache Spark inklusive Umgebungsvariablen.
Als empfohlene Voraussetzung installierst du Python von hier.
Java-Installation
- Gehe zu Java JDK herunterladen.
Besuche die Oracle-Website, um das Java Development Kit (JDK) herunterzuladen. - Wechsle zum Download-Bereich und lade die passende Version herunter.

- Die Installation von Java kannst du im Terminal mit
$java --showversionüberprüfen.
Apache Spark installieren
- Rufe die Spark-Downloadseite auf.
- Wähle die Spark-Version und den Pakettyp wie gezeigt und lade die .tgz-Datei herunter.


- Speichere die Datei lokal und klicke auf „OK“.
- Entpacke die Datei mit folgendem Befehl.
$ tar -xzf spark-2.4.6-bin-hadoop2.7.tgz
Umgebungsvariablen für Apache Spark und Python konfigurieren
Öffne je nach Setup die Datei ~/.bashrc oder ~/.zshrc auf deinem Mac.
export SPARK_HOME="/Downloads/spark"
export PATH=$SPARK_HOME/bin:$PATH
export PYSPARK_PYTHON=python3
Starte PySpark mit dem Befehl „pyspark“. Die Ausgabe sieht dann wie folgt aus. 
Glückwunsch
Glückwunsch, du hast das Ende dieses Tutorials erreicht!
In diesem Tutorial hast du gelernt, wie du PySpark installierst – beginnend mit Java, über Apache Spark bis hin zur Verwaltung der Umgebungsvariablen unter Windows, Linux und macOS.
Wenn du mehr über PySpark lernen möchtest, schau dir den DataCamp-Kurs Introduction to PySpark an.
Wirf auch einen Blick auf unser Apache-Spark-Tutorial: ML mit PySpark.
