Kurs
Am Anfang gab es Data-Warehouses. Sie speicherten Daten in Zeilen und Spalten, weil Internet und Computer damals vor allem einfache Textinformationen verarbeiten konnten. Viel später kamen Data Lakes — sie konnten nahezu jede Art von Daten aufnehmen, die du sammeln konntest. Perfekt für das Social-Media- und YouTube-Zeitalter.
Beide hatten jedoch Nachteile — Data-Warehouses waren teuer und für moderne Data Science wenig geeignet, während Data Lakes unübersichtlich wurden und oft zu Data Swamps verkommen sind. Unternehmen betrieben daher zwei getrennte Tech-Stacks — Warehouses für BI und Analytics und Lakes für Machine Learning.
Die Pflege zweier unterschiedlicher Datenarchitekturen war jedoch so aufwendig, dass die Ergebnisse oft zu wünschen übrig ließen. Daraus entstand die Lakehouse-Architektur — genau dafür ist Databricks berühmt.
Databricks ist eine Cloud-Plattform, die es ermöglicht, den Mehrwert von Warehouses und Lakes in einer gemeinsamen Umgebung zu vereinen. Dieser Artikel bietet einen Überblick über die Plattform, zeigt die wichtigsten Features und wie du sie nutzt.
Was wir in diesem Databricks-Tutorial behandeln
Databricks ist so umfangreich, dass allein die Dokumentation ein eigenes Buch füllen könnte. Ziel dieses Artikels ist daher, dir eine sinnvolle Begriffshierarchie zu geben — linear geordnete Erklärungen der Databricks-Features, mit denen du vom Einsteiger zur versierten Databricks-Anwenderin bzw. zum versierten Anwender wirst. Wenn du ganz neu bist, wirf auch einen Blick auf unseren Introduction to Databricks-Kurs.
Los geht’s!
1. Was ist Databricks?
Wenn du Databricks liest, denk an eine Plattform — nicht an ein Framework oder eine Python-Bibliothek. Plattformen bieten typischerweise einen großen Funktionsumfang, und Databricks ist da keine Ausnahme. Es ist eine der wenigen Plattformen, die jede Datenrolle abdeckt — von Data Engineers bis zu modernen Machine-Learning-Engineers (oder, wie die Presse heute sagt, KI-Programmierern).
Databricks umfasst diese Kernkomponenten:
- Workspace: Ein zentrales Umfeld, in dem Teams reibungslos zusammenarbeiten. Der Zugriff erfolgt über eine nutzerfreundliche Weboberfläche.
- Notebooks: Eine für Zusammenarbeit und Flexibilität optimierte Variante von Jupyter-Notebooks.
- Apache Spark: Databricks setzt auf Apache Spark. Die Engine treibt die parallele Verarbeitung riesiger Datensätze an und ist ideal für Big-Data-Analytics.
- Delta Lake: Eine Weiterentwicklung von Data Lakes mit ACID-Transaktionen. Delta Lake sorgt für Datenzuverlässigkeit und -konsistenz und löst klassische Lake-Probleme.
- Skalierung: Die Plattform skaliert horizontal statt vertikal — ideal für Organisationen mit stetig wachsenden Datenanforderungen.
Vorteile von Databricks
Im Zusammenspiel erschließen diese Komponenten zahlreiche Vorteile:
- Teamübergreifende Zusammenarbeit: Engineers, Analysten, Data Scientists und ML Engineers arbeiten nahtlos auf derselben Plattform.
- Konsistenz: Dank Notebooks kannst du zwischen Aufgaben und Programmiersprachen wechseln, ohne den Kontext zu verlieren.
- Effiziente Workflows: Von Datenbereinigung über Transformation bis hin zu Machine Learning — alles aus einem Guss.
- Integriertes Datenmanagement: Daten aus verschiedenen Quellen einlesen, Tabellen anlegen und SQL ausführen.
- Echtzeit-Zusammenarbeit: Geteilte Notebooks und Co-Editing ermöglichen paralleles Arbeiten mehrerer Teammitglieder.
Wenn dich das von der Bedeutung von Databricks in der Datenwelt überzeugt, machen wir dich jetzt startklar auf der Plattform.
2. Account einrichten
Richte deinen Account unter https://www.databricks.com/try-databricks ein und registriere dich für die Community Edition.

Die Community Edition bietet weniger Funktionen als die Enterprise-Version, benötigt aber keine Einrichtung beim Cloud-Anbieter — ideal für kleine Use Cases wie Tutorials.
Wenn du nach der E-Mail-Verifizierung diese Seite siehst, kannst du loslegen:

3. Databricks-Workspace
Die Oberfläche, die du siehst, ist der Workspace für deine E-Mail-Adresse (den Community-Edition-Workspace findest du leicht). In Unternehmen legt in der Regel ein Account-Admin einen zentralen Databricks-Account an und verwaltet die Zugriffe auf den Workspace.
Schauen wir uns jetzt das UI der Plattform an. Links findest du das Menü für die verschiedenen Komponenten von Databricks. Die Enterprise-Version hat noch mehr Optionen:

Die erste Option im Menü ist der Workspace-Typ, standardmäßig auf Data Science and Engineering gesetzt. Wenn du auf Machine Learning wechselst, erscheint die neue Option Experiments:

Auf den ersten Blick wirkt das unspektakulär, doch mit einem Upgrade und etwas Hands-on fallen schnell die Stärken der Plattform auf:
- Zentrale Anlaufstelle für Ressourcen: Notebooks, Cluster, Tabellen, Bibliotheken und Dashboards
- Notebooks in mehreren Sprachen
- Clustermanagement: Rechenressourcen für die Codeausführung verwalten
- Tabellenverwaltung
- Dashboard-Erstellung: Visualisierungen direkt im Workspace zu Dashboards zusammenführen
- Kollaboratives Echtzeit-Editing von Notebooks
- Versionskontrolle für Notebooks
- Job-Scheduling (sehr mächtig): Notebooks und Skripte zeitgesteuert ausführen
und vieles mehr.
Sehen wir uns einige dieser Komponenten genauer an.
4. Databricks-Cluster
Cluster in Databricks sind die Rechenressourcen, mit denen Datenverarbeitungsaufgaben ausgeführt werden. In der Regel stellt dein gewählter Cloud-Anbieter die Cluster bei der Accounterstellung bereit.
In der Community Edition sind RAM und CPU begrenzt, GPUs sind nicht enthalten. Premium-Nutzende können jedoch häufig Folgendes sehr bequem umsetzen:
- Datenverarbeitung: Cluster verarbeiten und transformieren große Datenmengen mithilfe der Parallelisierung von Spark.
- Machine Learning: Modelle mit Python (oder anderen Sprachen) und zugehörigen Bibliotheken trainieren und einsetzen.
- ETL-Workflows: Extract, Transform, Load effizient von der Quelle bis zum Ziel.
Um einen Cluster zu erstellen, nutze den Button „Create“ oder den Menüpunkt „Compute“:

Wähle bei der Erstellung eine passende Spark-Version für deine Umgebung und warte ein paar Minuten, bis der Cluster einsatzbereit ist.
5. Databricks-Notebooks
Sobald dein Cluster läuft, kannst du Notebooks anlegen. Wenn du mit Jupyter, Colab oder den DataCamp Workspaces gearbeitet hast, kommt dir vieles vertraut vor:

Warum aber „Jupyter-ähnlich“ nutzen, wenn es echtes Jupyter gibt? Nun, Databricks-Notebooks haben gegenüber Jupyter diese Vorteile:
- Zusammenarbeit: Eingebaute Funktionen erlauben gleichzeitiges Arbeiten mehrerer Personen am selben Notebook. Änderungen werden in Echtzeit nachverfolgt.
- Ausführungsumgebung: Viele Jupyter-Setups laufen auf Einzelmaschinen mit fester Hardware. Bibliotheken und Abhängigkeiten musst du selbst installieren. Databricks-Notebooks hingegen laufen auf Clustern, die Ressourcen und Skalierung automatisch an die Last anpassen. Die Umgebungen sind vorkonfiguriert.
- Integration mit Big-Data-Tech: Jupyter kann mit Apache Spark arbeiten, erfordert aber manuelles Sitzungs- und Abhängigkeitsmanagement. Databricks wurde von den Spark-Erfinderinnen und -Erfindern gegründet und unterstützt Spark nativ. Spark-Sessions und Cluster verwaltet die Plattform automatisch.
Es gibt noch viele weitere Vorteile. Hier eine Tabelle mit den wichtigsten Unterschieden:
|
Feature |
Jupyter Notebooks |
Databricks Notebooks |
|
Plattform |
Open Source, lokal oder in der Cloud |
Exklusiv auf der Databricks-Plattform |
|
Zusammenarbeit & Teilen |
Begrenzte Kollaboration, manuelles Teilen |
Integrierte Kollaboration, gleichzeitiges Echtzeit-Editing |
|
Ausführung |
Lokal oder auf externen Servern |
Ausführung auf Databricks-Clustern |
|
Big-Data-Integration |
Mit Spark integrierbar, zusätzliche Konfiguration nötig |
Native Apache-Spark-Integration, für Big Data optimiert |
|
Eingebaute Features |
Externe Tools/Erweiterungen für Versionskontrolle, Kollaboration, Visualisierung |
Integration mit Databricks-Features wie Delta Lake, eingebaute Kollaboration und Analytics-Tools |
|
Kosten & Skalierung |
Lokal oft kostenlos, Cloud-Varianten können kostenpflichtig sein |
Kostenpflichtiger Dienst, nutzungsabhängige Kosten, nahtlose Skalierung mit Clustern |
|
Benutzerfreundlichkeit |
Vertraut und weit verbreitet in der Data-Science-Community |
Für Big-Data-Analytics zugeschnitten, ggf. steilere Lernkurve bei Databricks-spezifischen Features |
|
Datenvisualisierung |
Begrenzte integrierte Visualisierung |
Eingebaute Visualisierung im Notebook |
|
Clustermanagement |
Spark-Sessions und Abhängigkeiten manuell verwalten |
Automatisches Clustermanagement und -skalierung durch die Plattform |
|
Anwendungsfälle |
Vielseitig für diverse Data-Science-Aufgaben |
Spezialisiert für kollaborative Big-Data-Analytics auf Databricks |
Am Ende zählen die Vorteile der Databricks-Notebooks vor allem in bestimmten Use Cases. Wenn du lokal mit einem CSV und Pandas spielst, ist Jupyter die bessere Wahl.
Für Enterprise-Anwendungen kann Databricks als Plattform jedoch die stärkere Option sein.
6. Daten in Databricks laden
Dateningestion beschreibt das Importieren von Daten aus diversen Quellen. Databricks unterstützt unter anderem:
- AWS S3
- Azure Blob Storage
- Google Cloud Storage
- Relationale Datenbanken (MySQL, PostgreSQL etc.)
- Data Lakes (Delta Lake, Parquet, Avro etc.)
- Streaming-Plattformen (Apache Kafka)
- Google BigQuery
- Deine lokale CSV-Datei
und mehr.
Schauen wir uns an, wie du verschiedene Datentypen in Databricks lädst. Starten wir mit lokalen Dateien:

Befolgst du die Schritte im GIF, liegt die Datei im Workspace. So lädst du sie mit Spark:
# Importing necessary libraries
from pyspark.sql import SparkSession
# Creating a Spark session
spark = SparkSession.builder.appName("S3ImportExample").getOrCreate()
# Defining the CSV path to the data
path = "dbfs:/FileStore/tables/diamonds.csv"
# Reading data from S3 into a DataFrame
data_from_s3 = spark.read.csv(path, header=True, inferSchema=True)
# Displaying the imported data
data_from_s3.show()
Achte auf das Präfix dbfs:. Alle Workspace-Dateien benötigen es, damit Spark die Datei korrekt lädt. DBFS steht für Databricks File System.
Der Import aus einem S3-Bucket ist ähnlich (bei Enterprise-Accounts):
# Importing necessary libraries
from pyspark.sql import SparkSession
# Creating a Spark session
spark = SparkSession.builder.appName("S3ImportExample").getOrCreate()
# Defining the S3 path to the data
s3_path = "s3://your-bucket/your-data.csv"
# Reading data from S3 into a DataFrame
data_from_s3 = spark.read.csv(s3_path, header=True, inferSchema=True)
# Displaying the imported data
data_from_s3.show()
Für weitere Datentypen findest du Infos in den Bereichen Data Engineering und Connect to data sources der Databricks-Dokumentation.
7. SQL in Databricks ausführen
Beim Upload der Datei diamonds.csv wurde daraus eine Databricks-Tabelle in einer Datenbank namens default:

Diese Datenbank default wird erstellt, wenn wir strukturierte Dateien laden, ohne zuvor eine Datenbank anzulegen.
Wenn es eine Datenbank gibt, können wir sie auch mit SQL abfragen, nicht nur mit Spark. Erstelle dazu ein neues Notebook oder wechsele die Sprache des aktuellen Notebooks auf SQL. Dann probiere diesen Snippet:
SELECT * FROM default.diamonds_1_csv
LIMIT 5;
Du solltest die ersten fünf Zeilen der Diamonds-Tabelle erhalten:

Hinweis: Ich verwende für den obigen Snippet ein SQL-Notebook.
Du kannst diese Tabelle auch in Pandas laden. Füge im selben Notebook diesen Snippet ein:
%python
# Import the necessary libraries
import pandas as pd
# Assuming 'default' is the database name and 'diamonds' is the table name
# Use the spark.sql function to query the table and retrieve the data
table_df = spark.sql("SELECT * FROM default.diamonds_1_csv")
# Convert the Spark DataFrame to a Pandas DataFrame
pandas_df = table_df.toPandas()
# Display the Pandas DataFrame
pandas_df.head()
Das gibt den Kopf der Tabelle aus:

Jetzt kannst du mit SQL und Pandas alle üblichen Analyseschritte auf der Tabelle ausführen.
Fazit und nächste Schritte
Mit dem schlanken Community-Edition-Account haben wir schon viel gelernt und ausprobiert. Um weiter einzusteigen, nutze zuerst die zweiwöchige kostenlose Testphase für Premium-Accounts bei Databricks.
Anschließend holst du das Maximum aus dem Kurs Introduction to Databricks von DataCamp. Neben dem Account-Setup lernst du dort diese Kernfunktionen von Databricks kennen und übst sie:
- Databricks-Workspaces administrieren
- Lesen und Schreiben in externe Datenbanken
- Datentransformationen
- Datenorchestrierung, also Jobs einplanen
- Umfassender Überblick über Databricks SQL
- Lakehouse AI für Machine Learning im großen Maßstab nutzen.
Ich bin Content-Creator im Bereich Data Science mit über zwei Jahren Erfahrung und zähle zu den größten Stimmen auf Medium. Ich schreibe gern ausführliche Artikel über KI und ML – mit einer Prise Sarkasmus, damit das Ganze nicht zu trocken wird. Bisher habe ich über 130 Artikel veröffentlicht und einen DataCamp-Kurs produziert, ein weiterer ist in Arbeit. Meine Inhalte wurden von über 5 Millionen Menschen gelesen, 20.000 davon folgen mir auf Medium und LinkedIn.
