Weiter zum Inhalt

Databricks-Tutorial: 7 Konzepte, die jede Datenfachkraft kennen muss

Lerne die führende Unified-Plattform für Big-Data-Analytics kennen: Databricks. Das Tutorial behandelt die sieben Kernkonzepte und Features von Databricks und wie sie zusammenspielen, um reale Herausforderungen in der modernen Datenwelt zu lösen.
Aktualisiert 18. Sept. 2026  · 12 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity

Am Anfang gab es Data-Warehouses. Sie speicherten Daten in Zeilen und Spalten, weil Internet und Computer damals vor allem einfache Textinformationen verarbeiten konnten. Viel später kamen Data Lakes — sie konnten nahezu jede Art von Daten aufnehmen, die du sammeln konntest. Perfekt für das Social-Media- und YouTube-Zeitalter.

Beide hatten jedoch Nachteile — Data-Warehouses waren teuer und für moderne Data Science wenig geeignet, während Data Lakes unübersichtlich wurden und oft zu Data Swamps verkommen sind. Unternehmen betrieben daher zwei getrennte Tech-Stacks — Warehouses für BI und Analytics und Lakes für Machine Learning.

Die Pflege zweier unterschiedlicher Datenarchitekturen war jedoch so aufwendig, dass die Ergebnisse oft zu wünschen übrig ließen. Daraus entstand die Lakehouse-Architektur — genau dafür ist Databricks berühmt.

Databricks ist eine Cloud-Plattform, die es ermöglicht, den Mehrwert von Warehouses und Lakes in einer gemeinsamen Umgebung zu vereinen. Dieser Artikel bietet einen Überblick über die Plattform, zeigt die wichtigsten Features und wie du sie nutzt.

Was wir in diesem Databricks-Tutorial behandeln

Databricks ist so umfangreich, dass allein die Dokumentation ein eigenes Buch füllen könnte. Ziel dieses Artikels ist daher, dir eine sinnvolle Begriffshierarchie zu geben — linear geordnete Erklärungen der Databricks-Features, mit denen du vom Einsteiger zur versierten Databricks-Anwenderin bzw. zum versierten Anwender wirst. Wenn du ganz neu bist, wirf auch einen Blick auf unseren Introduction to Databricks-Kurs.

Los geht’s!

1. Was ist Databricks?

Wenn du Databricks liest, denk an eine Plattform — nicht an ein Framework oder eine Python-Bibliothek. Plattformen bieten typischerweise einen großen Funktionsumfang, und Databricks ist da keine Ausnahme. Es ist eine der wenigen Plattformen, die jede Datenrolle abdeckt — von Data Engineers bis zu modernen Machine-Learning-Engineers (oder, wie die Presse heute sagt, KI-Programmierern).

Databricks umfasst diese Kernkomponenten:

  1. Workspace: Ein zentrales Umfeld, in dem Teams reibungslos zusammenarbeiten. Der Zugriff erfolgt über eine nutzerfreundliche Weboberfläche.
  2. Notebooks: Eine für Zusammenarbeit und Flexibilität optimierte Variante von Jupyter-Notebooks.
  3. Apache Spark: Databricks setzt auf Apache Spark. Die Engine treibt die parallele Verarbeitung riesiger Datensätze an und ist ideal für Big-Data-Analytics.
  4. Delta Lake: Eine Weiterentwicklung von Data Lakes mit ACID-Transaktionen. Delta Lake sorgt für Datenzuverlässigkeit und -konsistenz und löst klassische Lake-Probleme.
  5. Skalierung: Die Plattform skaliert horizontal statt vertikal — ideal für Organisationen mit stetig wachsenden Datenanforderungen.

Vorteile von Databricks

Im Zusammenspiel erschließen diese Komponenten zahlreiche Vorteile:

  • Teamübergreifende Zusammenarbeit: Engineers, Analysten, Data Scientists und ML Engineers arbeiten nahtlos auf derselben Plattform.
  • Konsistenz: Dank Notebooks kannst du zwischen Aufgaben und Programmiersprachen wechseln, ohne den Kontext zu verlieren.
  • Effiziente Workflows: Von Datenbereinigung über Transformation bis hin zu Machine Learning — alles aus einem Guss.
  • Integriertes Datenmanagement: Daten aus verschiedenen Quellen einlesen, Tabellen anlegen und SQL ausführen.
  • Echtzeit-Zusammenarbeit: Geteilte Notebooks und Co-Editing ermöglichen paralleles Arbeiten mehrerer Teammitglieder.

Wenn dich das von der Bedeutung von Databricks in der Datenwelt überzeugt, machen wir dich jetzt startklar auf der Plattform.

2. Account einrichten

Richte deinen Account unter https://www.databricks.com/try-databricks ein und registriere dich für die Community Edition.

image4.png

Die Community Edition bietet weniger Funktionen als die Enterprise-Version, benötigt aber keine Einrichtung beim Cloud-Anbieter — ideal für kleine Use Cases wie Tutorials.

Wenn du nach der E-Mail-Verifizierung diese Seite siehst, kannst du loslegen:

image3.png

3. Databricks-Workspace

Die Oberfläche, die du siehst, ist der Workspace für deine E-Mail-Adresse (den Community-Edition-Workspace findest du leicht). In Unternehmen legt in der Regel ein Account-Admin einen zentralen Databricks-Account an und verwaltet die Zugriffe auf den Workspace.

Schauen wir uns jetzt das UI der Plattform an. Links findest du das Menü für die verschiedenen Komponenten von Databricks. Die Enterprise-Version hat noch mehr Optionen:

image6.png

Die erste Option im Menü ist der Workspace-Typ, standardmäßig auf Data Science and Engineering gesetzt. Wenn du auf Machine Learning wechselst, erscheint die neue Option Experiments:

image5.gif

Auf den ersten Blick wirkt das unspektakulär, doch mit einem Upgrade und etwas Hands-on fallen schnell die Stärken der Plattform auf:

  • Zentrale Anlaufstelle für Ressourcen: Notebooks, Cluster, Tabellen, Bibliotheken und Dashboards
  • Notebooks in mehreren Sprachen
  • Clustermanagement: Rechenressourcen für die Codeausführung verwalten
  • Tabellenverwaltung
  • Dashboard-Erstellung: Visualisierungen direkt im Workspace zu Dashboards zusammenführen
  • Kollaboratives Echtzeit-Editing von Notebooks
  • Versionskontrolle für Notebooks
  • Job-Scheduling (sehr mächtig): Notebooks und Skripte zeitgesteuert ausführen

und vieles mehr.

Sehen wir uns einige dieser Komponenten genauer an.

4. Databricks-Cluster

Cluster in Databricks sind die Rechenressourcen, mit denen Datenverarbeitungsaufgaben ausgeführt werden. In der Regel stellt dein gewählter Cloud-Anbieter die Cluster bei der Accounterstellung bereit.

In der Community Edition sind RAM und CPU begrenzt, GPUs sind nicht enthalten. Premium-Nutzende können jedoch häufig Folgendes sehr bequem umsetzen:

  • Datenverarbeitung: Cluster verarbeiten und transformieren große Datenmengen mithilfe der Parallelisierung von Spark.
  • Machine Learning: Modelle mit Python (oder anderen Sprachen) und zugehörigen Bibliotheken trainieren und einsetzen.
  • ETL-Workflows: Extract, Transform, Load effizient von der Quelle bis zum Ziel.

Um einen Cluster zu erstellen, nutze den Button „Create“ oder den Menüpunkt „Compute“:

image12.gif

Wähle bei der Erstellung eine passende Spark-Version für deine Umgebung und warte ein paar Minuten, bis der Cluster einsatzbereit ist.

5. Databricks-Notebooks

Sobald dein Cluster läuft, kannst du Notebooks anlegen. Wenn du mit Jupyter, Colab oder den DataCamp Workspaces gearbeitet hast, kommt dir vieles vertraut vor:

image1.gif

Warum aber „Jupyter-ähnlich“ nutzen, wenn es echtes Jupyter gibt? Nun, Databricks-Notebooks haben gegenüber Jupyter diese Vorteile:

  • Zusammenarbeit: Eingebaute Funktionen erlauben gleichzeitiges Arbeiten mehrerer Personen am selben Notebook. Änderungen werden in Echtzeit nachverfolgt.
  • Ausführungsumgebung: Viele Jupyter-Setups laufen auf Einzelmaschinen mit fester Hardware. Bibliotheken und Abhängigkeiten musst du selbst installieren. Databricks-Notebooks hingegen laufen auf Clustern, die Ressourcen und Skalierung automatisch an die Last anpassen. Die Umgebungen sind vorkonfiguriert.
  • Integration mit Big-Data-Tech: Jupyter kann mit Apache Spark arbeiten, erfordert aber manuelles Sitzungs- und Abhängigkeitsmanagement. Databricks wurde von den Spark-Erfinderinnen und -Erfindern gegründet und unterstützt Spark nativ. Spark-Sessions und Cluster verwaltet die Plattform automatisch.

Es gibt noch viele weitere Vorteile. Hier eine Tabelle mit den wichtigsten Unterschieden:

Feature

Jupyter Notebooks

Databricks Notebooks

Plattform

Open Source, lokal oder in der Cloud

Exklusiv auf der Databricks-Plattform

Zusammenarbeit & Teilen

Begrenzte Kollaboration, manuelles Teilen

Integrierte Kollaboration, gleichzeitiges Echtzeit-Editing

Ausführung

Lokal oder auf externen Servern

Ausführung auf Databricks-Clustern

Big-Data-Integration

Mit Spark integrierbar, zusätzliche Konfiguration nötig

Native Apache-Spark-Integration, für Big Data optimiert

Eingebaute Features

Externe Tools/Erweiterungen für Versionskontrolle, Kollaboration, Visualisierung

Integration mit Databricks-Features wie Delta Lake, eingebaute Kollaboration und Analytics-Tools

Kosten & Skalierung

Lokal oft kostenlos, Cloud-Varianten können kostenpflichtig sein

Kostenpflichtiger Dienst, nutzungsabhängige Kosten, nahtlose Skalierung mit Clustern

Benutzerfreundlichkeit

Vertraut und weit verbreitet in der Data-Science-Community

Für Big-Data-Analytics zugeschnitten, ggf. steilere Lernkurve bei Databricks-spezifischen Features

Datenvisualisierung

Begrenzte integrierte Visualisierung

Eingebaute Visualisierung im Notebook

Clustermanagement

Spark-Sessions und Abhängigkeiten manuell verwalten

Automatisches Clustermanagement und -skalierung durch die Plattform

Anwendungsfälle

Vielseitig für diverse Data-Science-Aufgaben

Spezialisiert für kollaborative Big-Data-Analytics auf Databricks

Am Ende zählen die Vorteile der Databricks-Notebooks vor allem in bestimmten Use Cases. Wenn du lokal mit einem CSV und Pandas spielst, ist Jupyter die bessere Wahl.

Für Enterprise-Anwendungen kann Databricks als Plattform jedoch die stärkere Option sein.

6. Daten in Databricks laden

Dateningestion beschreibt das Importieren von Daten aus diversen Quellen. Databricks unterstützt unter anderem:

  • AWS S3
  • Azure Blob Storage
  • Google Cloud Storage
  • Relationale Datenbanken (MySQL, PostgreSQL etc.)
  • Data Lakes (Delta Lake, Parquet, Avro etc.)
  • Streaming-Plattformen (Apache Kafka)
  • Google BigQuery
  • Deine lokale CSV-Datei

und mehr.

Schauen wir uns an, wie du verschiedene Datentypen in Databricks lädst. Starten wir mit lokalen Dateien:

image10.gif

Befolgst du die Schritte im GIF, liegt die Datei im Workspace. So lädst du sie mit Spark:

# Importing necessary libraries
from pyspark.sql import SparkSession

# Creating a Spark session
spark = SparkSession.builder.appName("S3ImportExample").getOrCreate()

# Defining the CSV path to the data
path = "dbfs:/FileStore/tables/diamonds.csv"

# Reading data from S3 into a DataFrame
data_from_s3 = spark.read.csv(path, header=True, inferSchema=True)

# Displaying the imported data
data_from_s3.show()

Achte auf das Präfix dbfs:. Alle Workspace-Dateien benötigen es, damit Spark die Datei korrekt lädt. DBFS steht für Databricks File System.

Der Import aus einem S3-Bucket ist ähnlich (bei Enterprise-Accounts):

# Importing necessary libraries
from pyspark.sql import SparkSession

# Creating a Spark session
spark = SparkSession.builder.appName("S3ImportExample").getOrCreate()

# Defining the S3 path to the data
s3_path = "s3://your-bucket/your-data.csv"

# Reading data from S3 into a DataFrame
data_from_s3 = spark.read.csv(s3_path, header=True, inferSchema=True)

# Displaying the imported data
data_from_s3.show()

Für weitere Datentypen findest du Infos in den Bereichen Data Engineering und Connect to data sources der Databricks-Dokumentation.

7. SQL in Databricks ausführen

Beim Upload der Datei diamonds.csv wurde daraus eine Databricks-Tabelle in einer Datenbank namens default:

image9.png

Diese Datenbank default wird erstellt, wenn wir strukturierte Dateien laden, ohne zuvor eine Datenbank anzulegen.

Wenn es eine Datenbank gibt, können wir sie auch mit SQL abfragen, nicht nur mit Spark. Erstelle dazu ein neues Notebook oder wechsele die Sprache des aktuellen Notebooks auf SQL. Dann probiere diesen Snippet:

SELECT * FROM default.diamonds_1_csv
LIMIT 5;

Du solltest die ersten fünf Zeilen der Diamonds-Tabelle erhalten:

image11.png

Hinweis: Ich verwende für den obigen Snippet ein SQL-Notebook.

Du kannst diese Tabelle auch in Pandas laden. Füge im selben Notebook diesen Snippet ein:

%python
# Import the necessary libraries
import pandas as pd

# Assuming 'default' is the database name and 'diamonds' is the table name
# Use the spark.sql function to query the table and retrieve the data
table_df = spark.sql("SELECT * FROM default.diamonds_1_csv")

# Convert the Spark DataFrame to a Pandas DataFrame
pandas_df = table_df.toPandas()

# Display the Pandas DataFrame
pandas_df.head()

Das gibt den Kopf der Tabelle aus:

image8.png

Jetzt kannst du mit SQL und Pandas alle üblichen Analyseschritte auf der Tabelle ausführen.

Fazit und nächste Schritte

Mit dem schlanken Community-Edition-Account haben wir schon viel gelernt und ausprobiert. Um weiter einzusteigen, nutze zuerst die zweiwöchige kostenlose Testphase für Premium-Accounts bei Databricks.

Anschließend holst du das Maximum aus dem Kurs Introduction to Databricks von DataCamp. Neben dem Account-Setup lernst du dort diese Kernfunktionen von Databricks kennen und übst sie:

  • Databricks-Workspaces administrieren
  • Lesen und Schreiben in externe Datenbanken
  • Datentransformationen
  • Datenorchestrierung, also Jobs einplanen
  • Umfassender Überblick über Databricks SQL
  • Lakehouse AI für Machine Learning im großen Maßstab nutzen.

Bexruz (Bex) Tuychiev's photo
Author
Bexruz (Bex) Tuychiev
LinkedIn

Ich bin Content-Creator im Bereich Data Science mit über zwei Jahren Erfahrung und zähle zu den größten Stimmen auf Medium. Ich schreibe gern ausführliche Artikel über KI und ML – mit einer Prise Sarkasmus, damit das Ganze nicht zu trocken wird. Bisher habe ich über 130 Artikel veröffentlicht und einen DataCamp-Kurs produziert, ein weiterer ist in Arbeit. Meine Inhalte wurden von über 5 Millionen Menschen gelesen, 20.000 davon folgen mir auf Medium und LinkedIn. 

Themen
Datenanalyse
Big Data

Starte heute deine Databricks-Reise!

Kurs

Databricks-Konzepte

4 Std.
23.3K
Lerne die Leistungsfähigkeit von Databricks Lakehouse kennen und verbessere deine Fähigkeiten in den Bereichen Data Engineering und maschinelles Lernen.
Details anzeigenRight Arrow
Kurs Starten
Mehr anzeigenRight Arrow