Kurs
DataCamp Workspace baut auf Jupyter-Notebooks auf und optimiert das Erlebnis, damit du produktiver arbeitest.
Ein häufiger Stolperstein für Data Analysts und Data Scientists: Es ist oft mühselig, ein Jupyter-Notebook mit einer Datenbank zu verbinden, um loszulegen. Für Einsteiger ist das Problem noch größer: Wie sollst du SQL lernen, wenn du dich nicht einmal mit einer Datenbank verbinden kannst?
In Workspace schreibst du SQL ganz ohne Hürden – egal ob du übst oder arbeitest. Dieses Tutorial zeigt dir, wie du in wenigen Sekunden in Workspace mit SQL startest.
Dieses Tutorial setzt voraus, dass du schon einmal SQL verwendet hast. Falls nicht, lies zuerst unser SQL-Tutorial für Einsteiger und probiere anschließend die Beispiele daraus in Workspace mit den hier gezeigten Techniken aus!
Erste Schritte
Um Workspace zu nutzen, musst du dich bei DataCamp registrieren. (Ein kostenloses Konto reicht für den Start.)
Sobald dein Konto erstellt ist, nutze die obere Navigation, um zu Workspace zu wechseln.

In diesem Tutorial verwenden wir den integrierten Datensatz "NBA Shooting Data". Wenn du lieber deinen eigenen Datensatz nutzen möchtest, springe zum Abschnitt weiter unten.
Wechsle über die linke Navigation zur Datasets-Seite.

Gib "nba" in das Suchfeld ein und klicke auf den Datensatz.

Du siehst nun eine Vorschau des Datensatzes. Lies sie kurz durch und klicke dann auf "Use Dataset".

Eigenen Datensatz hochladen
Du kannst in Workspace SQL für alle tabellenartigen Daten verwenden. Aktuell sind CSV-Dateien am besten unterstützt. Zum Lernen empfiehlt es sich daher, einen CSV-Datensatz zu verwenden.
Klicke auf der Übersichtsseite auf "Empty", um einen leeren Workspace zu erstellen.

Gib deinem Workspace einen Namen und klicke dann auf "Create Workspace".

Öffne in der linken Werkzeugleiste das Tool Files.

Ziehe links oben im Tool eine Datei in den Dateibereich, um sie hochzuladen. (Du kannst auch auf "browse files" klicken oder auf die Schaltfläche ⊕ und dann auf Upload.)
SQL mit Daten in CSV-Dateien nutzen
Die NBA-Shooting-Daten liegen in der Datei nba_players_shooting.csv. Öffne in der linken Werkzeugleiste das Files-Tool, um die Datei zu sehen.

Das Notebook im Workspace enthält etwas Python-Code zum Import des Datensatzes. In diesem Fall wollen wir jedoch SQL verwenden.
Klicke am Ende des Notebooks auf "Add SQL".

Wähle im Dropdown "Select source" die Option "DataFrames and CSVs".

Um eine SQL-Abfrage gegen eine CSV-Datei zu schreiben, brauchst du nur eine Abweichung von Standard-SQL: In der FROM-Klausel gibst du statt eines Tabellennamens den Pfad zur CSV-Datei in einfachen Anführungszeichen an.
Berechnen wir den Anteil der getroffenen Würfe je Schütze, absteigend vom besten zum schwächsten. Tippe folgenden Code in die SQL-Zelle.
SELECT
shooter,
SUM((SCORE = 'MADE')::DOUBLE) / COUNT(*) AS prop_score_made
FROM 'nba_players_shooting.csv'
GROUP BY shooter
ORDER BY prop_score_made DESC

Beachte: Wenn du mit einer CSV-Datei arbeitest, wird der SQL-Dialekt DuckDB verwendet. Mehr dazu im Artikel DuckDB makes SQL a first-class citizen on DataCamp Workspace.
Weiterarbeiten in Python, R oder mit No-Code-Charts
Im letzten Beispiel haben wir die Standardeinstellung für das Rückgabeformat der Abfrage beibehalten. Oben in der SQL-Zelle siehst du, dass das Ergebnis als DataFrame namens df zurückgegeben wird. So kannst du direkt in Python weiterarbeiten (oder in R, wenn du einen R-Workspace nutzt) oder No-Code-Diagramme erstellen.

Klicke auf "Add Chart", um ein No-Code-Diagramm hinzuzufügen.

Lege folgende Optionen fest.
- Type: Bar
- X-axis: prop_score_made
- Y-axis: SHOOTER

SQL mit Daten in Data Frames nutzen
Die SQL-Abfrage gegen die CSV-Datei hat einen DataFrame namens df erzeugt. Du kannst auch SQL-Abfragen gegen diese pandas- oder R-Data-Frames schreiben. Der einzige Unterschied zu Standard-SQL: In der FROM-Klausel verwendest du den DataFrame-Namen statt des Tabellennamens.
Wir verwenden hier die Ergebnisse in df erneut und teilen die Spalte shooter in Vor- und Nachnamen auf. Füge eine SQL-Zelle hinzu, wähle als Quelle "DataFrames and CSVs" und nutze den folgenden Code.
SELECT
str_split(shooter, ' ')[1] AS first_name,
str_split(shooter, ' ')[2] AS last_name,
prop_score_made
FROM df
Beispieldatenbanken verwenden
Workspace stellt außerdem mehrere Beispieldatenbanken bereit, mit denen du deine SQL-Kompetenzen üben kannst.
Füge eine SQL-Zelle hinzu und scrolle im Quell-Dropdown zum Bereich "Sample Integrations". Hier verwenden wir "Bicycle Sales".

Es erscheint eine Standardabfrage. Für das Tutorial ersetzen wir sie durch eine einfachere Abfrage.
SELECT
product_name,
MIN(list_price) AS cheapest_list_price
FROM products
GROUP BY product_name
Wenn du eine Verbindung zu einer Datenbank nutzt (statt SQL gegen eine CSV-Datei oder einen DataFrame zu schreiben), kannst du die Ergebnisse als Query zurückgeben lassen. Wähle im Dropdown "Query". Du kannst den Ergebniswert auch benennen. Ändere hier "query" in "best_price".

Das Ausführen der Abfrage liefert folgende Ausgabe.

Du kannst dieses Ergebnis nun für weitere SQL-Abfragen verwenden. Im Grunde hast du eine Common Table Expression erstellt (behandelt im Tutorial SQL Commands for Data Scientists), ohne die CTE-Syntax zu schreiben.
Füge eine weitere SQL-Zelle hinzu und schreibe diese Abfrage.
SELECT *
FROM best_price
WHERE cheapest_list_price > 10000
Diese Abfrage liefert die folgenden Ergebnisse.

Verbindung zu anderen Datenbanken
Workspace kann sich auch mit vielen weiteren Datenbanksystemen verbinden, darunter PostgreSQL, MySQL, Redshift, BigQuery, Athena, SQL Server, MariaDB und Oracle Database. Ausführliche Verbindungsanleitungen findest du in den Workspace-Dokumenten.
Klicke in der linken Werkzeugleiste auf "Integrations" und dann auf die Schaltfläche ⊕, um eine neue Integration zu erstellen.
Wähle den Typ der Datenbank, zu der du eine Verbindung herstellen möchtest.

Du wirst nach Verbindungsdetails gefragt (diese variieren je nach Datenbanktyp).

Den KI-Assistenten nutzen
SQL zu schreiben macht Spaß und ist nützlich – aber wenn dir eine KI dabei hilft, lernst du schneller und arbeitest produktiver. Mehr über den KI-Assistenten erfährst du in From Data to Insights: Get There Faster with the DataCamp Workspace AI Assistant.
Füge eine SQL-Zelle hinzu. Klicke im Kontextmenü rechts auf "Generate".

Oben in der SQL-Zelle erscheint ein Textfeld. Formuliere dort eine Aufgabe für die KI. Du kannst dir selbst eine Aufgabe ausdenken oder Folgendes ausprobieren.
Return the product names and list prices for all mountain bikes made by Trek that are in stock.
Drücke nach der Eingabe deiner Anfrage die Eingabetaste, damit die KI SQL-Code generiert.

Wenn der Code sinnvoll aussieht, klicke auf "Accept & run" (oder klicke auf "Accept" und später auf "Run"), um die Ergebnisse der Abfrage zu sehen.

Lass dir Fehler von der KI erklären
Die in Workspace integrierte KI kann dir auch erklären, warum Fehler in deinem SQL auftreten. Angenommen, du hast dich bei der Abfrage für die teuren Fahrräder vertan und statt > versehentlich ein Fortran-.GT verwendet.
SELECT *
FROM best_price
WHERE cheapest_list_price .GT. 10000
Das führt zu einem Fehler. Klicke unten links in der SQL-Zelle auf "Fix Error".

Die KI liefert den korrekten Code und erklärt anschließend, was schiefgelaufen ist.

Zusammenfassung
Du hast gesehen, wie du dir das Einrichten einer Datenbank sparst, indem du SQL-Abfragen direkt gegen CSV-Dateien und Data Frames schreibst. Du hast mit Beispieldatenbanken geübt und gelernt, wie du mit natürlicher Sprache SQL generierst und Fehler mit KI behebst.
Diese Funktionen erleichtern den Einstieg in SQL erheblich und steigern deine Produktivität beim Lernen und Arbeiten.
Nächsten Schritt gehen
Starte mit SQL in Workspace, indem du dich einloggst oder ein DataCamp-Konto erstellst. In unserem Skill Track zu SQL-Grundlagen meisterst du außerdem die wichtigsten Konzepte, um mit deinen Daten zu arbeiten und sie abzufragen.
Richie hilft Einzelpersonen und Organisationen dabei, Daten und KI besser zu nutzen. Er war schon Datenwissenschaftler, bevor es Data Science hieß, und hat zwei Bücher geschrieben und viele DataCamp-Kurse zu diesem Thema veranstaltet. Er ist Gastgeber des DataFramed-Podcasts und leitet das DataCamp-Webinarprogramm.
