Weiter zum Inhalt

Datensätze und wo du sie findest: Den Informationsdschungel navigieren

Du suchst spannende Datensätze für deine Analyse? Du hast einen Beispieldatensatz, aber noch keinen Plan für die nächsten Schritte? Dann ist dieses Tutorial für dich! Wir erklären, was ein Datensatz ist, wo du einen findest, wie du ihn bereinigst und explorierst – und wo du deine Datenstory präsentierst.
Aktualisiert 18. Sept. 2026  · 11 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity

Egal, ob du ein Datenprojekt für dein Portfolio planst oder deinen ersten Auftrag als bezahlte:r Data Scientist beginnst: Als Erstes brauchst du einen geeigneten Datensatz. Doch was genau ist ein Datensatz – und wo findest du ihn?

Daten gibt es überall, aber eine seriöse, leicht zugängliche Quelle für genau die Fragen zu finden, die du beantworten willst, ist oft schwieriger als gedacht. Jedes starke Datenprojekt startet jedoch mit einem guten Datensatz. In diesem Tutorial schauen wir uns kurz an, welche Arten von Datensätzen es gibt, wie du sie findest und was du damit machst, sobald du sie hast.

Was sind Datensätze?

Ein Datensatz ist schlicht eine Sammlung von Informationen. In der Regel sind diese Informationen in irgendeiner Form organisiert. Allerdings ist die Struktur nicht immer direkt für deinen Kontext hilfreich – dann ist etwas Vorarbeit nötig, um sie nutzbar zu machen.

Es gibt verschiedene Datentypen, die unterschiedlich organisiert sein können. Häufige Arten von Datensätzen sind:

  • Tabellarische Daten, die in Tabellen wie in Kalkulationen angeordnet sind
  • Relationale Daten, also Sammlungen mehrerer Tabellen, die über Beziehungen verknüpft sind
  • Zeitreihendaten, also Daten, die chronologisch geordnet sind

Andere Datensätze können Sammlungen von Bildern, Textdokumenten oder Audio- bzw. Videoaufnahmen enthalten.

Wo finde ich Datensätze?

Nach zuverlässigen Datensätzen zu suchen, kann viel Zeit kosten. Es gibt viele frei verfügbare Datensätze, andere sind kostenpflichtig oder sogar proprietär.

Paywalls, rechtliche Fragen, IP-Rechte oder schlicht die Tatsache, dass genau die benötigten Daten noch gar nicht existieren, können die Suche zusätzlich erschweren.

In solchen Fällen brauchst du Kreativität: Entweder holst du aus verfügbaren Daten das Beste heraus oder du erhebst eigene Daten (was schnell selbst zum Projekt wird). Schau dir dazu diesen Kurs zu Web Scraping mit Python, diesen Kurs zum Verständnis von Data Science oder diesen Kurs zu Data Science für Business an, um Ideen für die Datenerhebung zu bekommen.

DataCamp stellt eine leicht zugängliche Sammlung kuratierter Datensätze zu verschiedensten Themen bereit. Das ist ein guter Startpunkt, besonders wenn du noch nicht weißt, wo du beginnen sollst.

Weitere gute Anlaufstellen sind Regierungswebsites, Websites von Non-Profit-Organisationen, Universitäten und Bibliotheken. Unten findest du eine Tabelle mit hilfreichen Quellen für interessante Datensätze.

Quelle für Datensätze

Weblink

DataCamp

https://www.datacamp.com/workspace/datasets

Google Dataset Search

https://datasetsearch.research.google.com/

Data.gov

https://data.gov/

Datahub

https://www.datahub.io/search

UCI Machine Learning Repository

https://archive.ics.uci.edu/

Kaggle

https://www.kaggle.com/datasets

Library of Congress

https://guides.loc.gov/datasets

US Census Bureau

https://www.census.gov/data/datasets.html

Federal Trade Commission

https://www.ftc.gov/policy-notices/open-government/data-sets

World Health Organization

https://www.who.int/data/sets

Centers for Disease Control and Prevention

https://open.cdc.gov/data.html

National Institutes for Health

https://www.ncbi.nlm.nih.gov/datasets/

Ein entscheidender Schritt bei der Wahl einer Datenquelle ist die Prüfung von Qualität und Zuverlässigkeit. Vor allem solltest du sicherstellen, dass die Quelle seriös ist. Jeder DataCamp-Datensatz verlinkt auf das Ursprungsmaterial, sodass du die Echtheit leicht prüfen kannst.

Bei anderen Quellen ist oft etwas mehr Recherche notwendig, um die Verlässlichkeit zu beurteilen. Wichtige Kriterien sind, wie die Daten erhoben wurden, welche Populationen vertreten sind und ob es Verzerrungen im Erhebungsprozess gab.

Ebenfalls wichtig: Wie viel Bereinigung und Aufbereitung ist nötig, um die Daten in ein nutzbares Format zu bringen? Ein kuratierter Datensatz kann viel Zeit sparen. Oft kommst du aber um „unordentliche“ Daten nicht herum – dann musst du Formate vereinheitlichen, fehlende Werte behandeln und Duplikate entfernen.

Dieses Tutorial zur Datenbereinigung hilft dir, solche Aufgaben zu meistern.

Strukturen von Datensätzen erkunden

Es gibt einige gängige Begriffe für Bestandteile eines Datensatzes, die du kennen solltest.

Tabellarische Datensätze bestehen aus Zeilen und Spalten. In der Regel entspricht jede Zeile einem Datensatz, jede Spalte einem Attribut bzw. einer Variable dieses Datensatzes.

Jede Datenzelle am Schnittpunkt von Zeile und Spalte enthält genau einen Wert. Ein Index gibt jedem Datensatz eine eindeutige Nummer. Der Header, also die erste Zeile einer Spalte, enthält normalerweise den Namen des Attributs bzw. der Spalte. In einer relationalen Datenbank können einzelne Tabellen über Relationen verknüpft sein.

image1.png

Wenn du einen Datensatz zum ersten Mal öffnest, solltest du ihn untersuchen und diese Schlüsseleigenschaften identifizieren. Es gibt viele Möglichkeiten, dir den Datensatz anzuschauen, zum Beispiel indem du ihn in Python, SQL, R oder Matlab lädst und gezielt Zeilen anzeigen lässt.

Je nach Dateityp und -größe kannst du ihn auch direkt in Microsoft Excel oder Google Sheets öffnen. Beachte: Sehr große Datensätze brauchen viel Speicher, wenn du sie komplett lädst – arbeite dann lieber in Teilstücken.

Datensätze bereinigen und vorbereiten

Nach der Beschaffung eines Datensatzes folgt meist viel Bereinigung und Vorbereitung, um ihn in ein nutzbares Format zu bringen. Kuratierte Datensätze, wie du sie bei DataCamp findest, reduzieren den Aufwand.

Trotzdem wirst du den Datensatz häufig an deine Bedürfnisse anpassen müssen – besonders, wenn du Daten aus mehreren Quellen kombinierst.

image3.png

Typische Aufgaben bei der Bereinigung und Vorbereitung sind:

  • Nicht relevante Daten für deine Analyse entfernen
  • Duplikate erkennen und löschen
  • Tippfehler, Groß/Kleinschreibung oder uneinheitliche Benennungen korrigieren
  • Fehlende Werte entfernen oder imputieren
  • Kategoriale Daten numerisch codieren
  • Daten in ein einheitliches Format transformieren
  • Konsistenz und Genauigkeit im Datensatz sicherstellen

Mehr dazu findest du in den Kursen Datenbereinigung in Python und Datenbereinigung in SQL Server-Datenbanken.

Explorative Datenanalyse

Explorative Datenanalyse hilft dir, deinen Datensatz wirklich zu verstehen – ein unverzichtbarer Schritt, bevor du dich in komplexere Analysen stürst. Viele Junior-Data-Profis überspringen ihn und bereuen es später.

Ich rate dir dringend, mehrere explorative Analysen durchzuführen, bevor du mit Modellierung, Machine Learning oder anderen komplexen Verfahren startest.

So entdeckst du Auffälligkeiten, Inkonsistenzen oder Probleme im Datensatz. Außerdem findest du dadurch später leichter die passende Analysemethode und erkennst sowie korrigierst anomale Ergebnisse.

Die Exploration sollte verschiedene Formen annehmen – von deskriptiven Statistiken bis zu einfachen Visualisierungen. Bei tabellarischen Datensätzen liefern Kennzahlen wie Mittelwert, Median und Standardabweichung sowie einfache Scatterplots oder Balkendiagramme wertvolle Einblicke in Muster und Verhalten deiner Daten.

Ich ermutige dich, so viele Variablen wie sinnvoll zu visualisieren. Auch wenn diese Schritte nicht im finalen Dashboard, Bericht oder der Anwendung landen, führen sie dich sicher durch den Prozess. Lerne mehr über explorative Datenanalyse in Python oder in R.

Deine Datenstory präsentieren

Am Ende jedes Datenprojekts steht die Präsentation deiner Ergebnisse. Ob geschäftliche Stakeholder, potenzielle Arbeitgeber:innen oder Data-Kolleg:innen – deine Insights müssen klar und leicht verständlich sein.

Manchmal reicht ein einfaches Diagramm mit aussagekräftigem Titel. In anderen Fällen braucht es ein umfangreicheres Dashboard. Wichtig ist, dass deine Interpretation zum Datensatz passt.

Spickzettel für Datenvisualisierung

Unser Spickzettel zur Datenvisualisierung hilft dir, die passende Darstellung für deine Datensätze zu wählen.

Ziel ist es, deinem Publikum ehrlich zu vermitteln, was der Datensatz abbildet und wie er deine Fragen beantwortet. Im Skill-Lernpfad Data Storytelling meisterst du diese Kernkompetenz.

DataCamp ist ein idealer Ort, um dein Datenportfolio zu präsentieren. Weitere beliebte Optionen sind ein GitHub-Repository oder eine professionelle Website. Wo auch immer du dein Projekt hostest – sorge dafür, dass deine Zielgruppe es leicht findet.

Fazit

Information ist der Kern von Data Science. Datensätze bündeln Informationen an einem Ort und machen es möglich, Trends zu erkennen, Vorhersagen zu treffen und Fortschritt zu gestalten. Die Suche nach Datensätzen kann anfangs einschüchternd wirken. Aber mit ein paar guten Startpunkten wird es deutlich einfacher. Stöbere in DataCamps Auswahl an interessanten Datensätzen und lass dich inspirieren!


Amberle McKee's photo
Author
Amberle McKee
LinkedIn

Ich bin promoviert und habe 13 Jahre Erfahrung in der Arbeit mit Daten in der biologischen Forschung. Ich entwickle Software in verschiedenen Programmiersprachen, darunter Python, MATLAB und R. Meine Leidenschaft ist es, meine Liebe zum Lernen mit der Welt zu teilen.

Themen
Datenanalyse
Datenwissenschaft

Starte heute deine Data Journey!

Lernpfad

Assoziierter Datenanalyst in SQL

39 Std.
Erwerbe die SQL-Kenntnisse, die du brauchst, um eine Datenbank abzufragen, die Ergebnisse zu analysieren und ein SQL-kompetenter Datenanalyst zu werden. Du brauchst keine Erfahrung im Programmieren zu haben!
Details anzeigenRight Arrow
Kurs Starten
Mehr anzeigenRight Arrow
Verwandt

Blog

Lehrer/innen und Schüler/innen erhalten das Premium DataCamp kostenlos für ihre gesamte akademische Laufbahn

Keine Hacks, keine Tricks. Schüler/innen und Lehrer/innen, lest weiter, um zu erfahren, wie ihr die Datenerziehung, die euch zusteht, kostenlos bekommen könnt.
Nathaniel Taylor-Leach's photo

Nathaniel Taylor-Leach

4 Min.

Tutorial

Python Datenstrukturen Tutorial

Mach dich mit Python-Datenstrukturen vertraut: Lerne mehr über Datentypen und primitive sowie nicht-primitive Datenstrukturen wie Strings, Listen, Stapel usw.
Sejal Jaiswal's photo

Sejal Jaiswal

24 Min.

Tutorial

Wie man Listen in Python aufteilt: Einfache Beispiele und fortgeschrittene Methoden

Lerne, wie du Python-Listen mit Techniken wie Slicing, List Comprehensions und itertools aufteilen kannst. Finde heraus, wann du welche Methode für die beste Datenverarbeitung nutzen solltest.
Allan Ouko's photo

Allan Ouko

11 Min.

Tutorial

Python Switch Case Statement: Ein Leitfaden für Anfänger

Erforsche Pythons match-case: eine Anleitung zu seiner Syntax, Anwendungen in Data Science und ML sowie eine vergleichende Analyse mit dem traditionellen switch-case.
Matt Crabtree's photo

Matt Crabtree

5 Min.

Tutorial

Ein Leitfaden zu Python-Hashmaps

Finde heraus, was Hashmaps sind und wie sie in Python mit Hilfe von Wörterbüchern umgesetzt werden.
Javier Canales Luna's photo

Javier Canales Luna

11 Min.

Tutorial

Python-Anweisungen IF, ELIF und ELSE

In diesem Tutorial lernst du ausschließlich Python if else-Anweisungen kennen.
Sejal Jaiswal's photo

Sejal Jaiswal

9 Min.

Mehr AnzeigenMehr Anzeigen