Weiter zum Inhalt

40+ Ressourcen zu Python-Statistik für Data Science

Eine Sammlung von Python-Ressourcen zu acht Statistikthemen, die du beherrschen solltest, um in Data Science durchzustarten.
Aktualisiert 18. Sept. 2026  · 13 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity

Data Science versus Statistik

Laut unserer Infografik „Learn Data Science In 8 (Easy) Steps“ gehört es zu den ersten Schritten für Data Science, Statistik, Mathematik und Machine Learning zu verstehen.

Wenn du dich erinnerst: Der nächste Schritt ist Programmieren lernen.

Doch sobald du genug Python für Data Science beherrschst, ist es Zeit, dein Wissen zu festigen.

Die Statistikthemen für Data Science, auf die sich dieser Blog bezieht und zu denen er Ressourcen enthält, sind:

Diese Liste deckt nicht die gesamte in Data Science verwendete Statistik ab, soll dir aber den Einstieg erleichtern. :) 

Falls du Python für Data Science noch lernen möchtest, schau dir unseren Kurs Intro to Python For Data Science an. Er hilft dir, Statistik mit Python anzuwenden. 

Statistik für Data Science ist sehr praxisnah. Deshalb solltest du die theoretischen Konzepte, die du zu Beginn deiner Data-Science-Reise gelernt hast, unbedingt weiterhin üben.

Aber worin liegt eigentlich der Unterschied zwischen Statistik und Data Science?

Beides wird oft verwechselt, und manche sagen, es gäbe keinen Unterschied und Data Scientists seien letztlich Statistiker.

Legt man diese Meinungen kurz beiseite, lässt sich festhalten: Statistik ist ein Kernbestandteil von Data Science.

Statistik mit Python

Dieser Beitrag zeigt dir, wie du Statistik mit Python lernst – inklusive der Themen, die du auf deinem Data-Science-Weg mit Python erkunden solltest.

Warum Python?

R ist für Statistik ein guter Start. Es wurde für statistisches Rechnen und Grafiken entwickelt und bietet Unmengen an Statistik-Paketen. Python ist dagegen eine universelle Sprache mit vielen Einsatzmöglichkeiten.

Dennoch kannst du Python hervorragend für Statistik nutzen.

Manche wählen Python wegen der Performance oder weil es vieles kann, was auch R kann. 

Wesentlich ist: Die Sprache wird immer beliebter, und die Anzahl an Paketen für Data Science ist in den letzten Jahren stark gewachsen. 

Kurz: Es gibt viele gute Gründe, Python für statistische Analysen einzusetzen.

Welches Tool du am Ende nutzt, hängt davon ab, welche Analysen du machen willst.

Bist du bereit, mit Statistik in Python loszulegen?

PS: Suchst du auch Ressourcen für Statistik mit R? Dann schau in DataCamps Open Courses oder in die Intro to Statistics With R.


Lerne Python-Statistik für Data Science


Python-Statistik & Wahrscheinlichkeitsrechnung

Als Erstes solltest du Statistik und Wahrscheinlichkeitsrechnung angehen. Neben vielen Videos und Kursen gibt es zahlreiche (gedruckte) Bücher, die dir den Einstieg in Statistik mit Python erleichtern.

Introduction to Statistics with Python 

Für den Einstieg ist dieses Tutorial mit Praxisbeispielen ideal. Die Notebooks führen dich in Konzepte wie Mittelwert, Median, Standardabweichung sowie die Grundlagen von Hypothesentests und Wahrscheinlichkeitsverteilungen ein.

Ein guter Start, denn es ist inspiriert von den Büchern „Think Bayes“ und „Think Stats“ – zwei Top-Empfehlungen, die weiter unten wieder auftauchen!

Wenn du Bücher suchst, probiere dieses kostenlose Buch über Computational Statistics in Python. Es enthält nicht nur eine Einführung in Python, sondern behandelt auch Themen wie Markov Chain Monte Carlo, den Expectation-Maximization-(EM)-Algorithmus, Resampling-Methoden und vieles mehr.

Oder du kaufst dieses Buch von Thomas Haslwanter für eine allgemeine Einführung in gängige statistische Tests, lineare Regressionsanalyse sowie Themen aus der Survival-Analyse und der Bayesschen Statistik. Hinweis: Das Buch nutzt Lebens- und Medizinwissenschaften als Anwendungsfeld.

Wie du siehst, führen beide Bücher auch in fortgeschrittenere Statistikthemen mit Python ein.

Wenn du Videos bevorzugst, sieh dir dieses Tutorial zur statistischen Datenanalyse mit SciPy von Christopher Fonnesbeck an, Assistant Professor am Department of Biostatistics der Vanderbilt University School of Medicine. Außerdem gibt es dieses Video von Gaël Varoquaux zu inferenzieller und explorativer Statistik mit Python. Letzteres nutzt die Python-Pakete Pandas und StatsModels. 

Diese Ressourcen sind allgemein gehalten und helfen dir beim Einstieg in Statistik mit Python.

Wenn du dich schnell mit den Basics vertraut machen willst, schau dir DataCamps Kurs Statistical Thinking in Python von Justin Bois an. Du lernst Konzepte wie Explorative Datenanalyse (EDA), Varianz und Kovarianz, Mittelwerte und Mediane, Wahrscheinlichkeitsverteilungen und vieles mehr.

Wahrscheinlichkeitsrechnung mit Python

Wahrscheinlichkeitsrechnung ist beim Lernen von Statistik mit Python extrem wertvoll. Sie analysiert zufällige Phänomene. Das heißt: Das Ergebnis eines zufälligen Ereignisses ist nicht deterministisch, es kann eines von mehreren möglichen Ergebnissen sein und wird durch Zufall bestimmt.

Die Wahrscheinlichkeitstheorie liefert die konzeptionellen Ursprünge der Statistik.

Die oben genannten Ressourcen geben eine allgemeine Einführung in Statistik und teils auch in Wahrscheinlichkeiten (was angesichts des Vorstehenden naheliegt). Es gibt aber auch Angebote, die sich ausschließlich diesem Thema widmen.

Du kannst dir unter anderem Folgendes ansehen:

Eine Top-Empfehlung ist der EdX-Kurs Computational Probability and Inference. Dieser praxisnahe Kurs von MIT-Dozierenden macht dich mit den Prinzipien von Wahrscheinlichkeit und Inferenz vertraut.

Lesenswert ist auch dieses kostenlose Buch von Professor Brian Blais, ein Einführungslehrbuch zur statistischen Inferenz, motiviert durch Wahrscheinlichkeitstheorie als Logik.

Wahrscheinlichkeitsverteilungen in Python

Um Statistik mit Python für Data Science wirklich zu beherrschen, brauchst du ein gutes Gespür dafür, wann welche Verteilung passt. Eine Verteilung zeigt alle möglichen Werte bzw. Intervalle der Daten und wie häufig sie auftreten.

Ein Blick auf diese Liste zeigt: Es gibt eine Menge Verteilungen.

Für eine Einführung in Gleichverteilung, Normal-, Binomial- und Poisson-Verteilung mit SciPy schau dir diesen Blogpost an.

Sehr empfehlenswert ist Kapitel 4 im Buch „Think Stats: Probability and Statistics for Programmers“, das kontinuierliche Verteilungen einführt. Kapitel 5 liefert ebenfalls eine solide Einführung in Wahrscheinlichkeitsverteilungen.

Zur Visualisierung von Verteilungen kannst du u. a. Histogramme nutzen. Einen schnellen Überblick bietet dieses IPython-Notebook mit einer kurzen Einführung in beschreibende Statistik mit Mittelwerten, Quantilen und Histogrammen und deren Zusammenhängen. Mehr zur Visualisierung von Verteilungen findest du im Seaborn-Tutorial.

Es gibt auch dieses plotly-Tutorial zu grundlegender Statistik in Python.

Wenn du einen Kurs suchst, der einige Verteilungen wie Binomial und Poisson sowie Verteilungsfunktionen wie die empirische Verteilungsfunktion abdeckt oder zeigt, wie du diese Verteilungen visualisierst, sieh dir DataCamps Kurs Statistical Thinking in Python an.


Wahrscheinlichkeitsverteilungen in Python


Hypothesentests mit Python

Hypothesentests sind statistische Tests, mit denen festgestellt wird, ob eine Stichprobe genug Evidenz liefert, um anzunehmen, dass eine bestimmte Aussage für die gesamte Population gilt.

Zentrale Konzepte sind die Nullhypothese und die Alternativhypothese, ebenso ist der p-Wert grundlegend. Das ist gerade für Einsteigende nicht leicht zu verstehen: Du musst das Alpha-Niveau bzw. die Signifikanzschwelle zum p-Wert greifen können und wissen, was über Ablehnen oder Nicht-Ablehnen der Nullhypothese entscheidet.

Auf der Website der SciPy-Bibliothek findest du ein Tutorial, das kurz mit p-Werten und Schätzungen arbeitet.

Diese SciPy Lectures führen in den t-Test ein, mit dem du Hypothesen über die Mittelwerte zweier Populationen prüfen kannst. Alternativ kannst du diesen Blogpost zu t-Tests lesen.

Wenn du lesen möchtest: Die Top-Empfehlung „Think Stats: Probability and Statistics for Programmers“ gilt auch hier. Kapitel 7 bringt dir Hypothesentests näher, falls du nicht schon über die vorherigen Kapitel zu Verteilungen eingestiegen bist.

Für alle, die Kurse bevorzugen: DataCamps Statistical Thinking in Python (Part 2) bietet eine Einführung und Übungsbeispiele, damit du Hypothesentests und vieles mehr sicher beherrschst. 

Statistische Modellierung und Fitting in Python

Nachdem du Hypothesentests und Verteilungen verstanden hast, kannst du wiederholen oder vertiefen, wie du statistische Modelle erstellst und Verteilungen an Daten anpasst.

Statistische Modelle nähern den Prozess an, der deine Daten erzeugt, und dienen in der Analyse dazu, zu zusammenfassen, zu prognostizieren oder zu simulieren. Kurz: Sie repräsentieren komplexe Phänomene hinter den Daten und lassen sich für Zusammenfassungen, Vorhersagen oder Simulationen nutzen.

Das bedeutet aber auch: Du musst prüfen können, ob deine Daten zum Modell passen.

Um die beste Anpassung zwischen Modell und Daten zu finden, nutzt man Schätzung. Dabei leitest du Aussagen über eine Population aus Stichprobendaten ab. Neben Hypothesentests ist das ein Weg, aus der Stichprobe etwas über die Grundgesamtheit zu lernen.

Dieses Tutorial führt dich mit der Python-Bibliothek SciPy ins Fitting ein.

Statistische Datenmodellierung und Fitting sind auch ein Kapitel in diesem Tutorial zur statistischen Analyse von Christopher Fonnesbeck, ausgearbeitet in Notebooks. Der Name kommt dir jetzt sicher bekannt vor! 

Für Video-Fans gibt es das Tutorial auch auf YouTube in vier Teilen, inklusive Themen wie Schätzung (Maximum-Likelihood und Momentenmethode).

Die Videos findest du hier.

Wenn du mehr über Maximum-Likelihood-Schätzung für statistische Mustererkennung wissen willst, sieh dir dieses IPython-Notebook oder dieses Notebook an, das die Berechnung für verschiedene Verteilungen erklärt. Die Notebooks stammen aus dem Pattern-Classification-Repository von Sebastian Raschka, der auch ein Repository zu seinem Python Machine Learning-Buch pflegt. 

Machine Learning mit Python

Und mit der letzten Buchempfehlung zu Machine Learning könntest du dich fragen: Ging es hier nicht um Statistik?

Ganz genau.

Und auch wenn Machine Learning und Statistik nicht dasselbe sind, stellen beide die gleiche Frage: Wie lernen wir aus Daten?

Beide Disziplinen werden außerdem häufig in Bereichen wie Mustererkennung oder Data Mining eingesetzt. 

Machine Learning ist ein äußerst nützliches Werkzeug in deinem Data-Science-Toolkit. Das Feld ist breit, und du kannst viel Zeit investieren, um Konzepte und Algorithmen zu verinnerlichen.

Deshalb: Fang am besten jetzt an!

Der Start ist allerdings nicht trivial, weil es so viele Ressourcen gibt.

Sehr verbreitet ist der Machine-Learning-Kurs von Andrew Ng. Er ist recht theoretisch, aber zu empfehlen, wenn du die Grundkonzepte und Algorithmen erst einmal aus theoretischer Sicht angehen willst.

Daneben gibt es viele praktischere Ressourcen, die dir den Einstieg erleichtern.

Hier eine kleine Auswahl:

Diese sanfte Einführung in Machine Learning mit SciPy bringt dich auf Kurs. Das Tutorial eignet sich für alle, die ihre Statistikbasics auffrischen und darauf aufbauen möchten. Kyle Kastner führt durch Parameterschätzung, Regression, Modellauswahl und einfache Klassifikation.

Wenn du ein Buch bevorzugst, wirf einen Blick ins IPython Interactive Computing and Visualization Cookbook. Kapitel 8 führt in grundlegende ML-Konzepte ein und zeigt Algorithmen wie logistische Regression, Naive Bayes, k-nächste Nachbarn, Support-Vector-Machines, Random Forests u. a. Die Beispiele nutzen Scikit-learn.

Ein Tutorial mit Einführung in Scikit-learn findest du hier

Und verpasse nicht dieses Tutorial zum Naive-Bayes-Klassifikator.

Regressionsanalyse mit Python

Regression darf in der Statistik für Data Science nicht fehlen. Es ist ein Verfahren, um Zusammenhänge zwischen Variablen zu schätzen.

Um Regression mit Python zu verstehen, solltest du mit Material zur linearen Regression beginnen.

Sieh dir zuerst dieses Tutorial an: Es behandelt Regressionsanalyse mit dem StatsModels-Paket und Quandl, erklärt erst die verschiedenen Regressionsarten und liefert dann ein Praxisbeispiel.

Gehe danach durch dieses Tutorial zur linearen Regression für weitere Übung.

Danach kannst du zu nichtlinearer Regression übergehen. Für ein Tutorial zu Ridge- und Lasso-Regression in Python empfiehlt sich dieser Beitrag von Analytics Vidhya. Der Artikel nutzt NumPy, Pandas, Matplotlib und Scikit-learn und erklärt den Ansatz sehr anschaulich. 

Ein tolles Notebook-Tutorial zur logistischen Regression findest du hier.

Und lies auch diesen Yhat-Blogpost zur logistischen Regression mit Rodeo.


Bayessches Denken und Modellieren mit Python


Bayessches Denken & Modellieren in Python

Die Bayessche Statistik beschreibt Evidenz über den wahren Zustand der Welt als Grade des Glaubens, sogenannte Bayessche Wahrscheinlichkeiten. Manchmal ist ein Bayesscher Ansatz für Data-Science-Probleme sinnvoll.

Was das genau bedeutet, erklärt diese hervorragende fünfteilige Serie, die eine praxisnahe Einführung in Frequentismus und Bayesianismus gibt.

Wenn du lieber liest, sieh dir „Think Bayes: Bayesian Statistics in Python“ an. „Bayesian Methods For Hackers“ ist eine weitere starke Ressource, um in die Bayessche Inferenz einzusteigen. Zwei Must-Reads für alle, die Bayessches Denken und Modellieren lernen wollen! 

Oder du startest mit einer Notebook-Einführung, die den Satz von Bayes erklärt.

Verpasse auch dieses Tutorial zur Bayesschen Statistik in Python und die begleitenden YouTube-Videos nicht. Sie führen in Bayessche Statistik, Markov-Chain-Monte-Carlo, PyMC, hierarchisches Modellieren sowie Modellprüfung und -validierung ein.

Für ein Tutorial zum Bayesschen Modell-Fitting in Python sieh dir diese IPython-Notebooks und das dazugehörige YouTube-Video an, einen Vortrag von Jake VanderPlas beim ESAC Data Analysis and Statistics Workshop 2014.  

Wenn du Ressourcen wiederverwenden willst, hilft dir erneut das IPython Interactive Computing and Visualization Cookbook, das du vielleicht schon für Machine Learning genutzt hast. Kapitel 7 behandelt statistische Datenanalyse mit Fokus auf frequentistischen und Bayesschen Methoden für Hypothesentests, parametrische und nichtparametrische Schätzung sowie Modellschlüsse.

Hier gibt es ein Tutorial zu PyMC, einem Python-Modul für Bayessche Modelle und Fitting-Algorithmen, inklusive Markov-Chain-Monte-Carlo (MCMC). Ebenfalls lesenswert ist dieses Tutorial, in dem du lernst, Bayessche lineare Regressionsmodelle mit PyMC3 zu implementieren. 

Markow-Ketten

Einfach gesagt sind Markow-Ketten mathematische Systeme, die von einem „Zustand“ in einen anderen übergehen. Diese Zustände können Situationen oder Wertemengen sein. Du hast also eine Liste möglicher Zustände, und die Markow-Kette gibt dir die Wahrscheinlichkeit für den Übergang von einem Zustand in einen anderen.

Einige der oben genannten Ressourcen führen bereits in dieses Thema ein.

dieses Video ansehen: Ein Tutorial, das u. a. Monte-Carlo-Simulation und Resampling nutzt, um Hypothesentests und statistisches Modellieren zu erkunden. Eine gute Möglichkeit, dein Wissen zu festigen, bevor du tiefer in Markow-Ketten einsteigst.

Auch das Computational Statistics in Python-Buch gibt dir Einblicke in Markow-Ketten. Es ist eine starke Einführung in Markov Chain Monte Carlo.

So startest du mit Statistik in Python

Diese Liste ist ein Einstieg. Viele Ressourcen überschneiden sich, und du wirst sicher weitere finden. Teile sie gern mit uns auf Twitter!

Es gibt jedenfalls keinen Grund zu warten. Starte jetzt mit Statistik in Python.

Jetzt starten

Themen
Python

Python und weitere passende Kurse

Kurs

Einführung in Data Science mit Python

4 Std.
502.2K
Dieser Data-Science-Kurs zeigt dir, wie du mit Python Daten effektiv analysieren und visualisieren kannst, auch ohne Programmierkenntnisse.
Details anzeigenRight Arrow
Kurs Starten
Mehr anzeigenRight Arrow