Weiter zum Inhalt

Pandas 2.0: Das ist neu – plus Top-Tipps

Tauche ein in pandas 2.0, das neueste Update der zentralen Datenanalysebibliothek – mit PyArrow-Integration, nullable Datentypen und Datetime jenseits der Nanosekunde für mehr Performance und Effizienz.
Aktualisiert 18. Sept. 2026  · 9 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity

Datenanalyse stützt sich oft stark auf die unverzichtbare pandas-Bibliothek. Sie bietet leicht zu bedienende Datenstrukturen und Funktionen zur Datenmanipulation, mit denen sich tabellarische Datensätze effizient verarbeiten lassen. Mit pandas kannst du Daten aus verschiedensten Quellen wie CSV-Dateien, Excel-Tabellen, SQL-Datenbanken und mehr bequem importieren, bereinigen, transformieren und zusammenfassen.

Wenn du lernen möchtest, wie du mit pandas Daten importierst und bereinigst, Statistiken berechnest und Visualisierungen erstellst, schau dir unseren Data Manipulation with pandas Course an.

In diesem Tutorial werfen wir einen Blick auf die neueste Iteration der pandas-Bibliothek und zeigen anhand von Beispielen, wie du die neuen Features nutzt.

Das lang erwartete Update pandas 2.0 ist endlich da

Pandas 2.0 wurde am 3. April 2023 veröffentlicht – nach drei Jahren Entwicklung. Diese Version bringt zahlreiche Neuerungen mit: verbesserten Support für Extension Arrays, DataFrame-Unterstützung für PyArrow und Datetime-Auflösungen jenseits der Nanosekunde. Gleichzeitig wurden Deprecations nun durchgesetzt, was zu API-Änderungen führt.

Als großes Update setzt Version 2.0 alle Deprecations aus 1.X um. Das jüngste Release 1.5.3 meldete rund 150 Warnungen. Wenn dein Code unter 1.X warnungsfrei läuft, sollte er mit 2.0 kompatibel sein.

Die neuesten Features in pandas 2.0

Schauen wir uns an, was es in pandas 2.0 Neues gibt – inklusive Beispiele für den Einsatz der Verbesserungen.

Mehr Leistung: Schnellere und speichereffizientere Operationen

PyArrow kann als das zentrale Feature dieses Releases gelten.

Pandas basierte ursprünglich auf NumPy-Datenstrukturen für das Speichermanagement. Jetzt kannst du PyArrow als zugrunde liegendes Speicherformat nutzen.

PyArrow ist eine Python-Bibliothek (auf Arrow aufgebaut), die eine Schnittstelle für große Datensätze auf Basis von Arrow-Speicherstrukturen bietet, außerdem Tools für Serialisierung, Komprimierung und die Integration mit anderen Datenverarbeitungssystemen wie Apache Spark und Apache Parquet.

Arrow ist ein Open-Source-, sprachunabhängiges spaltenorientiertes Datenformat für die In-Memory-Repräsentation. Es ist in C++ geschrieben, aber sprachagnostisch.

Ineffiziente Speichernutzung durch das ursprüngliche NumPy-Backend treibt viele Anwender zu Alternativen wie Spark, Dask oder Ray. Durch die reduzierte Speicherauslastung mit dem PyArrow-Backend kann pandas jetzt einen schlankeren Workflow bieten und effizienteres Arbeiten ermöglichen.

Benchmarks vergleichen Mean- und Replace-Operationen mit NumPy- und PyArrow-Backend sowie Polars 

Pandas-Diagramm

Polars ist eine in Rust entwickelte Bibliothek zur Datenmanipulation für Python, die eine ähnliche DataFrame-API wie pandas bietet, jedoch mit mehr Performance und Skalierbarkeit für große Datensätze. Mehr zu Polars findest du auf der offiziellen Website.

Hier ist ein Code-Snippet, um eine CSV-Datei mit PyArrow als Backend einzulesen:

pd.read_csv(my_file, dytpe_backend='pyarrow')

Wenn du effiziente Techniken in pandas lernen möchtest, um deinen Python-Code zu optimieren, schau dir den Kurs Writing Efficient Code with pandas auf DataCamp an.

Nullable Datentypen sind jetzt möglich

Der Umgang mit fehlenden Werten war in pandas früher schwierig, weil NumPy für manche Datentypen keine Nullwerte unterstützt. So erlauben NumPy-Integer-dtypes keine Nullwerte. Sobald in einer Integer-Spalte ein Nullwert auftauchte, wurde die Spalte automatisch in einen Float-dtype umgewandelt – unschön.

Pandas 1.0 brachte zwar bereits nullable dtypes, deren Nutzung erforderte jedoch zusätzlichen Aufwand. Mit der neuesten Version kannst du beim Einlesen in ein DataFrame die Verwendung von nullable dtypes angeben – deutlich unkomplizierter.

pd.read_csv(my_file, use_nullable_dtypes=True)

Copy-on-Write für mehr Performance

Copy-on-Write ist eine Speichermanagementtechnik, die pandas nutzt, um die Performance zu erhöhen und den Speicherbedarf bei großen Datensätzen zu senken. Das bringt pandas näher an Spark und dessen Lazy Operations. Lazy Operations werden erst ausgeführt, wenn eine Aktion die Berechnung auslöst. Sie verzögern also die Ausführung, bis das Endergebnis wirklich benötigt wird.

Der Kern dahinter: Beim Erstellen einer Kopie eines pandas-Objekts (z. B. DataFrame oder Series) wird zunächst nur eine Referenz auf die Originaldaten erzeugt. Erst bei einer Modifikation entsteht eine echte Kopie.

So können mehrere Kopien dieselben Daten im Speicher nutzen, bis sich etwas ändert – redundant Kopieren entfällt, der Speicherbedarf sinkt deutlich und die Performance steigt.

NumPy-Zahlentypen im Index unterstützt

In pandas 2.0 wurde der Index um zusätzliche NumPy-Zahlentypen erweitert, z. B. int8, int16, int32, uint8, uint16, uint32, uint64, float32 und float64. Zuvor wurden nur int64, uint64 und float64 unterstützt.

Damit lassen sich Indexe mit geringerer Bitbreite erstellen, etwa 32-Bit-Indexe, wo zuvor automatisch 64-Bit-Indexe entstanden.

Alle numerischen Indexe werden jetzt als Index mit zugehörigem dtype dargestellt.

pip-Extras installieren

Wenn du bei der Installation von pandas mit pip Extras angibst, kannst du optionale Abhängigkeiten bequem mitinstallieren. Zum Beispiel:

pip install "pandas[performance, aws]>=2.0.0"

Damit werden die optionalen Abhängigkeiten performance und aws installiert. Im Installationsleitfaden von pandas findest du die Liste verfügbarer Extras. Dazu gehören: [all, performance, computation, fss, aws, gcp, excel, parquet, feather, hdf5, spss, postgresql, mysql, sql-other, html, xml, plot, output_formatting, clipboard, compression und test] Vergiss nicht, Anführungszeichen („“) zu setzen.

Timestamps mit Nicht-Nanosekunden-Auflösung

Lange Zeit konnte pandas Zeitstempel nur in Nanosekunden-Auflösung darstellen. Dadurch ließen sich keine Daten vor dem 21. September 1677 oder nach dem 11. April 2264 abbilden – ein Problem für Forschende, die sehr langläufige Zeitreihen analysieren.

Mit pandas 2.0 gibt es nun Unterstützung für weitere Auflösungen wie Sekunde, Millisekunde und Mikrosekunde. Damit sind Zeiträume von bis zu ± 2,9e11 Jahren möglich – mehr als ausreichend für die meisten Anwendungsfälle.

Einheitliches Parsing-Format für Datetime

Früher hat to_datetime() das Format jedes Elements separat erkannt. Das war problematisch, wenn ein konsistentes Format erwartet wurde, die Funktion aber zwischen Formaten wechselte.

Für gemischte Datumsformate war das teils hilfreich, bereitete vielen Nutzenden jedoch Probleme.

In pandas 2.0 wird jetzt ein einheitliches Format verwendet, das vom ersten nicht-NA-Wert abgeleitet wird. Du kannst weiterhin explizit ein Format angeben; dann wird dieses verwendet.

Altes Verhalten:

ser = pd.Series(['13-01-2000', '12-01-2000'])
pd.to_datetime(ser)
Out[2]:
0   2000-01-13
1   2000-12-01
dtype: datetime64[ns]

Neues Verhalten:

ser = pd.Series(['13-01-2000', '12-01-2000'])

pd.to_datetime(ser)
Out[43]: 
0   2000-01-13
1   2000-01-12
dtype: datetime64[ns]

Beispiele nach der offiziellen Dokumentation.

Kompatibilität und Migration

Rückwärts inkompatible API-Änderungen sind Modifikationen an der API einer Bibliothek, die bestehenden Code oder Integrationen brechen können. Dazu zählen etwa das Entfernen oder Umbenennen von Funktionen, Klassen oder Parametern oder Änderungen ihres erwarteten Verhaltens. Die Liste aller Breaking Changes in pandas 2.0 findest du in der Doku unter Backward incompatible API changes.

Um die pandas-Bibliothek zu aktualisieren, führe einfach diesen Befehl im Terminal oder Notebook aus:

pip install -U pandas

Community und Support

Sieh dir die vollständigen Release Notes zu pandas 2.0 an.

Als schnellen Leitfaden zu den Basics der Python-Datenanalysebibliothek kannst du auch unser pandas Data-Science-Cheatsheet mit Codebeispielen nutzen.

Python for Data Science Cheatsheet

Cheatsheet von DataCamp. Quelle

Pandas ist ein Community-getriebenes Open-Source-Projekt, das von einer großen Gruppe an Mitwirkenden und einem kleineren Team von Maintainer'innen und Maintainern gemeinsam entwickelt wird. Das pandas-Leadership setzt sich für eine positive, inklusive und offene Community ein. Wenn du mitmachen möchtest, findest du im Contributor Community Guide alle Infos.

Fazit

Pandas 2.0 ist ein großes Update der beliebten Datenanalysebibliothek und bringt neue Features wie mehr Performance durch PyArrow, nullable Datentypen, Copy-on-Write-Optimierung, erweiterte Unterstützung für NumPy-Zahlentypen in Indexen sowie Datetime-Auflösungen jenseits der Nanosekunde.

Mit diesem Update kann pandas größere Datensätze bei effizienterer Speichernutzung bearbeiten und bietet dir einen deutlich schlankeren Workflow.

Um die neuen Features zu nutzen, aktualisiere deine pandas-Bibliothek einfach mit dem Befehl pip install -U pandas. Die pandas-Community bietet weiterhin Support und Ressourcen, darunter Kurse auf DataCamp, damit du deine Datenanalysekompetenzen ausbauen kannst.

Hier sind ein paar starke Tutorials, die dir beim Lernen von Datenanalyse helfen.

Themen
Python
Datenanalyse

Top-pandas-Kurse

Kurs

Datenbearbeitung mit pandas

4 Std.
564.4K
Erweitere deine pandas-Kenntnisse und lerne, wie du Daten importierst und bereinigst, Kennzahlen berechnest und Visualisierungen erstellst.
Details anzeigenRight Arrow
Kurs Starten
Mehr anzeigenRight Arrow
Verwandt

Tutorial

Python Datenstrukturen Tutorial

Mach dich mit Python-Datenstrukturen vertraut: Lerne mehr über Datentypen und primitive sowie nicht-primitive Datenstrukturen wie Strings, Listen, Stapel usw.
Sejal Jaiswal's photo

Sejal Jaiswal

24 Min.

Tutorial

Python-Arrays

Python-Arrays mit Code-Beispielen. Lerne noch heute, wie du mit Python NumPy Arrays erstellen und ausdrucken kannst!
DataCamp Team's photo

DataCamp Team

3 Min.

Tutorial

Python NaN: 4 Möglichkeiten, um in Python nach fehlenden Werten zu suchen

Schau dir 4 Möglichkeiten an, wie du NaN-Werte in Python mit NumPy und Pandas erkennen kannst. Lerne die wichtigsten Unterschiede zwischen NaN und None kennen, um Daten effizient zu bereinigen und zu analysieren.
Adel Nehme's photo

Adel Nehme

5 Min.

Tutorial

Python JSON-Daten: Ein Leitfaden mit Beispielen

Lerne, wie man mit JSON in Python arbeitet, einschließlich Serialisierung, Deserialisierung, Formatierung, Leistungsoptimierung, Umgang mit APIs und Verständnis der Einschränkungen und Alternativen von JSON.
Moez Ali's photo

Moez Ali

6 Min.

Tutorial

30 coole Python-Tricks für besseren Code mit Beispielen

Wir haben 30 coole Python-Tricks zusammengestellt, mit denen du deinen Code verbesserst und deine Python-Kompetenzen ausbaust.
Kurtis Pykes 's photo

Kurtis Pykes

15 Min.

Tutorial

Python Switch Case Statement: Ein Leitfaden für Anfänger

Erforsche Pythons match-case: eine Anleitung zu seiner Syntax, Anwendungen in Data Science und ML sowie eine vergleichende Analyse mit dem traditionellen switch-case.
Matt Crabtree's photo

Matt Crabtree

5 Min.

Mehr AnzeigenMehr Anzeigen