Weiter zum Inhalt

Top-Artikel, die du letzten Monat vielleicht verpasst hast

Dieser Artikel fasst die wichtigsten News und Updates aus Data Science und Machine Learning des letzten Monats zusammen – von Tutorials und Forschung über neue Packages bis hin zu Use Cases und mehr.
Aktualisiert 18. Sept. 2026  · 7 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity

Data Science gehört zu den dynamischsten Branchen überhaupt. Täglich erscheinen neue Research Papers, Packages, Tutorials und Technologien – da den Überblick zu behalten, ist nicht immer leicht. Für alle, die mit Daten arbeiten, ist es entscheidend, beim Neuesten aus der Data-Science-Welt am Ball zu bleiben, um weiterzulernen und zu wachsen. In diesem Artikel findest du eine Auswahl an News, Tutorials, Forschung und Insights, die du im letzten Monat vielleicht übersehen hast. 

Neue Tutorials

Zwei Wege, eigene Transformer mit scikit-learn zu erstellen

Dieser Towards Data Science Blogpost zeigt in einem kompakten Tutorial, wie du einen eigenen Transformer mit scikit-learn baust. Scikit-learn ist eines der meistgenutzten Pakete in Data Science – und wohl das populärste Machine-Learning-Paket überhaupt. Es bietet zahlreiche Preprocessing-Funktionen wie One-Hot-Encoding, MinMax-Scaling und mehr. Manchmal braucht es jedoch eigene Vorverarbeitungen statt der vorgefertigten Bausteine wie One-Hot-Encoder. Dieses Tutorial erklärt, wie du in scikit-learn Custom Transformer erstellst und so das Daten-Preprocessing für Machine Learning effizienter machst.

MLOps in BigQuery ML mit Vertex AI

Im vergangenen Jahr haben Big-Tech-Unternehmen große Fortschritte im Bereich MLOps gemacht. ML-Modelle in produktive Umgebungen zu bringen, ist für Datenteams eine der größten Herausforderungen. Dieses Video zeigt in einem kurzen Tutorial, wie du Google Clouds Vertex AI und BigQuery ML kombinierst, um eine produktionsreife Vertex-AI-Pipeline aufzubauen.

Neue Power-BI-Tutorials von DataCamp

Mit dem Launch des neuen Data Analyst in Power BI Track in Partnerschaft mit Microsoft hat DataCamp im letzten Monat mehrere Power-BI-Tutorials veröffentlicht. Power BI ist eines der am weitesten verbreiteten Business-Intelligence-Tools – und wenn dein Unternehmen Microsoft Office nutzt, hast du vermutlich bereits Zugriff. Es ist auch ein idealer nächster Schritt für alle, die über Excel hinaus tiefer in die Datenwelt eintauchen möchten. Die Tutorials decken das komplette Arbeiten mit Power BI ab: vom Wechsel von Excel zu Power BI über Power BI für Einsteiger, Datenmodellierung in Power BI bis hin zu DAX-Formeln für Einsteiger. Zusätzlich kannst du dir dieses praktische Cheat Sheet für deinen Lernweg herunterladen. 

Wegweisende Machine-Learning-Forschung

DALLE-2 von OpenAI

OpenAI hat die Welt mit seinem DALLE-2 Bildgenerierungs-Algorithmus beeindruckt. OpenAI hat dieses neue Machine-Learning-Modell darauf trainiert, aus natürlicher Spracheingabe fotorealistische Bilder und Kunst zu erzeugen. DALLE-2, der Nachfolger von DALLE-1, erreicht seinen hohen Grad an Fotorealismus mit einem Prozess namens „Diffusion“: Dabei wird ein Muster aus zufälligen Punkten erzeugt und schrittweise so verändert, dass ein zum Text passendes Bild entsteht. Lies mehr dazu hier und sieh dir an, wie Isabella Leslie Miller, DataCamps Data Journalist, das Ganze in unserem Weekly Roundup News Video auf den Punkt bringt.

Pathways Language Model (PaLM)

PaLM zeigt den ersten groß angelegten Einsatz des Pathways-Systems. Die Pathways-Systemarchitektur wurde letztes Jahr von Google eingeführt, um eine neue Generation von Modellen effizient zu trainieren, die vielfältige Aufgaben über verschiedene Domänen hinweg erledigen können. Mit PaLM hat Google ein riesiges Transformer-Modell mit 540 Milliarden Parametern geschaffen, das bei zahlreichen Sprach- und Reasoning-Aufgaben neue Bestwerte erzielt. Die Aufgaben reichen von Codegenerierung über das Erklären von Witzen bis hin zur Identifikation von Ursache-Wirkungs-Beziehungen. Lies den Artikel für einen Deep Dive in Pathways und die Use Cases, die PaLM ermöglicht. 

Neue Packages und Modelle

PyTorch 1.11 Release

Mit dem Release von Pytorch Version 1.11 kommen zahlreiche Verbesserungen. Die neueste PyTorch-Version bietet nun Betas von TorchData, dem Nachfolger der DataLoader-API, und functorch, das kombinierbare Funktionstransformationen für PyTorch-Module bereitstellt. Darüber hinaus bringt PyTorch 1.11 diverse Performance-Boosts, etwa bis zu 40% schnellere Startzeiten für Mobile- und Edge-Deployments. Wenn du mehr über PyTorch lernen möchtest, sieh dir diesen DataCamp-Kurs für Einsteiger an. 

EpyNN 1.2.7

EpyNN steht für „Educational Python for Neural Networks“. Es richtet sich an Lehrende, Studierende, Wissenschaftlerinnen und Wissenschaftler sowie an alle mit grundlegenden Python-Kenntnissen, die neuronale Netze von Grund auf verstehen und aufbauen möchten. Es bietet zahlreiche Architektur-Templates und praxisnahe Beispiele, die die Lernzeit für die Entwicklung eigener neuronaler Netze erheblich verkürzen. 

BigScience Large Language Model Training (tr11-176B-ml-logs)

BigScience ist ein populärer Bereich auf Hugging Face und hat sich zum Ziel gesetzt, gemeinsam mit Tausenden Forschenden weltweit große Sprachmodelle offen zu entwickeln. Das Training des Hauptmodells von BigScience begann am 11. März 2022 und läuft drei bis vier Monate auf 384 A100 80GB GPUs des öffentlichen Jean-Zay-Supercomputers. Dieses Open-Source-Modell wird 176 Milliarden Parameter haben und eine GPT-ähnliche Decoder-only-Architektur nutzen. Du kannst die Trainings-Updates auf Twitter verfolgen – und das Modell voraussichtlich ab Juni nutzen. 

Use Cases für Data Science & Machine Learning

La Liga arbeitet mit Databricks für Football Analytics

La Ligas Analytics-Team hat sich mit Databricks zusammengetan, um ein Data Lakehouse in der Analytics-Infrastruktur der Liga aufzubauen. So kann La Liga Tech – der neue, konsolidierte Analytics-Bereich der Liga – Daten deutlich effizienter strukturieren und managen und Machine Learning für spannende Use Cases wie Verletzungsvorhersage, Content-Empfehlungen für Fans und mehr einsetzen. 

Mit Deep Learning das Proteinuniversum annotieren

Wissenschaftlerinnen und Wissenschaftler nutzen seit Langem computergestützte Tools, um Proteinfunktionen direkt aus der Sequenz abzuleiten und zu annotieren. Googles KI-Team hat mit Deep Learning die zuverlässige Vorhersage von Proteinfunktionen erreicht; sie nennen das Modell ProtENN und konnten damit rund 6,8 Millionen Einträge zur Datenbank von Pfam hinzufügen. Googles KI-Team hat das ProtENN-Modell und einen distill-ähnlichen interaktiven Artikel zur Exploration veröffentlicht. Solche Durchbrüche beschleunigen mit Machine Learning die Entwicklung neuer, verlässlicher Therapeutika und Wirkstoffe. 

Insights & Meinungen

Den modernen Data Analyst stärken

In der neuesten Folge des DataFramed Podcasts erklärt Peter Fishman, CEO von Mozart Data, den Status quo des Modern Data Stack und wie aktuelle Data-Science-Tools den modernen Data Analyst empowern. Außerdem spricht er über seine Erfahrungen in der Leitung von Datenteams, was exzellente Data Analysten ausmacht, warum Domänenwissen und das Zuhören bei Nutzerinnen und Nutzern entscheidend sind und mehr. Hör rein und abonniere DataFramed überall dort, wo es Podcasts gibt.

MLOps ist chaotisch – und das ist normal

In diesem Artikel teilt Mihail Eric, Gründer von Confetti AI, seine Einschätzungen zum aktuellen Tooling in MLOps. Wie die Überschrift andeutet, zerlegt Mihail brillant den fragmentierten Tooling-Markt im Machine Learning. Da Machine-Learning-Operations noch in den Kinderschuhen steckt, entstehen Standards, Tools und Best Practices erst – eine klare Referenz-Stack, auf die sich Praktiker verlassen können, gibt es noch nicht. Zudem werden der Fachkräftemangel und die Verankerung von Machine-Learning-Denken in Unternehmenskulturen die MLOps-Adoption in den kommenden Jahren prägen. 

Mehr erfahren

Wir hoffen, dir hat dieser Überblick über Top-Stories, Insights, Tutorials und Forschung gefallen. Wenn du mehr zum Neuesten aus Data Science suchst, schau dir diese Ressourcen an:

Themen
Datenwissenschaft
Maschinelles Lernen
Verwandt

Blog

Lehrer/innen und Schüler/innen erhalten das Premium DataCamp kostenlos für ihre gesamte akademische Laufbahn

Keine Hacks, keine Tricks. Schüler/innen und Lehrer/innen, lest weiter, um zu erfahren, wie ihr die Datenerziehung, die euch zusteht, kostenlos bekommen könnt.
Nathaniel Taylor-Leach's photo

Nathaniel Taylor-Leach

4 Min.

Blog

2022-2023 DataCamp Classrooms Jahresbericht

Zu Beginn des neuen Schuljahres ist DataCamp Classrooms motivierter denn je, das Lernen mit Daten zu demokratisieren. In den letzten 12 Monaten sind über 7.650 neue Klassenzimmer hinzugekommen.
Nathaniel Taylor-Leach's photo

Nathaniel Taylor-Leach

8 Min.

Tutorial

Python Switch Case Statement: Ein Leitfaden für Anfänger

Erforsche Pythons match-case: eine Anleitung zu seiner Syntax, Anwendungen in Data Science und ML sowie eine vergleichende Analyse mit dem traditionellen switch-case.
Matt Crabtree's photo

Matt Crabtree

5 Min.

Tutorial

Python-Anweisungen IF, ELIF und ELSE

In diesem Tutorial lernst du ausschließlich Python if else-Anweisungen kennen.
Sejal Jaiswal's photo

Sejal Jaiswal

9 Min.

Tutorial

Python Datenstrukturen Tutorial

Mach dich mit Python-Datenstrukturen vertraut: Lerne mehr über Datentypen und primitive sowie nicht-primitive Datenstrukturen wie Strings, Listen, Stapel usw.
Sejal Jaiswal's photo

Sejal Jaiswal

24 Min.

Tutorial

30 coole Python-Tricks für besseren Code mit Beispielen

Wir haben 30 coole Python-Tricks zusammengestellt, mit denen du deinen Code verbesserst und deine Python-Kompetenzen ausbaust.
Kurtis Pykes 's photo

Kurtis Pykes

15 Min.

Mehr AnzeigenMehr Anzeigen