Kurs

Notebooks sind seit fast einem Jahrzehnt fester Bestandteil der Data Science, und jede Datenexpertin und jeder Datenexperte hat schon mit ihnen gearbeitet. Sie ermöglichen schnelles Experimentieren und das Teilen von Erkenntnissen – dank rasch aufgesetzter Umgebungen, interaktiven Ausgaben und Code-Snippets, die in beliebiger Reihenfolge ausgeführt werden können.
Organisationen investieren stark in Data Science und Analytics. Ein Schwerpunkt liegt auf Tools, mit denen Data Scientists effizient arbeiten und zügig mit Daten experimentieren können. Notebooks stehen dabei im Mittelpunkt und sind Baustein vieler Tool-Innovationen im modernen Data-Stack. Noch wichtiger: Notebooks befähigen Citizen Data Scientists und machen Datenwissen breiter zugänglich.
Dieser Artikel schaut auf Vergangenheit, Gegenwart und Zukunft des Notebooks – und darauf, wie Notebooks Datensilos aufbrechen und Zusammenarbeit rund um Daten erleichtern.
Die Geschichte des Data-Science-Notebooks
Fast alle Data Scientists arbeiten heute mit einem Notebook – am verbreitetsten sind Jupyter Notebooks. Ihre Geschichte reicht jedoch weiter zurück als die Data Science – bis in die frühen 1980er Jahre.
Der Aufstieg des literate programming
1984 stellte Donald Knuth das literate programming vor – eine Methodik, um Programme so zu schreiben, dass sie für Menschen gut lesbar sind. Die Idee: Die Programm-Logik wird in natürlicher Sprache beschrieben, während Code-Snippets und Makros als eigene Kommentare notiert werden, bekannt als „WEB“. Die Makros ähneln dem Pseudocode, der in der Informatiklehre eingesetzt wird.
Ein Preprocessor parst WEB anschließend zu Quellcode („tangle“) und Dokumentation („weave“). Literate programming wird auch heute noch genutzt, etwa in Axiom. Die zentralen Ideen haben jedoch maßgeblich die Entwicklung von Notebooks beeinflusst, die jenen ähneln, die wir heute kennen.
Frühe Notebooks
Zu den ersten prägenden Notebooks gehörten Wolfram Mathematica und Maple aus den späten 1980ern. Sie arbeiteten mit einem Frontend und einem Kernel im Backend. Das folgende Bild zeigt einen 3D-Plot aus Mathematica mit der vertrauten In[ ]- und Out[ ]-Notation, die wir in Notebooks bis heute sehen.

Das frühe Wolfram-Mathematica-Notebook
Die Tools unterschieden sich in Details, etwa ob Code mit Enter statt mit Shift+Enter ausgeführt wurde oder wie mathematische Operationen dargestellt waren. Beide prägten jedoch die Gestaltung moderner Notebooks.
Ein zentrales Hindernis für die breite Nutzung waren die Kosten: Die Tools waren teuer und lizenzpflichtig. Dieses branchenweite Problem trug 1998 zur Gründung der Open Source Initiative bei – die Wegbereiterin vieler leistungsstarker, frei verfügbarer Tools, die wir heute nutzen (z. B. Jupyter Notebooks!).
Frühe Grundlagen moderner Data-Science-Notebooks
2001 erschienen IPython und SciPy, 2003 folgte Matplotlib. SciPy machte wissenschaftliche Berechnungen in Python möglich, IPython verbesserte die Benutzererfahrung im Terminal und brachte Unterstützung für verteiltes Rechnen. Matplotlib erleichterte – wie heute – die Erstellung von Visualisierungen in Python.
Erst 2005 wurden diese und andere Open-Source-Tools in einem Werkzeugsatz gebündelt: SageMath. Ziel war eine Open-Source-Alternative zu Mathematica und Maple, die bestehende wissenschaftliche Open-Source-Tools kombiniert, darauf aufbaut und webbasierte Funktionen liefert – heute Standard in modernen Notebooks.
2011 veröffentlichte IPython sein Notebook mit einer klaren Trennung zwischen der Webanwendung im Frontend und dem zugrunde liegenden Notebook-Dokument.

Das IPython Notebook
Die Geburt der Jupyter Notebooks
Jupyter wurde 2014 aus IPython ausgegliedert, brachte die Notebook-Oberfläche und weitere sprachunabhängige Teile von IPython mit. Der Name verweist auf die ursprünglich unterstützten Sprachen: Julia, Python und R. Jupyter Notebooks sind heute das Standardwerkzeug für Data Scientists und zweifellos die am weitesten verbreitete Notebook-Oberfläche.
Ein wichtiger Entwicklungsschritt der letzten Jahre sind Apps, die Frontend und Kernel trennen: Das Frontend läuft im Browser der Nutzerinnen und Nutzer, der Kernel in Cloud-Rechenzentren. Ein hervorragendes Beispiel ist DataCamp Workspace, wo du direkt im Browser mit einer Jupyter-Notebook-Instanz loslegen kannst.

JupyterLab in DataCamp Workspace
Mit der zunehmenden Verbreitung von Notebooks ist in den letzten Jahren eine Welle moderner Oberflächen entstanden, mit denen wirklich alle leicht mit Daten arbeiten können. Im nächsten Abschnitt zeigen wir, wie moderne Notebooks Barrieren bei der Datenarbeit abbauen.
Wie moderne Data-Science-Notebooks Citizen Data Scientists stärken
Den Begriff Citizen Data Scientist prägte Gartner im Jahr 2016. Citizen Data Scientists verfügen über technische Kompetenzen, haben aber nicht zwingend einen klassischen Hintergrund in Data Science, Statistik oder Informatik.
Da sich Data Science zunehmend von einem Feld zu einer Methodik zur Lösung von Geschäftsproblemen entwickelt, sind Citizen Data Scientists das Gesicht moderner, datengetriebener Organisationen. Notebooks sind ein ideales Werkzeug für sie: Sie ermöglichen schnelles Experimentieren und teilbare Erkenntnisse – mit minimalen Einstiegshürden.
Während Notebooks schon immer stark für die schnelle Exploration und Analyse von Datensätzen waren, haperte es früher bei Zusammenarbeit und beim Teilen von Insights. 2022 gilt das nicht mehr: Moderne Notebooks und ihr Ökosystem schließen viele dieser historischen Lücken. So treiben Notebooks Produktivität, Effizienz und Kollaboration voran.
Moderne Data-Science-Notebooks sind kollaborativ
Ein bekanntes Beispiel für ein kollaboratives Tool ist Google Docs. Viele Personen können Dokumente nutzen und bearbeiten, gleichzeitig lässt sich steuern, wer Änderungen vornehmen darf und wer nur Vorschläge machen kann. Änderungen werden regelmäßig gespeichert, um Datenverlust zu vermeiden.
Ähnliche Technologien gibt es heute auch für Notebooks – etwa mit Deepnote und Datacamp Workspace. Mehrere Nutzerinnen und Nutzer können Notebooks gleichzeitig bearbeiten und ausführen sowie Kommentare hinterlassen. Diese Zusammenarbeit passiert in Echtzeit und macht den gesamten Prozess deutlich effizienter.

Zusammenarbeit in DataCamp Workspace
Zusammenarbeit ist für alle, die mit Daten arbeiten, essenziell. Weniger Hürden bei der Kollaboration bedeuten auch weniger Datensilos – Wissen und Expertise werden geteilt. War die Zusammenarbeit in Notebooks früher oft zäh, ist sie im modernen Data-Stack schnell und effizient. Viele Tools integrieren sich nahtlos in bestehende Tech-Stacks, sodass Teams mit ihren gewohnten Werkzeugen arbeiten und trotzdem eng zusammenarbeiten können.
Sie demokratisieren Dateneinblicke
Analysen zu teilen, ist oft eine Herausforderung – ob mit Business-Stakeholdern oder technisch versierten Kolleginnen und Kollegen. Früher wurden Notebook-Reports und Insights per E-Mail, Slack, Präsentationen oder eigens entwickelten Web-Apps verbreitet.
Moderne Notebooks demokratisieren Insights, indem sie das Teilen nahtlos ermöglichen. IPyWidgets erlaubt zum Beispiel interaktive Widgets im Notebook, mit denen Nutzerinnen und Nutzer per Slider Grafiken anpassen und stärker mit den Insights interagieren. Binder verwandelt ein Repo in gehostete, interaktive Notebooks, die jede und jeder ausführen kann. Voila macht aus einem Notebook eine gehostete Web-App, sodass man vollständig interagieren kann, ohne den gesamten Code zu sehen. Datacamp Workspace ermöglicht das Teilen von Notebooks und bietet Templates, um Daten Geschichten zu geben.

Reports in DataCamp Workspace veröffentlichen
Sie überbrücken die Talentlücke
Data Science ist breit und tief zugleich: Es gibt extrem viel zu lernen – in vielen Teilgebieten. Wer NLP beherrscht, ist nicht automatisch eine starke Data Engineerin oder versteht zwangsläufig Computer Vision.
Die verbindenden Elemente zwischen den Subdisziplinen sind Daten und Infrastruktur. Ohne gute Daten performen Modelle schlecht. Und ohne Infrastruktur für Modellentwicklung und Datenaufbereitung ist der Start schwer.
Citizen Data Scientists brauchen dafür keine Engineering-Skills. Moderne Notebooks machen jeden schnell startklar – dank Cloud-Infrastruktur. Umgebungen und Pakete sind sauber gemanagt und lassen sich von den meisten Nutzenden leicht aktualisieren und anpassen. So müssen Engineering-Lücken nicht geschlossen werden, und Praktikerinnen und Praktiker können sich auf Insights konzentrieren.
Zudem sind die meisten Data-Science-Techniken vollständig notebooktauglich: Modelle lassen sich trainieren, 3D-Grafiken plotten und Datenpipelines bauen. So können Citizen Data Scientists mit dem gesamten Methodenspektrum experimentieren, Ergebnisse leicht an Stakeholder kommunizieren oder Code mit anderen Tech-Teams teilen.
Moderne Notebooks integrieren sich in andere Tools
Wir haben gesehen, wie moderne Notebooks Datensilos zwischen Teams abbauen und den Einstieg in die Datenarbeit erleichtern. Ein weiterer früherer Schmerzpunkt war die schwache Integration mit anderen Tools im Data-Science-Workflow – allen voran SQL.
Früher wurden Datenbankverbindungen über Pakete wie `mysql.connector` in Python oder `DBI` in R hergestellt. Diese erforderten manuelles Einrichten der Verbindung sowie das händische Eingeben von Zugangsdaten.
Moderne Notebooks bieten dagegen native SQL-Unterstützung. In DataCamp Workspace können Nutzerinnen und Nutzer zum Beispiel aus dem DataCamp Notebook Editor heraus sichere Verbindungen zu Datenbanken wie PostgreSQL, MySQL und Amazon Redshift einrichten. Die daraus extrahierten Daten lassen sich anschließend in R oder Python analysieren.

SQL-Zellen in DataCamp Workspace
Die Zukunft des Data-Science-Notebooks
Das moderne Notebook steht im Zentrum der Datenrevolution. Es gibt Fachleuten mit unterschiedlichen Kompetenzprofilen ein Werkzeug an die Hand, mit dem sie leicht mit Daten experimentieren, Insights teilen und die Lücke zwischen Business und Datenteam schließen können. Zudem stärken Notebooks Citizen Data Scientists und treiben die Datenkompetenz in Organisationen voran.
Datengetriebene Unternehmen wie Netflix sind bekannt für ihre Notebook-Innovationen – Notebooks sind dort das beliebteste Tool für die Arbeit mit Daten über Rollen und Teams hinweg. Die Zukunft der Notebooks wird geprägt sein von mehr Agilität, besserer Integration mit dem restlichen Data-Stack sowie starker Zusammenarbeit und Sharing, um Dateneinblicke zu demokratisieren. Wenn du mehr über Notebooks erfahren willst, schau dir diese Ressourcen an:
