Weiter zum Inhalt

Welche Kompetenzen und Hintergründe haben Data Scientists gemeinsam?

Gewinne Einblicke aus 1 Million datenbezogenen Jobs.
Aktualisiert 18. Sept. 2026  · 12 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity

Motivation

2012 hat die Harvard Business Review Data Scientist als den attraktivsten Job des 21. Jahrhunderts bezeichnet. Seitdem ist der Begriff Data Scientist immer populärer geworden.

Die Grafik oben zeigt das Interesse am Keyword „data science“ in der Google-Suche von 2016 bis 2021. Wir sehen, dass das Interesse an Data Science in den letzten fünf Jahren stetig gestiegen ist.

Data Scientist ist nicht nur gut bezahlt, die Rolle ermöglicht dir auch, vielfältige Kompetenzen einzusetzen, spannende Erkenntnisse aus Realwelt-Daten zu gewinnen und mit deinen Analysen gesellschaftliche Wirkung zu erzielen. Es ist also nachvollziehbar, dass dieser Beruf als der attraktivste Job des 21. Jahrhunderts galt.

Bevor du dich jedoch auf eine Data-Science-Stelle bewirbst, lohnt sich ein Blick auf die Profile und Hintergründe von Data Scientists. Wenn du ihre Hintergründe und Kompetenzen kennst, weißt du, welche Fähigkeiten du dir aneignen solltest, um unter vielen Bewerbenden herauszustechen.

Spannende Fragen zur Analyse sind unter anderem:

  • Welche Kompetenzen bringen die meisten Data Scientists mit?
  • Wie unterscheiden sich diese Kompetenzen von denen anderer Rollen wie Machine Learning Engineer, Data Analyst und Data Engineer?
  • Welche Studienfächer sind am beliebtesten?
  • Brauchst du einen Master oder eine Promotion, um Data Scientist zu werden?
  • Wie ist das Geschlechterverhältnis im Data-Science-Bereich?
  • Wo befinden sich die meisten Data-Science-Jobs?
  • Wie verändert sich die Beliebtheit verschiedener datenbezogener Jobs im Zeitverlauf?
  • Wie verändern sich die gefragten Kompetenzen für Data Scientists über die Zeit?

Daten beschaffen

Wir nutzen die Daten von mehr als 160.000 Data Scientists, 570.000 Data Analysts, über 100.000 Data Engineers und mehr als 19.000 Machine Learning Engineers weltweit. Die Datensätze stammen von Diffbot, dem weltweit größten Knowledge Graph. Eine Anleitung zur Nutzung von Diffbot findest du hier.

Damit du dem Artikel leichter folgen kannst, haben wir alle verwendeten Daten in diesem Repository bereitgestellt. Der Zugriff und Download ist kostenlos.

Das Notebook mit dem Code zu diesem Artikel findest du hier. Wenn du die Daten direkt über Diffbot beziehen möchtest, kannst du stattdessen mit diesem Notebook experimentieren.

Die beliebtesten Programmiersprachen ermitteln

Welche Top-Kompetenzen zeichnen Data Scientists, Data Analysts, Data Engineers und Machine Learning Engineers aus? Diese Frage beantworten wir mit Daten zu den 100 beliebtesten Kompetenzen von Personen mit diesen Jobtiteln.

import pandas as pd
skill_count = pd.read_csv(
"https://media.githubusercontent.com/media/khuyentran1401/dataset/master/data_science_market/all_skills.csv",
    index_col=0,
)

# Show the top 10 rows
skill_count.head(10)

Mit diesem Datensatz analysieren wir die Beliebtheit verschiedener Programmiersprachen in bestimmten datenbezogenen Rollen. Visualisiert wird das Ganze als Blasenmatrix auf Observable.

Eine Blasenmatrix nutzt Größen und Farben, um zweidimensionale Informationen darzustellen. Die Zeilen stehen für die Jobtitel, die Spalten für die Sprachen. Je größer die Blase, desto häufiger wird die Sprache in der jeweiligen Jobkategorie verwendet.

Für die Blasengröße berechnen wir das Verhältnis zwischen der Häufigkeit einer Sprache und der maximalen Häufigkeit über alle Sprachen und Rollen hinweg.

languages = skill_count[
    skill_count["skill"].isin(
        ["python", "r", "sql", "c", "c++", "matlab", "java", "javascript"]
    )
]

languages["Ratio to All Skills"] = languages["count"].apply(
    lambda c: c / max(skill_count["count"])
)
# View languages used by data analysts
languages[languages["Title"] == "Data Analyst"]

Blasen werden hervorgehoben, wenn sie eine bestimmte Anzahl an Vorkommen überschreiten. Über einen Schieberegler kannst du den Schwellenwert festlegen, ab dem Blasen markiert werden. Wählst du zum Beispiel 100.000, werden nur Blasen mit mehr als 100.000 Nennungen dunkelviolett gefärbt.

Außerdem lässt sich die Darstellung nach Jobtiteln sortieren. Nutzen wir das, um die Top-Kompetenzen je Jobtitel zu finden.

Du kannst die Grafik hier interaktiv erkunden. Daraus lässt sich ablesen:

  • Die Top 3 Kompetenzen von Data Analysts sind in absteigender Reihenfolge SQL, Python und R.
  • Die Top 3 Kompetenzen von Data Engineers sind SQL, Python und Java.
  • Die Top 3 Kompetenzen von Data Scientists sind Python, R und SQL.
  • Die Top 3 Kompetenzen von Machine Learning Engineers sind Python, Java und C++.

Ausbildung analysieren

Die beliebtesten Studienfächer

Welche Studienfächer dominieren in datenbezogenen Rollen? Um das zu beantworten, laden wir Daten herunter, die die Häufigkeit der Top-Fächer pro Rolle zeigen.

!wget 'majors_df.pkl' 'https://github.com/khuyentran1401/dataset/raw/master/data_science_market/majors_df.pkl'

import pickle

majors_df = pickle.load(open("majors_df.pkl", "rb"))
majors_df["data scientist"]

Visualisieren wir den Datensatz für ein besseres Verständnis. Zunächst erstellen wir eine Funktion, um die Fächer einer Rolle darzustellen.

import plotly.express as px


def plot_majors(title: str, majors_df: dict):
    majors = majors_df[title]
    return px.bar(data_frame=majors, x="name", y="value")

Die Top-Fächer von Data Scientists:

plot_majors('data scientist', majors_df)

Interagiere mit der Grafik hier. Da viele Data-Science-Rollen Programmier- und Mathekenntnisse erfordern, überrascht es nicht, dass Informatik und Mathematik die beiden Top-Fächer für Data Scientists sind.

Die Top-Fächer von Data Engineers:

plot_majors('data engineer', majors_df)

Interagiere mit der Grafik hier. Da die Arbeit von Data Engineers Kenntnisse in unterschiedlichen Technologien und Programmiersprachen verlangt, ist es plausibel, dass die Mehrheit der Data Engineers Informatik und Informationstechnologie statt Mathematik studiert hat.

Die Top-Fächer von Data Analysts:

plot_majors('data analyst', majors_df)

Interagiere mit der Grafik hier. Die drei häufigsten Fächer bei Data Analysts sind Betriebswirtschaft, Informatik und Volkswirtschaftslehre. Das passt, da Data Analysts Daten interpretieren und in den Geschäftskontext einordnen.

Die Top-Fächer von Machine Learning Engineers:

plot_majors('machine learning engineer', majors_df)

Interagiere mit der Grafik hier. Zusätzlich zeigt eine Circle-Packing-Grafik die Unterschiede der Studienfächer zwischen den Rollen.

Die interaktive Version findest du hier.

Abschlüsse analysieren

In vielen Stellenanzeigen für Data Scientists werden ein Master oder eine Promotion gefordert. Aber wie viele Data Scientists haben tatsächlich einen Master oder eine Promotion?

Beantworten wir das mit Daten, die die Anzahl je Abschluss und Rolle zeigen.

degree_df = pd.read_csv(
"https://media.githubusercontent.com/media/khuyentran1401/dataset/master/data_science_market/degrees.csv"
)

degree_df.head(10)

Die Abschlüsse umfassen:

  • High School
  • Associate
  • Bachelor
  • Master
  • Ph.D.
  • Zertifikat

Visualisieren wir die Daten wieder als Blasenmatrix.

Die interaktive Grafik findest du hier. Daraus wird deutlich: Der am weitesten verbreitete Abschluss über alle datenbezogenen Rollen hinweg ist der Bachelor. Das ist logisch, da die meisten Jobs mindestens einen Bachelor verlangen und auch Master- und Ph.D.-Absolventen zuvor einen Bachelor erworben haben.

So sieht dasselbe als gruppiertes Balkendiagramm aus.

Auffällig ist, dass die Zahl der Data Analysts mit Bachelor fast doppelt so hoch ist wie die der Data Analysts mit Master. Bei Data Scientists ist die Zahl der Bachelor-Absolventen hingegen ungefähr gleich hoch wie die der Master-Absolventen.

Das bedeutet: Unter Data Scientists ist der Anteil mit weiterführendem Abschluss höher als bei Data Analysts, die nach dem Bachelor noch einen höheren Abschluss anstreben.

Geschlechter analysieren

Wie ist das Verhältnis von Männern und Frauen in datenbezogenen Rollen? Das beantworten wir mit Daten, die die Anzahl von Männern und Frauen je Rolle zeigen.

gender_df = pd.read_csv(
    "https://media.githubusercontent.com/media/khuyentran1401/dataset/master/data_science_market/genders.csv"
)
gender_df.head(10)

Im nächsten Schritt visualisieren wir die Daten als gruppiertes Balkendiagramm.

Aus der Grafik geht hervor:

  • In allen datenbezogenen Jobs außer der Datenerfassung (Data Entry) gibt es mehr Männer als Frauen.
  • Bei Rollen wie Data Analyst und Statistiker ist die Zahl der Männer fast doppelt so hoch wie die der Frauen.
  • Bei Data Scientist, Data Engineer und Machine Learning Engineer ist die Zahl der Männer mehr als doppelt so hoch wie die der Frauen.

Standorte analysieren

Die beliebtesten US-Bundesstaaten für Data Scientists

Welche Bundesstaaten sind für Data Scientists am beliebtesten? Starten wir mit Daten zur Anzahl der Data Scientists pro Bundesstaat.

state_jobs = pd.read_csv(
    "https://media.githubusercontent.com/media/khuyentran1401/dataset/master/data_science_market/state_jobs.csv"
)
state_jobs.head(10)

Anschließend plotten wir die Daten mit folium, einer Python-Bibliothek zur Kartenerstellung.

state_geo = "https://raw.githubusercontent.com/python-visualization/folium/master/examples/data/us-states.json"

m = folium.Map(location=[48, -102], zoom_start=3)

folium.Choropleth(
    geo_data=state_geo,
    name="choropleth",
    data=state_jobs,
    columns=["state", "count"],
    key_on="feature.id",
    fill_color="YlGn",
    fill_opacity=0.7,
    line_opacity=0.2,
    legend_name="Number of Data Science Jobs",
).add_to(m)

folium.LayerControl().add_to(m)

m

Die interaktive Karte findest du hier. Am meisten Data Scientists arbeiten in Kalifornien. Auf den Plätzen zwei bis vier folgen New York, Massachusetts und Texas.

Die 25 beliebtesten Länder weltweit für Data Scientists

Welche sind die 25 beliebtesten Länder für Data Scientists? Laden wir zunächst die Daten zur Anzahl der Data Scientists pro Land:

!wget 'countries.pkl' 'https://github.com/khuyentran1401/dataset/raw/master/data_science_market/countries.pkl'

countries = pickle.load(open("countries.pkl", "rb"))

Als Nächstes plotten wir die Top 25 Länder für Data Scientists:

def plot_top_25_locations(title: str, locations: dict):
    data = locations[title]
    return px.bar(data_frame=data, x="location", y="count")

plot_top_25_locations("data scientist", countries)

Die interaktive Grafik gibt es hier. Die fünf beliebtesten Länder für Data Scientists sind:

  • United States
  • India
  • France
  • United Kingdom
  • Germany

Die 25 beliebtesten Städte weltweit für Data Scientists

Welche sind die 25 beliebtesten Städte für Data Scientists? Wir laden die Daten zur Anzahl der Data Scientists pro Stadt:

!wget 'cities.pkl' 'https://github.com/khuyentran1401/dataset/raw/master/data_science_market/cities.pkl'

cities = pickle.load(open("cities.pkl", "rb"))

Die Grafik der Top-25-Städte für Data Scientists:

Interagiere mit der Grafik hier. Die fünf beliebtesten Städte sind:

  • San Francisco
  • Bengaluru
  • London
  • Paris
  • New York City

Die beliebtesten Titel für Data Scientists

Rund um die Rolle des Data Scientist gibt es zahlreiche Titel, etwa Senior Data Scientist, Junior Data Scientist, Data Scientist Intern und viele mehr. Wäre es nicht hilfreich zu sehen, wie beliebt die einzelnen Titel sind?

Wir beginnen mit Daten zur Häufigkeit aller Titel, die sich auf Data Scientist beziehen:

!wget "top_titles.pkl" "https://github.com/khuyentran1401/dataset/raw/master/data_science_market/top_titles.pkl"

top_titles = pickle.load(open("top_titles.pkl", "rb"))
top_titles["data scientist"]

Das Balkendiagramm der Top-Titel rund um Data Scientist:

Die interaktive Version findest du hier. Zusätzlich zeigt eine Circle-Packing-Grafik die Vielfalt der Titel in einigen datenbezogenen Rollen.

Die interaktive Grafik findest du hier.

Branchentrends analysieren

Keywords

Wie hat sich das Interesse am Keyword Data Scientist in der Google-Suche über die Zeit verändert? Diese Daten holen wir mit pytrends und plotten sie mit Plotly Express:

from pytrends.request import TrendReq


def plot_keyword_trend(title: str):
    pytrends = TrendReq(hl="en-US", tz=360)
    pytrends.build_payload(kw_list=[title])

    df = pytrends.interest_over_time()
    return px.line(data_frame=df, y=title)


plot_keyword_trend("data scientist")

Die interaktive Grafik findest du hier. Das Interesse am Keyword Data Scientist steigt von 2016 bis 2021 annähernd linear.

Veränderung der Anzahl von Positionen im Zeitverlauf

Wie hat sich die Zahl der Positionen über die Zeit verändert? Das sehen wir in Daten, die die Entwicklung der Vollzeitpositionen über die Jahre zeigen.

dates_df = pd.read_csv(
"https://media.githubusercontent.com/media/khuyentran1401/dataset/master/data_science_market/dates.csv",
    index_col=0)
dates_df.head(10)

Die erste Zeile zeigt: 1988 arbeiteten 40 Data Scientists. Die zweite Zeile zeigt: 1989 waren es 52.

Das Liniendiagramm zu den Daten:

px.line(dates_df, x="date", y="value", color="name")

Interagiere mit der Grafik hier. Zentrale Erkenntnisse:

  • Die Zahl der Statistiker bleibt über die Zeit relativ konstant.
  • Vor 2010 ist Data Entry die beliebteste Rolle unter den datenbezogenen Positionen.
  • 2010 überholt Data Analyst die Datenerfassung.
  • 2013 überholen Data Scientist, Data Analyst und Data Engineer gemeinsam die Rolle Statistiker. Data Scientist wächst stark, während manuelle Datenerfassung deutlich an Bedeutung verliert.
  • 2019 überholt schließlich auch die Rolle Machine Learning Engineer die Statistiker.

Mit einem Bar-Chart-Race lässt sich der Wechsel in den Platzierungen besonders gut verfolgen:

Sehr anschaulich! So wird der genaue Zeitpunkt von Rangänderungen sichtbar. Die interaktive Version gibt es hier.

Veränderung der gefragten Kompetenzen im Zeitverlauf

Wie haben sich die Häufigkeiten der Top-Kompetenzen für Data Scientists über die Zeit verändert? Das beobachten wir mit Daten zur Anzahl der Nennungen von Kompetenzen im Zeitverlauf.

skills_df = pd.read_csv(
    "https://media.githubusercontent.com/media/khuyentran1401/dataset/master/data_science_market/skills_over_time.csv",
    index_col=0,
)
skills_df.head(10)

Darauf basierend erstellen wir ein Bar-Chart-Race:

Wir sehen: Vor 2014 waren Lehre und Volkswirtschaftslehre die zwei häufigsten Kompetenzen unter Data Scientists. Ab 2014 überholte Python beide und wurde zur gefragtesten Kompetenz.

Fazit

Bist du bereit, deine professionellen Data-Science-Kompetenzen unter Beweis zu stellen? Sieh dir DataCamps Zertifizierungsprogramm und die Karriereservices an und mach den nächsten Schritt zu deinem Traumjob in Data Science.

Themen
Datenwissenschaft
Karrieredienste
Verwandt

Blog

Die 20 besten Snowflake-Interview-Fragen für alle Niveaus

Bist du gerade auf der Suche nach einem Job, der Snowflake nutzt? Bereite dich mit diesen 20 besten Snowflake-Interview-Fragen vor, damit du den Job bekommst!
Nisha Arya Ahmed's photo

Nisha Arya Ahmed

15 Min.

Blog

Ein kompletter Leitfaden zu den Gehältern von Business-Analysten im Jahr 2026

Finde raus, wie viel du als Business Analyst verdienen kannst und wie du dein jetziges Gehalt aufbessern kannst.
Matt Crabtree's photo

Matt Crabtree

14 Min.

Blog

Lehrer/innen und Schüler/innen erhalten das Premium DataCamp kostenlos für ihre gesamte akademische Laufbahn

Keine Hacks, keine Tricks. Schüler/innen und Lehrer/innen, lest weiter, um zu erfahren, wie ihr die Datenerziehung, die euch zusteht, kostenlos bekommen könnt.
Nathaniel Taylor-Leach's photo

Nathaniel Taylor-Leach

4 Min.

Blog

Top 50+ AWS-Interviewfragen und Antworten für 2026

Ein kompletter Guide mit grundlegenden, fortgeschrittenen und szenariobasierten AWS-Interviewfragen – mit Beispielen aus der Praxis.
Zoumana Keita 's photo

Zoumana Keita

15 Min.

Blog

Q2 2023 DataCamp Donates Digest

DataCamp Donates hat im zweiten Quartal 2023 über 20.000 Stipendien an unsere gemeinnützigen Partner vergeben. Erfahre, wie fleißige benachteiligte Lernende diese Chancen in lebensverändernde berufliche Erfolge verwandelt haben.
Nathaniel Taylor-Leach's photo

Nathaniel Taylor-Leach

Blog

Arten von KI-Agenten: Ihre Rollen, Strukturen und Anwendungen verstehen

Lerne die wichtigsten Arten von KI-Agenten kennen, wie sie mit ihrer Umgebung interagieren und wie sie in verschiedenen Branchen eingesetzt werden. Verstehe einfache reflexive, modellbasierte, zielbasierte, nutzenbasierte, lernende Agenten und mehr.
Mehr AnzeigenMehr Anzeigen