Weiter zum Inhalt

Warum wir bei DataCamp IRT einsetzen

Erfahre, warum DataCamp die Item-Response-Theory in Zertifizierungs-Assessments einsetzt.
Aktualisiert 18. Sept. 2026  · 9 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity

Du erinnerst dich vielleicht noch gut an Uni-Klausuren und daran, dass man danach diskutiert hat, ob die eigenen Aufgaben schwerer waren als die der anderen. Oder du hast eine Wiederholungsprüfung geschrieben und sie als einfacher empfunden. War die bessere Note dem leichteren Test geschuldet oder hast du einfach mehr gelernt?

Genau hier zeigt sich die Herausforderung, Wissen, Kompetenzen und Fähigkeiten in einem Fachgebiet zu messen. Ein typischer Ansatz für Prüfungen: Man erstellt einen Fragenkatalog, legt ihn den Lernenden vor, bewertet jede Frage als richtig/falsch und zählt die richtigen Antworten. Diese Endpunktzahl soll dann das Wissen einer Person quantifizieren und darüber entscheiden, ob sie besteht oder durchfällt.

Bei DataCamp bieten wir etwas Ähnliches an. Nutzerinnen und Nutzer können mit unseren Assessments messen, wie gut sie in einem bestimmten Bereich sind (z. B. Data Management in SQL) – melde dich an und probiere eines hier aus! Auch für die DataCamp Certification gilt: Zuerst müssen mehrere Prüfungen bestanden werden, um ein Zertifikat zu erhalten.

Klassische Testtheorie

Im Kern der Testentwicklung steht die sogenannte klassische Testtheorie (CTT). Die grundlegende Gleichung lautet:

X = T + E

Dabei ist X der beobachtete Testwert, T der wahre Wert und E die Fehlerkomponente. Diese Gleichung besagt, dass jeder beobachtete Score eine Mischung aus dem wahren Wert einer Person und einem nicht-systematischen Fehler ist. Dieser Ansatz eignet sich gut, wenn man eine Gruppe von Personen (z. B. alle Studierenden in einem Kurs) zu einem Zeitpunkt mit demselben festen Fragenkatalog prüfen möchte. Hast du zum Beispiel einen Test zu SQL-Kompetenzen entwickelt, ist CTT ein gutes Rahmenwerk, um die Testqualität zu analysieren.

DataCamp lässt sich jedoch als ein riesiges, weltweites Klassenzimmer verstehen, in dem Lernende rund um die Uhr ihre Kompetenzen in einem Fach ihrer Wahl prüfen oder eine Zertifizierung anstreben können.

In diesem Umfeld stoßen wir schnell an Grenzen, wenn wir uns allein auf CTT verlassen wollen, um die Testqualität sicherzustellen.

Da wir sowohl Assessments als auch DataCamp Certifications anbieten und dabei Wissen, Kompetenzen und Fähigkeiten in einem bestimmten Bereich quantifizieren wollen, können wir nicht allen immer wieder dieselben 15 Fragen stellen. Das würde Tests anfällig machen für geleakte Inhalte und reines Auswendiglernen bei Wiederholungen. Die Scores würden mit der Zeit an Aussagekraft verlieren.

Einsatz der Item-Response-Theory

Eine einfache Lösung wäre, die Anzahl potenzieller Fragen zu erhöhen und/oder den Fragenpool kontinuierlich zu erneuern. Allerdings betrachtet CTT nur den wahren Wert einer Person und sagt nichts über die Eigenschaften der Fragen aus! Wie können wir die Fähigkeit einer Person schätzen, wenn wir nicht wissen, ob die Fragen zwischen zwei Tests gleich schwer waren?

Hier kommt die Item-Response-Theory (IRT) ins Spiel. IRT ist ein Messrahmen, bei dem der beobachtete Score auf einer einzelnen Frage (z. B. richtig/falsch) als Ergebnis eines probabilistischen Zusammenspiels zwischen der Fähigkeit einer Person und der Schwierigkeit eines Items angenommen wird. Formal ausgedrückt:

testing score equation

Dieses Modell ist auch als Ein-Parameter-Logistikmodell (1-PL) oder Rasch-Modell bekannt. Aus Gründen der Schätzung werden Fähigkeiten als normalverteilt mit Mittelwert 0 und Standardabweichung 1 angenommen. Dadurch entsteht eine Skala in Standardabweichungen, die typischerweise zwischen -4 und 4 liegt (weil mehr als 99,99% der Normalverteilung in diesem Bereich liegen). Keine Sorge, diese Skala lässt sich beliebig transformieren! Bei DataCamp entspricht zum Beispiel -3,33 einem Score von 0, 0 einem Score von 100 und 3,33 einem Score von 200. Fixiert man die Gleichung für ein bestimmtes Item (hier bei 0) und variiert die Fähigkeit zwischen -4 und 4, erhält man folgende Kurve:

Figure 1. Item characteristic curve for an item with difficulty level 0.

Abbildung 1. Item-Charakteristik-Kurve für ein Item mit Schwierigkeitsgrad 0. (Quelle: DataCamp Workspace)

Diese Kurve, die sogenannte Item-Charakteristik-Kurve, zeigt für jedes Fähigkeitsniveau die erwartete Wahrscheinlichkeit, das Item korrekt zu beantworten. Jedes Item im Pool wird durch eine solche Kurve beschrieben, und das Set aller Kurven lässt die erwartete Testleistung für jede Person vollständig abbilden. Das Schöne daran: Man erhält ein gutes Gefühl dafür, welche Performance auf einem Item bei unterschiedlichen Fähigkeiten zu erwarten ist.

So nutzen wir IRT bei DataCamp

Kehren wir zu unserer Ausgangsfrage zurück: Welchen Nutzen hat IRT für DataCamp? Die folgende Abbildung zeigt ein hypothetisches Set von 7 Fragen mit unterschiedlichen Schwierigkeitsgraden. Nehmen wir an, wir zeigen derselben Person in zwei Sitzungen einmal die drei einfachsten und einmal die drei schwierigsten Fragen – bei durchschnittlicher Fähigkeit. Aus den Kurven lässt sich ablesen: Im einfachen Test wäre die erwartete Anzahl richtiger Antworten etwa 2,5 (Summe der Einzelwahrscheinlichkeiten), im schweren Test dagegen nur rund 0,875! Mit Blick auf die reinen Trefferzahlen wäre das im leichten Test fast dreimal so gut. Der Clou: IRT ermöglicht es, eine Fähigkeit basierend auf Richtigkeit der Antwort und dem zugehörigen Schwierigkeitsgrad zu schätzen. So können wir in beiden Fällen korrekt eine Fähigkeit von 0 rekonstruieren (mit etwas Messfehler je nach Testlänge).

Figure 2. Item characteristic curves for a set of items.

Abbildung 2. Item-Charakteristik-Kurven für eine Gruppe von Items. (Quelle: DataCamp Workspace)

Lass uns eine kleine Simulation durchspielen, um das zu veranschaulichen. Für eine glatte Score-Verteilung erweitern wir den Item-Pool auf insgesamt 61 Items, weiterhin mit Schwierigkeitsgraden von -3 bis 3. Wir lassen 1000 (hypothetische) Nutzerinnen und Nutzer mit einem wahren Wert von 0 entweder 30 Items von -3 bis 0 (der „einfache“ Test) oder 30 Items von 0 bis 3 (der „schwere“ Test) beantworten. Die Ergebnisse lassen sich auf zwei Arten zusammenfassen: über die Anzahl richtiger Antworten von 30 oder über die geschätzte Fähigkeit auf Basis des IRT-Modells. Wenig überraschend liefert die Simulation im einfachen Test im Mittel 24 richtige Fragen und im schweren Test nur 6 (siehe Abbildung 3). Überträgst du diese beiden Testformen in dein Klassenzimmer und nutzt die Zahl der richtigen Antworten als Leistungsmaß, entstehen zwei vollkommen unterschiedliche Gruppen – obwohl niemand objektiv besser ist als der andere.

Figure 3. Distribution of number of correct responses, for simulated easy and hard tests.

Abbildung 3. Verteilung der Anzahl richtiger Antworten in simulierten einfachen und schweren Tests. (Quelle: DataCamp Workspace)

Abbildung 3 steht im deutlichen Gegensatz zu Abbildung 4: Dort überlappen sich die Verteilungen der geschätzten Fähigkeiten stark, und beide Mittelwerte liegen nahezu perfekt bei null! Der Hauptgrund: Bei der Fähigkeitsschätzung berücksichtigen wir die Schwierigkeit der Fragen. Auch wenn das Beispiel konstruiert ist, zeigt es die Stärke von IRT und die Fähigkeit, den Einfluss von Person und Item auf die Antworten zu entflechten. Auf dein Klassenzimmer übertragen würde es weiterhin Leistungsunterschiede geben, aber die künstliche Teilung in zwei Gruppen verschwindet.

Figure 4. Distribution of estimated abilities, for both simulated easy and hard tests.

Abbildung 4. Verteilung der geschätzten Fähigkeiten für beide simulierten Testvarianten. (Quelle: DataCamp Workspace)

Fazit

Kurz gesagt: IRT ermöglicht es uns, sehr viele unterschiedliche Fragen zu erstellen und dir jeweils nur einen Teil davon zu zeigen – während wir deinen Score trotzdem präzise berechnen, ohne Sicherheit und Qualität unserer Tests zu gefährden. Mehr noch: IRT erlaubt es, Fragen passend zu deinem aktuellen Leistungsniveau zu präsentieren. Ja, jedes Assessment fällt etwas anders aus, weil wir die nächste Frage adaptiv auswählen! So werden Tests kürzer, ohne an Präzision zu verlieren. Mehr dazu im nächsten Blogpost. Starte jetzt ein Assessment oder hol dir dein Zertifikat! ;)

[Die Abbildungen in diesem Blogpost wurden mit DataCamp Workspace erstellt, unserem Cloud-Notebook, das einfach funktioniert. Schau es dir hier an, kommentiere es gern oder experimentiere selbst damit!]

Themen
Zertifizierung
Verwandt

Blog

Lehrer/innen und Schüler/innen erhalten das Premium DataCamp kostenlos für ihre gesamte akademische Laufbahn

Keine Hacks, keine Tricks. Schüler/innen und Lehrer/innen, lest weiter, um zu erfahren, wie ihr die Datenerziehung, die euch zusteht, kostenlos bekommen könnt.
Nathaniel Taylor-Leach's photo

Nathaniel Taylor-Leach

4 Min.

Blog

2022-2023 DataCamp Classrooms Jahresbericht

Zu Beginn des neuen Schuljahres ist DataCamp Classrooms motivierter denn je, das Lernen mit Daten zu demokratisieren. In den letzten 12 Monaten sind über 7.650 neue Klassenzimmer hinzugekommen.
Nathaniel Taylor-Leach's photo

Nathaniel Taylor-Leach

8 Min.

Blog

Q2 2023 DataCamp Donates Digest

DataCamp Donates hat im zweiten Quartal 2023 über 20.000 Stipendien an unsere gemeinnützigen Partner vergeben. Erfahre, wie fleißige benachteiligte Lernende diese Chancen in lebensverändernde berufliche Erfolge verwandelt haben.
Nathaniel Taylor-Leach's photo

Nathaniel Taylor-Leach

Blog

Die 20 besten Snowflake-Interview-Fragen für alle Niveaus

Bist du gerade auf der Suche nach einem Job, der Snowflake nutzt? Bereite dich mit diesen 20 besten Snowflake-Interview-Fragen vor, damit du den Job bekommst!
Nisha Arya Ahmed's photo

Nisha Arya Ahmed

15 Min.

Blog

Top 50+ AWS-Interviewfragen und Antworten für 2026

Ein kompletter Guide mit grundlegenden, fortgeschrittenen und szenariobasierten AWS-Interviewfragen – mit Beispielen aus der Praxis.
Zoumana Keita 's photo

Zoumana Keita

15 Min.

Tutorial

Python Switch Case Statement: Ein Leitfaden für Anfänger

Erforsche Pythons match-case: eine Anleitung zu seiner Syntax, Anwendungen in Data Science und ML sowie eine vergleichende Analyse mit dem traditionellen switch-case.
Matt Crabtree's photo

Matt Crabtree

5 Min.

Mehr AnzeigenMehr Anzeigen