In den vergangenen Monaten sorgten die Data-Science- und KI-Communities mit der Ankunft von GPT-3, dem neuesten Sprachmodell von OpenAI, für Aufsehen. Für viele markiert das Modell einen großen Schritt nach vorn: Ein einzelner Algorithmus kann in verschiedensten Aufgabenbereichen erstaunlich gut mit menschlicher Sprache umgehen.
Entwickler:innen, die GPT-3 testen, haben zahlreiche spannende Use Cases geliefert. Beispiele wie automatische Codegenerierung auf Basis einfacher englischer Prompts, das Beantworten medizinischer Fragen oder die Übersetzung juristischer Sprache beflügeln die Fantasie vieler Data Scientists, die über die nächste Generation KI-gestützter Software nachdenken.



Auch wenn der geschäftliche Mehrwert von Machine Learning in Unternehmen oft in naheliegenden Anwendungsfällen wie Churn-Prognosen, einfachen Verkaufsprognosen oder Kundensegmentierung liegt, lohnt sich der Blick auf die Kommerzialisierung von GPT-3 und ihre Bedeutung für die Zukunft. Das Potenzial ist groß, wie wir über Künstliche Intelligenz denken und sie in der Praxis einsetzen.
KI, Machine Learning und Deep Learning: kurz erklärt
In Business und Medien wimmelt es von Buzzwords wie Künstliche Intelligenz (KI), Machine Learning (ML) und Deep Learning (DL). Bevor wir klären, wie GPT-3 funktioniert, definieren wir die Begriffe kurz.
Andrew Ng, Mitgründer von Google Brain und früherer Chief Scientist bei Baidu, beschreibt Künstliche Intelligenz als einen „riesigen Werkzeugkasten, um Computer intelligent handeln zu lassen“. Das umfasst explizit programmierte Software wie Taschenrechner ebenso wie ML-Anwendungen wie Empfehlungssysteme und selbstfahrende Autos.
Machine Learning ist laut Arthur Samuel, einem Pionier der KI und des Computerspielens, das „Forschungsfeld, das Computern die Fähigkeit gibt, zu lernen, ohne explizit programmiert zu werden“. Grundsätzlich gibt es zwei Arten von ML-Algorithmen: Beim überwachten Lernen (Supervised Learning) lernen Algorithmen die Muster zwischen vorhandenen Daten (Inputs) und Labels (Outputs) und sagen dann Outputs für unbekannte Daten voraus—etwa ob ein neuer Kunde kündigt, basierend auf historischen Churn-Daten. Beim unüberwachten Lernen (Unsupervised Learning) entdecken Algorithmen allgemeine Muster in den Daten und gruppieren ähnliche Datenpunkte, zum Beispiel um Kundensegmente mit ähnlichem Verhalten zu bilden.
Deep Learning ist eine Spielart des Machine Learning auf Basis mehrschichtiger künstlicher neuronaler Netze, lose inspiriert von biologischen neuronalen Netzen im Gehirn. DL kann überwacht oder unüberwacht sein und ist maßgeblich für viele prominente ML-Anwendungen des letzten Jahrzehnts verantwortlich, etwa Bilderkennung oder Sentiment-Analyse. Deep-Learning-Modelle unterscheiden sich in ihrer Architektur—von einfach bis komplex, je nach Anzahl der Schichten und Knoten. Je komplexer ein Modell, desto mehr Parameter hat es. Wenn du lernen möchtest, wie Deep-Learning-Modelle aufgebaut sind, schau dir den Deep Learning Skill Track von DataCamp an.
Für einen tieferen Einstieg in diese Themen empfehlen wir unser E-Book The Definitive Guide to Machine Learning for Business Leaders.
So funktioniert GPT-3
Wo ordnet sich GPT-3 zwischen KI, Machine Learning und Deep Learning ein? Das Akronym GPT steht für „Generative Pre-trained Transformer“—einen unüberwachten Deep-Learning-Algorithmus, der in der Regel vorab auf einer großen Menge unbeschrifteter Texte trainiert wird. Anschließend wird er feinjustiert und auf einem großen, aufgabenspezifischen, beschrifteten Datensatz trainiert (z. B. Übersetzung Englisch–Französisch) und soll dann die wahrscheinlichsten Outputs (französische Übersetzung) zu gegebenen Inputs (englische Wörter) ableiten. Du kannst dir das als eine sehr ausgefeilte Autovervollständigung für verschiedenste Sprachaufgaben vorstellen.
GPT-3 ist die dritte Iteration dieses Modells. Es bringt keine grundlegend neue Architektur mit, wurde aber auf extrem großen Datensätzen vortrainiert, die einen erheblichen Teil des Internets abdecken—darunter den Common Crawl—und enthält deutlich mehr Schichten in seiner Netzwerkarchitektur. Damit ist GPT-3 das komplexeste je entwickelte Sprachmodell mit 175 Milliarden Parametern. Das sind zehnmal so viele Parameter wie das zuvor komplexeste Modell, Turing-NLG von Microsoft, und 117-mal so viele wie GPT-2.
Am wichtigsten ist, dass GPT-3 vom Few-Shot-Learning profitiert: Das vortrainierte Modell muss für eine spezifische Sprachaufgabe nicht mehr mit riesigen, beschrifteten Datensätzen feinabgestimmt werden. Stattdessen erhält es eine Aufgabenbeschreibung—zum Beispiel „Übersetze englische Wörter ins Französische“—und nur wenige Beispielpaare aus Input und Output. In Kombination mit einer leicht zu nutzenden Plug-and-Play-Schnittstelle senkt GPT-3 die Einstiegshürden erheblich und ermöglicht auch Nicht-Expert:innen, in verschiedenen Sprachaufgaben sinnvolle Ergebnisse zu erzielen.

Warum GPT-3 wichtig ist
Mit nur wenigen Beispielen und Aufgabenbeschreibungen erreicht GPT-3 eine Leistung, die feinabgestimmten Sprachmodellen mit aufgabenspezifischen Trainingsdaten Konkurrenz macht—und das über verschiedene Sprachaufgaben hinweg. GPT-3 zeigt außerdem Erfolge bei Aufgaben, die eigentlich logisches Denken erfordern—etwa Arithmetik—und nicht zwingend reine Sprachprobleme sind. So erzielte GPT-3 nach wenigen Beispielen zu Addition und Subtraktion bei zweistelligen Aufgaben 100% Genauigkeit. Weniger komplexe Modelle mit deutlich weniger Parametern durchbrechen hier kaum die 60%-Marke. Zwar schwächelt GPT-3 bei komplexerer Arithmetik, doch das deutet darauf hin, dass größere Modelle über ihr Trainingsfeld hinaus generalisieren könnten.

Interessant ist auch: Zusätzliche Leistungsgewinne scheinen allein durch das Hochskalieren von Datenmenge und Modellgröße möglich. Aktuell wirkt es nicht so, als würde die Gesamtleistung des Modells über verschiedene Aufgaben bei 175 Milliarden Parametern ein Plateau erreichen. Nimmt man die Skalierung von GPT-2 zu GPT-3 als Maßstab, ist die Frage spannend, wie sich die Performance entwickeln würde, wenn GPT-4 117-mal mehr Parameter hätte als GPT-3.

Derzeit läuft eine private Beta-Phase. Sobald GPT-3 jedoch als Plug-and-Play-API gebündelt verfügbar ist, kann es schnell im großen Maßstab eingesetzt werden. Wie die KI-Forscherin Shreya Shankar anmerkt, wird eine zentrale Herausforderung sein, diese API effizient und unkompliziert für Unternehmen bereitzustellen.

Was das für die Zukunft bedeutet
Neue Technologien folgen oft dem Hype-Zyklus von Gartner—OpenAI-CEO Sam Altman hat bereits vor überzogenen Erwartungen an GPT-3 gewarnt.

Die Use Cases aus der Entwicklercommunity zeigen dennoch, welche KI-gestützten Anwendungen mittel- bis langfristig realistisch sind. Denkbar sind Tools, mit denen Designer:innen schneller prototypen, Datenanalysen verschlanken, Forschung robuster wird, Content-Marketer Inhalte automatisiert erstellen—und vieles mehr.




Außerdem könnte eine einfache Plug-and-Play-Oberfläche die Art verändern, wie KI unternehmensweit eingesetzt wird. Beispielsweise könnte sie Unternehmen davon abbringen, eigene Inhouse-Modelle zu entwickeln—und weniger technische Fachleute in die Lage versetzen, mit GPT-3 Lösungen zu bauen.
Nicht zuletzt gilt beim Einsatz von KI im großen Maßstab: Die Gefahr, Vorurteile zu verstärken und damit Schaden anzurichten, ist real. Wie viele Forscher:innen bei Tests mit GPT-3 zeigten, lassen sich aus neutralen Eingaben relativ leicht schädliche, stereotype Outputs erzeugen.

Wie bei jedem im großen Maßstab eingesetzten ML-Algorithmus braucht auch GPT-3 sorgfältige Prüfung und laufendes Monitoring, um potenziellen Schaden zu vermeiden.

