Lernpfad
BERT, GPT-3, DALL-E 2, LLaMA, BLOOM – diese Modelle sind einige der Stars der KI-Revolution, die wir seit der Veröffentlichung von ChatGPT erleben. Was haben sie gemeinsam? Genau: Es sind alles Foundation Models.
Foundation Models sind eine jüngere Entwicklung in der KI. Diese Modelle werden mit Algorithmen entwickelt, die auf Allgemeingültigkeit und vielseitige Ausgaben optimiert sind. Sie beruhen auf großskaligen neuronalen Netzen, die häufig mit einer breiten Palette an Datenquellen und sehr großen Datenmengen trainiert werden, um eine Vielzahl nachgelagerter Aufgaben zu bewältigen – darunter auch solche, für die sie nicht gezielt entwickelt oder trainiert wurden.
Die Popularität von Foundation Models befeuert die klassische Debatte zwischen Narrow AI und Artificial General Intelligence (AGI), auch Starke KI genannt. Narrow AI bezeichnet KI-Systeme, die für klar umrissene Aufgaben entwickelt wurden und außerhalb dieses Rahmens nicht arbeiten können. AGI hingegen ist ein hypothetisches KI-System, das Wissen ähnlich wie ein Mensch verstehen, lernen und auf eine breite Palette von Aufgaben anwenden kann.
Auch wenn Foundation Models noch nicht wie Menschen denken, liefern sie bahnbrechende Ergebnisse, die uns der Schwelle zur AGI näherbringen. Deshalb sollten Datenprofis und Nicht‑Expertinnen und -Experten diese Modelle kennen.
Für alle, die neu im Thema sind, bietet unser AI Essentials Skill Track einen fundierten Überblick über KI-Modelle der nächsten Generation. Wer bereits Vorkenntnisse mitbringt, kann mit unserem Artikel zu generativen KI-Projekten sein Wissen direkt anwenden.
Schauen wir uns Foundation Models genauer an!
Was sind Foundation Models? Zentrale Konzepte verständlich erklärt
Der Begriff Foundation Model ist relativ neu und überschneidet sich mit anderen populären Konzepten wie Generative KI, Transformer und Large Language Models (LLMs).
Die KI-Terminologie ist allerdings weiterhin umkämpft. Hier sind Definitionen, die dir helfen, dich im rasant entwickelnden Feld der KI zurechtzufinden:
- Generative KI. Ein Oberbegriff für KI-Systeme, deren Hauptfunktion das Erzeugen von Inhalten ist – im Gegensatz zu Systemen, die z. B. für Klassifikation oder Vorhersagen entwickelt wurden.
- Transformer. Transformer haben das Deep Learning revolutioniert. Sie stellen eine neue Architektur bereit, um sequenzielle Daten effizient zu verarbeiten. Besonders für Text sind sie hervorragend geeignet und bilden daher das Rückgrat der Verarbeitung und Generierung natürlicher Sprache (NLP/NLG). Transformer kommen jedoch auch bei anderen Datentypen wie Bildern erfolgreich zum Einsatz.
- Large Language Model. LLMs sind KI-Systeme zur Modellierung und Verarbeitung menschlicher Sprache. Transformer sind die zugrunde liegende Technologie. „Large“ sind sie, weil sie Hunderte Millionen bis Milliarden Parameter besitzen und mit riesigen Textkorpora vortrainiert werden.
- Foundation Model. Ein weiter Begriff für KI-Modelle, die auf eine breite, allgemeine Vielfalt von Ausgaben ausgelegt sind. Sie können zahlreiche Aufgaben und Anwendungen abdecken, etwa die Erzeugung von Text, Video, Bild oder Audio. Ein besonderes Merkmal: Sie können als eigenständige Systeme laufen oder als „Fundament“ für andere Anwendungen dienen. So fungiert das LLM GPT als Foundation Model für ChatGPT.
Wie funktionieren Foundation Models?
Die Basistechnologie von Foundation Models – unabhängig von Aufgabe und Trainingsdaten – ist der Transformer.
Von Google-Forschenden im Jahr 2017 entwickelt, bieten Transformer eine Alternative zu klassischen rekurrenten neuronalen Netzen (RNNs) und Convolutional Neural Networks (CNNs) für sequenzielle Daten – insbesondere Text.
Transformer sagen das nächste Wort in einer Sequenz voraus, um eine kohärente Antwort zu bilden. Dabei nutzen sie den sogenannten Attention‑Mechanismus, der den Einfluss verschiedener Wörter beim Generieren einer Antwort gewichtet.
Das Training von Transformern umfasst zwei Schritte: Pretraining und Feintuning.
Pretraining
In dieser Phase werden Transformer mit großen Mengen unstrukturierter (Text‑)Daten trainiert, vorwiegend aus dem Internet.
Das Training erfolgt per Self‑Supervised Learning – einer innovativen Methode, die keine manuelle Datenlabelung erfordert.
Ziel des Pretrainings ist es, statistische Sprachmuster zu erlernen. Da die gängige Strategie für bessere Leistungen darin besteht, die Modellgröße (also die Anzahl der Parameter) und die Datenmenge im Pretraining zu erhöhen, ist diese Phase meist zeit- und kostenintensiv.
Feintuning
Das Pretraining vermittelt ein grundlegendes Sprachverständnis, reicht aber für spezifische Praxisaufgaben nicht aus. Daher folgt das Feintuning: Das Modell wird auf einem schmaleren, domänenspezifischen Datensatz trainiert, der mit Hilfe menschlicher Reviewer nach klaren Richtlinien erstellt wurde.
Modalität
Ein weiteres wichtiges Merkmal von Foundation Models ist die Modalität. Je nach Art der Eingabedaten sind sie unimodal oder multimodal. Unimodale Modelle verarbeiten nur eine Datenart und erzeugen denselben Typ Ausgabe. Multimodale Modelle können mehrere Eingabemodalitäten verarbeiten und verschiedene Ausgabetypen erzeugen (zum Beispiel kann GPT‑4 sowohl Bild‑ als auch Texteingaben verarbeiten und Text ausgeben).
Das Innenleben von Transformern ist komplex und sprengt den Rahmen dieses Artikels. Für eine detailliertere Erklärung lies unseren Beitrag What is ChatGPT und vertiefe dich in Transformer und Hugging Face für eine technischere Perspektive.
Wenn du verstehen willst, wie LLMs im Detail funktionieren, ist unser Large Language Models (LLMs) Concepts Course ein idealer Startpunkt.
Anwendungsfelder von Foundation Models
Foundation Models können als eigenständige Systeme eingesetzt oder als Basis für unzählige nachgelagerte KI‑Systeme und Anwendungen genutzt werden. Während viele moderne Foundation‑Systeme auf Text‑ oder Codegenerierung und NLP‑Aufgaben ausgerichtet sind, wächst die Anzahl der Systeme, die andere Ausgaben wie Bilder oder Musik erzeugen können.
Unten findest du eine Tabelle mit einigen der bekanntesten Foundation Models.
|
Foundation Model |
Nachgelagertes KI‑System |
Anwendungen |
|
LaMDA (Google) |
Experimenteller, konversationeller KI‑Chat‑Dienst. |
|
|
GPT-3.5 (OpenAI) |
Ermöglicht Unterhaltungen, die sich menschlich anfühlen. |
|
|
GPT-4 (OpenAI) |
Hilft DataLab‑Usern, besser und effizienter zu programmieren. |
|
|
Codex (OpenAI) |
GitHub Copilot |
Schlägt in Echtzeit Code und ganze Funktionen vor. |
|
AudioLM (Google) |
MusicLM |
Erzeugt Musik basierend auf Textbeschreibungen. |
|
BLOOM (Hugging Face) |
Keine nachgelagerte Anwendung. Direkt nutzbar. |
Vielfältige NLP‑Aufgaben. Trainiert in 46 Sprachen und 13 Programmiersprachen. |
|
LLaMA (Meta) |
Keine nachgelagerte Anwendung. Direkt nutzbar. |
Unterstützt Forschende dabei, dieses KI‑Teilgebiet voranzutreiben. |
|
DALL-E 2 (OpenAI) |
Keine nachgelagerte Anwendung. Direkt nutzbar. |
Erzeugt realistische Bilder und Kunst aus Beschreibungen in natürlicher Sprache. |
Herausforderungen und Risiken von Foundation Models
Foundation Models stehen an der Spitze der KI-Entwicklung und können unzählige Anwendungen antreiben. Dennoch sollten potenzielle Risiken und Herausforderungen mitgedacht werden.
Eine nicht abschließende Liste zentraler Risiken bei der breiten Einführung von Foundation Models:
- Fehlende Transparenz. Algorithmische Intransparenz ist eines der größten Probleme. Häufig gelten Foundation Models als „Black Box“, also als so komplex, dass sich ihr Schlussfolgern nicht nachverfolgen lässt. KI‑Anbieter geben aus Wettbewerbsgründen oft nur wenige Einblicke. Mehr Transparenz ist jedoch entscheidend, um Kosten und Auswirkungen zu verstehen sowie Sicherheit und Wirksamkeit zu bewerten.
- Bias und Diskriminierung. Verzerrte Foundation Models können zu unfairen Entscheidungen führen und bestehende Benachteiligungen von Minderheiten verstärken. IBM Research untersucht Wege, diese Verzerrungen zu minimieren.
- Datenschutz. Foundation Models werden mit riesigen Datenmengen trainiert, oft inklusive personenbezogener Daten. Das birgt Risiken für Datenschutz und Datensicherheit.
- Ethische Fragen. Entscheidungen von Foundation Models können tiefgreifende Folgen für unser Leben haben und Grundrechte berühren. Die Ethik generativer KI haben wir in einem separaten Beitrag beleuchtet.
Die Zukunft von Foundation Models
Foundation Models treiben den aktuellen Boom der generativen KI an. Die Anwendungsmöglichkeiten sind so groß, dass praktisch jede Branche – einschließlich der Data Science – von der Verbreitung von KI betroffen sein wird.
Auch wenn wir noch weit von Artificial General Intelligence entfernt sind, markieren Foundation Models einen wichtigen Meilenstein im KI‑Wettrennen. Unternehmen, Regulierende und die Gesellschaft insgesamt sollten den Status quo der KI kennen – als Grundlage für Transparenz, Fairness und Verantwortlichkeit.
DataCamp arbeitet daran, allen zugängliche, umfassende Ressourcen bereitzustellen, um bei der KI‑Entwicklung am Ball zu bleiben. Schau rein:
- Introduction to Meta AI's LLaMA: Empowering AI Innovation – Dieser Blogpost stellt LLaMA vor, eine Sammlung moderner Foundation‑Sprachmodelle.
- An Introduction to Statistical Machine Learning – Dieses Tutorial erklärt die statistischen Grundlagen von Machine‑Learning‑Modellen – ein zentrales Fundament zum Verständnis von Foundation Models.
- 5 Projects You Can Build with Generative AI Models (with examples) – Praktische Projektideen rund um generative KI‑Modelle, eine Art von Foundation Model.
- How to Ethically Use Machine Learning to Drive Decisions – Warum ethische Leitplanken bei ML‑Modellen, inklusive Foundation Models, unverzichtbar sind.
- AI Essentials Skill Track – Dieser Lernpfad bietet eine umfassende Einführung in KI, inklusive Modellen wie ChatGPT, einem Typ von Foundation Model.
Ich bin freiberufliche Datenanalystin und arbeite mit Unternehmen und Organisationen auf der ganzen Welt an Data-Science-Projekten zusammen. Ich bin auch Ausbilder für Data Science mit mehr als 2 Jahren Erfahrung. Ich schreibe regelmäßig datenwissenschaftliche Artikel in englischer und spanischer Sprache, von denen einige auf etablierten Websites wie DataCamp, Towards Data Science und Analytics Vidhya veröffentlicht wurden. Als Datenwissenschaftlerin mit einem Hintergrund in Politik- und Rechtswissenschaften ist es mein Ziel, an der Schnittstelle von Politik, Recht und Technologie zu arbeiten und die Macht der Ideen zu nutzen, um innovative Lösungen und Erzählungen voranzutreiben, die uns dabei helfen können, dringende Herausforderungen wie die Klimakrise anzugehen. Ich betrachte mich als Autodidakt, der ständig lernt und ein überzeugter Verfechter der Multidisziplinarität ist. Es ist nie zu spät, neue Dinge zu lernen.
