Lernpfad

Sowohl Google AI als auch OpenAI sind bekannt dafür, KI-Technologien an der Spitze der Entwicklung zu veröffentlichen. Mit der Einführung von ChatGPT hat sich das Feld jedoch verändert und einen neuen Wettlauf entfacht, in dem Tech-Giganten wie Google fieberhaft versuchen, ähnliche KI-Modelle auf den Markt zu bringen.
In diesem Beitrag schauen wir uns die jüngsten Entwicklungen bei OpenAI und Google AI an und was uns künftig erwartet. Außerdem erfährst du, wie Fortschritte in der KI das Feld der Data Science verändern und wie wir sie für mehr Produktivität nutzen können.
OpenAI
Die OpenAI API ist eine Plattform, über die wir per API auf modernste generative Modelle zugreifen. Wir können mit DALLE-2 hochqualitative Bilder erzeugen, mit GPT-3 Text und Code generieren und Embeddings für weitere sprachbezogene Aufgaben nutzen. Darüber hinaus kannst du Ergebnisse moderieren, Ratenlimits setzen und das Modell auf einem spezifischen Datensatz feinjustieren. Lerne GPT-3 kennen in unserem Blog Beginner's Guide to GPT-3.

Bild: Autorin/Autor | Quelle: OpenAI
Das alles sind kommerzielle Produkte mit nutzungsbasierter Abrechnung. Von Zeit zu Zeit veröffentlicht OpenAI jedoch auch Open-Source-Tools und -Modelle, zum Beispiel:
- Whisper: Spracherkennungsmodell mit großskaliger schwacher Supervision.
- OpenAI Baselines: Implementierungen von Reinforcement-Learning-Algorithmen.
- Gym: Toolkit für Entwicklung und Evaluation von Reinforcement-Learning-Algorithmen.
- GPT2: Code und Modellimplementierung zum Paper „Language Models are Unsupervised Multitask Learners“.
- DALL-E: PyTorch-Paket für das diskrete VAE, das in DALL·E verwendet wird.
APIs, Toolkits und große Sprachmodelle sind klasse, reichen aber nicht an den Erfolg von ChatGPT heran.
Das ChatGPT-Modell wurde mit Reinforcement Learning from Human Feedback (RLHF) trainiert, ähnlich wie InstructGPT (eine verbesserte Variante von GPT-3), allerdings unterscheidet sich die Datenerhebung etwas.
Worin unterscheidet es sich von früheren Modellgenerationen? Die Konversations-KI kann Rückfragen stellen, falsche Prämissen hinterfragen, Fehler eingestehen und Sicherheitsmaßnahmen zeigen.
Kürzlich hat OpenAI-Partner Microsoft eine verbesserte Version von ChatGPT vorgestellt. Mit OpenAIs iterativer Bereitstellung erleben wir eine neue Welle an KI-Technologien, die unsere Bedürfnisse verstehen und uns aktiv unterstützen.
Wenn du ganz neu bei Künstlicher Intelligenz bist, starte mit dem No-Code-Kurs AI Fundamentals. Er deckt die Grundlagen des Machine Learnings ab, von überwachtem und unüberwachtem Lernen über Deep Learning bis darüber hinaus.
GPT-4
Neben ChatGPT erwarten wir GPT-4, das fortschrittlichste große Sprachmodell. Im Greylock-Podcast hat OpenAI-CEO Sam Altman wenige Details zu GPT-4 verraten. Gerüchte auf Twitter seien falsch, es werde keine 100 Billionen Parameter haben, und die Leute würden geradezu darum bitten, enttäuscht zu werden. Zudem sagte er: "Wir werden GPT-4 veröffentlichen, wenn wir es für sicher und funktionsfähig halten".

Bild: Autorin/Autor
Was kannst du von GPT-4 erwarten?
- Die Modellgröße wird nicht viel über GPT-3 liegen.
- Optimierte große Modelle mit neuer Parametrisierung (μP).
- Training mit optimaler Rechenleistung, indem die Anzahl der Trainingstokens erhöht wird, um den minimalen Loss zu erreichen.
- Es wird ein reines Textmodell sein. GPT-4 ist nicht multimodal wie DALL-E 2.
- Möglicherweise nutzt es Sparsität, um Rechenkosten zu senken.
- Wie ChatGPT wird es stärker auf unsere Intentionen ausgerichtet sein und unsere Werte besser einhalten.
Lerne alles über GPT-1, GPT-2, GPT-3 und GPT-4 in unserem Beitrag Everything We Know About GPT-4 So Far.
Entwicklung sicherer AGI
Im Gespräch mit StrictlyVC gab Altman Einblicke, wie weit die Entwicklung von AGI (Artificial General Intelligence) ist.
Er sagte: „Je näher wir kommen, desto schwieriger ist die Antwort. Denn ich glaube, der Übergang wird viel unschärfer und gradueller, als viele denken.“
Er widerlegte auch Gerüchte über AGI. OpenAI verfüge nicht über eine AGI, die wie Menschen lernen kann.

Bild: Autorin/Autor
OpenAI ist auf einem guten Weg zur Entwicklung sicherer AGI, aber noch weit von Perfektion entfernt. Die vielzitierte AGI ist ein multimodales Modell, das Sprache, Text, Bild und Video versteht. Eine Kombination aus ChatGPT, DALLE-2, Whisper, einem Videogenerationsmodell und weiteren Reinforcement-Learning-Algorithmen.
Multimodale Modelle
Für AGI muss OpenAI an multimodalen Modellen arbeiten – nicht nur Text-zu-Bild, sondern auch Text-zu-Video sowie Audio-zu-Video und -Audio. Das bedeutet, du kannst mit einem natürlich klingenden und aussehenden Bot sprechen. Erste Ansätze gibt es bereits, etwa die KI-generierte Twitch-Streamer-Persona. Noch nicht perfekt, aber ein Anfang.
Während des StrictlyVC-Programms verriet Sam Altman, dass an einem Videomodell gearbeitet wird. Wir können annehmen, dass es sich um Text-zu-Video-Generierung mit Audiomodell handelt – eine weitere Komplexitätsebene. Es gibt bereits Videogenerationstechnologien, bei denen Entwickler Frames aus dem Stable-Diffusion-Modell überblenden.
Google AI
Google AI ist das Rückgrat des Google-Ökosystems. Es steckt in Google Maps, Fotos, Apps und Cloud. Google prägt die Entwicklung von KI-Tools und -Modellen maßgeblich. Die meisten Produkte sind in der Google Cloud verfügbar – von AutoML bis zu modernsten großen Sprach- und Vision-Modellen.
Zudem wurden zahlreiche Tools und State-of-the-Art-Modelle veröffentlicht, die NLP, Sprachverarbeitung und Computer Vision geprägt haben. Von TensorFlow bis BERT (Bidirectional Encoder Representations from Transformers) hat Google der KI- und Machine-Learning-Forschung und -Entwicklung neue Wege geebnet.

GIF aus LaMDA
2020 stellte Google Research Meena vor, ein neuronales Konversationsmodell, das Kontext versteht und sinnvoll antwortet. Danach kam LaMDA, ähnlich zu ChatGPT. Ein Durchbruch in Konversationstechnologie, aufgebaut auf Transformern und auf Dialogen trainiert.
Jedes Jahr bringt Google neue Technologien heraus. Künftig können wir eine weiterentwickelte Google-Suche erwarten, gestützt von AI Bard sowie Sprach-, Bild-, generativen und multimodalen Modellen, die KI vielseitig einsetzbar machen.
Google AI Bard
Nach dem Start von ChatGPT kursierten Gerüchte, es sei der „Google-Killer“. Die vertiefte Partnerschaft zwischen Microsoft und OpenAI machte das noch wahrscheinlicher. Microsoft ist bereit, Google im Suchgeschäft mit dem OpenAI-unterstützten Bing anzugreifen.
Als Reaktion darauf brachte Google seine eigene ChatGPT-Variante namens Google AI Bard heraus. Lies unseren Vergleich von ChatGPT und Google Bard in einem separaten Artikel.

GIF aus Bard and new AI features
In den jüngsten Google-AI-Updates stellte Sundar Pichai, CEO von Google und Alphabet, einen neuen experimentellen Konversationsdienst namens Bard vor, der von LaMDA angetrieben wird. Google hat ihn zunächst vertrauenswürdigen Testern zugänglich gemacht und kündigte eine baldige Öffnung für die breite Öffentlichkeit an.
Bard nutzt Informationen aus dem Web, um hochwertige Antworten zu liefern. Anders als das ChatGPT-Modell ist Bard ein Dienst, der Weltwissen mit Leistung, Intelligenz und Kreativität verbindet. Zunächst bringt Google eine schlanke LaMDA-Variante, später folgen stärkere Sprachmodelle.
Sprache, Vision und generative Modelle
Laut aktuellen Berichten von Google Research gab es Fortschritte bei Sprachtechnologien, Computer Vision und generativen Modellen.

Bild: Google AI
- Große Sprachmodelle: Pathways Language Model (PaLM) und LaMDA zeigen vielversprechende Ergebnisse. Künftig kannst du noch bessere Sprachmodelle für Konversations-KI und andere NLP-Aufgaben erwarten.
- Computer Vision: MaxViT (Multi-Axis Vision Transformer), Pix2Seq (Language-Modeling-Framework für Objekterkennung) sowie Fortschritte von 2D zu 3D mithilfe großer Motion-Frame-Interpolation.
- Bildgenerierung: Fortschrittliche fotorealistische Bildgeneratoren: Imagen (Diffusionsmodell) und Parti (autoregressive Transformer-Architektur). Beide generieren aus Texteingaben Bildpixel.
- Videogenerierung: 2022 arbeitete Google AI an Imagen Video und Phenaki. Imagen Video nutzt kaskadierte Diffusionsmodelle für hochauflösende Videos, während Phenaki mit offenen Textbeschreibungen variabel lange Videos erzeugt.
Starte deine Deep-Learning-(KI-)Karriere mit unserem Lernpfad Deep Learning in Python. Der Lernpfad umfasst vier Kurse und bringt dein Machine-Learning-Können auf das nächste Level.
Multimodale Modelle
Die meisten ML-Modelle konzentrieren sich auf eine einzelne Modalität (Textklassifikation, Bildsegmentierung oder Spracherkennung). Durch DALL-E 2 und Stable Diffusion rücken nun multimodale Modelle in den Fokus, um State-of-the-Art-Ergebnisse zu erzielen.
Google AI erreicht Multimodalität, indem Daten durch modalitätsspezifische Verarbeitungsschichten laufen und die Merkmale über eine Bottleneck-Schicht zusammengeführt werden. Die Kombination von Modalitäten kann auch die Leistung bei Einzelmodalitätsaufgaben steigern.

GIF aus Google AI
Einige der neuesten Forschungsarbeiten von Google AI zu multimodalen Modellen:
- Locked-image Tuning (LiT) erweitert bestehende vortrainierte Bildmodelle um Sprachverständnis.
- PaLI bewältigt viele Aufgaben in über 100 Sprachen, etwa visuelle Fragebeantwortung, Bildbeschreibung, Objekterkennung mit Übersetzung, Bildklassifikation und mehr.
- VDTTS: Visually-Driven-Text-to-Speech-Modell, das Text sowie Originalvideoframes einer Person nutzt und passende Sprachausgaben erzeugt – Timing und Emotion bleiben erhalten.
- Look and Talk ist eine multimodale Technologie, die Video und Audio als Eingaben nutzt, um Gespräche mit dem Google Assistant natürlicher zu machen. Das Modell lernt visuelle und akustische Signale, um besser zu erkennen, ob eine Person den Assistant anspricht oder nicht.
- 4D-Net kombiniert 3D-Punktwolkendaten aus autonomen Fahrzeugen mit weiteren Sensorsignalen, um Umgebung und Objekte besser zu verstehen und bessere Entscheidungen zu treffen.
Wir können davon ausgehen, dass diese Modelle künftig im Google-Ökosystem Einzug halten, um die Nutzung zu steigern und neue Produkte zu entwickeln.
KI und Data Science
Moderne KI lebt von Data Science, Algorithmen und Data Engineering. Um Technologien wie ChatGPT und LaMDA zu entwickeln, müssen wir bei den Grundlagen starten: Daten verarbeiten, NLP- und Reinforcement-Learning-Techniken anwenden, Deep-Learning-Algorithmen und Transformer verstehen und Modelle optimieren.
Starte deine Data-Science-Karriere mit dem Career Track Data Scientist with Python. Er vermittelt dir die wesentlichen Kompetenzen, um als professionelle:r Data Scientist durchzustarten.

Bild: Autorin/Autor
Kommen wir zur großen Frage: Wird KI Data Scientists, Analysts oder Engineers ersetzen? Die kurze Antwort lautet: „Nein.“ Vielleicht in ferner Zukunft – und selbst dann werden neue, kreativere, entscheidungsorientierte Jobs entstehen. Mit der Entwicklung der KI wachsen auch wir.
GitHub Copilot, DALL-E 2, ChatGPT und andere moderne Technologien sind da, um uns zu unterstützen. Sie sollen uns produktiver und effizienter machen.
Andrej Karpathy, früher Director of AI bei Tesla und OpenAI, sagt:
„Copilot hat mein Programmieren drastisch beschleunigt, es ist schwer vorstellbar, wieder zum „manuellen Programmieren“ zurückzukehren. Ich lerne noch, es zu nutzen, aber es schreibt bereits ~80% meines Codes, ~80% Genauigkeit. Ich programmiere kaum noch, ich prompt-e & editiere.“ - Twitter
Das zeigt: Viele, die die Technologie verstehen, werden sie nutzen, um bei Programmierung, Logik, Datenanalyse und Entscheidungen besser zu werden.
Wie können Data Scientists KI nutzen?
- Reale Daten generieren und gleichzeitig die Privatsphäre der Nutzenden wahren.
- Eleganten und effizienten Code schreiben.
- Produkte prototypisieren.
- Bessere Datenanalysen mit gezielten Prompts durchführen.
- Komplexe SQL-Abfragen in natürlicher Sprache erzeugen.
- Aussagekräftigere Reports für nicht-technische Stakeholder verfassen.
- Komplexe statistische Analysen mit Erklärungen durchführen.
- Neue Programmiersprachen, Kompetenzen, Frameworks und Konzepte lernen.
- KI-gestützte AutoML- und Modelloptimierungstools nutzen, um moderne ML-Lösungen zu bauen.
- Automatisierungsskripte erstellen, um Zeit zu sparen und Fehler zu vermeiden.
Eine neue Ära des KI-Fortschritts
Microsoft hat in Partnerschaft mit OpenAI ChatGPT in die neue Bing-Suche integriert – als Copilot für das Web. Damit hat ein neuer Wettlauf um die Technologieführerschaft begonnen.
Microsoft plant, ChatGPT und andere GPT-Modelle in sein Ökosystem zu integrieren. Das ändert vieles: Nutzende müssen die Anwendung nicht mehr verlassen. Sie können suchen, Inhalte einfügen, redigieren und Ideen entwickeln – einfach per Chat mit einem Bot.

Bing-Copilot-Demo
Auf dem Paris-Event stellte Google seine ChatGPT-Variante Bard vor, angetrieben von einer leichten LaMDA. Bard ähnelt Microsofts Copilot für das Web und ist ebenfalls in die Google-Suche integriert – mit ähnlichen Funktionen.
Die Schattenseiten des KI-Fortschritts
- Große Sprachmodelle wie GPT können für Desinformationskampagnen genutzt werden – openai.com. Das Potenzial für körperlichen und emotionalen Schaden ist real.
- KI-generierte Inhalte sind SEO-optimiert und schwerer zu erkennen. Lernende und Professionals nutzen sie, um scheinbar originäre Arbeiten zu erstellen, ohne Konzepte zu verstehen. Mehr zu Bildungsrisiken und -chancen in der OpenAI API-Doku.
- Urheberrechtsfragen sind real. Modelle wurden auf Online-Texten trainiert, teils urheberrechtlich geschützt. Man darf fremde Werke nicht einfach vereinnahmen, nur um KI-Fortschritt zu rechtfertigen.
- Mitunter liefert KI faktisch falsche Antworten. Das kann gravierende Folgen haben, wenn solche Modelle etwa in der Strafverfolgung eingesetzt werden.
Diese Probleme werden adressiert werden, und neue Gesetze werden die Nutzung von KI regulieren. Schulen und Content-Plattformen setzen bereits Richtlinien für KI-generierte Inhalte um.
Was können wir tun? Wir können diese Technologien verstehen lernen und sie verantwortungsvoll einsetzen. Starte mit dem Lernen von KI, zum Beispiel im Career Track Machine Learning Scientist with Python. Er vermittelt dir die Kernkompetenzen, um als AI Engineer einzusteigen.