Kurs

KI-Agenten wie Auto-GPT, AgentGPT und BabyAGI sind der nächste Evolutionsschritt in der rasant fortschreitenden KI-Welt. ChatGPT hat generative KI Ende 2022 in den Mainstream gebracht, benötigt aber menschliche Prompts. Die Idee hinter KI-Agenten ist, dass die KI mit minimalem oder ganz ohne menschlichen Input eigenständig auf ein Ziel hinarbeitet.
Viele Entwicklerinnen und Entwickler haben das Potenzial dieser neuen Technologie erkannt. Misst man es an der Zahl der GitHub-Sterne (vergleichbar mit dem Favorisieren eines Softwareprojekts), ist Auto-GPT das am schnellsten wachsende Open-Source-Projekt der Geschichte. In den sechs Wochen seit dem Start hat es 107.000 Sterne gesammelt. Zum Vergleich: pandas, das beliebteste Python-Paket für Data Science, hat 38.000 Sterne.
Dieses Tutorial erklärt, was KI-Agenten sind, wie sie mit großen Sprachmodellen wie GPT zusammenhängen und wie sie eingesetzt werden können. Vorab ist es hilfreich zu wissen, was ein großes Sprachmodell ist. A Beginner's Guide to GPT-3 ist ein guter Einstieg. Außerdem empfehle ich unseren neuen Kurs Introduction to AI Agents, um alles über KI-Agenten und ihre praktische Nutzung zu lernen.
Einführung in KI-Agenten
Wie hängen KI-Agenten mit ChatGPT zusammen?
Um KI-Agenten zu erklären, braucht es etwas Fachjargon. Hier sind die wichtigsten Begriffe:
- Ein Large Language Model (LLM) ist ein Typ von Machine-Learning-Modell, das Texte generiert.
- OpenAIs GPT ist aktuell das populärste LLM. Die neueste Version ist GPT-4, die Vorgängerversion GPT-3.5-turbo ist weiterhin im Einsatz.
- Chatten bezeichnet den Ablauf, bei dem du einen Textprompt an die KI schickst und eine Textantwort erhältst.
- Embedding ist ein Ablauf, bei dem du einen Textprompt an die KI schickst und als Antwort eine numerische Repräsentation des Textes erhältst. Diese Zahlenrepräsentation ist nützlich für Suche, Empfehlungen und Klassifikation.
- OpenAIs ChatGPT ist eine Webanwendung mit einer bequemen Oberfläche für Unterhaltungen mit GPT.
So wie ChatGPT eine Web-App ist, die vom GPT-LLM angetrieben wird, sind die drei hier behandelten KI-Agenten ebenfalls Anwendungen, die auf GPT basieren.
Das Hauptproblem, das diese KI-Agenten lösen wollen, ist, den menschlichen Aufwand zu reduzieren, der nötig ist, damit die KI eine Aufgabe abschließt.
AgentGPT und BabyAGI sind im Grunde "GPT in einer Schleife": GPT wird wiederholt aufgerufen, um die Anfrage der Nutzerin bzw. des Nutzers in lösbare Teilprobleme zu zerlegen, und die Ergebnisse jeder Stufe werden verfeinert, bis jede Teilaufgabe erfolgreich abgeschlossen ist.
Auto-GPT geht noch einen Schritt weiter, indem es dem KI-Agenten Internetzugang und die Fähigkeit zum Ausführen von Code gibt. So kann er eine größere Bandbreite an Problemen lösen.
Die folgenden Innovationen sind besonders spannend.
Langzeitgedächtnis
LLMs generieren Wörter basierend auf den vorangegangenen Wörtern im Gespräch (sowohl Nutzerprompts als auch KI-Antworten). Allerdings haben LLMs ein eher kurzes Gedächtnis: Viele Modelle behalten nur ein paar hundert Wörter, und das aktuelle Spitzenmodell GPT-4 merkt sich standardmäßig etwa 6000 Wörter. Überschreitet die Unterhaltung diese Länge, können die Antworten inkonsistent werden.
Für die meisten Anwendungsfälle ist das kein Problem. In manchen Fällen ist es jedoch entscheidend, dass die gesamte Unterhaltung — und vielleicht sogar frühere Gespräche — erhalten bleibt. Chatbots und ihre weiterentwickelten Verwandten, KI-Agenten, sind gute Beispiele dafür.
Ein Gedächtnis für den KI-Agenten wird über einen Embedding-Workflow umgesetzt, der den Gesprächstext als Zahlen speichert. Jeder Prompt und jede Antwort werden als Vektor abgelegt, der die Bedeutung des Textes repräsentiert.
Diese Zahlenvektoren landen in einer Vektordatenbank. Aktuell nutzen Auto-GPT und BabyAGI Pinecone (den führenden Anbieter in diesem Bereich), und das AgentGPT-Team arbeitet daran, diese Fähigkeit zu integrieren.
Webbrowsing-Fähigkeiten
Fragst du ChatGPT nach aktuellen Ereignissen, erklärt es, dass es nur bis September 2021 trainiert wurde. Auch das ist für viele Anwendungen kein Problem, führt aber zu Einschränkungen, wenn es um aktuelle Informationen geht.
Eine Lösung ist, der KI Browsing-Fähigkeiten zu geben, damit sie selbständig im Internet recherchieren kann.
Auto-GPT kann über die Google-Search-API eigene Recherchen durchführen.
Diese Funktion ist umstritten: Die Entwickler von AgentGPT und BabyAGI haben sie derzeit nicht integriert und beschränken das Wissen der KI bewusst auf das, was GPT bereits kann.
Code ausführen
LLMs wie GPT können zwar Code von Grund auf generieren sowie vorhandenen Code debuggen oder verbessern, ihn aber nicht selbst ausführen.
Auto-GPT kann Shell- und Python-Code ausführen. Das heißt, es kann Code schreiben und direkt laufen lassen.
Das ermöglicht etwas besonders Mächtiges: Der Agent kann den Code schreiben, um mit anderer Software zu interagieren, und ihn dann ausführen. So kann er Aufgaben erledigen, indem er andere Tools nutzt.
Wofür lassen sich KI-Agenten einsetzen?
Wir stehen noch ganz am Anfang, was die Nutzung von KI-Agenten angeht. Viele Beispiele sind Varianten eines automatisierten persönlichen Assistenten, also eine Next-Gen-Version des IBM Watson Assistant.
Udit Goenka, CEO von FirstSales.io, postete auf Twitter, dass er mit Auto-GPT eine Prospecting-Engine gebaut hat. Der Screenshot zeigt, wie der Agent einen Plan erstellt, um Unternehmen zu finden, die im letzten Jahr Seed-Kapital aufgenommen haben (also voraussichtlich über ausreichend Mittel verfügen), und beschreibt die Details zur Erstellung der Liste (Extraktion von Firmennamen und URLs).

Yew Jin Lim, Softwareingenieur bei Google, berichtete, dass er mit Auto-GPT einen E-Mail-Assistenten erstellt hat (Github-Repo). Das Video zeigt, wie Yew Jin dem Agenten per E-Mail eine Aufgabe schickt und der Agent z. B. einen Termin in seinen Kalender einträgt.
Welche Risiken und Grenzen haben KI-Agenten?
Die gängige Empfehlung beim Arbeiten mit KI lautet: Die meisten Aufgaben gelingen besser mit einem Menschen in der Schleife, der prüft, was die KI tut. Denk daran: Die KI ist ein Assistent, kein Experte (und ein Assistent, der gelegentlich halluziniert). Folgende Hinweise solltest du beachten.
Durchgängig laufende KI kann teuer werden
Ein einzelner Aufruf von GPT über die OpenAI-API ist recht günstig (typischerweise weniger als 1 US-Cent für GPT-3.5, je nach Ausgabelänge; GPT-4 ist teurer). Für komplexe Aufgaben mit den hier besprochenen KI-Agenten können jedoch Hunderte oder Tausende API-Calls anfallen.
Es ist sinnvoll, Haltepunkte einzubauen, an denen eine Person die Erlaubnis für das Weitermachen gibt.
Auto-GPT Zugang zu Software zu geben, kann gefährlich sein
Auto-GPT kann Zugriff auf beliebige APIs erhalten. Wenn du ihm ermöglichst, automatisch in deinem Namen Aktien zu kaufen, musst du damit rechnen, dein gesamtes Guthaben zu verlieren. Ebenso ist es keine gute Idee, ihm Schreibzugriff auf eure Firmendatenbank zu geben.
Jenseits persönlicher oder unternehmerischer Verluste argumentieren einige KI-Forschende, dass fortgeschrittene KI große oder sogar existenzielle Risiken birgt. Während erste Versuche, mit Auto-GPT die Menschheit zu vernichten, erfolglos waren, lohnt sich die Warnung von Eliezer Yudkowsky, Senior Research Fellow am Machine Intelligence Research Institute.
Um dir eine feindliche übermenschliche KI vorzustellen, denke nicht an einen trockenen, nur buchklugen Denker, der im Internet wohnt und böswillige E-Mails verschickt. Stell dir eine ganze fremdartige Zivilisation vor, die millionenfach schneller denkt als Menschen, zunächst auf Computer beschränkt — in einer Welt von Wesen, die aus ihrer Sicht sehr dumm und sehr langsam sind. Eine hinreichend intelligente KI bleibt nicht lange auf Computer beschränkt. In der heutigen Welt kannst du DNA-Sequenzen an Labore mailen, die Proteine on demand herstellen — damit könnte eine KI, die anfangs nur im Internet lebt, künstliche Lebensformen bauen oder direkt zu postbiologischer molekularer Fertigung übergehen.
Wenn heute jemand eine zu mächtige KI baut, rechne ich unter den aktuellen Bedingungen damit, dass kurz darauf jedes einzelne Mitglied der menschlichen Spezies und alles biologische Leben auf der Erde stirbt.
Auch wenn das klar ein Worst-Case-Szenario ist, solltest du im Blick behalten, welche Gefahren eine entfesselte KI mit sich bringen könnte.
Wie bekomme ich Zugriff auf einen KI-Agenten?
Wenn du diese KI-Agenten selbst ausprobieren möchtest, gibt es mehrere Websites, auf denen du die Technik testen kannst. Für den ernsthaften Einsatz solltest du sie auf deiner bevorzugten Entwicklungsplattform installieren.
Welchen Agenten du auch nutzt und wie auch immer du ihn einsetzen willst: Du brauchst einen OpenAI-API-Schlüssel. Eine Anleitung findest du im Tutorial Using GPT-3.5 and GPT-4 via the OpenAI API in Python.
Beachte: Die Installation dieser KI-Agenten erfolgt über die Kommandozeile und erfordert in ihrem aktuellen Zustand etwas Aufwand.
Web-Oberflächen
Die KI-Plattform Hugging Face stellt eine gehostete Version von Auto-GPT bereit. Du musst nur deinen OpenAI-API-Schlüssel angeben, dann der KI eine Rolle und Ziele zuweisen.
God Mode (benannt nach einem Cheat-Modus in Videospielen) erlaubt ähnlich, deinen OpenAI-API-Schlüssel einzugeben und Auto-GPT einfach eine Aufgabe zu geben.
Für Replit-Nutzer kannst du auch dieses Repl forken und deinen OpenAI-API-Schlüssel hinterlegen.
Das AgentGPT-Team stellt eine Demo-Version seines KI-Agenten bereit; die kostenlose Variante beendet sich allerdings nach etwa zwei Minuten.
Aktuell gibt es keine gehostete Version von BabyAGI, die ich gefunden hätte.
Auto-GPT installieren
Auto-GPT ist eine Kommandozeilen-Anwendung und erfordert in seinem aktuellen Zustand etwas Einrichtung. In der ausführlichen Setup-Dokumentation findest du Hilfe für den Start.
Diese Anleitung setzt voraus, dass du Zugriff auf eine Shell (z. B. bash oder zsh) hast und git sowie Python installiert sind.
Auto-GPT-Repository klonen
Klonen das Auto-GPT-Repository im Terminal.
git clone https://github.com/Significant-Gravitas/Auto-GPT.git
Wechsle in das soeben erstellte Verzeichnis Auto-GPT und checke den Stable-Branch aus.
cd Auto-GPT
git checkout stable
API-Schlüssel besorgen
Auto-GPT erfordert einen OpenAI-API-Schlüssel (für den Kontakt zu GPT). Ein kostenloses Konto erlaubt nur 3 API-Calls pro Minute und ist damit für Auto-GPT ungeeignet, also brauchst du ein bezahltes Konto. Eine Anleitung findest du im Tutorial Using GPT-3.5 and GPT-4 via the OpenAI API in Python.
Optional kannst du die Pinecone-API (für Speicher), die ElevenLabs-API (für eine Sprachschnittstelle), die Google-API (für Suche) und die Twitter-API (um das Gebaute zu promoten) nutzen.
Auto-GPT konfigurieren
Auto-GPT speichert alle API-Schlüssel in einer Konfigurationsdatei namens .env.
Beachte, dass die Ablage von API-Schlüsseln im Klartext schlechte Sicherheitspraxis ist. Führe Auto-GPT daher nur in einer sicheren Umgebung aus (z. B. lokal), oder entwerte deine Schlüssel nach der Nutzung.
Erstelle eine Kopie der Datei .env.template und benenne sie in .env um.
Suche im Texteditor die Zeile, die mit OPENAI_API_KEY= beginnt, und füge deinen OpenAI-API-Schlüssel ohne Leerzeichen oder Anführungszeichen ein.
Füge weitere API-Schlüssel im gleichen key=value-Format hinzu.
Auto-GPT ausführen
Auto-GPT wird über das Shell-Skript run.sh gestartet (run.bat unter Windows).
Mit dem Argument --help erhältst du eine Hilfeübersicht.
sh run.sh --help
Beachte, dass das Skript vor der Anzeige der Nutzungshinweise umfangreiche Versionsprüfungen für Python-Pakete durchführt.
Um einen Auto-GPT-Assistenten zu starten, rufe denselben Befehl ohne Help-Argument auf.
sh run.sh
Nach den Paketprüfungen fragt dich Auto-GPT nach drei Dingen:
- Gib deinem KI-Assistenten einen Namen.
- Beschreibe die Rolle deiner KI.
- Formuliere bis zu fünf Ziele, die der Assistent erreichen soll.
AgentGPT installieren
AgentGPT beschreibt den Einstieg kurz in der README seines GitHub-Repos.
AgentGPT-Repository klonen
Klonen das AgentGPT-Repository im Terminal.
git clone https://github.com/reworkd/AgentGPT.git
Wechsle in das soeben erstellte Verzeichnis AgentGPT.
cd AgentGPT
Setup-Skript ausführen
Es gibt ein Bash-Skript, das den Agenten einrichtet.
bash setup.sh --local
Als Erstes wirst du aufgefordert, deinen OpenAI-API-Schlüssel einzugeben und mit ENTER zu bestätigen.
Eventuell wirst du um Zugriff auf deine Desktop-Dateien und um die Annahme eingehender Netzwerkverbindungen gebeten. Bestätige dies.
Nach wenigen Sekunden solltest du eine Meldung ähnlich der folgenden sehen:
ready - started server on 0.0.0.0:3000, url: http://localhost:3000
Kopiere die URL und füge sie in die Adresszeile deines Browsers ein. AgentGPT öffnet sich mit einer Willkommensnachricht.

Agenten starten
Gib deinem Agenten einen Namen und ein Ziel und klicke dann auf "Deploy Agent".

BabyAGI installieren
BabyAGI hat eine (sehr knappe) Dokumentation in der README seines GitHub-Repos.
BabyAGI-Repository klonen
Klonen das BabyAGI-Repository im Terminal.
git clone https://github.com/yoheinakajima/babyagi.git
Wechsle in das soeben erstellte Verzeichnis BabyAGI.
cd BabyAGI
Erforderliche Python-Pakete installieren
Installiere mit pip die Pakete, die für BabyAGI benötigt werden.
pip install -r requirements.txt
BabyAGI konfigurieren
Erstelle eine Konfigurationsdatei namens .env.
cp .env.example .env
Bearbeite die Konfigurationsdatei. Du kannst jeden Terminal-Editor verwenden; hier nutzen wir vim.
vim .env
Drücke i, um Text einzufügen.
- Hänge in der Zeile mit
OPENAI_API_KEY=deinen OpenAI-API-Schlüssel an. - Gib in der Zeile mit
INSTANCE_NAME=optional deinem Agenten einen Namen. - Lege in der Zeile mit
OBJECTIVE=das Ziel deines Agenten fest.
BabyAGI ausführen
Starte das BabyAGI-Skript.
python3 babyagi.py
Auto-GPT-Beispiel
Als Test habe ich meinen KI-Assistenten "Jeff" genannt, ihn als "Data-Science-Experten, der Tutorials über KI schreibt" beschrieben und ihm das Ziel gegeben, ein "Tutorial über Auto-GPT zu schreiben".

Auto-GPT fragt dich regelmäßig um Erlaubnis für den nächsten Schritt, etwa um im Internet weiter zu recherchieren oder eine Datei zu schreiben. Drücke „y“, um fortzufahren, oder gib Feedback als Text.
Nach ein paar Minuten hat Auto-GPT versucht, ein Tutorial zu schreiben, und diese Datei erzeugt.

Das Ergebnis ist weder gut noch faktisch korrekt. Wie immer gilt: Sei sehr präzise in deinen Prompts und verfolge genau, was die KI tut.
Mach den nächsten Schritt
KI-Agenten wie Auto-GPT, AgentGPT und BabyAGI sind ein großer Sprung nach vorn und bringen uns der Vision wirklich autonomer KI-Systeme näher. Weil sie mit minimalem menschlichen Eingriff auf Ziele hinarbeiten, eröffnen sie ein breites Feld an Anwendungen — von persönlichen Assistenten bis zu Problemlösern.
Um in diesem dynamischen Umfeld die Nase vorn zu behalten, lohnt es sich, dein Wissen und deine Kompetenzen in Data Science, Machine Learning und KI auszubauen. Schau dir diese Ressourcen an:
Einführung in den ChatGPT-Kurs
Beginne mit ChatGPT
Richie hilft Einzelpersonen und Organisationen dabei, Daten und KI besser zu nutzen. Er war schon Datenwissenschaftler, bevor es Data Science hieß, und hat zwei Bücher geschrieben und viele DataCamp-Kurse zu diesem Thema veranstaltet. Er ist Gastgeber des DataFramed-Podcasts und leitet das DataCamp-Webinarprogramm.
FAQs
Worin unterscheidet sich ChatGPT von KI-Agenten wie Auto-GPT?
ChatGPT ist für Human-in-the-Loop-Interaktionen ausgelegt: Eine Person gibt Prompts ein und erhält Antworten. KI-Agenten wie Auto-GPT hingegen arbeiten autonom auf ein definiertes Ziel hin und nutzen dafür oft Schleifen, Gedächtnis und externe Tools wie Webbrowser oder Codeausführung, um Aufgaben mit wenig bis keinem weiteren menschlichen Input zu erledigen.
Brauche ich Programmierkenntnisse, um KI-Agenten zu nutzen?
Grundkenntnisse in Kommandozeile, Python und dem Umgang mit API-Schlüsseln sind in der Regel erforderlich, um KI-Agenten wie Auto-GPT oder BabyAGI zu installieren und auszuführen. Einige Plattformen (wie Hugging Face oder God Mode) bieten benutzerfreundlichere Oberflächen, aber um die volle Leistungsfähigkeit zu nutzen, ist häufig eine manuelle Konfiguration und Einrichtung nötig.
Können KI-Agenten im Web surfen und Echtzeitdaten abrufen?
Ja, einige KI-Agenten wie Auto-GPT können über APIs wie Google Search auf das Internet zugreifen und Echtzeitdaten abrufen. Diese Fähigkeit wird jedoch mitunter bewusst weggelassen (z. B. bei AgentGPT und BabyAGI) — aus Gründen der Sicherheit, der Kosten oder der Zuverlässigkeit.

