Kurs

Auf dem OpenAI Dev Day hat das Unternehmen mehrere Neuerungen vorgestellt, darunter eine neue Assistants API. Details zu den anderen Ankündigungen findest du in den Artikeln zu GPT-4 Turbo und GPTs und dem GPT Store.
Die Assistants API erweitert die bestehende OpenAI API und macht es Softwareentwicklerinnen und -entwicklern leichter, KI-Assistenten wie Chatbots zu bauen.
Vier neue Funktionen wurden angekündigt:
- „Threads“ für besseres Management längerer Gespräche
- „Retrieval“, um zusätzliche Texte zu speichern
- Integrierte Code-Interpretation
- Verbesserungen beim Function Calling.
Wichtige Funktionen der Assistants API
Im Folgenden schauen wir uns jede dieser Funktionen genauer an.
Einfacheres Gesprächsmanagement mit Threads
Einige Aufgaben lassen sich mit einer einzigen Eingabe an die API und einer einzelnen Antwort erledigen, doch Chatbots brauchen längere Unterhaltungen (oder „Threads“). Bisher mussten Entwicklerinnen und Entwickler selbst den Gesprächsverlauf nachhalten und entscheiden, welche früheren Nachrichten sie an die API schicken. Je länger das Gespräch, desto mehr Text muss pro API-Call gesendet werden – das bremst die Performance.
Sobald die Unterhaltung außerdem das „Kontextfenster“ überschreitet (also die Textmenge, die GPT auf einmal im Blick behalten kann), müssen Entscheidungen getroffen werden: Alte Nachrichten verwerfen, zusammenfassen oder extern speichern und später entscheiden, was relevant ist? Das wird schnell fummelig und verzögert die Entwicklung.
Die neuen Threading-Tools machen aus dem bislang „zustandslosen“ Modell (ohne Gedächtnis) ein „zustandsbehaftetes“. Frühere Nachrichten können direkt bei OpenAI gespeichert werden, sodass sich Entwicklerinnen und Entwickler nicht mehr um diese Verwaltungsdetails kümmern müssen.
Retrieval-Tools zum Speichern zusätzlicher Texte
In der OpenAI-Präsentation wurden außerdem Retrieval-Tools zum Speichern von Texten erwähnt. Das wurde als eigene Funktion präsentiert, wobei unklar ist, wie stark sie sich vom Threading abgrenzt, da Threads offenbar darauf aufsetzen.
Technische Details waren rar, aber man kann erahnen, wie es funktioniert. Aktuell benötigen Anwendungen mit generativer KI zwei Technologien: ein Large Language Model (LLM) wie GPT und eine Vektordatenbank.
Vektordatenbanken speichern Texte (oder Bilder und andere unstrukturierte Datentypen) als numerische Vektoren mittels Embeddings. Diese Textstücke lassen sich später abrufen und in Prompts einbinden. Ein typischer Anwendungsfall ist ein Wissensspeicher mit faktenbasierten Inhalten zum jeweiligen Thema.
Wenn du zum Beispiel einen Chatbot baust, der Fragen zu den Produkten deines Unternehmens beantwortet, kannst du die Produktinformationen in der Vektordatenbank speichern und so sicherstellen, dass das LLM korrekte Fakten liefert.
Die in der Präsentation erwähnten Retrieval-Funktionen deuten darauf hin, dass die Assistants API einen API-Zugriff auf eine Vektordatenbank bieten könnte. Das eröffnet interessante Möglichkeiten über längere Gespräche hinaus, denn so bräuchtest du keine separate Vektordatenbank wie Pinecone, Milvus oder Weaviate, um deine Texte zu speichern.
Das ist derzeit noch Spekulation, und wir müssen auf konkrete Details zur Assistants API warten.
Code-Interpretation ist integriert
ChatGPT bietet mit Advanced Data Analysis ein Tool, das GPT ermöglicht, auf Basis natürlicher Sprache Python-Code zu generieren und auszuführen. In der OpenAI-Präsentation waren die Details zwar vage, es klang jedoch so, als wäre diese Funktion in die Assistants API integriert – du kannst also Prompts formulieren, die GPT Python-Code ausführen lassen.
Verbessertes Function Calling für leichtere Software-Integration
Die Function-Calling-Funktion der API erlaubt es dir, eine Anweisung in natürlicher Sprache zu schreiben und von GPT einen JSON-String zurückzugeben, der einen Aufruf an eine von dir definierte Funktion repräsentiert. Das ist wichtig für KI-Agenten, die Aufgaben auf Basis natürlicher Sprache ausführen sollen.
Die Ankündigung beschreibt zwei Verbesserungen. Erstens gibt es einen „JSON-Modus“, in dem die Antwort garantiert gültiges JSON ist und sich enger an die vorgegebene Funktionssignatur hält. Bisher bestand die Gefahr, dass Antworten ungültig sind und du aufwendige Fehlerbehandlung einbauen musstest.
Die neuen Möglichkeiten vereinfachen die Entwicklung von KI-Agenten und machen es leichter, natürliche Sprachschnittstellen zu Software zu bauen.
Fazit
Die generative-KI-Revolution 2023 war beeindruckend, doch um generative KI in Software zu integrieren, war bislang viel Engineering-Know-how nötig. Die Assistants API verspricht, diese Einstiegshürde zu senken – und ermöglicht es mehr Produkten, die Technologie schneller zu nutzen.
Weiterlernen
DataCamp bietet mehrere Kurse, die dir zeigen, wie du die OpenAI API nutzt. Starte mit Working with the OpenAI API und mach weiter mit Introduction to Embeddings with the OpenAI API.
Außerdem lernst du die Function-Calling-API im OpenAI Function Calling Tutorial kennen.