Weiter zum Inhalt

Tiktoken-Tutorial: OpenAIs Python-Bibliothek zum Tokenisieren von Text

Tiktoken ist ein schneller BPE-Tokenizer von OpenAI. Er wird vor allem genutzt, um Tokens für große Sprachmodelle zu zählen und eine effiziente Textverarbeitung innerhalb vorgegebener Limits sicherzustellen.
Aktualisiert 18. Sept. 2026  · 5 Min. lesen

Mit KI erkunden

ChatGPTClaudePerplexity

Tokenisierung ist eine Grundaufgabe in der Arbeit mit NLP. Dabei wird Text in kleinere Einheiten zerlegt, sogenannte Tokens, die Wörter, Subwörter oder Zeichen sein können.

Effiziente Tokenisierung ist entscheidend für die Leistung von Sprachmodellen und damit ein wichtiger Schritt in vielen NLP-Aufgaben wie Textgenerierung, Übersetzung und Zusammenfassung.

Tiktoken ist eine schnelle, effiziente Tokenisierungsbibliothek von OpenAI. Sie bietet eine robuste Lösung, um Text in Tokens umzuwandeln und umgekehrt. Durch ihre Geschwindigkeit und Effizienz ist sie eine exzellente Wahl für Developer und Data Scientists, die mit großen Datensätzen und komplexen Modellen arbeiten.

Diese Anleitung richtet sich an Developer, Data Scientists und alle, die Tiktoken praktisch mit Beispielen nutzen möchten.

OpenAI Grundlagen

Benutze die OpenAI API und mehr!

Jetzt Starten

Erste Schritte mit Tiktoken

Um Tiktoken zu nutzen, installieren wir es zunächst in unserer Python-Umgebung (Tiktoken ist auch für andere Programmiersprachen verfügbar). Das geht mit folgendem Befehl:

pip install tiktoken

Den Code der Open-Source-Python-Version von Tiktoken findest du im folgenden GitHub-Repo.

Zum Import der Bibliothek führen wir aus:

import tiktoken

Encoding-Modelle

Encoding-Modelle in Tiktoken legen die Regeln fest, nach denen Text in Tokens zerlegt wird. Sie sind zentral, weil sie bestimmen, wie Text aufgeteilt und codiert wird und damit Effizienz und Genauigkeit von Sprachverarbeitungsaufgaben beeinflussen. Verschiedene OpenAI-Modelle verwenden unterschiedliche Encodings.

Tiktoken bietet drei Encoding-Modelle, optimiert für verschiedene Anwendungsfälle:

  • o200k_base: Encoding für das neueste GPT-4o-Mini-Modell.
  • cl100k_base: Encoding-Modell für neuere OpenAI-Modelle wie GPT-4 und GPT-3.5-Turbo.
  • p50k_base: Encoding für Codex-Modelle, die in Code-Anwendungen eingesetzt werden.
  • r50k_base: Älteres Encoding für verschiedene GPT-3-Versionen.

Alle diese Modelle sind über die OpenAI-API verfügbar. Die API bietet deutlich mehr Modelle, als hier aufgeführt sind. Zum Glück stellt Tiktoken eine einfache Möglichkeit bereit, um zu prüfen, welches Encoding zu welchem Modell passt.

Wenn ich zum Beispiel wissen möchte, welches Encoding das Modell text-embedding-3-small verwendet, kann ich folgenden Befehl ausführen und erhalte die Antwort als Ausgabe:

print(tiktoken.encoding_for_model('text-embedding-3-small'))

Als Ausgabe erhalten wir <Encoding 'cl100k_base'>. Bevor wir direkt mit Tiktoken arbeiten, noch der Hinweis: OpenAI stellt eine Tokenisierungs-Web-App bereit, in der du sehen kannst, wie unterschiedliche Strings tokenisiert werden—du findest sie hier. Es gibt außerdem einen externen Online-Tokenizer, Tiktokenizer, der auch nicht-OpenAI-Modelle unterstützt.

Text in Tokens encodieren

Um Text mit Tiktoken in Tokens zu encodieren, brauchst du zunächst ein Encoding-Objekt. Es gibt zwei Wege zur Initialisierung. Erstens über den Namen des Tokenizers:

encoding = tiktoken.get_encoding("[name of the tokenizer]")

Oder du nutzt die bereits erwähnte Funktion encoding_for_model, um den Encoder für ein bestimmtes Modell zu erhalten:

encoding = tiktoken.encoding_for_model("[name of the model]")

Jetzt können wir die Methode encode unseres encoding-Objekts aufrufen, um einen String zu encodieren. Beispielsweise encodieren wir den String „I love DataCamp“ wie folgt—hier nutze ich den Encoder cl100k_base:

print(encoding.encode("I love DataCamp"))

Als Ausgabe erhalten wir [40, 3021, 2956, 34955].

Tokens in Text decodieren

Um Tokens zurück in Text zu decodieren, nutzen wir die Methode .decode() auf dem encoding-Objekt.

Decodieren wir zum Beispiel die Tokens [40, 4048, 264, 2763, 505, 2956, 34955]:

print(encoding.decode([40, 4048, 264, 2763, 505, 2956, 34955]))

Die Tokens decodieren zu „I learn a lot from DataCamp.“

Praxisanwendungen und Tipps

Neben Encodieren und Decodieren gibt es zwei weitere naheliegende Anwendungsfälle.

Kostenschätzung und -steuerung

Wenn du die Tokenanzahl vor dem Senden einer Anfrage an die OpenAI-API kennst, kannst du deine Kosten besser steuern. Da die Abrechnung von OpenAI auf der Zahl verarbeiteter Tokens basiert, ermöglicht dir die Vor-Tokenisierung eine Schätzung deiner API-Kosten. So zählst du die Tokens in deinem Text mit Tiktoken:

tokens = encoding.encode(text)
print(len(tokens))

Wir prüfen einfach die Länge des Arrays, um zu sehen, wie viele Tokens entstanden sind. Wenn du die Tokenanzahl im Voraus kennst, kannst du entscheiden, ob du den Text kürzen oder deine Nutzung anpassen willst, um im Budget zu bleiben.

Mehr dazu findest du in diesem Tutorial: Estimating The Cost of GPT Using The tiktoken Library in Python.

Eingabelängen prüfen

Bei der Nutzung von OpenAI-Modellen über die API bist du durch maximale Tokenzahlen für Eingaben und Ausgaben begrenzt. Wenn du diese Limits überschreitest, kommt es zu Fehlern oder abgeschnittenen Ausgaben. Mit Tiktoken kannst du die Eingabelänge validieren und sicherstellen, dass sie innerhalb der Tokenlimits bleibt.

Fazit

Tiktoken ist eine Open-Source-Tokenisierungsbibliothek, die Geschwindigkeit und Effizienz für OpenAIs Sprachmodelle bietet.

Wenn du verstehst, wie man Text mit Tiktoken encodiert und decodiert und welche Encoding-Modelle es gibt, verbessert das deine Arbeit mit großen Sprachmodellen deutlich.

Verdiene eine Top-KI-Zertifizierung

Zeige, dass du KI effektiv und verantwortungsbewusst einsetzen kannst.

Dimitri Didmanidze's photo
Author
Dimitri Didmanidze
LinkedIn
Ich bin Dimitri Didmanidze, ein Datenwissenschaftler, der zurzeit einen Master in Mathematik mit dem Schwerpunkt Maschinelles Lernen macht. Auf meinem akademischen Weg habe ich auch über die Möglichkeiten transformatorischer Modelle geforscht und an der Universität gelehrt, was mein Verständnis für komplexe theoretische Konzepte bereichert hat. Ich habe auch im Bankensektor gearbeitet, wo ich diese Prinzipien angewendet habe, um reale Datenherausforderungen zu bewältigen.
Themen
Künstliche Intelligenz

Lerne KI mit diesen Kursen!

Kurs

Einführung in Embeddings mit der OpenAI API

3 Std.
23.2K
Schalte fortgeschrittene KI-Anwendungen wie semantische Suche und Empfehlungsmaschinen mit dem Einbettungsmodell von OpenAI frei!
Details anzeigenRight Arrow
Kurs Starten
Mehr anzeigenRight Arrow