Kurs
Mistral hat Pixtral 12B veröffentlicht, ein Open-Source-Large Language Model (LLM) mit 12 Milliarden Parametern. Es ist Mistrals erstes multimodales Modell, das sowohl Text als auch Bilder verarbeiten kann.
Darum ist Pixtral eine starke Ergänzung in der LLM-Landschaft:
- Es verarbeitet Bilder aller Größen ohne Vorverarbeitung effizient.
- Ein 128K-Context-Window erlaubt komplexe Prompts und viele Bilder.
- Starke Performance bei reinen Text- und multimodalen Aufgaben.
- Kostenlos für nicht monetarisierte Projekte – ideal für Forschung und Hobbyprojekte.
- Open Source unter der Apache-2.0-Lizenz und damit ein Beitrag zur Demokratisierung von KI.
In diesem Tutorial bekommst du viele Beispiele und Schritt-für-Schritt-Anleitungen zur Nutzung von Pixtral über die Web-Chat-Oberfläche Le Chat und programmatisch über die API. Zunächst schauen wir uns jedoch die wichtigsten theoretischen Grundlagen von Pixtral an.
Was ist Pixtral 12B?
Mistral AI hat Pixtral 12B vorgestellt, ein Modell, das Bilder und Text gemeinsam verarbeiten kann. Mit 12 Milliarden Parametern bewältigt es Aufgaben, die eine Kombination aus visuellen und sprachlichen Elementen erfordern, etwa das Interpretieren von Diagrammen, Dokumenten oder Grafiken.
Es eignet sich für Umgebungen, in denen ein tiefes Verständnis beider Formate gefragt ist.
Ein zentrales Feature von Pixtral 12B ist die Fähigkeit, mehrere Bilder in einer Eingabe in nativer Auflösung zu verarbeiten. Das Modell verfügt über ein Kontextfenster von 128.000 Tokens und kann dadurch lange, komplexe Dokumente, Bilder oder mehrere Datenquellen gleichzeitig analysieren. Das ist beispielsweise für Finanzberichte oder das Scannen von Geschäftsdokumenten hilfreich.
Pixtrals Benchmarks
Pixtral schneidet bei Aufgaben zu multimodalem Wissen und Reasoning gut ab, insbesondere im MathVista-Test, wo es führend ist. Auch in multimodalen QA-Aufgaben behauptet es sich, vor allem in ChartQA.

Quelle: Mistral AI
Bei Instruction-Following und rein textbasierten Aufgaben zeigen jedoch andere Modelle wie Claude-3 Haiku und Gemini Flash-8B eine vergleichbare oder bessere Leistung. Das deutet darauf hin, dass Pixtral 12B vor allem in multimodalen und visuellen Reasoning-Aufgaben überzeugt, aber nicht zwingend bei reinen Textaufgaben dominiert.
Pixtrals Architektur
Die Architektur von Pixtral 12B ist darauf ausgelegt, Text und Bilder gleichzeitig zu verarbeiten. Sie besteht aus zwei Hauptkomponenten: einem Vision-Encoder und einem Multimodal-Transformer-Decoder.
Der Vision-Encoder mit 400 Millionen Parametern ist speziell darauf trainiert, Bilder unterschiedlicher Größen und Auflösungen zu verarbeiten.

Quelle: Mistral AI
Die zweite Komponente, der Multimodal-Transformer-Decoder, ist mit 12 Milliarden Parametern deutlich umfangreicher. Er basiert auf der bestehenden Mistral-Nemo-Architektur und sagt das nächste Text-Token in Sequenzen vorher, die Text und Bilddaten verknüpfen.
Dieser Decoder kann sehr lange Kontexte (bis zu 128k Tokens) verarbeiten und damit zahlreiche Bild- sowie umfangreiche Texttokens in großen Dokumenten handhaben.

Quelle: Mistral AI
Diese kombinierte Architektur ermöglicht es Pixtral, eine große Bandbreite an Bildgrößen und -formaten zu bewältigen und hochauflösende Bilder ohne Kontextverlust in konsistente Tokens zu übersetzen.
So nutzt du Pixtral in Le Chat
Am einfachsten greifst du kostenlos über Le Chat auf Pixtral zu, die Chat-Oberfläche von Mistral. Sie erinnert an andere LLM-Chats – etwa ChatGPT.

Wähle im Modellmenü neben dem Prompt-Eingabefeld unten das Pixtral-Modell aus der Liste der verfügbaren Modelle aus.

Pixtral ist multimodal und unterstützt Text und Bilder. Über das Büroklammer-Symbol unten lädst du ein oder mehrere Bilder hoch und kombinierst sie mit einem Textprompt. So kannst du dir zum Beispiel eine Frucht auf einem Bild identifizieren lassen.

Schauen wir uns ein weiteres Beispiel an, in dem wir Pixtral bitten, ein Tortendiagramm aus einem Bild in eine Markdown-Tabelle zu überführen:

So verbindest du dich mit der Pixtral-API auf La Plateforme
Die Weboberfläche ist bequem, lässt sich aber nicht direkt in Projekte integrieren. In diesem Abschnitt zeige ich dir, wie du über die API mit Pixtral in Python interagierst – über La Plateforme.
Profil einrichten
Lege zunächst ein Konto an. Das geht mit einem Klick per Google-Konto oder klassisch mit Benutzername und Passwort.
Direkt danach richtest du einen Workspace ein. Wähle einen beliebigen Namen und setze die Option "I'm a solo creator".

Gehe danach zur Seite für Abotarife. Dort kannst du einen experimentellen Tarif anlegen, um die API kostenlos zu testen, oder einen kostenpflichtigen Tarif wählen. Beachte: Beim kostenlosen Experimentaltarif musst du eine gültige Telefonnummer verknüpfen.

Jetzt kannst du einen API-Schlüssel erstellen. Den benötigen wir, um Anfragen an die Mistral-API zu stellen und mit Pixtral in Python zu arbeiten.
API-Schlüssel erzeugen
Wechsle zur API-Keys-Seite. Oben findest du die Schaltfläche, um einen neuen API-Key zu erstellen:

Beim Erstellen kannst du einen Namen und ein Ablaufdatum vergeben. Beides ist optional und kann leer bleiben.

Grundsätzlich empfiehlt es sich, ein Ablaufdatum zu setzen. Oft werden Schlüssel für Tests erstellt und dann vergessen – sie bleiben unbegrenzt aktiv. Ein Ablaufdatum reduziert das Risiko, falls ein Key versehentlich geleakt wird.

Nach der Erstellung wird der Key einmalig angezeigt. Kopiere ihn unbedingt, denn später ist er nicht mehr einsehbar. Geht er verloren, lösche ihn in der Liste und erstelle einen neuen.
Ich empfehle, im gleichen Verzeichnis wie dein Python-Skript eine .env-Datei zu erstellen und den Key in folgendem Format zu speichern (ersetze <key_value> durch den echten Schlüssel):
# contents of the .env fileAPI_KEY=<key_value>Vom Hardcoden des API-Keys im Skript ist abzuraten. So könntest du deinen Code nicht teilen, ohne auch den Key preiszugeben. Mehr dazu im Tutorial zu Python-Umgebungsvariablen.
Abhängigkeiten installieren
Installiere zunächst die benötigten Pakete:
mistralai, die Client-Bibliothek von Mistral für die API.python-dotenv, um Umgebungsvariablen aus einer.env-Datei zu laden.
pip install python-dotenv mistralaiSind die Abhängigkeiten installiert, geht es an das Skript. Lege im selben Ordner wie die .env-Datei eine Datei mistral_example.py an. Importiere die Module und lade den API-Key in eine Variable.
# Create a mistral_example.py file in the same folder as the .env fileimport osfrom mistralai import Mistralfrom dotenv import load_dotenvload_dotenv()api_key = os.getenv("API_KEY")Anschließend initialisieren wir den Client.
Client initialisieren
Die Mistral-Dokumentation listet alle verfügbaren Modelle. Für uns relevant ist das aktuelle Pixtral-Modell mit dem API-Endpunkt pixtral-12b-2409.

# Add this code in mistral_example.py after initializing the API keymodel = "pixtral-12b-2409"client = Mistral(api_key=api_key)Eine API-Anfrage senden
Jetzt können wir eine Anfrage an die Mistral-API senden und programmatisch mit Pixtral interagieren. So reichst du einen Textprompt ein:
# Add this code in mistral_example.py after initializing the clientchat_response = client.chat.complete( model=model, messages = [ { "role": "user", "content": [ { "type": "text", "text": "What is 1 + 1?" } ] }, ])print(chat_response.choices[0].message.content)Führe das Skript im Terminal aus und sieh dir Pixtrals Antwort auf den Prompt an:
$ python mistral_example.py The sum of 1 + 1 is 2. So,1 + 1 = 2Die API multimodal nutzen
Im Beispiel wird der Textprompt über das Feld content übergeben, wobei type auf "text" gesetzt ist.
{ "type": "text", "text": "What is 1 + 1?"}Das Feld content ist ein Array und kann mehrere Inhalte enthalten. Als multimodales Modell akzeptiert Pixtral auch Bilddaten. Um ein Bild per URL zu übergeben, fügst du es als Eintrag mit dem Typ "image_url" hinzu:
{ "type": "image_url", "Image_url": "<image_url>” }Ersetze <image_url> durch die tatsächliche Bildadresse. So kann Pixtral zum Beispiel die folgenden Performance-Diagramme analysieren:

Quelle: Mistral AI
chat_response = client.chat.complete( model=model, messages = [ { "role": "user", "content": [ { "type": "text", "text": "According to the chart, how does Pixtral 12B performs compared to other models?" }, { "type": "image_url", "image_url": "https://mistral.ai/images/news/pixtral-12b/pixtral-benchmarks.png" } ] }, ])print(chat_response.choices[0].message.content)Bei dieser Anfrage erhält Pixtral den Textprompt und das Diagramm zur Analyse und liefert dann eine ausführliche Antwort. Aufgrund der Länge zeigen wir sie hier nicht an.
Lokale Bilder laden
Im vorigen Beispiel haben wir ein Bild per URL eingebunden. Alternativ kannst du ein lokal gespeichertes Bild als Base64-kodierten String laden. Dafür nutzt du das eingebaute Paket base64:
def encode_image_base64(image_path): with open(image_path, "rb") as image_file: return base64.b64encode(image_file.read()).decode("utf-8")Auch bei Base64-basierten Bildern verwenden wir den Typ image_url, präfixen den Wert aber mit data:image/jpeg;base64,:
{ "type": "image_url", "image_url": f"data:image/jpeg;base64,{base_64_image}"}base_64_image ist das Ergebnis des Aufrufs von encode_image_base64(). Bitten wir Pixtral nun, basierend auf zwei Skizzen eine To-do-Listen-Website mit zwei Seiten zu erstellen:

Wir übergeben die beiden Bilder jeweils einzeln und formulieren einen Prompt, der eine HTML-Website auf Basis der Skizzen anfordert:
list_image = encode_image_base64("./todo-list.jpeg")new_item_image = encode_image_base64("./new-item-form.jpeg")chat_response = client.chat.complete( model=model, messages = [ { "role": "user", "content": [ { "type": "text", "text": "Create a HTML website with two pages like in the images" }, { "type": "image_url", "image_url": f"data:image/jpeg;base64,{list_image}" }, { "type": "image_url", "image_url": f"data:image/jpeg;base64,{new_item_image}" }, ] }, ])print(chat_response.choices[0].message.content)Pixtral gibt zwei Codeblöcke mit dem Inhalt der beiden Seiten aus. Wir haben den Code in index.html und add.html gespeichert und im Browser geöffnet. So sieht das Ergebnis aus:

Es ist noch keine vollständig funktionsfähige App, läuft aber und ist ein guter Ausgangspunkt für die Weiterentwicklung.
Fazit
Pixtral 12B ist Mistrals erstes multimodales Modell. Es verarbeitet Bilder in jeder Größe ohne Vorverarbeitung, bietet ein 128K-Kontextfenster für komplexe Prompts und liefert solide Ergebnisse bei reinen Text- wie auch multimodalen Aufgaben.
Es ist für nicht monetarisierte Projekte kostenlos verfügbar und als Open Source unter der Apache-2.0-Lizenz veröffentlicht – ein Gewinn für Forschende und Maker gleichermaßen.
In diesem Tutorial hast du praxisnahe Einblicke in die Nutzung von Pixtral erhalten – mit Beispielen und Schritt-für-Schritt-Anleitung.
FAQs
Ist Pixtral kostenlos, und unter welchen Bedingungen?
Pixtral ist kostenlos nutzbar über Le Chat oder über die API für nicht monetarisierte Projekte.
Ist Pixtral Open Source?
Ja. Es ist Open Source unter der Apache-2.0-Lizenz.
Welche Eingabedaten unterstützt Pixtral?
Pixtral ist das erste multimodale LLM von Mistral AI. Es unterstützt Text und Bilder.
Welche Bilder unterstützt Pixtral?
Pixtral unterstützt Bilder in beliebiger Größe, ohne dass eine Vorverarbeitung erforderlich ist.
Warum ist Pixtral wichtig?
Pixtral bietet eine starke Leistung für ein Modell mit nur 12 Milliarden Parametern. Außerdem ist es kostenlos nutzbar und Open Source.
