Lernpfad
Nachdem DeepSeek den KI-Markt aufgemischt hat, hat Qwen, ein weiteres chinesisches Unternehmen, mehrere hochmoderne Modelle veröffentlicht, die sogar DeepSeeks Reasoning-Modelle übertreffen. Nur wenige Tage nach dem DeepSeek-Launch brachte Qwen spezialisierte Spitzenmodelle heraus, die echten Mehrwert liefern – nicht nur als Chatbots, sondern für konkrete Aufgaben.
Mehr zum Qwen-Reasoning-Modell ähnlich zu DeekSeek R1 findest du im Blog I Tested QwQ 32B Preview: Alibaba’s Reasoning Model.
In diesem Tutorial schauen wir uns Qwen2.5-VL an – ein Vision-Language-Modell, das alle proprietären Modelle bei den Vision-Fähigkeiten übertrifft. Außerdem zeigen wir, wie du es lokal nutzt und das Flaggschiffmodell online ausprobierst.

Bild: Autor
Wenn du neu in KI und Large Language Models (LLMs) bist, lohnt sich der Kurs Introduction to LLMs in Python. Er vermittelt dir die Grundlagen zu LLMs und der revolutionären Transformer-Architektur, auf der sie basieren.
Einordnung: Qwen2.5-VL
Qwen2.5-VL ist das neue Vision-Language-Flaggschiff von Qwen und ein deutlicher Sprung gegenüber dem Vorgänger Qwen2-VL. Das Modell setzt einen neuen Standard für Multimodal-KI: Es erkennt nicht nur Objekte wie Blumen, Vögel, Fische und Insekten, sondern analysiert auch komplexe Texte, Diagramme, Icons, Grafiken und Layouts in Bildern.
Darüber hinaus ist Qwen2.5-VL stark agentisch ausgelegt und zu dynamischem Reasoning sowie Tool-Steuerung fähig – egal ob am Computer oder auf dem Smartphone.
Zu den fortgeschrittenen Funktionen gehört, dass das Modell Videos von über einer Stunde länge versteht, spezifische Ereignisse darin findet und Objekte in Bildern präzise über Bounding Boxes oder Punkte lokalisiert. Dazu liefert es stabile JSON-Ausgaben für Koordinaten und Attribute – ideal für Aufgaben mit strukturierten Daten.
Außerdem unterstützt Qwen2.5-VL strukturierte Ausgaben für gescannte Dokumente wie Rechnungen, Formulare und Tabellen – besonders wertvoll für Branchen wie Finanzwesen und Handel.

Quelle: Qwen2.5 VL
Das Flaggschiff Qwen2.5-VL-72B-Instruct liefert auf einer breiten Palette von Benchmarks starke Ergebnisse und zeigt seine Vielseitigkeit über Domänen und Aufgaben hinweg. Es übertrifft führende Modelle wie Gemini 2 Flash, GPT-4o und Claude 3.5 Sonnet und festigt damit seinen Status als erstklassiges Vision-Language-Modell.
Du kannst Qwen oder beliebige LLMs auch selbst bewerten – folge dazu dem Tutorial Evaluate LLMs Effectively Using DeepEval.
Qwen2.5-VL auf einem Laptop mit GPU nutzen
Im Folgenden lernst du mehrere Wege, Qwen2.5-VL lokal auszuführen. Diese Lösungen findest du bereits im QwenLM/Qwen2.5-VL GitHub-Repository. Du musst nur die Umgebung einrichten, ein paar typische Fehler beheben und die Web-App lokal starten.
1. Qwen2.5-VL-Web-App lokal starten
1. Klone das Qwen2.5-VL-Repository und wechsle ins Projektverzeichnis:
git clone https://github.com/QwenLM/Qwen2.5-VL
cd Qwen2.5-VL
2. Installiere die benötigten Abhängigkeiten für die Web-Anwendung mit folgendem Befehl:
pip install -r requirements_web_demo.txt
3. Installiere zur GPU-Kompatibilität die neuesten Versionen von PyTorch, TorchVision und TorchAudio mit CUDA-Unterstützung. Selbst wenn PyTorch bereits installiert ist, kann es zu Problemen kommen – aktualisiere daher am besten:
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu124
4. Aktualisiere Gradio und Gradio Client, um Verbindungs- und UI-Fehler zu vermeiden, die bei älteren Versionen auftreten können:
pip install -U gradio gradio_client
5. Starte nun die Web-Demo mit dem kleineren 3B-Checkpoint. Empfohlen für Laptops mit begrenztem Grafikspeicher (z. B. 8 GB VRAM). Das 7B-Modell kann möglich sein, wird aber voraussichtlich deutlich langsamer antworten:
python web_demo_mm.py --checkpoint-path "Qwen/Qwen2.5-VL-3B-Instruct"
Wie du siehst, wird zuerst das Modell geladen, dann Processor und Model initialisiert, und die Web-App läuft unter der lokalen URL http://127.0.0.1:7860.

Die Web-App läuft einwandfrei.

6. Lade ein Bild mit Text und mehreren Grafiken hoch und lass dir die Inhalte erläutern. Selbst das kleinere 3B-Modell zeigt starke Leistung und erkennt feine Details im Bild.

7. Du kannst auch ohne Bild interagieren. Dann liefert das Modell reine Textantworten – wie ein klassisches LLM.

Wenn du im Task-Manager die Leistung überwachst, siehst du eine GPU-Auslastung von rund 6% – läuft also angenehm flüssig.

2. Experimentelle Qwen2.5-VL-Web-App lokal starten
Im Repository gibt es außerdem eine experimentelle Streaming-Videochat-Demo im Verzeichnis web_demo_streaming. Damit kannst du über deine Webcam mit dem Modell interagieren.
Wechsle dazu ins Streaming-Verzeichnis und starte die App mit dem 3B-Checkpoint.
cd web_demo_streaming/
python app.py --checkpoint-path "Qwen/Qwen2.5-VL-3B-Instruct"
Mit einer stärkeren GPU läuft diese Web-App sehr rund. Einfach Webcam-Zugriff erlauben und losfragen.

Lerne, wie du das lokal bereitgestellte Modell nutzt und eine saubere UI darum baust – z. B. im Kurs Developing LLM Applications with LangChain.
3. Qwen2.5-VL lokal mit Docker Desktop ausführen
Am stabilsten läuft Qwen2.5-VL lokal in Docker. Das Qwen-Team stellt vorkonfigurierte Docker-Images mit allen nötigen Umgebungen bereit.
1. Lade Docker Desktop von der offiziellen Website herunter und installiere es.
2. Nutze zur einfachen Bereitstellung das vorgefertigte Docker-Image qwenllm/qwenvl. Installiere die benötigten Treiber und lade die Modelldateien herunter, um die Demo zu starten.
docker run --gpus all --ipc=host --network=host --rm --name qwen2 -it qwenllm/qwenvl:2-cu121 bash
Mehr zu einem Code-Generierungsmodell namens Qwen 2.5 Coder findest du in unserem Guide Qwen 2.5 Coder: A Guide With Examples.
Qwen2.5-VL als Online-Chatbot nutzen
Wenn du das Flaggschiff Qwen2.5-VL 72B Instruct ausprobieren möchtest, gehe zu Qwen Chat, lege ein Konto an und nutze das Modell ähnlich wie ChatGPT. Eventuell musst du das Modell auswählen, bevor du ein Bild lädst.

Lade ein Bild hoch und stelle Fragen dazu.

Die Antworten kommen schnell und präzise – mit wenig Aufwand erlebst du hier ein Spitzenmodell.
Über Alibaba Cloud bekommst du alle Tools, um diverse KI-Modelle per API anzusprechen und ähnlich wie auf der OpenAI-Plattform zu finetunen. Mehr dazu im Qwen (Alibaba Cloud) Tutorial: Introduction and Fine-Tuning.
Fazit
Qwen2.5-VL gibt einen Ausblick auf die Zukunft der KI und zeigt, dass Innovation bei Advanced-AI-Modellen nicht nur in den USA oder im Westen stattfindet. Das Modell liefert eine außergewöhnliche Genauigkeit und lässt sich reibungslos in Workflows integrieren – ideal, um eigene KI-Tools zur Automatisierung aufzubauen.
Beispielsweise kannst du mit Qwen2.5-VL ein LinkedIn-Konto einrichten, vollständig ausfüllen und sogar Artikel posten – mit minimalem Aufwand.
In diesem Tutorial hast du Qwen2.5-VL kennengelernt – ein Vision-Modell, das selbst kleinste Details in Bildern erfasst. Außerdem haben wir gezeigt, wie du es lokal auf einem Laptop mit GPU nutzt. Zum Schluss haben wir ein Qwen-Konto erstellt und das Flaggschiffmodell online ähnlich wie ChatGPT verwendet.
Lies auch Alibaba's Qwen 2.5-Max – ein Modell, das mit GPT-4o, Claude 3.5 Sonnet und DeepSeek V3 konkurriert.
Als zertifizierter Data Scientist ist es meine Leidenschaft, modernste Technologien zu nutzen, um innovative Machine Learning-Anwendungen zu entwickeln. Mit meinem fundierten Hintergrund in den Bereichen Spracherkennung, Datenanalyse und Reporting, MLOps, KI und NLP habe ich meine Fähigkeiten bei der Entwicklung intelligenter Systeme verfeinert, die wirklich etwas bewirken können. Neben meinem technischen Fachwissen bin ich auch ein geschickter Kommunikator mit dem Talent, komplexe Konzepte in eine klare und prägnante Sprache zu fassen. Das hat dazu geführt, dass ich ein gefragter Blogger zum Thema Datenwissenschaft geworden bin und meine Erkenntnisse und Erfahrungen mit einer wachsenden Gemeinschaft von Datenexperten teile. Zurzeit konzentriere ich mich auf die Erstellung und Bearbeitung von Inhalten und arbeite mit großen Sprachmodellen, um aussagekräftige und ansprechende Inhalte zu entwickeln, die sowohl Unternehmen als auch Privatpersonen helfen, das Beste aus ihren Daten zu machen.
