Weiter zum Inhalt

Kurs

Multimodale Modelle mit Hugging Face

Mittelstufe4 Std.

Kombiniere Text, Bilder, Audio und Video mit den neuesten KI-Modellen von Hugging Face und erstelle neue Bilder und Videos!

Python4 Std.14 Videos45 Übungen3,800 XP1,937Leistungsnachweis

Erstelle dein kostenloses Konto

Mit Google fortfahren
oder
Indem du fortfährst, akzeptierst du unsere Nutzungsbedingungen, unser Datenschutzrichtlinie und dass Ihre Daten in den USA gespeichert werden.

Geliebt von Lernenden in Tausenden Unternehmen

Kursbeschreibung

Nutze die Kraft der multimodalen KI

Tauch ein in die coole Welt der multimodalen KI-Modelle, wo Text, Bilder und Sprache zusammenkommen, um echt starke Anwendungen zu schaffen. Erfahre, wie du das riesige Repository von Hugging Face mit Modellen nutzen kannst, die sehen, hören und verstehen können wie nie zuvor. Egal, ob du Social-Media-Inhalte analysierst, Sprachassistenten entwickelst oder KI-Anwendungen der nächsten Generation erstellst – multimodale Modelle sind dein Schlüssel zum nahtlosen Umgang mit verschiedenen Datentypen.

Beherrsch die wichtigsten multimodalen Techniken

Entdecke topmoderne Modelle wie CLIP für das Verstehen von Bildern und Text, SpeechT5 für Sprachsynthese und das Qwen2 Vision Language-Modell für multimodale Sentimentanalyse. Durch praktische Übungen lernst du die Techniken, die führende KI-Unternehmen zum Aufbau komplexer multimodaler Systeme einsetzen.

Mach deine KI-Fähigkeiten zukunftssicher

In diesem Kurs bekommst du ein solides Toolkit für den Umgang mit multimodalen KI-Aufgaben. Du lernst, verschiedene Datenmodalitäten effektiv zu verarbeiten und zu kombinieren, vortrainierte Modelle für individuelle Anwendungen anzupassen und die Modellleistung über verschiedene Modalitäten hinweg zu bewerten und zu verbessern.

Voraussetzungen

Lernprogramm

Kursübersicht

1

Zugriff auf Hugging Face-Modelle und Datensätze

2

Unimodale Modelle für Sehen, Hören und Lesen

Lerne, einzelne Modalitäten mit den neuesten Modellen zu meistern. Tauch ein in die Welt der Computervision für Bildklassifizierung und -segmentierung, probier Sprachsteuerung und Text-zu-Sprache-Synthese aus und lern effektive Feinabstimmungstechniken. Lerne praktische Fähigkeiten mit vorab trainierten Modellen aus der Transformers-Bibliothek von Hugging Face.
Kapitel starten
3

Multimodale Modelle für die Klassifizierung

Lerne, visuelle, Text- und Audio-Infos zu verbinden, um KI-Anwendungen noch besser zu machen. Lerne Techniken wie CLIP für Zero-Shot-Klassifizierung, baue Sentiment-Analysatoren, die sehen und lesen können, und entwickle Emotionsdetektoren, die Gesichtsausdrücke mit der Stimme kombinieren. Bring deine KI-Modelle über das Denken in einer einzigen Modalität hinaus.
Kapitel starten
4

Multimodale Erzeugung

Ideen in die Tat umsetzen! Lerne die neuesten KI-Techniken, um mit Textvorlagen visuelle Inhalte zu erstellen und zu bearbeiten. Mach coole Bilder, bearbeite Fotos auf clevere Weise und baue starke Frage-Antwort-Systeme für Bilder und Dokumente auf. Mach deine kreativen Ideen mit multimodaler KI digital wahr.
Kapitel starten

Multimodale Modelle mit Hugging Face

Kurs
abgeschlossen

Bescheinigung über den Abschluss erhalten

Jetzt einschreiben

Datenkompetenz für unterwegs – mit der DataCamp-App

Mit unseren Kursen für Mobilgeräte und täglichen Programmier-Challenges erweiterst du deine Datenkompetenz von unterwegs.