After doing these courses, I feel confident creating professional visualizations and dashboards
Descrierea cursului
Valorifică puterea AI-ului multimodal
Pătrunde în lumea de ultimă generație a modelelor AI multimodale, unde textul, imaginile și vocea se combină pentru a crea aplicații puternice. Învață cum să valorifici vastul repertoriu de modele Hugging Face care pot vedea, auzi și înțelege ca niciodată până acum. Fie că analizezi conținutul de pe rețelele sociale, construiești asistenți vocali sau creezi aplicații AI de nouă generație, modelele multi-modale sunt poarta ta de acces către gestionarea fără efort a diverselor tipuri de date.Stăpânește tehnici esențiale multi-modale
Explorează modele de ultimă generație precum CLIP pentru înțelegerea imagine-text, SpeechT5 pentru sinteza vocală și modelul Qwen2 Vision Language pentru analiza sentimentului multi-modal. Prin exerciții practice, vei stăpâni tehnicile folosite de companiile de top din domeniul AI pentru a construi sisteme multi-modale sofisticate.Pregătește-ți competențele în AI pentru viitor
Acest curs îți va oferi un set solid de instrumente pentru a gestiona sarcini AI multimodale. Vei învăța să procesezi și să combini eficient diferite modalități de date, să ajustezi fin modele pre-antrenate pentru aplicații personalizate și să evaluezi și să îmbunătățești performanța modelelor în toate modalitățile.Cerințe prealabile
Curriculum
Structura cursului
1
Accesarea modelelor și seturilor de date Hugging Face
Explorează hub-ul de modele Hugging Face, transformă text brut, audio și date vizuale în formate compatibile cu AI. Învață cum să găsești cele mai recente și populare modele pentru sarcini precum generarea de text și cum să folosești pipeline-uri gata construite.
- Navigarea modelelor Hugging Face50 XP
- Câte modele!?100 XP
- Găsirea celui mai popular model text-to-image100 XP
- Preprocesarea diferitelor modalități50 XP
- Tokenizarea textului100 XP
- Preprocesarea imaginilor100 XP
- Preprocesarea datelor audio100 XP
- Sarcini de pipeline și evaluări50 XP
- Generarea de descrieri cu pipeline100 XP
- Transmiterea argumentelor cheie100 XP
- Evaluarea modelului pe un set de date personalizat100 XP
2
Modele Unimodale pentru Viziune, Audio și Text
Învață să stăpânești modalități individuale cu modele de ultimă generație. Descoperă computer vision pentru clasificarea și segmentarea imaginilor, explorează recunoașterea vorbirii și sinteza text-to-speech și exersează tehnici eficiente de fine-tuning. Dezvoltă abilități practice cu modele pre-antrenate din biblioteca transformers de la Hugging Face.
3
Modele Multi-Modale pentru Clasificare
Învață să combini informații vizuale, textuale și audio pentru aplicații AI mai complexe. Stăpânește tehnici precum CLIP pentru clasificare zero-shot, construiește analizatoare de sentiment care văd și citesc și creează detectoare de emoții ce îmbină expresiile faciale cu vocea. Du modelele tale AI dincolo de gândirea cu o singură modalitate.
4
Generare Multi-Modală
Transformă ideile în realitate! Stăpânește tehnici AI de ultimă oră pentru a genera și manipula conținut vizual cu ajutorul prompturilor text. Creează imagini impresionante, editează fotografii în mod inteligent și construiește sisteme puternice de răspuns la întrebări despre imagini și documente. Dă formă viziunii tale creative cu AI multi-modal.
Modele Multi-Modale cu Hugging Face
Curs
finalizat

