After doing these courses, I feel confident creating professional visualizations and dashboards
Opis kursu
Wykorzystaj moc multimodalnej sztucznej inteligencji
Zanurz się w najnowocześniejszym świecie multimodalnych modeli AI, w którym tekst, obrazy i mowa łączą się, tworząc potężne aplikacje. Dowiedz się, jak wykorzystać ogromne repozytorium modeli Hugging Face, które potrafią widzieć, słyszeć i rozumieć jak nigdy dotąd. Niezależnie od tego, czy analizujesz treści z mediów społecznościowych, tworzysz asystentów głosowych, czy budujesz aplikacje AI nowej generacji, modele multimodalne są Twoją bramą do płynnej obsługi różnorodnych typów danych.Opanuj kluczowe techniki multimodalne
Poznaj najnowocześniejsze modele, takie jak CLIP do rozumienia obrazu i tekstu, SpeechT5 do syntezy głosu oraz model Qwen2 Vision Language do multimodalnej analizy sentymentu. Dzięki praktycznym ćwiczeniom opanujesz techniki stosowane przez wiodące firmy AI do tworzenia zaawansowanych systemów multimodalnych.Zabezpiecz swoje umiejętności AI na przyszłość
Ten kurs da Ci solidny zestaw narzędzi do pracy z zadaniami AI multimodalnymi. Nauczysz się skutecznie przetwarzać i łączyć różne modalności danych, dostrajać wstępnie wytrenowane modele do niestandardowych zastosowań oraz oceniać i poprawiać wydajność modeli w różnych modalnościach.Wymagania wstępne
Program kursu
Plan kursu
1
Dostęp do modeli i zbiorów danych Hugging Face
Naucz się poruszać po repozytorium modeli Hugging Face oraz przekształcać surowe dane tekstowe, audio i wizualne w formaty przyjazne dla AI. Dowiedz się, jak znajdować najnowsze i najpopularniejsze modele do takich zadań jak generowanie tekstu, i wykorzystaj możliwości gotowych potoków przetwarzania.
- Nawigacja po modelach Hugging Face50 XP
- Ile jest modeli!?100 XP
- Znajdowanie najpopularniejszego modelu text-to-image100 XP
- Przetwarzanie wstępne różnych modalności50 XP
- Tokenizacja tekstu100 XP
- Przetwarzanie wstępne obrazów100 XP
- Wstępne przetwarzanie dźwięku100 XP
- Zadania potokowe i ewaluacja50 XP
- Generowanie podpisów obrazów za pomocą potoku100 XP
- Przekazywanie argumentów słownikowych100 XP
- Ewaluacja modelu na własnym zbiorze danych100 XP
2
Unimodalne modele wizji, audio i tekstu
Naucz się pracować z poszczególnymi modalnościami przy użyciu najnowocześniejszych modeli. Zagłęb się w widzenie komputerowe na potrzeby klasyfikacji i segmentacji obrazów, poznaj rozpoznawanie mowy i syntezę mowy z tekstu, a także opanuj skuteczne techniki dostrajania modeli. Zdobywaj praktyczne umiejętności, korzystając z wytrenowanych modeli z biblioteki transformers Hugging Face.
3
Modele multimodalne do klasyfikacji
Naucz się łączyć informacje wizualne, tekstowe i audio, aby tworzyć bogatsze aplikacje AI. Opanuj techniki takie jak CLIP do klasyfikacji zero-shot, buduj analizatory nastrojów widzące i czytające jednocześnie, oraz twórz detektory emocji łączące mimikę twarzy z głosem. Wyjdź poza myślenie w kategoriach pojedynczej modalności.
4
Generowanie multimodalne
Przekształć pomysły w rzeczywistość! Opanuj najnowocześniejsze techniki AI do generowania i manipulowania treściami wizualnymi za pomocą promptów tekstowych. Twórz efektowne obrazy, inteligentnie edytuj zdjęcia i buduj wydajne systemy odpowiadania na pytania dotyczące obrazów i dokumentów. Zamień swoją wizję twórczą w cyfrową rzeczywistość z multimodalną AI.
Modele multimodalne z Hugging Face
Kurs
ukończony

