Przejdź do głównej treści

Kurs

Modele multimodalne z Hugging Face

Średniozaawansowany4 godz.

Łącz tekst, obrazy, audio i wideo z najnowszymi modelami AI od Hugging Face i twórz nowe obrazy oraz filmy!

Python4 godz.{count, plural, one {# film} few {# filmy} many {# filmów} other {# filmów}}{count, plural, one {# ćwiczenie} few {# ćwiczenia} many {# ćwiczeń} other {# ćwiczenia}}3,800 XP1,937Oświadczenie o ukończeniu

Utwórz bezpłatne konto

Kontynuuj z Google
lub
Kontynuując, akceptujesz nasz Warunki użytkowania, nasz Polityka prywatności i że Twoje dane są przechowywane w USA.

Uwielbiany przez uczących się w tysiącach firm

Szkolisz zespół?

Wypróbuj dla firm

Opis kursu

Wykorzystaj moc multimodalnej sztucznej inteligencji

Zanurz się w najnowocześniejszym świecie multimodalnych modeli AI, w którym tekst, obrazy i mowa łączą się, tworząc potężne aplikacje. Dowiedz się, jak wykorzystać ogromne repozytorium modeli Hugging Face, które potrafią widzieć, słyszeć i rozumieć jak nigdy dotąd. Niezależnie od tego, czy analizujesz treści z mediów społecznościowych, tworzysz asystentów głosowych, czy budujesz aplikacje AI nowej generacji, modele multimodalne są Twoją bramą do płynnej obsługi różnorodnych typów danych.

Opanuj kluczowe techniki multimodalne

Poznaj najnowocześniejsze modele, takie jak CLIP do rozumienia obrazu i tekstu, SpeechT5 do syntezy głosu oraz model Qwen2 Vision Language do multimodalnej analizy sentymentu. Dzięki praktycznym ćwiczeniom opanujesz techniki stosowane przez wiodące firmy AI do tworzenia zaawansowanych systemów multimodalnych.

Zabezpiecz swoje umiejętności AI na przyszłość

Ten kurs da Ci solidny zestaw narzędzi do pracy z zadaniami AI multimodalnymi. Nauczysz się skutecznie przetwarzać i łączyć różne modalności danych, dostrajać wstępnie wytrenowane modele do niestandardowych zastosowań oraz oceniać i poprawiać wydajność modeli w różnych modalnościach.

Wymagania wstępne

Program kursu

Plan kursu

1

Dostęp do modeli i zbiorów danych Hugging Face

Naucz się poruszać po repozytorium modeli Hugging Face oraz przekształcać surowe dane tekstowe, audio i wizualne w formaty przyjazne dla AI. Dowiedz się, jak znajdować najnowsze i najpopularniejsze modele do takich zadań jak generowanie tekstu, i wykorzystaj możliwości gotowych potoków przetwarzania.
Rozpocznij rozdział
2

Unimodalne modele wizji, audio i tekstu

Naucz się pracować z poszczególnymi modalnościami przy użyciu najnowocześniejszych modeli. Zagłęb się w widzenie komputerowe na potrzeby klasyfikacji i segmentacji obrazów, poznaj rozpoznawanie mowy i syntezę mowy z tekstu, a także opanuj skuteczne techniki dostrajania modeli. Zdobywaj praktyczne umiejętności, korzystając z wytrenowanych modeli z biblioteki transformers Hugging Face.
Rozpocznij rozdział
3

Modele multimodalne do klasyfikacji

Naucz się łączyć informacje wizualne, tekstowe i audio, aby tworzyć bogatsze aplikacje AI. Opanuj techniki takie jak CLIP do klasyfikacji zero-shot, buduj analizatory nastrojów widzące i czytające jednocześnie, oraz twórz detektory emocji łączące mimikę twarzy z głosem. Wyjdź poza myślenie w kategoriach pojedynczej modalności.
Rozpocznij rozdział
4

Generowanie multimodalne

Przekształć pomysły w rzeczywistość! Opanuj najnowocześniejsze techniki AI do generowania i manipulowania treściami wizualnymi za pomocą promptów tekstowych. Twórz efektowne obrazy, inteligentnie edytuj zdjęcia i buduj wydajne systemy odpowiadania na pytania dotyczące obrazów i dokumentów. Zamień swoją wizję twórczą w cyfrową rzeczywistość z multimodalną AI.
Rozpocznij rozdział

Modele multimodalne z Hugging Face

Kurs
ukończony

Zdobądź Certyfikat Ukończenia

Zapisz się

Rozwijaj swoje umiejętności danych z DataCamp for Mobile

Rozwijaj się w drodze dzięki naszym kursom mobilnym i codziennym 5-minutowym wyzwaniom kodowania.