Перейти до основного вмісту

Курс

Багатомодальні моделі з Hugging Face

Середній4 год

Поєднуйте текст, зображення, аудіо й відео з новітніми моделями ШІ від Hugging Face та створюйте нові зображення й відео!

Python4 год14 відео45 вправ3,800 XP1,932Свідоцтво про досягнення

Створіть безкоштовний обліковий запис

Продовжити через Google
або
Продовжуючи, ви приймаєте наші Умови використання, наш Політика конфіденційності і що ваші дані зберігаються в США.

Улюблений учнями у тисячах компаній

Навчаєте команду?

Спробувати для бізнесу

Опис курсу

Опануйте силу мультимодального ШІ

Пориньте в передовий світ мультимодальних моделей ШІ, де текст, зображення та мовлення поєднуються, щоб створювати потужні застосунки. Дізнайтеся, як використовувати величезний репозиторій моделей Hugging Face, які можуть бачити, чути й розуміти як ніколи раніше. Незалежно від того, чи ви аналізуєте контент у соціальних мережах, створюєте голосових асистентів або розробляєте AI-застосунки нового покоління, мультимодальні моделі — це ваш шлях до безшовної роботи з різними типами даних.

Опануйте основні мультимодальні техніки

Ознайомтеся з передовими моделями, такими як CLIP для розуміння зображень і тексту, SpeechT5 для синтезу голосу та модель Qwen2 Vision Language для мультимодального аналізу настроїв. За допомогою практичних вправ ви опануєте методи, які провідні компанії у сфері ШІ використовують для створення складних мультимодальних систем.

Підготуйте свої навички в галузі ШІ до майбутнього

Цей курс надасть вам потужний набір інструментів для роботи з мультимодальними завданнями ШІ. Ви навчитеся ефективно обробляти та поєднувати різні модальності даних, тонко налаштовувати попередньо навчені моделі для індивідуальних застосувань і оцінювати та покращувати продуктивність моделей у різних модальностях.

Попередні вимоги

Навчальний план

Зміст курсу

1

Доступ до моделей і датасетів Hugging Face

Опануйте навігацію в хабі моделей Hugging Face та перетворюйте сирий текст, аудіо й візуальні дані у формати, зручні для ШІ. Дізнайтеся, як знаходити найновіші й найпопулярніші моделі для задач на кшталт генерації тексту та як ефективно використовувати готові конвеєри (pipelines).
Почати розділ
2

Унімодальні моделі для зору, аудіо та тексту

Навчіться впевнено працювати з окремими модальностями за допомогою найсучасніших моделей. Пориньте у комп'ютерний зір для класифікації та сегментації зображень, дослідіть розпізнавання мовлення й синтез текст-у-мову та опануйте ефективні підходи до тонкого налаштування. Розвивайте практичні навички з попередньо навченими моделями з бібліотеки transformers від Hugging Face.
Почати розділ
3

Багатомодальні моделі для класифікації

Навчіться об'єднувати візуальну, текстову та аудіоінформацію для потужніших застосунків ШІ. Опануйте техніки на кшталт CLIP для zero-shot класифікації, створіть аналізатори тональності, що «бачать» і «читають», і побудуйте детектори емоцій, які поєднують міміку з голосом. Виведіть свої моделі за межі мислення однією модальністю.
Почати розділ
4

Багатомодальна генерація

Втілюйте ідеї в реальність! Опануйте передові техніки ШІ для генерації та редагування візуального контенту за допомогою текстових підказок. Створюйте вражаючі зображення, розумно редагуйте фото та будуйте потужні системи запитань-відповідей для зображень і документів. Перетворіть своє творче бачення на цифрову реальність завдяки багатомодальному ШІ.
Почати розділ

Багатомодальні моделі з Hugging Face

Курс
завершено

Отримайте сертифікат про досягнення

Зараєструватися

Розвивайте навички роботи з даними з DataCamp для мобільних

Навчайтеся будь-де з нашими мобільними курсами та щоденними 5-хвилинними завданнями з кодування.

Багатомодальні моделі з Hugging Face | DataCamp