Accéder au contenu principal

Cours

Modèles multimodaux avec Hugging Face

Intermédiaire4 h

Combinez du texte, des images, du son et de la vidéo avec les derniers modèles d'IA de Hugging Face, et générez de nouvelles images et vidéos.

Python4 h14 vidéos45 exercices3,800 XP1,937Attestation de réussite

Créez votre compte gratuit

Continuer avec Google
ou
En continuant, vous acceptez nos Conditions d’utilisation, notre notre Politique de confidentialité et que vos données sont stockées aux États-Unis.

Plébiscité par des apprenants dans des milliers d’entreprises

Description du cours

Exploitez la puissance de l'IA multimodale

Plongez dans l'univers de pointe des modèles d'IA multimodaux, où le texte, les images et la parole se combinent pour créer des applications performantes. Découvrez comment tirer parti du vaste référentiel de modèles Hugging Face, capables de voir, d'entendre et de comprendre comme jamais auparavant. Que vous analysiez du contenu sur les réseaux sociaux, développiez des assistants vocaux ou créiez des applications d'IA de nouvelle génération, les modèles multimodaux vous permettent de traiter différents types de données en toute transparence.

Maîtrisez les techniques multimodales essentielles

Découvrez des modèles de pointe tels que CLIP pour la compréhension des images et du texte, SpeechT5 pour la synthèse vocale et le modèle Qwen2 Vision Language pour l'analyse multimodale des sentiments. Grâce à des exercices pratiques, vous maîtriserez les techniques utilisées par les principales entreprises d'IA pour créer des systèmes multimodaux sophistiqués.

Assurez la pérennité de vos compétences en IA

Ce cours vous fournira une boîte à outils robuste pour gérer des tâches d'IA multimodales. Vous apprendrez à traiter et à combiner efficacement différentes modalités de données, à affiner des modèles pré-entraînés pour des applications personnalisées, ainsi qu'à évaluer et améliorer les performances des modèles dans toutes les modalités.

Prérequis

Programme de formation

Plan du cours

1

Accéder aux modèles et jeux de données Hugging Face

Parcourez le Hub de modèles Hugging Face et transformez du texte, de l’audio et des données visuelles brutes en formats exploitables par l’IA. Apprenez à trouver les modèles les plus récents et populaires pour des tâches comme la génération de texte et à tirer parti de pipelines prêts à l’emploi.
Commencer le chapitre
2

Modèles unimodaux pour la vision, l’audio et le texte

3

Modèles multimodaux pour la classification

Apprenez à fusionner informations visuelles, textuelles et audio pour des applications d’IA plus riches. Maîtrisez des techniques comme CLIP pour la classification zero-shot, créez des analyseurs de sentiment qui voient et lisent, et concevez des détecteurs d’émotions combinant expressions faciales et voix. Faites sortir vos modèles d’IA de la pensée monomodale.
Commencer le chapitre
4

Génération multimodale

Transformez vos idées en réalité ! Maîtrisez des techniques d’IA de pointe pour générer et manipuler du contenu visuel à partir d’invites textuelles. Créez des images remarquables, retouchez des photos intelligemment et construisez des systèmes puissants de questions-réponses pour les images et les documents. Donnez vie à votre vision créative grâce à l’IA multimodale.
Commencer le chapitre

Modèles multimodaux avec Hugging Face

Cours
terminé

Obtenir un certificat d'achèvement

S’inscrire maintenant

Apprenez où que vous soyez avec l'application DataCamp

Même en déplacement, suivez quotidiennement nos cours mobiles et nos défis de codage de 5 minutes.