Après avoir suivi ces cours, je me sens confiant dans la création de visualisations et de tableaux de bord professionnels.
Description du cours
Exploitez la puissance de l'IA multimodale
Plongez dans l'univers de pointe des modèles d'IA multimodaux, où le texte, les images et la parole se combinent pour créer des applications performantes. Découvrez comment tirer parti du vaste référentiel de modèles Hugging Face, capables de voir, d'entendre et de comprendre comme jamais auparavant. Que vous analysiez du contenu sur les réseaux sociaux, développiez des assistants vocaux ou créiez des applications d'IA de nouvelle génération, les modèles multimodaux vous permettent de traiter différents types de données en toute transparence.Maîtrisez les techniques multimodales essentielles
Découvrez des modèles de pointe tels que CLIP pour la compréhension des images et du texte, SpeechT5 pour la synthèse vocale et le modèle Qwen2 Vision Language pour l'analyse multimodale des sentiments. Grâce à des exercices pratiques, vous maîtriserez les techniques utilisées par les principales entreprises d'IA pour créer des systèmes multimodaux sophistiqués.Assurez la pérennité de vos compétences en IA
Ce cours vous fournira une boîte à outils robuste pour gérer des tâches d'IA multimodales. Vous apprendrez à traiter et à combiner efficacement différentes modalités de données, à affiner des modèles pré-entraînés pour des applications personnalisées, ainsi qu'à évaluer et améliorer les performances des modèles dans toutes les modalités.Prérequis
Programme de formation
Plan du cours
1
Accéder aux modèles et jeux de données Hugging Face
Parcourez le Hub de modèles Hugging Face et transformez du texte, de l’audio et des données visuelles brutes en formats exploitables par l’IA. Apprenez à trouver les modèles les plus récents et populaires pour des tâches comme la génération de texte et à tirer parti de pipelines prêts à l’emploi.
- Navigation dans les modèles Hugging Face50 XP
- Combien de modèles !?100 XP
- Trouver le modèle texte‑vers‑image le plus populaire100 XP
- Prétraitement des différentes modalités50 XP
- Tokenisation de texte100 XP
- Prétraitement d’images100 XP
- Prétraitement audio100 XP
- Tâches des pipelines et évaluations50 XP
- Génération de légendes avec un pipeline100 XP
- Passer des arguments nommés100 XP
- Évaluation d’un modèle sur un jeu de données personnalisé100 XP
2
Modèles unimodaux pour la vision, l’audio et le texte
Maîtrisez chaque modalité avec des modèles de pointe. Plongez dans la vision par ordinateur pour la classification et la segmentation d’images, explorez la reconnaissance de la parole et la synthèse text-to-speech, et apprenez des techniques de fine-tuning efficaces. Développez des compétences pratiques avec des modèles préentraînés de la bibliothèque transformers de Hugging Face.
3
Modèles multimodaux pour la classification
Apprenez à fusionner informations visuelles, textuelles et audio pour des applications d’IA plus riches. Maîtrisez des techniques comme CLIP pour la classification zero-shot, créez des analyseurs de sentiment qui voient et lisent, et concevez des détecteurs d’émotions combinant expressions faciales et voix. Faites sortir vos modèles d’IA de la pensée monomodale.
4
Génération multimodale
Transformez vos idées en réalité ! Maîtrisez des techniques d’IA de pointe pour générer et manipuler du contenu visuel à partir d’invites textuelles. Créez des images remarquables, retouchez des photos intelligemment et construisez des systèmes puissants de questions-réponses pour les images et les documents. Donnez vie à votre vision créative grâce à l’IA multimodale.
Modèles multimodaux avec Hugging Face
Cours
terminé

