Après avoir suivi ces cours, je me sens confiant dans la création de visualisations et de tableaux de bord professionnels.
Description du cours
Travaillez-vous parfois avec des ensembles de données comportant un nombre impressionnant de caractéristiques ? Avez-vous besoin de toutes ces fonctionnalités ? Quels sont les plus importants ? Dans ce cours, vous apprendrez des techniques de réduction de dimensionnalité qui vous aideront à simplifier vos données et les modèles que vous construisez à partir de celles-ci, tout en conservant les informations contenues dans les données d'origine et de bonnes performances prédictives.
Nous vivons à l'ère de l'information, une époque caractérisée par une surcharge d'informations. L'art d'extraire des informations essentielles à partir de données est une compétence très recherchée sur le marché du travail. Les modèles s'entraînent plus rapidement sur des données réduites. En production, des modèles plus petits signifient un temps de réponse plus rapide. Il est important de noter que les données et les modèles de plus petite taille sont souvent plus faciles à appréhender. La réduction de dimensionnalité est votre principe de simplicité dans le domaine de la science des données.
La distinction entre la sélection des caractéristiques et l'extraction des caractéristiques ! À l'aide de R, vous apprendrez à identifier et à supprimer les caractéristiques contenant peu d'informations ou redondantes, tout en conservant celles qui contiennent le plus d'informations. Il s'agit de la sélection des caractéristiques. Vous apprendrez également à extraire des combinaisons de caractéristiques sous forme de composants condensés contenant un maximum d'informations. C'est ce qu'on appelle l'extraction de caractéristiques.
Cependant, le plus important est qu'en utilisant le nouveau package tidymodel de R, vous pourrez exploiter des données réelles pour construire des modèles avec moins de caractéristiques sans compromettre les performances de manière significative.
Réduction de la dimensionnalité
Nous vivons à l'ère de l'information, une époque caractérisée par une surcharge d'informations. L'art d'extraire des informations essentielles à partir de données est une compétence très recherchée sur le marché du travail. Les modèles s'entraînent plus rapidement sur des données réduites. En production, des modèles plus petits signifient un temps de réponse plus rapide. Il est important de noter que les données et les modèles de plus petite taille sont souvent plus faciles à appréhender. La réduction de dimensionnalité est votre principe de simplicité dans le domaine de la science des données.
Quels sont les principaux thèmes abordés dans ce cours ?
La distinction entre la sélection des caractéristiques et l'extraction des caractéristiques ! À l'aide de R, vous apprendrez à identifier et à supprimer les caractéristiques contenant peu d'informations ou redondantes, tout en conservant celles qui contiennent le plus d'informations. Il s'agit de la sélection des caractéristiques. Vous apprendrez également à extraire des combinaisons de caractéristiques sous forme de composants condensés contenant un maximum d'informations. C'est ce qu'on appelle l'extraction de caractéristiques.
Cependant, le plus important est qu'en utilisant le nouveau package tidymodel de R, vous pourrez exploiter des données réelles pour construire des modèles avec moins de caractéristiques sans compromettre les performances de manière significative.
Prérequis
Programme de formation
Plan du cours
1
Fondamentaux de la réduction de dimension
Préparez-vous à simplifier de grands jeux de données ! Vous allez découvrir la notion d’information, comment évaluer l’importance des variables, et vous exercer à repérer les variables faiblement informatives. À la fin du chapitre, vous comprendrez la différence entre sélection de variables et extraction de variables — les deux approches de la réduction de dimension.
- Introduction à la réduction de dimension50 XP
- Dimensionnalité et information des variables100 XP
- Caractéristiques à information mutuelle100 XP
- Information et importance des variables50 XP
- Calcul de l’entropie de la racine100 XP
- Calcul des entropies des nœuds enfants100 XP
- Calcul de l’information gagnée par la couleur100 XP
- L’importance de la réduction de dimension pour les données et la construction de modèles50 XP
- Calculer les combinaisons possibles100 XP
- Malédiction de la dimensionnalité, surapprentissage et biais100 XP
2
Sélection de variables pour l’importance des variables
Apprenez à identifier les variables riches et pauvres en information grâce aux taux de valeurs manquantes, à la variance et à la corrélation. Vous verrez ensuite comment créer des recettes tidymodels pour sélectionner des variables à l’aide de ces indicateurs d’information.
3
Sélection de variables pour les performances du modèle
Le troisième chapitre présente la différence entre les approches non supervisées et supervisées de sélection de variables. Vous reverrez comment utiliser les workflows tidymodels pour construire des modèles. Ensuite, vous réaliserez une sélection supervisée de variables avec une régression lasso et des modèles de forêts aléatoires.
4
Extraction de caractéristiques et performances du modèle
Dans ce dernier chapitre, vous développerez une solide intuition de l’extraction de variables en comprenant comment les composantes principales extraient et combinent l’information la plus importante de différentes variables. Vous apprendrez ensuite et appliquerez trois types d’extraction de variables — l’analyse en composantes principales (ACP), t-SNE et UMAP. Découvrez comment utiliser ces méthodes d’extraction comme étape de prétraitement dans le processus de construction de modèles avec tidymodels.
R
Réduction de dimension en R
Cours
terminé

