Accéder au contenu principal

Cours

Machine learning avec des modèles arborescents en Python

Intermédiaire5 h

Dans ce cours, vous apprendrez à utiliser des modèles basés sur des arbres et des ensembles pour la régression et la classification en utilisant scikit-learn.

Python5 h15 vidéos57 exercices4,650 XP110K+Attestation de réussite

Créez votre compte gratuit

Continuer avec Google
ou
En continuant, vous acceptez nos Conditions d’utilisation, notre notre Politique de confidentialité et que vos données sont stockées aux États-Unis.

Plébiscité par des apprenants dans des milliers d’entreprises

Description du cours

Les arbres de décision sont des modèles d'apprentissage supervisé utilisés pour les problèmes impliquant la classification et la régression. Les modèles arborescents offrent une grande flexibilité, mais cela a un coût : d'une part, ils permettent de saisir des relations non linéaires complexes ; d'autre part, ils ont tendance à mémoriser le bruit présent dans un ensemble de données. En regroupant les prédictions d'arbres entraînés différemment, les méthodes d'ensemble tirent parti de la flexibilité des arbres tout en réduisant leur tendance à mémoriser le bruit. Les méthodes d'ensemble sont utilisées dans divers domaines et ont été éprouvées en remportant de nombreux concours de machine learning. Dans ce cours, vous apprendrez à utiliser Python pour former des arbres de décision et des modèles basés sur des arbres à l'aide de la bibliothèque conviviale de machine learning scikit-learn. Vous comprendrez les avantages et les inconvénients des arbres et démontrerez comment l'assemblage peut pallier ces inconvénients, tout en vous exerçant sur des ensembles de données réels. Enfin, vous apprendrez également à ajuster les hyperparamètres les plus influents afin de tirer le meilleur parti de vos modèles.

Prérequis

Programme de formation

Plan du cours

2

Le compromis biais-variance

Le compromis biais-variance est l'un des concepts fondamentaux du machine learning supervisé. Dans ce chapitre, vous apprendrez à diagnostiquer les problèmes de surajustement et de sous-ajustement. Vous découvrirez également le concept d'ensembling, qui consiste à agréger les prédictions de plusieurs modèles afin d'obtenir des prédictions plus fiables.
Commencer le chapitre
3

Bagging et forêts aléatoires

Le bagging est une méthode d'ensemble qui consiste à entraîner plusieurs fois le même algorithme à l'aide de différents sous-ensembles échantillonnés à partir des données d'entraînement. Dans ce chapitre, vous apprendrez comment utiliser le bagging pour créer un ensemble d'arbres. Vous découvrirez également comment l'algorithme des forêts aléatoires peut conduire à une plus grande diversité de l'ensemble grâce à la randomisation au niveau de chaque division dans les arbres formant l'ensemble.
Commencer le chapitre
4

Boosting

Le boosting désigne une méthode d'ensemble dans laquelle plusieurs modèles sont entraînés séquentiellement, chaque modèle apprenant à partir des erreurs de ses prédécesseurs. Dans ce chapitre, vous découvrirez les deux méthodes de renforcement AdaBoost et Gradient Boosting.
Commencer le chapitre
5

Ajustement du modèle

Les hyperparamètres d'un modèle de machine learning sont des paramètres qui ne sont pas appris à partir des données. Ils doivent être définis avant d'adapter le modèle à l'ensemble d'apprentissage. Dans ce chapitre, vous apprendrez à ajuster les hyperparamètres d'un modèle basé sur un arbre à l'aide d'une validation croisée par recherche par grille.
Commencer le chapitre

Machine learning avec des modèles arborescents en Python

Cours
terminé

Obtenir un certificat d'achèvement

S’inscrire maintenant

Apprenez où que vous soyez avec l'application DataCamp

Même en déplacement, suivez quotidiennement nos cours mobiles et nos défis de codage de 5 minutes.