Build your ultimate AI agent
Description du cours
Les arbres de décision sont des modèles d'apprentissage supervisé utilisés pour les problèmes impliquant la classification et la régression. Les modèles arborescents offrent une grande flexibilité, mais cela a un coût : d'une part, ils permettent de saisir des relations non linéaires complexes ; d'autre part, ils ont tendance à mémoriser le bruit présent dans un ensemble de données. En regroupant les prédictions d'arbres entraînés différemment, les méthodes d'ensemble tirent parti de la flexibilité des arbres tout en réduisant leur tendance à mémoriser le bruit. Les méthodes d'ensemble sont utilisées dans divers domaines et ont été éprouvées en remportant de nombreux concours de machine learning.
Dans ce cours, vous apprendrez à utiliser Python pour former des arbres de décision et des modèles basés sur des arbres à l'aide de la bibliothèque conviviale de machine learning scikit-learn. Vous comprendrez les avantages et les inconvénients des arbres et démontrerez comment l'assemblage peut pallier ces inconvénients, tout en vous exerçant sur des ensembles de données réels. Enfin, vous apprendrez également à ajuster les hyperparamètres les plus influents afin de tirer le meilleur parti de vos modèles.
Prérequis
Programme de formation
Plan du cours
1
Arbres de classification et de régression
Les arbres de classification et de régression (CART) sont un ensemble de modèles d'apprentissage supervisé utilisés pour les problèmes impliquant la classification et la régression. Dans ce chapitre, vous découvrirez l'algorithme CART.
- Arbre de décision pour la classification50 XP
- Entraînez votre premier arbre de classification100 XP
- Évaluer l'arbre de classification100 XP
- Régression logistique et arbre de classification100 XP
- Arbre de classification d’apprentissage50 XP
- Développer un arbre de classification50 XP
- Utilisation de l'entropie comme critère100 XP
- Entropie vs index de Gini100 XP
- Arbre de décision pour la régression50 XP
- Entraînez votre premier arbre de régression100 XP
- Évaluer l'arbre de régression100 XP
- Régression linéaire et arbre de régression100 XP
2
Le compromis biais-variance
Le compromis biais-variance est l'un des concepts fondamentaux du machine learning supervisé. Dans ce chapitre, vous apprendrez à diagnostiquer les problèmes de surajustement et de sous-ajustement. Vous découvrirez également le concept d'ensembling, qui consiste à agréger les prédictions de plusieurs modèles afin d'obtenir des prédictions plus fiables.
3
Bagging et forêts aléatoires
Le bagging est une méthode d'ensemble qui consiste à entraîner plusieurs fois le même algorithme à l'aide de différents sous-ensembles échantillonnés à partir des données d'entraînement. Dans ce chapitre, vous apprendrez comment utiliser le bagging pour créer un ensemble d'arbres. Vous découvrirez également comment l'algorithme des forêts aléatoires peut conduire à une plus grande diversité de l'ensemble grâce à la randomisation au niveau de chaque division dans les arbres formant l'ensemble.
4
Boosting
Le boosting désigne une méthode d'ensemble dans laquelle plusieurs modèles sont entraînés séquentiellement, chaque modèle apprenant à partir des erreurs de ses prédécesseurs. Dans ce chapitre, vous découvrirez les deux méthodes de renforcement AdaBoost et Gradient Boosting.
5
Ajustement du modèle
Les hyperparamètres d'un modèle de machine learning sont des paramètres qui ne sont pas appris à partir des données. Ils doivent être définis avant d'adapter le modèle à l'ensemble d'apprentissage. Dans ce chapitre, vous apprendrez à ajuster les hyperparamètres d'un modèle basé sur un arbre à l'aide d'une validation croisée par recherche par grille.
Machine learning avec des modèles arborescents en Python
Cours
terminé

