Après avoir suivi ces cours, je me sens confiant dans la création de visualisations et de tableaux de bord professionnels.
Description du cours
Dans ce cours, vous allez apprendre à modéliser des données. Les modèles cherchent à capturer la relation entre une variable d’intérêt (variable à expliquer) et une série de variables explicatives/prédictives. Ces modèles peuvent servir à des fins explicatives, par exemple « Savoir l’âge des professeurs aide-t-il à expliquer leurs notes d’évaluation pédagogique ? », ou à des fins prédictives, par exemple « Dans quelle mesure peut-on prédire le prix d’une maison à partir de sa taille et de son état ? ». Vous mettrez à profit vos compétences en tidyverse pour construire et interpréter de tels modèles. Ce cours est centré sur l’utilisation de la régression linéaire, l’une des approches de modélisation les plus courantes et faciles à comprendre. Ce type de modélisation et de raisonnement est utilisé dans de nombreux domaines, notamment les statistiques, l’inférence causale, le Machine Learning et l’intelligence artificielle.
Prérequis
Programme de formation
Plan du cours
1
Introduction à la modélisation
Dans ce chapitre, vous découvrirez des notions de base et la terminologie de la modélisation : le cadre général de modélisation, la différence entre modéliser pour expliquer et modéliser pour prédire, ainsi que la problématique de modélisation. Vous commencerez aussi votre première analyse exploratoire des données, une étape essentielle avant toute modélisation formelle.
- Bases du modélisation pour l’explication50 XP
- Visualisation exploratoire de l’âge100 XP
- Synthèses numériques de l’âge100 XP
- Bases théoriques de la modélisation pour la prédiction50 XP
- Visualisation exploratoire de la taille des maisons100 XP
- Transformation log10 de la surface de la maison100 XP
- Le problème de modélisation pour l’explication50 XP
- EDA de la relation entre les notes d’évaluation de l’enseignement et les scores de « beauté »100 XP
- Corrélation entre les notes d’enseignement et les scores de « beauté »100 XP
- Le problème de modélisation pour la prédiction50 XP
- AED sur la relation entre le prix des maisons et la proximité de l’eau100 XP
- Prédire le prix d’une maison avec la variable waterfront100 XP
2
Modéliser avec une régression simple
Fort de votre compréhension du cadre général de modélisation, nous aborderons dans ce chapitre la régression linéaire simple, où vous modéliserez la variable de sortie y en fonction d’une seule variable explicative/prédictive x. Nous utiliserons des variables x numériques et catégorielles. La variable d’intérêt de ce chapitre sera la note d’évaluation pédagogique d’enseignants de l’Université du Texas, à Austin.
3
Modéliser avec une régression multiple
Au chapitre précédent, vous avez étudié la régression simple avec un seul prédicteur, numérique ou catégoriel. Mais pourquoi se limiter à une seule variable pour éclairer vos explications ou prédictions ? Vous allez maintenant étendre la régression simple à la régression multiple, qui permet d’intégrer plusieurs variables explicatives ou prédictives dans vos modèles. Vous modéliserez les prix des maisons à partir d’un jeu de données portant sur des logements de l’aire métropolitaine de Seattle (WA).
4
Évaluation et sélection de modèles
Dans les chapitres précédents, vous avez ajusté différents modèles pour expliquer ou prédire une variable d’intérêt. Mais comment savoir quels modèles choisir ? Les mesures d’évaluation de modèles permettent d’estimer la qualité de l’« ajustement » d’un modèle explicatif à des données, ou la précision d’un modèle prédictif. À partir de ces mesures, vous apprendrez des critères pour déterminer quels modèles sont « les meilleurs ».
R
Modéliser des données avec le Tidyverse
Cours
terminé

