Accéder au contenu principal

Cours

Analyse de clusters en Python

Intermédiaire4 h

Dans ce cours, vous découvrirez l’apprentissage non supervisé via des techniques comme le clustering hiérarchique et k-means avec la bibliothèque SciPy.

Python4 h14 vidéos46 exercices3,650 XP65,448Attestation de réussite

Créez votre compte gratuit

Continuer avec Google
ou
En continuant, vous acceptez nos Conditions d’utilisation, notre notre Politique de confidentialité et que vos données sont stockées aux États-Unis.

Plébiscité par des apprenants dans des milliers d’entreprises

Description du cours

Vous avez sans doute déjà utilisé Google Actualités, qui regroupe automatiquement des articles similaires sous un même thème. Vous êtes-vous demandé quel processus se cache derrière ces regroupements ? Dans ce cours, vous allez découvrir l’apprentissage non supervisé au travers du clustering avec la bibliothèque SciPy en Python. Le cours couvre le prétraitement des données et l’application du clustering hiérarchique et de k-means. Tout au long du cours, vous explorerez les statistiques de joueurs issues d’un célèbre jeu vidéo de football, FIFA 18. À la fin, vous serez en mesure d’appliquer rapidement différents algorithmes de clustering à des données, de visualiser les clusters formés et d’analyser les résultats.

Prérequis

Programme de formation

Plan du cours

1

Introduction au clustering

Avant de pouvoir classer des articles d’actualité, il est essentiel de découvrir les bases du clustering. Ce chapitre vous familiarise avec une classe d’algorithmes de Machine Learning appelée apprentissage non supervisé, puis vous présente le clustering, l’un de ses algorithmes phares. Vous verrez deux techniques de clustering populaires : le clustering hiérarchique et le clustering k-means. Le chapitre se termine par les étapes de prétraitement essentielles avant de commencer à regrouper des données.
Commencer le chapitre
2

Clustering hiérarchique

Ce chapitre s’intéresse à un algorithme de clustering très répandu — le clustering hiérarchique — et à son implémentation dans SciPy. Au-delà de la procédure pour réaliser un clustering hiérarchique, il vous aide à répondre à une question clé : combien de clusters votre jeu de données contient-il ? Le chapitre se conclut par une présentation des limites du clustering hiérarchique et des points d’attention lors de son utilisation.
Commencer le chapitre
3

Clustering k-means

Ce chapitre présente un autre algorithme de clustering — le clustering k-means — et son implémentation dans SciPy. Le k-means corrige le principal inconvénient du clustering hiérarchique évoqué au chapitre précédent. Les dendrogrammes étant propres au clustering hiérarchique, ce chapitre aborde une méthode pour déterminer le nombre de clusters avant d’exécuter k-means. Il se termine par une discussion sur les limites de k-means et les précautions à prendre lors de son usage.
Commencer le chapitre
4

Le clustering dans le monde réel

Maintenant que vous maîtrisez deux des techniques de clustering les plus utilisées, ce chapitre vous aide à appliquer ces connaissances à des problèmes concrets. Il commence par le processus d’extraction des couleurs dominantes d’une image, puis revient au problème présenté en introduction : le regroupement d’articles d’actualité. Le chapitre se conclut par une discussion sur le clustering avec de multiples variables, qui rend la visualisation de l’ensemble des données plus difficile.
Commencer le chapitre

Analyse de clusters en Python

Cours
terminé

Obtenir un certificat d'achèvement

S’inscrire maintenant

Apprenez où que vous soyez avec l'application DataCamp

Même en déplacement, suivez quotidiennement nos cours mobiles et nos défis de codage de 5 minutes.