Accéder au contenu principal

Cours

Introduction à la détection d’anomalies en R

Intermédiaire4 h

Apprenez les tests statistiques pour identifier les valeurs aberrantes et à utiliser des algorithmes sophistiqués de notation des anomalies.

R4 h13 vidéos47 exercices3,900 XP7,345Attestation de réussite

Créez votre compte gratuit

Continuer avec Google
ou
En continuant, vous acceptez nos Conditions d’utilisation, notre notre Politique de confidentialité et que vos données sont stockées aux États-Unis.

Plébiscité par des apprenants dans des milliers d’entreprises

Description du cours

Vous vous inquiétez de la présence d’enregistrements inexacts ou suspects dans vos données, sans savoir par où commencer ? Un algorithme de détection d’anomalies peut vous aider ! La détection d’anomalies regroupe des techniques destinées à repérer des points de données inhabituels, et elle est essentielle pour détecter la fraude et protéger les réseaux informatiques contre les activités malveillantes. Dans ce cours, vous explorerez des tests statistiques pour identifier les valeurs aberrantes et apprendrez à utiliser des algorithmes de notation d’anomalies avancés comme le facteur d’isolement local (local outlier factor) et l’isolation forest. Vous appliquerez ces techniques pour trouver des vins atypiques dans le jeu de données UCI Wine Quality et pour détecter des cas de maladie thyroïdienne à partir de mesures hormonales anormales.

Prérequis

Programme de formation

Plan du cours

1

Détection statistique des valeurs aberrantes

Dans ce chapitre, vous verrez comment des résumés numériques et graphiques peuvent servir à évaluer de manière informelle si les données contiennent des points inhabituels. Vous utiliserez une procédure statistique appelée test de Grubbs pour vérifier si un point est une valeur aberrante, et découvrirez l’algorithme Seasonal-Hybrid ESD, utile pour repérer des valeurs aberrantes lorsque les données forment une série chronologique.
Commencer le chapitre
2

Détection d’anomalies basée sur la distance et la densité

Dans ce chapitre, vous apprendrez à calculer la distance des k plus proches voisins (k-nearest neighbors) et le facteur d’isolement local (local outlier factor), qui servent à construire des scores d’anomalie continus pour chaque point lorsque les données ont plusieurs variables. Vous verrez la différence entre anomalies locales et globales et comment ces deux algorithmes peuvent aider dans chaque cas.
Commencer le chapitre
3

Isolation forest

La distance des k plus proches voisins et le facteur d’isolement local s’appuient sur la distance ou la densité relative des voisins les plus proches pour attribuer un score à chaque point. Dans ce chapitre, vous explorerez une approche alternative basée sur des arbres, appelée isolation forest, une méthode rapide et robuste de détection d’anomalies qui mesure à quel point il est facile d’isoler les points en scindant aléatoirement les données en régions de plus en plus petites.
Commencer le chapitre
4

Comparer les performances

Vous avez maintenant découvert plusieurs algorithmes de notation d’anomalies. Dans ce dernier chapitre, vous apprendrez à comparer les performances de détection des algorithmes lorsque des anomalies étiquetées sont disponibles. Vous calculerez et interpréterez la précision (precision) et le rappel (recall) d’un score d’anomalie, et verrez comment adapter les algorithmes pour gérer des données comportant des variables catégorielles.
Commencer le chapitre
R

Introduction à la détection d’anomalies en R

Cours
terminé

Obtenir un certificat d'achèvement

S’inscrire maintenant

Apprenez où que vous soyez avec l'application DataCamp

Même en déplacement, suivez quotidiennement nos cours mobiles et nos défis de codage de 5 minutes.