Hoppa till huvudinnehållet

Kurs

Introduktion till avvikelsedetektering i R

Medel4 tim

Lär dig statistiska tester för att hitta outliers och använda avancerade algoritmer för anomaly scoring.

R4 tim13 videor47 övningar3,900 XP7,363Prestationsintyg

Skapa ditt gratiskonto

Fortsätt med Google
eller
Genom att fortsätta godkänner du vår användarvillkor, våra integritetspolicy och att dina uppgifter lagras i USA.

Uppskattad av lärande på tusentals företag

Utbildar du ett team?

Prova för företag

Kursbeskrivning

Är du orolig för felaktiga eller misstänkta poster i dina data, men vet inte var du ska börja? En algoritm för avvikelsedetektering kan vara lösningen! Avvikelsedetektering är en samling tekniker för att identifiera ovanliga datapunkter, och är avgörande för att upptäcka bedrägerier och skydda datornätverk mot skadlig aktivitet. I den här kursen utforskar du statistiska tester för att identifiera extremvärden och lär dig använda avancerade algoritmer för avvikelsepoängsättning, som lokal extremvärdesdetektor och isolation forest. Du tillämpar avvikelsedetektering för att hitta ovanliga viner i UCI:s dataset för vinkvalitet, samt för att identifiera fall av sköldkörtelsjukdom utifrån onormala hormonmätningar.

Förkunskapskrav

Kursplan

Kursöversikt

1

Statistisk detektering av extremvärden

I det här kapitlet lär du dig hur numeriska och grafiska sammanfattningar kan användas för att informellt bedöma om data innehåller ovanliga punkter. Du använder ett statistiskt förfarande som kallas Grubbs test för att kontrollera om en punkt är ett extremvärde, och lär dig om algoritmen Seasonal-Hybrid ESD, som kan hjälpa till att identifiera extremvärden när data utgör en tidsserie.
Starta kapitel
2

Avvikelsedetektering baserad på avstånd och densitet

I det här kapitlet lär du dig hur man beräknar avståndet till de k närmaste grannarna och den lokala extremvärdesdetektor (local outlier factor), som används för att konstruera kontinuerliga avvikelsepoäng för varje datapunkt när data har flera egenskaper. Du lär dig skillnaden mellan lokala och globala avvikelser, och hur de två algoritmerna kan vara användbara i respektive fall.
Starta kapitel
3

Isolation forest

Avståndet till k närmaste grannar och lokal extremvärdesdetektor använder avståndet eller den relativa densiteten hos de närmaste grannarna för att poängsätta varje punkt. I det här kapitlet utforskar du ett alternativt trädbaserat tillvägagångssätt som kallas isolation forest – en snabb och robust metod för avvikelsedetektering som mäter hur lätt punkter kan separeras genom att slumpmässigt dela upp data i allt mindre regioner.
Starta kapitel
4

Jämförelse av prestanda

Nu har du bekantat dig med ett antal olika algoritmer för avvikelsepoängsättning. I det här avslutande kapitlet lär du dig att jämföra algoritmernas detekteringsprestanda i fall där märkta avvikelser finns tillgängliga. Du lär dig att beräkna och tolka precision och återanrop för en avvikelsepoäng, samt hur algoritmerna kan anpassas för att hantera data med kategoriska egenskaper.
Starta kapitel
R

Introduktion till avvikelsedetektering i R

Kurs
slutförd

Tjäna ett prestationsbevis

Registrera dig nu

Utveckla dina datafärdigheter med DataCamp for Mobile

Gör framsteg på språng med våra mobilkurser och dagliga femminuters kodningsutmaningar.