Build your ultimate AI agent
Descrierea cursului
Ești îngrijorat de înregistrări incorecte sau suspecte din datele tale, dar nu știi de unde să începi? Un algoritm de detecție a anomaliilor te-ar putea ajuta! Detecția anomaliilor reprezintă o colecție de tehnici concepute pentru a identifica puncte de date neobișnuite și este esențială pentru depistarea fraudelor și protejarea rețelelor de calculatoare împotriva activităților malițioase. În acest curs, vei explora teste statistice pentru identificarea valorilor extreme și vei învăța să folosești algoritmi sofisticați de scorare a anomaliilor, precum factorul local de devianță și pădurea de izolare. Vei aplica algoritmi de detecție a anomaliilor pentru a identifica vinuri neobișnuite din setul de date UCI Wine Quality și pentru a detecta cazuri de boală tiroidiană pe baza unor măsurători hormonale anormale.
Cerințe prealabile
Curriculum
Structura cursului
1
Detecția statistică a valorilor extreme
În acest capitol, vei învăța cum pot fi folosite rezumatele numerice și grafice pentru a evalua informal dacă datele conțin puncte neobișnuite. Vei aplica o procedură statistică numită testul Grubbs pentru a verifica dacă un punct este o valoare extremă și vei afla despre algoritmul Seasonal-Hybrid ESD, care poate ajuta la identificarea valorilor extreme în cazul seriilor de timp.
- Ce înțelegem prin anomalii?50 XP
- Identificarea tipurilor de anomalii50 XP
- Explorarea datelor privind nitrații din râu100 XP
- Testarea valorilor extreme cu testul Grubbs50 XP
- Verificare vizuală a normalității100 XP
- Testul Grubbs100 XP
- Identificarea mai multor valori aberante cu testul Grubbs100 XP
- Anomalii în serii de timp50 XP
- Evaluarea vizuală a sezonalității100 XP
- Algoritmul Seasonal Hybrid ESD100 XP
- Interpretarea rezultatelor algoritmului Seasonal-Hybrid ESD100 XP
- Seasonal-Hybrid ESD versus testul Grubbs50 XP
2
Detecția anomaliilor bazată pe distanță și densitate
În acest capitol, vei învăța cum să calculezi distanța față de cei mai apropiați k vecini și factorul local de devianță, folosite pentru a construi scoruri continue de anomalie pentru fiecare punct de date atunci când datele au mai multe atribute. Vei înțelege diferența dintre anomaliile locale și cele globale și cum pot ajuta cei doi algoritmi în fiecare caz.
3
Pădurea de izolare
Distanța față de cei mai apropiați k vecini și factorul local de devianță utilizează distanța sau densitatea relativă a vecinilor cei mai apropiați pentru a scora fiecare punct. În acest capitol, vei explora o abordare alternativă bazată pe arbori, numită pădure de izolare – o metodă rapidă și robustă de detectare a anomaliilor, care măsoară cât de ușor pot fi separate punctele prin împărțirea aleatorie a datelor în regiuni din ce în ce mai mici.
4
Compararea performanței
Ai explorat deja câțiva algoritmi diferiți pentru scorarea anomaliilor. În acest capitol final, vei învăța să compari performanța de detecție a algoritmilor în situațiile în care anomaliile sunt etichetate. Vei calcula și interpreta statisticile de precizie și recuperare pentru un scor de anomalie și vei afla cum să adaptezi algoritmii astfel încât să poată gestiona date cu atribute categoriale.
R
Introducere în Detecția Anomaliilor în R
Curs
finalizat

