Build your ultimate AI agent
Kursbeskrivning
Dataintegritet är viktigare än någonsin. Men hur balanserar du integritetsskydd med behovet av att samla in och dela värdefulla affärsinsikter? I den här kursen lär du dig att göra just det, med samma metoder som Google och Amazon – däribland datageneralisering och integritetsmodeller som k-anonymitet och differentiell integritet. Du får också en introduktion till ämnen som GDPR, och du lär dig att bygga och träna maskininlärningsmodeller i Python som skyddar användarnas känsliga information, till exempel anställnings- och inkomstdata. Då sätter vi igång!
Förkunskapskrav
Kursplan
Kursöversikt
1
Introduktion till dataintegritet
Här får du öva på anonymiseringstekniker som datasuppression, maskering, generering av syntetiska data och generalisering. Du lär dig att skilja mellan känslig och icke-känslig personligt identifierbar information (PII), kvasiidentifierare och grunderna i GDPR. Du kommer även att se verkliga exempel på vad som kan gå fel om dessa bästa praxis inte följs.
- Vad är privat, och varför spelar det roll?50 XP
- Integritet är makt50 XP
- Känslig eller icke-känslig?100 XP
- Undertryckning av känsliga attribut100 XP
- Datamaskering och datagenerering med Faker50 XP
- Maskera känsliga personuppgifter100 XP
- Ta bort namn med faker100 XP
- Anonymisering med datageneralisering50 XP
- Minska identifieringsrisken med generalisering100 XP
- Dataaggregering och datageneralisering50 XP
- Top- och bottomkodning av Vita husets löner100 XP
2
Mer om integritetsbevarande tekniker
Lär dig att anonymisera data genom att sampla från datamängder utifrån kolumnernas sannolikhetsfördelning. Därefter lär du dig att tillämpa integritetsmodellen k-anonymitet för att förhindra länknings- eller återidentifieringsattacker, och att använda hierarkier för att utföra datageneralisering i kategoriska variabler.
3
Differentiell integritet
Utforska differentiell integritet – modellen som används av stora teknikföretag som Apple, Google och Uber. I det här kapitlet analyserar du data genom att generera privata histogram och beräkna privata medelvärden. Du skapar även differentiellt privata maskininlärningsmodeller som hjälper företag att öka nyttan av sina data.
4
Anonymisering och publicering av datamängder
I det här sista kapitlet lär du dig att tillämpa dimensionalitetsreduceringsmetoder som principalkomponentanalys (PCA) för att anonymisera stora datamängder med många kolumner. Du använder sedan Faker för att generera realistiska och konsekventa datamängder, och scikit-learn för att skapa syntetiska datamängder som följer en normalfördelning. Avslutningsvis knyter du ihop allt du lärt dig i kursen genom att kombinera flera tekniker för att på ett säkert sätt publicera datamängder offentligt.
Dataintegritet och anonymisering i Python
Kurs
slutförd

