Hoppa till huvudinnehållet

Kurs

Dataintegritet och anonymisering i Python

Avancerad4 tim

Lär dig att bearbeta känslig information med integritetsbevarande tekniker.

Python4 tim16 videor49 övningar3,850 XP3,790Intyg om fullgjord kurs

Skapa ditt kostnadsfria konto

Fortsätt med Google
eller
Genom att fortsätta godkänner du våra Användarvillkor, vår Integritetspolicy och att dina data lagras i USA.

Älskad av elever på tusentals företag

Utbildar ett team?

Prova för företag

Kursbeskrivning

Dataintegritet är viktigare än någonsin. Men hur balanserar du integritetsskydd med behovet av att samla in och dela värdefulla affärsinsikter? I den här kursen lär du dig att göra just det, med samma metoder som Google och Amazon – däribland datageneralisering och integritetsmodeller som k-anonymitet och differentiell integritet. Du får också en introduktion till ämnen som GDPR, och du lär dig att bygga och träna maskininlärningsmodeller i Python som skyddar användarnas känsliga information, till exempel anställnings- och inkomstdata. Då sätter vi igång!

Förkunskapskrav

Kursplan

Kursöversikt

1

Introduktion till dataintegritet

Här får du öva på anonymiseringstekniker som datasuppression, maskering, generering av syntetiska data och generalisering. Du lär dig att skilja mellan känslig och icke-känslig personligt identifierbar information (PII), kvasiidentifierare och grunderna i GDPR. Du kommer även att se verkliga exempel på vad som kan gå fel om dessa bästa praxis inte följs.
Starta kapitel
2

Mer om integritetsbevarande tekniker

Lär dig att anonymisera data genom att sampla från datamängder utifrån kolumnernas sannolikhetsfördelning. Därefter lär du dig att tillämpa integritetsmodellen k-anonymitet för att förhindra länknings- eller återidentifieringsattacker, och att använda hierarkier för att utföra datageneralisering i kategoriska variabler.
Starta kapitel
3

Differentiell integritet

Utforska differentiell integritet – modellen som används av stora teknikföretag som Apple, Google och Uber. I det här kapitlet analyserar du data genom att generera privata histogram och beräkna privata medelvärden. Du skapar även differentiellt privata maskininlärningsmodeller som hjälper företag att öka nyttan av sina data.
Starta kapitel
4

Anonymisering och publicering av datamängder

I det här sista kapitlet lär du dig att tillämpa dimensionalitetsreduceringsmetoder som principalkomponentanalys (PCA) för att anonymisera stora datamängder med många kolumner. Du använder sedan Faker för att generera realistiska och konsekventa datamängder, och scikit-learn för att skapa syntetiska datamängder som följer en normalfördelning. Avslutningsvis knyter du ihop allt du lärt dig i kursen genom att kombinera flera tekniker för att på ett säkert sätt publicera datamängder offentligt.
Starta kapitel

Dataintegritet och anonymisering i Python

Kurs
slutförd

Tjäna intyg om genomförande

Registrera dig nu

Utveckla dina datakunskaper med DataCamp för mobil

Ta dig framåt var du än är med våra mobilkurser och dagliga 5-minuterskodningsutmaningar.