Build your ultimate AI agent
Opis kursu
Prywatność danych jest dziś ważniejsza niż kiedykolwiek. Jak jednak pogodzić ochronę prywatności z potrzebą gromadzenia i udostępniania cennych informacji biznesowych? W tym kursie nauczysz się robić dokładnie to – korzystając z tych samych metod co Google i Amazon – w tym generalizacji danych oraz modeli prywatności, takich jak k-anonimowość i prywatność różniczkowa. Omówimy też zagadnienia związane z RODO, a także pokażemy, jak budować i trenować modele uczenia maszynowego w Pythonie, chroniąc wrażliwe dane użytkowników, takie jak dane pracowników czy informacje o dochodach. Zaczynamy!
Wymagania wstępne
Program kursu
Plan kursu
1
Wprowadzenie do prywatności danych
Zapoznaj się z technikami anonimizacji, takimi jak usuwanie danych, maskowanie, generowanie danych syntetycznych i generalizacja. W tym rozdziale nauczysz się odróżniać wrażliwe i niewrażliwe dane osobowe (PII), quasi-identyfikatory oraz poznasz podstawy RODO. Zobaczysz też przykłady z życia wzięte – co może pójść nie tak, jeśli zignoruje się te dobre praktyki.
- Co jest prywatne i dlaczego to ważne?50 XP
- Prywatność to potęga50 XP
- Wrażliwe czy niewrażliwe?100 XP
- Usuwanie wrażliwych atrybutów100 XP
- Maskowanie danych i generowanie danych za pomocą Faker50 XP
- Maskowanie wrażliwych danych osobowych100 XP
- Usuwanie imion i nazwisk za pomocą faker100 XP
- Anonimizacja z użyciem generalizacji danych50 XP
- Zmniejszanie ryzyka identyfikacji za pomocą generalizacji100 XP
- Agregacja danych a generalizacja danych50 XP
- Kodowanie górne i dolne wynagrodzeń w Białym Domu100 XP
2
Więcej o technikach ochrony prywatności
Dowiedz się, jak anonimizować dane poprzez próbkowanie ze zbiorów danych zgodnie z rozkładem prawdopodobieństwa kolumn. Następnie nauczysz się stosować model prywatności k-anonimowości, aby zapobiegać atakom polegającym na łączeniu lub ponownej identyfikacji danych, oraz używać hierarchii do generalizacji danych w zmiennych kategorycznych.
3
Prywatność różniczkowa
Poznaj prywatność różniczkową – model stosowany przez największe firmy technologiczne, takie jak Apple, Google i Uber. W tym rozdziale będziesz eksplorować dane, generując prywatne histogramy i obliczając prywatne średnie. Stworzysz też modele uczenia maszynowego z prywatnością różniczkową, które pozwalają firmom zwiększyć użyteczność ich danych.
4
Anonimizacja i udostępnianie zbiorów danych
W tym ostatnim rozdziale nauczysz się stosować metody redukcji wymiarowości, takie jak analiza głównych składowych (PCA), do anonimizacji dużych zbiorów danych z wieloma kolumnami. Następnie użyjesz biblioteki Faker do generowania realistycznych i spójnych zbiorów danych oraz scikit-learn do tworzenia syntetycznych zbiorów danych o rozkładzie normalnym. Na koniec połączysz wszystko, czego się nauczyłeś w tym kursie, łącząc wiele technik, aby bezpiecznie udostępniać zbiory danych publicznie.
Prywatność danych i anonimizacja w Pythonie
Kurs
ukończony

