Build your ultimate AI agent
Description du cours
La confidentialité des données n’a jamais été aussi cruciale. Mais comment trouver l’équilibre entre protection de la vie privée et besoin de recueillir et de partager des informations métier utiles ? Dans ce cours, vous apprendrez à le faire en vous appuyant sur les mêmes méthodes que Google et Amazon — notamment la généralisation des données et des modèles de confidentialité comme la k-anonymat et la differential privacy. En plus d’aborder des sujets comme le RGPD, vous découvrirez comment créer et entraîner des modèles de Machine Learning en Python tout en protégeant les informations sensibles des utilisateurs, telles que les données d’employés et de revenus. Commençons !
Prérequis
Programme de formation
Plan du cours
1
Introduction à la confidentialité des données
Préparez-vous à appliquer des techniques d’anonymisation comme la suppression de données, le masquage, la génération de données synthétiques et la généralisation. Dans ce chapitre, vous apprendrez à distinguer les informations personnellement identifiables (PII) sensibles et non sensibles, les quasi-identifiants, ainsi que les bases du RGPD. Vous verrez aussi des exemples concrets de ce qui peut mal tourner si ces bonnes pratiques ne sont pas respectées.
- Qu’est-ce qui est privé, et pourquoi est-ce important ?50 XP
- La vie privée, c’est le pouvoir50 XP
- Est-ce sensible ou non sensible ?100 XP
- Suppression d’attributs sensibles100 XP
- Masquage des données et génération de données avec Faker50 XP
- Masquage des PII sensibles100 XP
- Supprimer les noms avec faker100 XP
- Anonymiser avec la généralisation des données50 XP
- Réduire le risque de ré-identification grâce à la généralisation100 XP
- Agrégation de données et généralisation de données50 XP
- Top- et bottom-coding des salaires de la Maison-Blanche100 XP
2
Aller plus loin avec les techniques de protection de la vie privée
Découvrez comment anonymiser des données en échantillonnant des jeux de données selon la distribution de probabilité des colonnes. Vous apprendrez ensuite à appliquer le modèle de confidentialité k-anonymat pour prévenir les attaques de recoupement ou de réidentification, et à utiliser des hiérarchies pour généraliser des variables catégorielles.
3
Differential Privacy
Découvrez la differential privacy, un modèle utilisé par de grandes entreprises technologiques comme Apple, Google et Uber. Dans ce chapitre, vous explorerez les données en générant des histogrammes privés et en calculant des moyennes privées. Vous créerez également des modèles de Machine Learning différentiellement privés qui permettent aux entreprises d’augmenter l’utilité de leurs données.
4
Anonymiser et publier des jeux de données
Dans ce dernier chapitre, vous apprendrez à appliquer des méthodes de réduction de dimensionnalité telles que l’analyse en composantes principales (PCA) pour anonymiser de grands jeux de données multicolonnes. Vous utiliserez ensuite Faker pour générer des jeux de données réalistes et cohérents, et scikit-learn pour créer des jeux de données synthétiques suivant une distribution normale. Enfin, vous rassemblerez tout ce que vous avez appris dans ce cours en combinant plusieurs techniques afin de publier des jeux de données en toute sécurité.
Confidentialité des données et anonymisation en Python
Cours
terminé

