Build your ultimate AI agent
Описание курса
Конфиденциальность данных важна как никогда. Но как сочетать защиту личной информации с необходимостью собирать и передавать ценные бизнес-аналитические данные? В этом курсе вы освоите именно такие методы — те же, что используют Google и Amazon: обобщение данных и модели конфиденциальности, такие как k-анонимность и дифференциальная приватность. Помимо ключевых тем, включая GDPR, вы узнаете, как создавать и обучать модели машинного обучения в Python, защищая при этом конфиденциальную информацию пользователей — например, данные о сотрудниках и доходах. Начнём!
Предварительные требования
Программа
Структура курса
1
Введение в конфиденциальность данных
Приготовьтесь применять методы анонимизации: подавление данных, маскирование, генерацию синтетических данных и обобщение. В этой главе вы научитесь различать чувствительные и нечувствительные персональные данные (PII), квазиидентификаторы, а также познакомитесь с основами GDPR. Кроме того, вы рассмотрите реальные примеры последствий несоблюдения этих методов.
- Что является личными данными и почему это важно?50 XP
- Конфиденциальность как ценность50 XP
- Чувствительные или нечувствительные данные?100 XP
- Подавление чувствительных атрибутов100 XP
- Маскирование данных и генерация данных с помощью Faker50 XP
- Маскирование конфиденциальных персональных данных100 XP
- Удаление имён с помощью faker100 XP
- Анонимизация с помощью обобщения данных50 XP
- Снижение риска идентификации с помощью обобщения100 XP
- Агрегация и обобщение данных50 XP
- Верхнее и нижнее кодирование зарплат в Белом доме100 XP
2
Дополнительные методы защиты конфиденциальности
Узнайте, как анонимизировать данные путём выборки из наборов данных с учётом вероятностного распределения столбцов. Затем вы научитесь применять модель конфиденциальности k-анонимность для защиты от атак связывания и повторной идентификации, а также использовать иерархии для обобщения категориальных переменных.
3
Дифференциальная приватность
Изучите дифференциальную приватность — модель, которую применяют крупнейшие технологические компании, такие как Apple, Google и Uber. В этой главе вы исследуете данные с помощью построения приватных гистограмм и вычисления приватных средних значений, а также создадите модели машинного обучения с дифференциальной приватностью, позволяющие компаниям повысить ценность своих данных.
4
Анонимизация и публикация наборов данных
В заключительной главе вы научитесь применять методы снижения размерности, например метод главных компонент (PCA), для анонимизации многомерных наборов данных. Затем воспользуетесь Faker для генерации реалистичных и согласованных наборов данных, а scikit-learn — для создания синтетических данных с нормальным распределением. В завершение вы объедините всё, что узнали в этом курсе, и применёте несколько методов в совокупности, чтобы безопасно публиковать наборы данных.
Конфиденциальность данных и анонимизация в Python
Курс
завершён

