Перейти к основному контенту

Курс

Конфиденциальность данных и анонимизация в Python

Продвинутый4 ч

Научитесь обрабатывать конфиденциальную информацию с помощью методов, сохраняющих конфиденциальность.

Python4 ч{count, plural, one {# видео} few {# видео} many {# видео} other {# видео}}{count, plural, one {# упражнение} few {# упражнения} many {# упражнений} other {# упражнения}}3,850 XP3,788Заявление об успешном завершении

Создайте бесплатный аккаунт

Продолжить с Google
или
Продолжая, вы принимаете наши Условия использования, наш Политика конфиденциальности и что ваши данные хранятся в США.

Любимый инструмент учащихся тысяч компаний

Обучаете команду?

Попробовать для бизнеса

Описание курса

Конфиденциальность данных важна как никогда. Но как сочетать защиту личной информации с необходимостью собирать и передавать ценные бизнес-аналитические данные? В этом курсе вы освоите именно такие методы — те же, что используют Google и Amazon: обобщение данных и модели конфиденциальности, такие как k-анонимность и дифференциальная приватность. Помимо ключевых тем, включая GDPR, вы узнаете, как создавать и обучать модели машинного обучения в Python, защищая при этом конфиденциальную информацию пользователей — например, данные о сотрудниках и доходах. Начнём!

Предварительные требования

Программа

Структура курса

1

Введение в конфиденциальность данных

Приготовьтесь применять методы анонимизации: подавление данных, маскирование, генерацию синтетических данных и обобщение. В этой главе вы научитесь различать чувствительные и нечувствительные персональные данные (PII), квазиидентификаторы, а также познакомитесь с основами GDPR. Кроме того, вы рассмотрите реальные примеры последствий несоблюдения этих методов.
Начать главу
2

Дополнительные методы защиты конфиденциальности

Узнайте, как анонимизировать данные путём выборки из наборов данных с учётом вероятностного распределения столбцов. Затем вы научитесь применять модель конфиденциальности k-анонимность для защиты от атак связывания и повторной идентификации, а также использовать иерархии для обобщения категориальных переменных.
Начать главу
3

Дифференциальная приватность

Изучите дифференциальную приватность — модель, которую применяют крупнейшие технологические компании, такие как Apple, Google и Uber. В этой главе вы исследуете данные с помощью построения приватных гистограмм и вычисления приватных средних значений, а также создадите модели машинного обучения с дифференциальной приватностью, позволяющие компаниям повысить ценность своих данных.
Начать главу
4

Анонимизация и публикация наборов данных

В заключительной главе вы научитесь применять методы снижения размерности, например метод главных компонент (PCA), для анонимизации многомерных наборов данных. Затем воспользуетесь Faker для генерации реалистичных и согласованных наборов данных, а scikit-learn — для создания синтетических данных с нормальным распределением. В завершение вы объедините всё, что узнали в этом курсе, и применёте несколько методов в совокупности, чтобы безопасно публиковать наборы данных.
Начать главу

Конфиденциальность данных и анонимизация в Python

Курс
завершён

Получить справку об окончании курса

Записаться

Развивайте навыки работы с данными с DataCamp для мобильных устройств

Продолжайте учиться в любом месте с мобильными курсами и ежедневными 5-минутными практическими заданиями.

Конфиденциальность данных и анонимизация в Python | DataCamp