본문으로 바로가기

코스

Python으로 배우는 데이터 프라이버시와 익명화

고급4시간

프라이버시 보존 기법으로 민감 정보를 안전하게 처리하는 방법을 학습하세요.

Python4시간16개 동영상49개 연습 문제3,850 XP3,790수료 확인서

무료 계정 만들기

Google에서 계속 진행
또는
계속 진행하시면 다음 약관에 동의하는 것으로 간주됩니다: 이용약관, 우리의 개인정보 처리방침 그리고 귀하의 데이터가 미국에 저장된다는 점입니다.

수천 개 기업의 학습자가 선택한 서비스

코스 설명

데이터 프라이버시는 그 어느 때보다 중요합니다. 그렇다면 귀중한 비즈니스 인사이트를 수집하고 공유하는 필요성과 프라이버시를 어떻게 균형 있게 맞출 수 있을까요? 이 강의에서는 Google과 Amazon이 사용하는 것과 같은 방법—데이터 일반화와 k-Anonymity, 차등 프라이버시 같은 프라이버시 모델—을 활용해 그 해법을 배웁니다. 또한 GDPR 같은 주제를 짚어 보면서, 직원 정보나 소득 데이터처럼 민감한 사용자 정보를 보호한 채로 Python에서 Machine Learning 모델을 구축하고 학습하는 방법도 알아봅니다. 지금 시작해 볼까요!

사전 요구 사항

커리큘럼

코스 개요

1

데이터 프라이버시 소개

데이터 억제(suppression), 마스킹(masking), 합성 데이터 생성, 일반화 같은 익명화 기법을 직접 적용할 준비를 해 보세요. 이 장에서는 민감 및 비민감 식별정보(PII), 준식별자(quasi-identifiers)를 구분하는 방법과 GDPR의 기초를 배웁니다. 또한 이러한 모범 사례를 지키지 않았을 때 실제로 어떤 문제가 생길 수 있는지 사례를 통해 확인합니다.
챕터 시작하기
2

프라이버시 보호 기법 더 알아보기

열의 확률 분포를 따르도록 데이터셋에서 샘플링해 데이터를 익명화하는 방법을 알아봅니다. 그런 다음 연결 공격이나 재식별 공격을 방지하기 위해 k-anonymity 프라이버시 모델을 적용하고, 범주형 변수에서 계층(hierarchy)을 사용해 데이터 일반화를 수행하는 방법을 배웁니다.
챕터 시작하기
3

차등 프라이버시

Apple, Google, Uber와 같은 주요 기술 기업이 사용하는 모델인 차등 프라이버시에 대해 학습합니다. 이 장에서는 프라이빗 히스토그램을 생성하고 프라이빗 평균을 계산해 데이터를 탐색해 봅니다. 또한 기업이 데이터 효용성을 높일 수 있도록 지원하는 차등 프라이빗 Machine Learning 모델을 만들어 봅니다.
챕터 시작하기
4

데이터셋 익명화와 공개

마지막 장에서는 주성분분석(PCA)과 같은 차원 축소 기법을 적용해 다수 열을 가진 대규모 데이터셋을 익명화하는 방법을 배웁니다. 이어서 Faker를 사용해 현실적이고 일관된 데이터셋을 생성하고, scikit-learn으로 정규 분포를 따르는 합성 데이터셋을 만듭니다. 마지막으로, 강의 전반에서 학습한 내용을 종합해 여러 기법을 결합하고 데이터셋을 안전하게 대중에 공개하는 과정을 마무리합니다.
챕터 시작하기

Python으로 배우는 데이터 프라이버시와 익명화

코스
완료

성취 확인서 획득하기

지금 등록하기

DataCamp for Mobile로 데이터 스킬을 키워보세요

모바일 강의와 매일 5분 코딩 챌린지로 이동 중에도 학습을 진행하세요.