メインコンテンツへスキップ

コース

Pythonで学ぶデータプライバシーと匿名化

上級4 時間

プライバシー保護手法を用いて、機密情報を安全に処理する方法を学びましょう。

Python4 時間16 本の動画49 個の演習3,850 XP3,790修了証明書

無料アカウントを作成

Google で続行
または
続行することで、 利用規約、私たちの プライバシーポリシー そして、あなたのデータが米国に保存されること。

何千もの企業の学習者に支持されています

チームのトレーニングをお考えですか?

ビジネス向けに試す

コース説明

データプライバシーの重要性はこれまでになく高まっています。一方で、価値あるビジネスインサイトを収集・共有するニーズとの両立はどうすればよいのでしょうか?このコースでは、GoogleやAmazonが用いるのと同じ手法――データの一般化や、k-Anonymity や Differential Privacy といったプライバシーモデル――を使って、そのバランスの取り方を学びます。GDPR などの話題に触れつつ、従業員情報や収入データのような機微情報を保護しながら、Python で Machine Learning モデルを構築・学習させる方法も身につけます。さあ、始めましょう!

前提条件

カリキュラム

コース概要

1

データプライバシー入門

データ抑制、マスキング、合成データ生成、一般化といった匿名化手法を実践する準備をしましょう。この章では、機微情報と非機微情報の個人特定情報(PII)の見分け方、準識別子、そして GDPR の基本を学びます。さらに、これらのベストプラクティスに従わなかった場合に現実世界で起こりうる問題の例も確認します。
2

プライバシー保護手法をさらに深く

列の確率分布に従ってデータセットからサンプリングし、データを匿名化する方法を学びます。続いて、リンク攻撃や再識別攻撃を防ぐために k-anonymity のプライバシーモデルを適用し、カテゴリ変数に対して階層を用いたデータ一般化を行う方法を身につけます。
3

Differential Privacy

Apple、Google、Uber などの大手テクノロジー企業が採用する Differential Privacy について学びます。この章では、プライベートなヒストグラムを生成したり、データのプライベート平均を計算したりしてデータを探索します。さらに、企業がデータの有用性を高められるように、Differential Privacy を満たす Machine Learning モデルを作成します。
4

データセットの匿名化と公開

最終章では、主成分分析(PCA)などの次元削減手法を用いて、多数の列を持つ大規模データセットを匿名化する方法を学びます。次に、Faker を使って現実味があり一貫性のあるデータセットを生成し、scikit-learn を使って正規分布に従う合成データセットを作成します。最後に、これまで学んだ内容を統合し、複数の手法を組み合わせてデータセットを安全に一般公開するまでを行います。

Pythonで学ぶデータプライバシーと匿名化

コース修了

達成証明書を取得する

今すぐ登録

DataCamp for Mobileでデータスキルを磨きましょう

モバイルコースと毎日5分のコーディングチャレンジで、外出先でも学習を進めましょう。