メインコンテンツにスキップ

コース

Pythonで学ぶ次元削減

中級4 時間

データの次元削減の概念を理解し、Pythonでその手法を実践的に習得しましょう。

Python4 時間動画 16 本演習 58 件4,700 XP36,911修了証明書

無料アカウントを作成する

Googleで続行
または
続行すると、次に同意したものとみなされます: 利用規約プライバシーポリシー 、およびデータが米国内に保管されることに同意したものとみなされます。

何千もの企業の学習者に愛されています

チームでトレーニングをお考えですか?

法人向けプランを試す

コースの説明

高次元のデータセットは圧倒されやすく、どこから手を付ければよいか迷ってしまいます。通常は新しいデータセットをまず可視化して探索しますが、次元が多すぎると従来の手法では不十分に感じられるでしょう。幸い、高次元データに特化した可視化手法があり、本コースではそれらを紹介します。データを探索すると、多くの特徴量が、分散がない、あるいは他の特徴量の重複であるといった理由で、ほとんど情報を持たないことがよくあります。これらの特徴量を検出してデータセットから除外し、有益な特徴量に集中する方法を学びます。次のステップとして、これらの特徴量でモデルを構築したい場合、目的変数の予測に影響を与えないものが含まれていることもあります。こうした無関係な特徴量も検出・除外して、次元(=複雑さ)を減らす方法を学びます。最後に、相関のない主成分を計算することで自動的に次元削減を行う、特徴量抽出の手法について学びます。

前提条件

カリキュラム

コース概要

1

高次元データの探索

この章では次元削減の概念を紹介し、その重要性と使いどきを学びます。特徴量選択と特徴量抽出の違いを理解し、両手法を用いてデータ探索を行います。章の最後では、高次元データを可視化できる強力な特徴量抽出手法である t-SNE を学びます。
2

特徴量選択 I - 情報量に基づく選択

特徴量選択に関する2章構成のうち最初の章では、次元の呪いと、それを乗り越えるための次元削減について学びます。分散が小さい、欠損値が多い、または他の特徴量と強く相関しているといった理由で、データセットにほとんど価値を追加しない特徴量を検出・除去するための手法をいくつか紹介します。
4

特徴量抽出

この章では、最も頻繁に使われる次元削減アルゴリズムである Principal Component Analysis (PCA) を掘り下げます。なぜこのアルゴリズムが強力なのかについて直感を養い、データ探索とモデリングパイプラインの前処理の両方で適用します。最後は、画像圧縮のクールなユースケースで締めくくります。

Pythonで学ぶ次元削減

コース修了

修了証明書を取得

今すぐ登録する

DataCamp for Mobileでデータスキルを伸ばしましょう

モバイルコースと毎日5分のコーディングチャレンジで、外出先でも学習を進められます。