メインコンテンツにスキップ

コース

Rで学ぶ異常検知入門

中級4 時間

外れ値を見つける統計的検定と、高度な異常スコアリング手法の使い方を学びます。

R4 時間動画 13 本演習 47 件3,900 XP7,369修了証明書

無料アカウントを作成する

Googleで続行
または
続行すると、次に同意したものとみなされます: 利用規約プライバシーポリシー 、およびデータが米国内に保管されることに同意したものとみなされます。

何千もの企業の学習者に愛されています

チームでトレーニングをお考えですか?

法人向けプランを試す

コースの説明

データに不正確または疑わしい記録が含まれていないか心配だけれど、どこから始めればよいかわからない—そんなときに役立つのが異常検知アルゴリズムです。異常検知は、通常とは異なるデータ点を特定するための手法の総称で、不正検出やコンピュータネットワークの悪意ある活動からの保護に不可欠です。本コースでは、外れ値を特定するための統計的検定を学び、local outlier factor や isolation forest のような高度な異常スコアリング手法を使えるようになります。UCI Wine quality データセットで異常なワインを見つけたり、ホルモン測定値の異常から甲状腺疾患の疑い例を検出したりする課題に、異常検知アルゴリズムを適用していきます。

前提条件

カリキュラム

コース概要

1

統計的な外れ値検出

この章では、数値要約やグラフ要約を使って、データに通常と異なる点が含まれていないかを非形式的に評価する方法を学びます。さらに、Grubbs 検定という統計的手続きを用いて特定の点が外れ値かどうかを確認し、時系列データにおける外れ値の特定に役立つ Seasonal-Hybrid ESD アルゴリズムについても学びます。
2

距離・密度に基づく異常検知

この章では、多変量データに対して各データ点の連続的な異常スコアを構成するために用いられる k-nearest neighbors 距離と local outlier factor の計算方法を学びます。さらに、ローカルな異常とグローバルな異常の違い、それぞれのケースでこれら2つのアルゴリズムがどのように役立つかを理解します。
3

Isolation forest

k-nearest neighbors 距離と local outlier factor は、最近傍点までの距離や相対的な密度に基づいて各点をスコアリングします。この章では、代替となる木構造ベースの手法である isolation forest を取り上げます。これはデータをランダムに分割して小さな領域へと細分化していく過程で、各点がどれだけ容易に分離できるかを測る、迅速かつ堅牢な異常検知手法です。
4

性能比較

これまでに、いくつかの異常スコアリング手法を紹介してきました。最終章では、ラベル付きの異常が利用できる場合に、各アルゴリズムの検出性能を比較する方法を学びます。異常スコアに対する precision(適合率)と recall(再現率)の計算と解釈、そしてカテゴリ型特徴量を含むデータにも対応できるようアルゴリズムを調整する方法を身につけます。
R

Rで学ぶ異常検知入門

コース修了

修了証明書を取得

今すぐ登録する

DataCamp for Mobileでデータスキルを伸ばしましょう

モバイルコースと毎日5分のコーディングチャレンジで、外出先でも学習を進められます。