メインコンテンツにスキップ

コース

Pythonで学ぶデータクリーニング

中級4 時間

汚れたデータを診断・修正し、生データを正確なインサイトに変換するために必要なスキルを身に付ける方法を学びましょう!

Python4 時間動画 13 本演習 44 件3,500 XP150K+修了証明書

無料アカウントを作成する

Googleで続行
または
続行すると、次に同意したものとみなされます: 利用規約プライバシーポリシー 、およびデータが米国内に保管されることに同意したものとみなされます。

何千もの企業の学習者に愛されています

チームでトレーニングをお考えですか?

法人向けプランを試す

コースの説明

Pythonでデータをクレンジングする方法を学ぶ

よく言われるのは、データサイエンティストは時間の80%をデータのクリーニングと操作に費やし、分析に使うのはわずか20%だということです。 データクリーニングは、すべてのデータサイエンティストにとって欠かせないステップです。なぜなら、汚れたデータを分析すると、誤った結論につながる可能性があるからです。

このコースでは、Pythonでシンプルなものから高度なものまで、さまざまなデータクリーニングの問題を特定、診断、解決する方法を学びます。 不適切なデータ型への対処、データが正しい範囲に収まっているかの確認、欠損データの処理、レコードリンケージなどを行います!

さまざまなデータ型をクレンジングする方法を学ぶ

コースの第1章では、よくあるデータの問題とその解決方法について学びます。 まずは基本的なデータ型を理解し、それぞれを個別にどのように扱うかを把握します。 その後、範囲制約を適用し、重複したデータポイントを削除します。

最後の章では、複数のデータセットを結合するための強力なツールであるレコードリンケージを扱います。 文字列間の類似度を計算してレコードをリンクする方法を学びます。 最後に、新たに身につけたスキルを使って、2つのレストランレビューのデータセットを1つのクリーンな統合データセットに結合することになります。

データのクリーニングに自信をつける

コースの終了時には、さまざまな種類のデータをクレンジングし、レコードリンケージを使って複数のデータセットを統合する自信が身につきます。 データのクリーニングは、データサイエンティストにとって不可欠なスキルです。 Pythonでのデータのクリーニングとその応用についてさらに学びたい方は、以下のトラックをご覧ください: PythonでデータサイエンスとPythonでのデータのインポートとクリーニング

前提条件

カリキュラム

コース概要

1

よくあるデータの問題

この章では、よく見られる汚れたデータの問題をどのように解決するかを学びます。データ型を変換し、将来日のデータ点を除外するために範囲制約を適用し、二重計上を避けるために重複データ点を削除します。
2

テキストとカテゴリ型データの問題

カテゴリ型やテキストデータは、非構造的であるためデータセットの中でも特に乱れがちな部分です。この章では、カテゴリラベルの空白や大文字・小文字の不一致を修正し、複数のカテゴリを1つにまとめ、文字列の書式をそろえて一貫性を高める方法を学びます。
3

発展的なデータの問題

この章では、ポンドではなくキログラムで重さを統一するなど、より高度なデータクリーニングの課題に取り組みます。値が正しく合計されているかを確認し、欠損値が分析に悪影響を与えないようにするための、実務で役立つスキルも身につけます。
4

レコードリンケージ

レコードリンケージは、誤字や表記ゆれがある場合に複数のデータセットを結合する強力な手法です。この章では、文字列同士の類似度を計算してレコードを照合する方法を学び、最後に2つのレストランレビューのデータセットを1つのクリーンなマスターデータセットに結合します。

Pythonで学ぶデータクリーニング

コース修了

修了証明書を取得

今すぐ登録する

DataCamp for Mobileでデータスキルを伸ばしましょう

モバイルコースと毎日5分のコーディングチャレンジで、外出先でも学習を進められます。