メインコンテンツへスキップ
ホームSpark

コース

PySparkで学ぶ特徴量エンジニアリング

上級スキルレベル
更新日 2026/01
データサイエンティストが時間の70~80%を費やす、データ整理と特徴量エンジニアリングの実践を学ぶ。
コースを無料で開始
SparkData Manipulation
4時間
16 ビデオ
60 演習
5,000 XP
17,832
修了証明書

無料アカウントを作成

Googleで続行その他のオプションを表示

または


続行すると、弊社の利用規約プライバシーポリシーに同意し、データが米国に保存されることに同意したことになります。

何千もの企業の従業員が支持

Group

チームのトレーニングを担当していますか?

Businessをお試しください

コース説明

現実のデータは雑然としており、その意味を見いだすのがあなたの役目です。MTCars や Iris のような玩具データセットは丁寧にキュレーション・クレンジングされていますが、それでも強力な Machine Learning アルゴリズムが意味を抽出し、予測・分類・クラスタリングに活用できるようにするには、変換が必要です。このコースでは、データサイエンティストが時間の70〜80%を費やすと言われる実務、すなわちデータ整形と特徴量エンジニアリングの泥臭い部分を扱います。データセットの規模がますます大きくなる今、PySpark を使ってこのビッグデータの課題をスケーラブルに解決していきましょう!

前提条件

Supervised Learning with scikit-learnIntroduction to PySpark
1

探索的データ分析

飛び込む前に、まずは問題設定を少し理解しましょう。そのうえで、データセットを統計的・視覚的に点検する方法を学びます。
チャプターを開始
2

Spark関数で行うデータ整形

実データが最初から分析に適した状態であることはほとんどありません。この章では、不要な情報の削除、欠損値の扱い、そして分析に追加のデータを取り込む方法を学びます。
3

特徴量エンジニアリング

PySparkで学ぶ特徴量エンジニアリング
コース完了

修了証明書を取得

この修了書をLinkedInや履歴書、CVに追加しましょう
ソーシャルメディアや人事評価で共有しましょう
今すぐ登録

19百万人を超える学習者と共にPySparkで学ぶ特徴量エンジニアリングを始めましょう!

無料アカウントを作成

Googleで続行その他のオプションを表示

または


続行すると、弊社の利用規約プライバシーポリシーに同意し、データが米国に保存されることに同意したことになります。

DataCamp for Mobileでデータスキルを磨きましょう

モバイル コースと毎日の 5 分間のコーディング チャレンジで、外出先でも進歩できます。