コース
Machine Learning with PySpark
上級スキルレベル
更新日 2025/11
SparkMachine Learning4時間16 ビデオ56 演習4,550 XP29,744修了証明書
無料アカウントを作成
Googleで続行その他のオプションを表示または
何千もの企業の従業員が支持
チームのトレーニングを担当していますか?
Businessをお試しくださいコース説明
Apache Spark を機械学習に活用する方法を学ぶ
Sparkは、ビッグデータを扱うための強力な汎用ツールです。 Spark は、クラスター全体にわたるコンピュートタスクの分散を透過的に処理します。 これは、処理が高速であることを意味しますが、技術的な詳細を気にするのではなく、分析に集中できるようにもなります。 このコースでは、データをSparkに取り込み、その後、Sparkの3つの基本的な機械学習アルゴリズムを学びます: 線形回帰、ロジスティック回帰/分類器、およびパイプラインの作成。決定木を構築してテストする
独自の決定木を構築することは、機械学習モデルの探求を始めるのに最適な方法です。 「再帰的分割」と呼ばれるアルゴリズムを使用してデータを2つのクラスに分け、データ内で2つのクラスを最も有益に分割する予測変数を見つけ、その後さらにノードを追加してこの処理を繰り返します。 その後、意思決定ツリーを使って新しいデータで予測できます。PySparkでロジスティック回帰と線形回帰をマスターする
ロジスティック回帰と線形回帰は、PySparkでサポートされている重要な機械学習手法です。 ロジスティック回帰モデルの構築と評価を学んだ後、線形回帰モデルの作成へ進み、予測変数を最も関連性の高い選択肢だけに絞り込む方法を身につけます。コースの終わりには、コース全体に散りばめられた実践的な課題と練習データセットのおかげで、新たに身につけた機械学習の知識を自信を持って活用できるようになります。
前提条件
Supervised Learning with scikit-learnIntroduction to PySpark1
Introduction
SparkはBig Dataを扱うためのフレームワークです。本章では、SparkとMachine Learningの基礎を確認します。続いて、PythonからSparkに接続し、CSVデータを読み込む方法を学びます。
2
Classification
Sparkへのデータ取り込みに慣れたら、2種類の分類モデル――決定木とロジスティック回帰――の構築に進みます。あわせて、データ準備のいくつかの手法についても学びます。
3
Regression
次に、線形回帰モデルの作成方法を学びます。さらに、新しい予測変数を作る特徴量エンジニアリングや、最も関連性の高い予測変数だけを選ぶ堅牢な手法についても扱います。
4
Ensembles & Pipelines
最後に、モデルをより効率的にする方法を学びます。コードをわかりやすく保守しやすくするパイプラインの使い方を理解し、クロスバリデーションでモデルをより適切に評価して良いハイパーパラメータを選びます。最後に、2種類のアンサンブルモデルも体験します。
Machine Learning with PySpark
コース完了 19百万人を超える学習者と共にMachine Learning with PySparkを始めましょう!
無料アカウントを作成
Googleで続行その他のオプションを表示または
DataCamp for Mobileでデータスキルを磨きましょう
モバイル コースと毎日の 5 分間のコーディング チャレンジで、外出先でも進歩できます。