メインコンテンツにスキップ

コース

Machine Learning with PySpark

上級4 時間

Apache Sparkでデータから予測する方法を学ぶ。決定木、ロジスティック回帰、線形回帰、アンサンブル、パイプラインを使用。

Python4 時間動画 16 本演習 56 件4,550 XP30,057修了証明書

無料アカウントを作成する

Googleで続行
または
続行すると、次に同意したものとみなされます: 利用規約プライバシーポリシー 、およびデータが米国内に保管されることに同意したものとみなされます。

何千もの企業の学習者に愛されています

チームでトレーニングをお考えですか?

法人向けプランを試す

コースの説明

Apache Spark を機械学習に活用する方法を学ぶ

Sparkは、ビッグデータを扱うための強力な汎用ツールです。 Spark は、クラスター全体にわたるコンピュートタスクの分散を透過的に処理します。 これは、処理が高速であることを意味しますが、技術的な詳細を気にするのではなく、分析に集中できるようにもなります。 このコースでは、データをSparkに取り込み、その後、Sparkの3つの基本的な機械学習アルゴリズムを学びます: 線形回帰、ロジスティック回帰/分類器、およびパイプラインの作成。

決定木を構築してテストする

独自の決定木を構築することは、機械学習モデルの探求を始めるのに最適な方法です。 「再帰的分割」と呼ばれるアルゴリズムを使用してデータを2つのクラスに分け、データ内で2つのクラスを最も有益に分割する予測変数を見つけ、その後さらにノードを追加してこの処理を繰り返します。 その後、意思決定ツリーを使って新しいデータで予測できます。

PySparkでロジスティック回帰と線形回帰をマスターする

ロジスティック回帰と線形回帰は、PySparkでサポートされている重要な機械学習手法です。 ロジスティック回帰モデルの構築と評価を学んだ後、線形回帰モデルの作成へ進み、予測変数を最も関連性の高い選択肢だけに絞り込む方法を身につけます。

コースの終わりには、コース全体に散りばめられた実践的な課題と練習データセットのおかげで、新たに身につけた機械学習の知識を自信を持って活用できるようになります。

前提条件

カリキュラム

コース概要

1

Introduction

SparkはBig Dataを扱うためのフレームワークです。本章では、SparkとMachine Learningの基礎を確認します。続いて、PythonからSparkに接続し、CSVデータを読み込む方法を学びます。

Machine Learning with PySpark

コース修了

修了証明書を取得

今すぐ登録する

DataCamp for Mobileでデータスキルを伸ばしましょう

モバイルコースと毎日5分のコーディングチャレンジで、外出先でも学習を進められます。