メインコンテンツへスキップ

コース

Machine Learning with PySpark

上級4 時間

Apache Sparkでデータから予測する方法を学ぶ。決定木、ロジスティック回帰、線形回帰、アンサンブル、パイプラインを使用。

Python4 時間16 本の動画56 個の演習4,550 XP29,823修了証明書

無料アカウントを作成

Google で続行
または
続行することで、 利用規約、私たちの プライバシーポリシー そして、あなたのデータが米国に保存されること。

何千もの企業の学習者に支持されています

チームのトレーニングをお考えですか?

ビジネス向けに試す

コース説明

Apache Spark を機械学習に活用する方法を学ぶ

Sparkは、ビッグデータを扱うための強力な汎用ツールです。 Spark は、クラスター全体にわたるコンピュートタスクの分散を透過的に処理します。 これは、処理が高速であることを意味しますが、技術的な詳細を気にするのではなく、分析に集中できるようにもなります。 このコースでは、データをSparkに取り込み、その後、Sparkの3つの基本的な機械学習アルゴリズムを学びます: 線形回帰、ロジスティック回帰/分類器、およびパイプラインの作成。

決定木を構築してテストする

独自の決定木を構築することは、機械学習モデルの探求を始めるのに最適な方法です。 「再帰的分割」と呼ばれるアルゴリズムを使用してデータを2つのクラスに分け、データ内で2つのクラスを最も有益に分割する予測変数を見つけ、その後さらにノードを追加してこの処理を繰り返します。 その後、意思決定ツリーを使って新しいデータで予測できます。

PySparkでロジスティック回帰と線形回帰をマスターする

ロジスティック回帰と線形回帰は、PySparkでサポートされている重要な機械学習手法です。 ロジスティック回帰モデルの構築と評価を学んだ後、線形回帰モデルの作成へ進み、予測変数を最も関連性の高い選択肢だけに絞り込む方法を身につけます。

コースの終わりには、コース全体に散りばめられた実践的な課題と練習データセットのおかげで、新たに身につけた機械学習の知識を自信を持って活用できるようになります。

前提条件

カリキュラム

コース概要

1

Introduction

SparkはBig Dataを扱うためのフレームワークです。本章では、SparkとMachine Learningの基礎を確認します。続いて、PythonからSparkに接続し、CSVデータを読み込む方法を学びます。

Machine Learning with PySpark

コース修了

達成証明書を取得する

今すぐ登録

DataCamp for Mobileでデータスキルを磨きましょう

モバイルコースと毎日5分のコーディングチャレンジで、外出先でも学習を進めましょう。

Machine Learning with PySpark | DataCamp