メインコンテンツにスキップ

コース

PySparkで学ぶBig Data入門

上級4 時間

PySparkでビッグデータを扱う基礎を学ぶ。

Python4 時間動画 16 本演習 55 件4,600 XP66,513修了証明書

無料アカウントを作成する

Googleで続行
または
続行すると、次に同意したものとみなされます: 利用規約プライバシーポリシー 、およびデータが米国内に保管されることに同意したものとみなされます。

何千もの企業の学習者に愛されています

チームでトレーニングをお考えですか?

法人向けプランを試す

コースの説明

近年Big Dataは大きな注目を集め、多くの企業で一般的に活用されるようになりました。では、Big Dataとは何でしょうか?このコースでは、PySparkを通してBig Dataの基礎を学びます。SparkはBig Data向けの「超高速なクラスター計算」フレームワークで、汎用のデータ処理エンジンを提供し、Hadoopに比べてメモリ上で最大100倍、ディスク上で最大10倍の高速化が可能です。PythonからSparkを扱うPySparkや、SparkSQL、MLlib(Machine Learning向け)などの強力な高水準ライブラリを使います。William Shakespeareの作品の分析、Fifa 2018データの解析、ゲノムデータセットのクラスタリングにも取り組みます。コースの最後には、PySparkの深い理解と、一般的なBig Data分析への応用力が身につきます。

前提条件

カリキュラム

コース概要

1

SparkによるBig Data分析の導入

この章では、Big Dataの魅力的な世界を紹介し、Big Data処理のためのさまざまな概念とフレームワークについて学びます。なぜApache SparkがBig Dataに最適なフレームワークと考えられているのかを理解できます。
4

PySpark MLlibで学ぶMachine Learning

PySpark MLlibは、Pythonで利用できるApache SparkのスケーラブルなMachine Learningライブラリで、一般的な学習アルゴリズムやユーティリティを含みます。最終章を通して、重要なMachine Learningアルゴリズムを学びます。映画のレコメンデーションエンジンやスパムフィルタを構築し、k-meansクラスタリングも実装します。

PySparkで学ぶBig Data入門

コース修了

修了証明書を取得

今すぐ登録する

DataCamp for Mobileでデータスキルを伸ばしましょう

モバイルコースと毎日5分のコーディングチャレンジで、外出先でも学習を進められます。