メインコンテンツへスキップ

コース

PySparkで学ぶBig Data入門

上級4 時間

PySparkでビッグデータを扱う基礎を学ぶ。

Python4 時間16 本の動画55 個の演習4,600 XP65,810修了証明書

無料アカウントを作成

Google で続行
または
続行することで、 利用規約、私たちの プライバシーポリシー そして、あなたのデータが米国に保存されること。

何千もの企業の学習者に支持されています

チームのトレーニングをお考えですか?

ビジネス向けに試す

コース説明

近年Big Dataは大きな注目を集め、多くの企業で一般的に活用されるようになりました。では、Big Dataとは何でしょうか?このコースでは、PySparkを通してBig Dataの基礎を学びます。SparkはBig Data向けの「超高速なクラスター計算」フレームワークで、汎用のデータ処理エンジンを提供し、Hadoopに比べてメモリ上で最大100倍、ディスク上で最大10倍の高速化が可能です。PythonからSparkを扱うPySparkや、SparkSQL、MLlib(Machine Learning向け)などの強力な高水準ライブラリを使います。William Shakespeareの作品の分析、Fifa 2018データの解析、ゲノムデータセットのクラスタリングにも取り組みます。コースの最後には、PySparkの深い理解と、一般的なBig Data分析への応用力が身につきます。

前提条件

カリキュラム

コース概要

1

SparkによるBig Data分析の導入

この章では、Big Dataの魅力的な世界を紹介し、Big Data処理のためのさまざまな概念とフレームワークについて学びます。なぜApache SparkがBig Dataに最適なフレームワークと考えられているのかを理解できます。
4

PySpark MLlibで学ぶMachine Learning

PySpark MLlibは、Pythonで利用できるApache SparkのスケーラブルなMachine Learningライブラリで、一般的な学習アルゴリズムやユーティリティを含みます。最終章を通して、重要なMachine Learningアルゴリズムを学びます。映画のレコメンデーションエンジンやスパムフィルタを構築し、k-meansクラスタリングも実装します。

PySparkで学ぶBig Data入門

コース修了

達成証明書を取得する

今すぐ登録

DataCamp for Mobileでデータスキルを磨きましょう

モバイルコースと毎日5分のコーディングチャレンジで、外出先でも学習を進めましょう。

PySparkで学ぶBig Data入門 | DataCamp