メインコンテンツへスキップ
ホームSpark

コース

PySparkで学ぶBig Data入門

上級スキルレベル
更新日 2025/02
PySparkでビッグデータを扱う基礎を学ぶ。
コースを無料で開始
SparkData Engineering
4時間
16 ビデオ
55 演習
4,600 XP
65,575
修了証明書

無料アカウントを作成

Googleで続行その他のオプションを表示

または


続行すると、弊社の利用規約プライバシーポリシーに同意し、データが米国に保存されることに同意したことになります。

何千もの企業の従業員が支持

Group

チームのトレーニングを担当していますか?

Businessをお試しください

コース説明

近年Big Dataは大きな注目を集め、多くの企業で一般的に活用されるようになりました。では、Big Dataとは何でしょうか?このコースでは、PySparkを通してBig Dataの基礎を学びます。SparkはBig Data向けの「超高速なクラスター計算」フレームワークで、汎用のデータ処理エンジンを提供し、Hadoopに比べてメモリ上で最大100倍、ディスク上で最大10倍の高速化が可能です。PythonからSparkを扱うPySparkや、SparkSQL、MLlib(Machine Learning向け)などの強力な高水準ライブラリを使います。William Shakespeareの作品の分析、Fifa 2018データの解析、ゲノムデータセットのクラスタリングにも取り組みます。コースの最後には、PySparkの深い理解と、一般的なBig Data分析への応用力が身につきます。

前提条件

Introduction to Python
1

SparkによるBig Data分析の導入

この章では、Big Dataの魅力的な世界を紹介し、Big Data処理のためのさまざまな概念とフレームワークについて学びます。なぜApache SparkがBig Dataに最適なフレームワークと考えられているのかを理解できます。
チャプターを開始
2

PySpark RDDによるプログラミング

Sparkが提供する主な抽象化はresilient distributed dataset(RDD)であり、これはこのエンジンの基盤となる基本データ型です。本章ではRDDを紹介し、RDD TransformationsやActionsを使ってRDDを作成・実行する方法を学びます。
4

PySpark MLlibで学ぶMachine Learning

PySpark MLlibは、Pythonで利用できるApache SparkのスケーラブルなMachine Learningライブラリで、一般的な学習アルゴリズムやユーティリティを含みます。最終章を通して、重要なMachine Learningアルゴリズムを学びます。映画のレコメンデーションエンジンやスパムフィルタを構築し、k-meansクラスタリングも実装します。
PySparkで学ぶBig Data入門
コース完了

修了証明書を取得

この修了書をLinkedInや履歴書、CVに追加しましょう
ソーシャルメディアや人事評価で共有しましょう
今すぐ登録

19百万人を超える学習者と共にPySparkで学ぶBig Data入門を始めましょう!

無料アカウントを作成

Googleで続行その他のオプションを表示

または


続行すると、弊社の利用規約プライバシーポリシーに同意し、データが米国に保存されることに同意したことになります。

DataCamp for Mobileでデータスキルを磨きましょう

モバイル コースと毎日の 5 分間のコーディング チャレンジで、外出先でも進歩できます。