メインコンテンツにスキップ

コース

Pythonで学ぶ Spark SQL 入門

上級4 時間

PythonのSQLを使用して、Sparkにおけるデータの操作方法と機械学習の特徴量セットの作成方法を学びましょう。

Python4 時間動画 15 本演習 52 件4,200 XP20,949修了証明書

無料アカウントを作成する

Googleで続行
または
続行すると、次に同意したものとみなされます: 利用規約プライバシーポリシー 、およびデータが米国内に保管されることに同意したものとみなされます。

何千もの企業の学習者に愛されています

チームでトレーニングをお考えですか?

法人向けプランを試す

コースの説明













前提条件

カリキュラム

コース概要

1

PySpark SQL

この章では、Spark で SQL テーブルを作成してクエリを実行する方法を学びます。Spark SQL は SQL の表現力を Spark にもたらします。また、Spark における SQL のウィンドウ関数の使い方も学びます。ウィンドウ関数は、現在行に関連する複数行にまたがって計算を行います。これにより、結合や従来の集計だけでは表現が難しい処理を大幅に簡単にできます。基本的な SQL では難しいランニングサム、ランニング差分、その他の操作をウィンドウ関数で実行していきます。
3

キャッシュ、ログ記録、Spark UI

前の章では、ウィンドウ関数 SQL の表現力を活用する方法を学びました。一方で、この表現力を活かすには、DataFrame や SQL テーブルを適切にキャッシュする方法を理解することが重要です。アプリケーションを評価する方法を知ることも欠かせません。ここでは Spark UI を使ってそれを行う方法を学びます。さらに、Spark におけるロギングのベストプラクティスも紹介します。Spark SQL には、クエリのパフォーマンスチューニングに役立つもう一つの便利なツールであるクエリ実行プランもあります。実行プランを使って DataFrame の由来を評価する方法を学びます。
4

テキスト分類

これまでの章では、生のテキストを読み込み、トークン化し、単語列を抽出するためのツールを学びました。これは分析としても有用ですが、Machine Learning にも役立ちます。ここまでに学んだ内容を組み合わせ、ロジスティック回帰でテキストを分類します。章の終わりまでに、生の自然言語テキストデータを読み込み、それを使ってテキスト分類器を学習させます。

Pythonで学ぶ Spark SQL 入門

コース修了

修了証明書を取得

今すぐ登録する

DataCamp for Mobileでデータスキルを伸ばしましょう

モバイルコースと毎日5分のコーディングチャレンジで、外出先でも学習を進められます。