コース
Pythonで学ぶ Spark SQL 入門
上級スキルレベル
更新日 2026/03
SparkData Manipulation4時間15 ビデオ52 演習4,200 XP20,511修了証明書
無料アカウントを作成
Googleで続行その他のオプションを表示または
何千もの企業の従業員が支持
チームのトレーニングを担当していますか?
Businessをお試しくださいコース説明
前提条件
Python ToolboxPostgreSQL Summary Stats and Window FunctionsIntroduction to PySpark1
PySpark SQL
この章では、Spark で SQL テーブルを作成してクエリを実行する方法を学びます。Spark SQL は SQL の表現力を Spark にもたらします。また、Spark における SQL のウィンドウ関数の使い方も学びます。ウィンドウ関数は、現在行に関連する複数行にまたがって計算を行います。これにより、結合や従来の集計だけでは表現が難しい処理を大幅に簡単にできます。基本的な SQL では難しいランニングサム、ランニング差分、その他の操作をウィンドウ関数で実行していきます。
2
自然言語処理のためのウィンドウ関数 SQL の活用
この章では、自然言語のテキストを読み込み、移動ウィンドウ分析を適用して頻出する単語列を見つけます。
3
キャッシュ、ログ記録、Spark UI
前の章では、ウィンドウ関数 SQL の表現力を活用する方法を学びました。一方で、この表現力を活かすには、DataFrame や SQL テーブルを適切にキャッシュする方法を理解することが重要です。アプリケーションを評価する方法を知ることも欠かせません。ここでは Spark UI を使ってそれを行う方法を学びます。さらに、Spark におけるロギングのベストプラクティスも紹介します。Spark SQL には、クエリのパフォーマンスチューニングに役立つもう一つの便利なツールであるクエリ実行プランもあります。実行プランを使って DataFrame の由来を評価する方法を学びます。
4
テキスト分類
これまでの章では、生のテキストを読み込み、トークン化し、単語列を抽出するためのツールを学びました。これは分析としても有用ですが、Machine Learning にも役立ちます。ここまでに学んだ内容を組み合わせ、ロジスティック回帰でテキストを分類します。章の終わりまでに、生の自然言語テキストデータを読み込み、それを使ってテキスト分類器を学習させます。
Pythonで学ぶ Spark SQL 入門
コース完了 19百万人を超える学習者と共にPythonで学ぶ Spark SQL 入門を始めましょう!
無料アカウントを作成
Googleで続行その他のオプションを表示または
DataCamp for Mobileでデータスキルを磨きましょう
モバイル コースと毎日の 5 分間のコーディング チャレンジで、外出先でも進歩できます。