メインコンテンツへスキップ
ホームSpark

コース

Pythonで学ぶ Spark SQL 入門

上級スキルレベル
更新日 2026/03
PythonのSQLを使用して、Sparkにおけるデータの操作方法と機械学習の特徴量セットの作成方法を学びましょう。
コースを無料で開始
SparkData Manipulation
4時間
15 ビデオ
52 演習
4,200 XP
20,511
修了証明書

無料アカウントを作成

Googleで続行その他のオプションを表示

または


続行すると、弊社の利用規約プライバシーポリシーに同意し、データが米国に保存されることに同意したことになります。

何千もの企業の従業員が支持

Group

チームのトレーニングを担当していますか?

Businessをお試しください

コース説明













前提条件

Python ToolboxPostgreSQL Summary Stats and Window FunctionsIntroduction to PySpark
1

PySpark SQL

この章では、Spark で SQL テーブルを作成してクエリを実行する方法を学びます。Spark SQL は SQL の表現力を Spark にもたらします。また、Spark における SQL のウィンドウ関数の使い方も学びます。ウィンドウ関数は、現在行に関連する複数行にまたがって計算を行います。これにより、結合や従来の集計だけでは表現が難しい処理を大幅に簡単にできます。基本的な SQL では難しいランニングサム、ランニング差分、その他の操作をウィンドウ関数で実行していきます。
チャプターを開始
2

自然言語処理のためのウィンドウ関数 SQL の活用

この章では、自然言語のテキストを読み込み、移動ウィンドウ分析を適用して頻出する単語列を見つけます。
3

キャッシュ、ログ記録、Spark UI

前の章では、ウィンドウ関数 SQL の表現力を活用する方法を学びました。一方で、この表現力を活かすには、DataFrame や SQL テーブルを適切にキャッシュする方法を理解することが重要です。アプリケーションを評価する方法を知ることも欠かせません。ここでは Spark UI を使ってそれを行う方法を学びます。さらに、Spark におけるロギングのベストプラクティスも紹介します。Spark SQL には、クエリのパフォーマンスチューニングに役立つもう一つの便利なツールであるクエリ実行プランもあります。実行プランを使って DataFrame の由来を評価する方法を学びます。
4

テキスト分類

これまでの章では、生のテキストを読み込み、トークン化し、単語列を抽出するためのツールを学びました。これは分析としても有用ですが、Machine Learning にも役立ちます。ここまでに学んだ内容を組み合わせ、ロジスティック回帰でテキストを分類します。章の終わりまでに、生の自然言語テキストデータを読み込み、それを使ってテキスト分類器を学習させます。
Pythonで学ぶ Spark SQL 入門
コース完了

修了証明書を取得

この修了書をLinkedInや履歴書、CVに追加しましょう
ソーシャルメディアや人事評価で共有しましょう
今すぐ登録

19百万人を超える学習者と共にPythonで学ぶ Spark SQL 入門を始めましょう!

無料アカウントを作成

Googleで続行その他のオプションを表示

または


続行すると、弊社の利用規約プライバシーポリシーに同意し、データが米国に保存されることに同意したことになります。

DataCamp for Mobileでデータスキルを磨きましょう

モバイル コースと毎日の 5 分間のコーディング チャレンジで、外出先でも進歩できます。