メインコンテンツにスキップ

コース

PySpark 入門

中級4 時間

PySpark を習得してビッグデータを自在に扱い、膨大なデータセットの処理、クエリ実行、最適化を学んで、強力な分析を実現しましょう!

Python4 時間動画 11 本演習 36 件2,850 XP32,637修了証明書

無料アカウントを作成する

Googleで続行
または
続行すると、次に同意したものとみなされます: 利用規約プライバシーポリシー 、およびデータが米国内に保管されることに同意したものとみなされます。

何千もの企業の学習者に愛されています

チームでトレーニングをお考えですか?

法人向けプランを試す

コースの説明

このコースは、大規模なデータセットを効率的に扱いたいデータエンジニア、データサイエンティスト、機械学習の実践者に最適です。 Pandas のようなツールから移行する方にも、ビッグデータ技術を初めて学ぶ方にも、このコースは PySpark と分散データ処理を学ぶための確かな入門となります。

なぜSparkなのか?なぜ今なのか?

Apache Sparkの高速性とスケーラビリティを体験し、ビッグデータ処理のために設計された強力なフレームワークを学びましょう。 インタラクティブなレッスンと実践的な演習を通じて、Spark のインメモリ処理が Hadoop のような従来のフレームワークに対して優位性を持つ理由を学びます。 まずはSparkセッションのセットアップから始め、Resilient Distributed Datasets(RDD)やDataFrameといった中核コンポーネントを学んでいきます。 実際の例題に取り組みながら、データセットのフィルタリング、グループ化、結合を簡単に行う方法を学びます。

PythonとSQLのスキルを高めてビッグデータに対応しよう

PySpark SQL を活用して、使い慣れた SQL 構文でデータをクエリし、管理する方法を学びましょう。 スキーマ、複雑なデータ型、ユーザー定義関数(UDF)に取り組みながら、分散システム向けのキャッシュとパフォーマンス最適化のスキルを身につけましょう。

ビッグデータの基礎を築く

このコースを修了する頃には、PySparkを使ってビッグデータを扱い、クエリを実行し、処理する自信が身についているでしょう。 これらの基礎スキルがあれば、機械学習やビッグデータ分析といった高度なトピックを学ぶ準備が整います。

前提条件

カリキュラム

コース概要

PySpark 入門

コース修了

修了証明書を取得

今すぐ登録する

DataCamp for Mobileでデータスキルを伸ばしましょう

モバイルコースと毎日5分のコーディングチャレンジで、外出先でも学習を進められます。