メインコンテンツへスキップ

コース

PySpark入門

中級4 時間

PySparkを習得してデータを自在に扱う—巨大なデータセットの処理、クエリ、最適化を学び、強力な分析へ!

Python4 時間11 本の動画36 個の演習2,850 XP30,422修了証明書

無料アカウントを作成

Google で続行
または
続行することで、 利用規約、私たちの プライバシーポリシー そして、あなたのデータが米国に保存されること。

何千もの企業の学習者に支持されています

チームのトレーニングをお考えですか?

ビジネス向けに試す

コース説明

このコースは、大規模データセットを効率的に扱いたいデータエンジニア、データサイエンティスト、機械学習実践者に最適です。 Pandasのようなツールから移行する場合でも、ビッグデータ技術に初めて取り組む場合でも、このコースはPySparkと分散データ処理の確かな入門を提供します。

なぜSparkなのか?なぜ今なのか?

Apache Sparkの高速性とスケーラビリティを体験し、ビッグデータ処理のために設計された強力なフレームワークを学びましょう。 インタラクティブなレッスンと実践的な演習を通じて、Sparkのインメモリ処理がHadoopのような従来のフレームワークに対してどのような優位性を持つのかを学べます。 まずはSparkセッションのセットアップから始め、Resilient Distributed Datasets(RDD)やDataFrameといった中核コンポーネントを学んでいきます。 実践的な例を通して、データセットのフィルタリング、グループ化、結合を簡単に習得できます。

PythonとSQLのスキルを高めてビッグデータに対応しよう

PySpark SQL を活用して、使い慣れた SQL 構文でデータをクエリし、管理する方法を学びましょう。 スキーマ、複雑なデータ型、ユーザー定義関数(UDF)に取り組みながら、分散システム向けのキャッシュとパフォーマンス最適化のスキルを身につけましょう。

ビッグデータの基礎を築く

このコースを修了する頃には、PySparkを使ってビッグデータを扱い、クエリを実行し、処理する自信が身についているでしょう。 これらの基礎スキルがあれば、機械学習やビッグデータ分析といった高度なトピックを学ぶ準備が整います。

前提条件

カリキュラム

コース概要

PySpark入門

コース修了

達成証明書を取得する

今すぐ登録

DataCamp for Mobileでデータスキルを磨きましょう

モバイルコースと毎日5分のコーディングチャレンジで、外出先でも学習を進めましょう。