강의
PySpark로 배우는 빅데이터 기초
고급기술 수준
업데이트됨 2025. 2.
SparkData Engineering4시간16 동영상55 연습 문제4,600 XP65,575성취 증명서
무료 계정 만들기
Google에서 계속 진행더 많은 옵션 보기또는
수천 개 기업의 학습자들이 사랑하는
팀을 교육하시나요?
비즈니스용으로 체험해 보세요강의 설명
선수 조건
Introduction to Python1
Spark로 시작하는 빅데이터 분석
이 장에서는 흥미로운 빅데이터의 세계와 함께, 빅데이터 처리를 위한 다양한 개념과 프레임워크를 소개합니다. 왜 Apache Spark가 빅데이터를 위한 최적의 프레임워크로 평가되는지 이해하게 될 거예요.
2
PySpark RDD 프로그래밍
Spark가 제공하는 핵심 추상화는 복원력 있는 분산 데이터셋(RDD)으로, 이 엔진의 기본이자 근간이 되는 데이터 타입입니다. 이 장에서는 RDD를 소개하고, RDD Transformations와 Actions를 사용해 RDD를 생성하고 실행하는 방법을 보여 드립니다.
3
PySpark SQL과 DataFrame
이 장에서는 구조화된 데이터 처리를 위한 Spark 모듈인 Spark SQL을 학습합니다. Spark SQL은 DataFrame이라는 프로그래밍 추상화를 제공하며, 분산 SQL 쿼리 엔진으로도 동작할 수 있어요. 이 장을 통해 Python에서 DataFrame을 Spark SQL로 활용하는 방법을 익히게 됩니다.
4
PySpark MLlib으로 하는 Machine Learning
PySpark MLlib은 Python에서 사용할 수 있는 Apache Spark의 확장 가능한 Machine Learning 라이브러리로, 일반적인 학습 알고리즘과 유틸리티로 구성되어 있습니다. 마지막 장에서는 중요한 Machine Learning 알고리즘을 학습합니다. 영화 추천 엔진과 스팸 필터를 만들고, k-means 클러스터링을 사용해 볼 거예요.
PySpark로 배우는 빅데이터 기초
강의 완료
19백만 명 이상의 학습자와 함께 PySpark로 배우는 빅데이터 기초을(를) 시작하세요!
무료 계정 만들기
Google에서 계속 진행더 많은 옵션 보기또는
DataCamp for Mobile을 통해 데이터 분석 능력을 향상시키세요.
모바일 강좌와 매일 5분 코딩 챌린지를 통해 이동 중에도 학습 효과를 높이세요.