본문으로 바로가기

코스

PySpark로 배우는 빅데이터 기초

고급4시간

PySpark를 활용한 빅데이터 작업의 기초를 익히세요.

Python4시간16개 동영상55개 연습 문제4,600 XP65,822수료 확인서

무료 계정 만들기

Google에서 계속 진행
또는
계속 진행하시면 다음 약관에 동의하는 것으로 간주됩니다: 이용약관, 우리의 개인정보 처리방침 그리고 귀하의 데이터가 미국에 저장된다는 점입니다.

수천 개 기업의 학습자가 선택한 서비스

코스 설명

지난 몇 년간 빅데이터에 대한 관심이 꾸준히 커지면서 이제는 많은 기업에서 보편적으로 활용하고 있어요. 그렇다면 빅데이터란 정확히 무엇일까요? 이 강의는 PySpark를 통해 빅데이터의 기본을 다룹니다. Spark는 빅데이터를 위한 "번개처럼 빠른 클러스터 컴퓨팅" 프레임워크로, 범용 데이터 처리 엔진을 제공하며 메모리에서는 최대 100배, 디스크에서는 최대 10배까지 Hadoop보다 빠르게 프로그램을 실행할 수 있어요. 여러분은 Spark 프로그래밍을 위한 Python 패키지인 PySpark와 SparkSQL, MLlib(머신 러닝용) 등의 강력한 고수준 라이브러리를 사용하게 됩니다. 셰익스피어 작품을 탐색하고, Fifa 2018 데이터를 분석하며, 유전체 데이터셋에 클러스터링을 수행해 볼 거예요. 강의가 끝나면 PySpark와 일반적인 빅데이터 분석에의 적용에 대해 깊이 있게 이해하게 됩니다.

사전 요구 사항

커리큘럼

코스 개요

1

Spark로 시작하는 빅데이터 분석

이 장에서는 흥미로운 빅데이터의 세계와 함께, 빅데이터 처리를 위한 다양한 개념과 프레임워크를 소개합니다. 왜 Apache Spark가 빅데이터를 위한 최적의 프레임워크로 평가되는지 이해하게 될 거예요.
챕터 시작하기
2

PySpark RDD 프로그래밍

4

PySpark MLlib으로 하는 Machine Learning

PySpark MLlib은 Python에서 사용할 수 있는 Apache Spark의 확장 가능한 Machine Learning 라이브러리로, 일반적인 학습 알고리즘과 유틸리티로 구성되어 있습니다. 마지막 장에서는 중요한 Machine Learning 알고리즘을 학습합니다. 영화 추천 엔진과 스팸 필터를 만들고, k-means 클러스터링을 사용해 볼 거예요.
챕터 시작하기

PySpark로 배우는 빅데이터 기초

코스
완료

성취 확인서 획득하기

지금 등록하기

DataCamp for Mobile로 데이터 스킬을 키워보세요

모바일 강의와 매일 5분 코딩 챌린지로 이동 중에도 학습을 진행하세요.