본문으로 바로가기

코스

Python에서 Spark SQL 입문

고급4시간

Python에서 SQL을 사용하여 Spark에서 데이터를 조작하고 머신러닝 특징 집합을 생성하는 방법을 배워보세요.

Python4시간15개 동영상52개 연습 문제4,200 XP20,601수료 확인서

무료 계정 만들기

Google에서 계속 진행
또는
계속 진행하시면 다음 약관에 동의하는 것으로 간주됩니다: 이용약관, 우리의 개인정보 처리방침 그리고 귀하의 데이터가 미국에 저장된다는 점입니다.

수천 개 기업의 학습자가 선택한 서비스

코스 설명













사전 요구 사항

커리큘럼

코스 개요

1

PySpark SQL

이 장에서는 Spark에서 SQL 테이블을 생성하고 쿼리하는 방법을 배웁니다. Spark SQL은 SQL의 표현력을 Spark로 가져옵니다. 또한 Spark에서 SQL 윈도 함수를 사용하는 방법도 학습합니다. 윈도 함수는 현재 행과 관련된 여러 행을 가로질러 계산을 수행합니다. 이는 조인과 전통적 집계만으로 표현하기 어려운 결과를 훨씬 쉽게 만들어 줍니다. 우리는 윈도 함수를 사용해 누적 합, 누적 차이 등 기본 SQL만으로 구현하기 까다로운 연산을 수행해 보겠습니다.
챕터 시작하기
3

캐싱, 로깅, 그리고 Spark UI

앞선 장들에서 윈도 함수 SQL의 표현력을 익혔습니다. 이제 이 표현력을 제대로 활용하려면 DataFrame과 SQL 테이블을 올바르게 캐시하는 방법을 이해하는 것이 중요합니다. 또한 애플리케이션을 평가하는 방법도 알아야 합니다. 이를 Spark UI로 수행하는 방법을 배웁니다. 아울러 Spark에서의 로깅 모범 사례도 살펴봅니다. Spark SQL은 쿼리 성능 문제를 튜닝하는 데 유용한 또 다른 도구인 쿼리 실행 계획을 제공합니다. 실행 계획을 사용해 DataFrame의 소스와 변환 과정을 평가하는 방법을 배우게 됩니다.
챕터 시작하기
4

텍스트 분류

앞선 장에서는 원시 텍스트를 로드하고 토크나이즈하며 단어 시퀀스를 추출하는 도구를 익혔습니다. 이는 분석에 매우 유용할 뿐 아니라 Machine Learning에도 활용할 수 있습니다. 이제 로지스틱 회귀를 사용해 텍스트를 분류하면서 배운 내용을 하나로 연결합니다. 이 장을 마치면 원시 자연어 텍스트 데이터를 로드해 텍스트 분류기를 학습하는 데까지 활용해 보게 됩니다.
챕터 시작하기

Python에서 Spark SQL 입문

코스
완료

성취 확인서 획득하기

지금 등록하기

DataCamp for Mobile로 데이터 스킬을 키워보세요

모바일 강의와 매일 5분 코딩 챌린지로 이동 중에도 학습을 진행하세요.

Python에서 Spark SQL 입문 | DataCamp