본문으로 바로가기
Spark

강의

Python에서 Spark SQL 입문

고급기술 수준
업데이트됨 2026. 3.
Python에서 SQL을 사용하여 Spark에서 데이터를 조작하고 머신러닝 특징 집합을 생성하는 방법을 배워보세요.
무료로 강의 시작
SparkData Manipulation
4시간
15 동영상
52 연습 문제
4,200 XP
20,502
성취 증명서

무료 계정 만들기

Google에서 계속 진행더 많은 옵션 보기

또는


계속 진행하시면 당사의 이용약관개인정보처리방침에 동의하고 및 귀하의 데이터가 미국에 저장되는 것에 동의하게 됩니다.

수천 개 기업의 학습자들이 사랑하는

Group

팀을 교육하시나요?

비즈니스용으로 체험해 보세요

강의 설명













선수 조건

Python ToolboxPostgreSQL Summary Stats and Window FunctionsIntroduction to PySpark
1

PySpark SQL

이 장에서는 Spark에서 SQL 테이블을 생성하고 쿼리하는 방법을 배웁니다. Spark SQL은 SQL의 표현력을 Spark로 가져옵니다. 또한 Spark에서 SQL 윈도 함수를 사용하는 방법도 학습합니다. 윈도 함수는 현재 행과 관련된 여러 행을 가로질러 계산을 수행합니다. 이는 조인과 전통적 집계만으로 표현하기 어려운 결과를 훨씬 쉽게 만들어 줍니다. 우리는 윈도 함수를 사용해 누적 합, 누적 차이 등 기본 SQL만으로 구현하기 까다로운 연산을 수행해 보겠습니다.
챕터 시작
2

자연어 처리에 윈도 함수 SQL 활용하기

이 장에서는 자연어 텍스트를 로드한 다음, 이동 윈도 분석을 적용해 빈번한 단어 시퀀스를 찾습니다.
챕터 시작
3

캐싱, 로깅, 그리고 Spark UI

앞선 장들에서 윈도 함수 SQL의 표현력을 익혔습니다. 이제 이 표현력을 제대로 활용하려면 DataFrame과 SQL 테이블을 올바르게 캐시하는 방법을 이해하는 것이 중요합니다. 또한 애플리케이션을 평가하는 방법도 알아야 합니다. 이를 Spark UI로 수행하는 방법을 배웁니다. 아울러 Spark에서의 로깅 모범 사례도 살펴봅니다. Spark SQL은 쿼리 성능 문제를 튜닝하는 데 유용한 또 다른 도구인 쿼리 실행 계획을 제공합니다. 실행 계획을 사용해 DataFrame의 소스와 변환 과정을 평가하는 방법을 배우게 됩니다.
챕터 시작
4

텍스트 분류

앞선 장에서는 원시 텍스트를 로드하고 토크나이즈하며 단어 시퀀스를 추출하는 도구를 익혔습니다. 이는 분석에 매우 유용할 뿐 아니라 Machine Learning에도 활용할 수 있습니다. 이제 로지스틱 회귀를 사용해 텍스트를 분류하면서 배운 내용을 하나로 연결합니다. 이 장을 마치면 원시 자연어 텍스트 데이터를 로드해 텍스트 분류기를 학습하는 데까지 활용해 보게 됩니다.
챕터 시작
Python에서 Spark SQL 입문
강의
완료

수료증 획득

LinkedIn 프로필, 이력서 또는 CV에 이 인증서를 추가하세요
소셜 미디어와 성과 평가에서 공유하세요
지금 등록

19백만 명 이상의 학습자와 함께 Python에서 Spark SQL 입문을(를) 시작하세요!

무료 계정 만들기

Google에서 계속 진행더 많은 옵션 보기

또는


계속 진행하시면 당사의 이용약관개인정보처리방침에 동의하고 및 귀하의 데이터가 미국에 저장되는 것에 동의하게 됩니다.

DataCamp for Mobile을 통해 데이터 분석 능력을 향상시키세요.

모바일 강좌와 매일 5분 코딩 챌린지를 통해 이동 중에도 학습 효과를 높이세요.